image

Receba as melhores vagas +2.150 cursos em tech e IA

66
%OFF

DJ

Diogo Júnior10/08/2026 10:04
Share

Como criei uma Wiki Corporativa com IA na AWS sem cair nas armadilhas comuns (Desafio DIO/Nublify)

    📌 Introdução

    Quando nos deparamos com o desafio de organizar arquivos antigos de uma empresa, a primeira reação costuma ser: "É só jogar tudo num OCR e mandar para uma IA responder".

    Mas no mundo real — e na arquitetura de nuvem profissional — soluções genéricas geram custos altos e respostas ruins.

    Neste artigo, compartilho a minha abordagem para o desafio prático "A Wiki Perdida dos Arquivos Corporativos", do Bootcamp Nublify da DIO. O objetivo foi transformar um acervo totalmente desorganizado em uma Wiki Inteligente pesquisável por IA (RAG) utilizando exclusivamente serviços Serverless da AWS.

    🔍 O Problema: A armadilha da pasta raw/

    A premissa do desafio nos coloca diante de uma pasta com três arquivos aparentemente simples, mas com naturezas totalmente diferentes:

    1. ata_reuniao_vendas_sa.pdf: Um PDF nativo de 5 páginas, criado digitalmente com camada de texto pesquisável.
    2. ata_resultados_vendas_novos_dados.png: Uma foto/imagem de 1 página contendo tabelas e anotações manuscritas à mão.
    3. vendas_sa_dados_ficticios_laboratorio.csv: Uma planilha de CRM com 240 oportunidades e 19 colunas.

    A tentação de tratar todos da mesma forma é grande. Porém, tratar dados estruturados (CSV) como texto corrido em um banco vetorial quebra o RAG, e mandar um PDF que já tem texto para um OCR encarece o pipeline desnecessariamente.

    📐 A Solução: Arquitetura em 4 Camadas Especializadas

    Para resolver esse problema com eficiência, desenhei um pipeline Serverless na AWS dividindo o processamento por tipo de mídia:

    image

    🛠️ A Logica por Trás das Escolhas Técnicas

    1. PDF Nativo: Por que não usar OCR?

    O arquivo PDF de 5 páginas já possui texto legível por código. Usar um serviço de OCR como o Amazon Textract nele seria desperdício de tempo e orçamento. A solução foi usar uma AWS Lambda leve com bibliotecas Python (pypdf) para extrair a camada de texto nativa instantaneamente.

    2. Imagem Escaneada: A necessidade do OCR Avançado

    O arquivo .png é composto 100% por pixels e traz rasuras e anotações feitas à mão (como marcações e notas de acompanhamento). Aqui o uso do Amazon Textract com as rotinas de FORMS, TABLES e Handwriting Recognition se tornou obrigatório para garantir que as anotações visuais não fossem perdidas.

    3. O Desafio do CSV: Dados Estruturados em Bancos Vetoriais

    Bancos de dados vetoriais (usados no RAG) funcionam muito bem com texto narrativo, mas são pessimos para responder perguntas agregadas em tabelas (ex: "Qual a soma de vendas da região Sudeste?").

    • Minha Abordagem: O pipeline via AWS Glue / Lambda transforma cada registro relevante do CSV em uma sentença descritiva ("A oportunidade OPP-102 do cliente X no segmento Y foi fechada por R$ Z...") e disponibiliza a tabela bruta no Amazon Athena para consultas analíticas em SQL direto.

    🏷️ O Poder dos Metadados

    Para que a Wiki responda não apenas com base no texto, mas sabendo quem, quando e onde as decisões foram tomadas, utilizei o Amazon Bedrock (Claude 3 Haiku) para extrair automaticamente metadados estruturados de cada documento e salvá-los no Amazon DynamoDB:

    • Nome e Tipo do Documento
    • Data da Reunião
    • Lista de Participantes
    • Decisões Aprovadas (IDs)
    • Responsáveis e Prazos das Ações

    Isso permite que a busca no Amazon OpenSearch Serverless faça um Filtro Híbrido (Busca Semântica + Filtro exato por responsável ou data).

    🔮 O Oráculo: Respostas em Linguagem Natural com Citação de Fontes

    Com os dados limpos, enriquecidos e vetorizados pelo Amazon Bedrock Knowledge Bases, a experiência do usuário se torna simples. Ao perguntar:

    "Quais foram as decisões tomadas sobre a campanha do terceiro trimestre?"

    O assistente (Bedrock Agent) responde de forma clara e cita a fonte exata:

    "De acordo com a ata de reunião de 08/07/2026 (ata_reuniao_vendas_sa.pdf), foi aprovada por consenso a execução da campanha Rota 120 (Decisão D-004), com o objetivo de gerar R$ 6.000.000 em pipeline qualificado sob responsabilidade das gerências regionais."

    💡 Principais Aprendizados

    1. Arquitetura orientada ao dado: Nem todo documento que entra na nuvem deve seguir o mesmo caminho. Classificar antes de processar economiza recursos.
    2. RAG não é bala de prata: Tabelas numéricas exigem técnicas híbridas (Narrativa + SQL via Athena) para que a IA não invente números.
    3. Resiliência e Governança: O uso de Step Functions para orquestrar o pipeline com Retry em falhas e o Cognito / KMS para controle de acesso tornam a proposta pronta para ambiente de produção.

    🔗 Repositório do Projeto

    Você pode conferir a solução técnica completa, incluindo as Quests preenchidas e a estrutura dos metadados no meu repositório do GitHub:

    👉https://github.com/Diofbjr/laboratorio-wiki-aws-diofbjr

    Gostou da abordagem? Se esse artigo te ajudou a destravar o desafio ou trouxe ideias para suas arquiteturas na AWS, deixe seu comentário ou reação! 🚀

    Share
    Recommended for you
    Nublify - Primeiros passos em IA e Cloud
    IBM Bob: IA de Nível Empresarial para Desenvolvedores e Tech Leaders
    AWS - Agentes de IA em Campo
    Comments (0)