Como criei uma Wiki Corporativa com IA na AWS sem cair nas armadilhas comuns (Desafio DIO/Nublify)
📌 Introdução
Quando nos deparamos com o desafio de organizar arquivos antigos de uma empresa, a primeira reação costuma ser: "É só jogar tudo num OCR e mandar para uma IA responder".
Mas no mundo real — e na arquitetura de nuvem profissional — soluções genéricas geram custos altos e respostas ruins.
Neste artigo, compartilho a minha abordagem para o desafio prático "A Wiki Perdida dos Arquivos Corporativos", do Bootcamp Nublify da DIO. O objetivo foi transformar um acervo totalmente desorganizado em uma Wiki Inteligente pesquisável por IA (RAG) utilizando exclusivamente serviços Serverless da AWS.
🔍 O Problema: A armadilha da pasta raw/
A premissa do desafio nos coloca diante de uma pasta com três arquivos aparentemente simples, mas com naturezas totalmente diferentes:
ata_reuniao_vendas_sa.pdf: Um PDF nativo de 5 páginas, criado digitalmente com camada de texto pesquisável.ata_resultados_vendas_novos_dados.png: Uma foto/imagem de 1 página contendo tabelas e anotações manuscritas à mão.vendas_sa_dados_ficticios_laboratorio.csv: Uma planilha de CRM com 240 oportunidades e 19 colunas.
A tentação de tratar todos da mesma forma é grande. Porém, tratar dados estruturados (CSV) como texto corrido em um banco vetorial quebra o RAG, e mandar um PDF que já tem texto para um OCR encarece o pipeline desnecessariamente.
📐 A Solução: Arquitetura em 4 Camadas Especializadas
Para resolver esse problema com eficiência, desenhei um pipeline Serverless na AWS dividindo o processamento por tipo de mídia:

🛠️ A Logica por Trás das Escolhas Técnicas
1. PDF Nativo: Por que não usar OCR?
O arquivo PDF de 5 páginas já possui texto legível por código. Usar um serviço de OCR como o Amazon Textract nele seria desperdício de tempo e orçamento. A solução foi usar uma AWS Lambda leve com bibliotecas Python (pypdf) para extrair a camada de texto nativa instantaneamente.
2. Imagem Escaneada: A necessidade do OCR Avançado
O arquivo .png é composto 100% por pixels e traz rasuras e anotações feitas à mão (como marcações e notas de acompanhamento). Aqui o uso do Amazon Textract com as rotinas de FORMS, TABLES e Handwriting Recognition se tornou obrigatório para garantir que as anotações visuais não fossem perdidas.
3. O Desafio do CSV: Dados Estruturados em Bancos Vetoriais
Bancos de dados vetoriais (usados no RAG) funcionam muito bem com texto narrativo, mas são pessimos para responder perguntas agregadas em tabelas (ex: "Qual a soma de vendas da região Sudeste?").
- Minha Abordagem: O pipeline via AWS Glue / Lambda transforma cada registro relevante do CSV em uma sentença descritiva ("A oportunidade OPP-102 do cliente X no segmento Y foi fechada por R$ Z...") e disponibiliza a tabela bruta no Amazon Athena para consultas analíticas em SQL direto.
🏷️ O Poder dos Metadados
Para que a Wiki responda não apenas com base no texto, mas sabendo quem, quando e onde as decisões foram tomadas, utilizei o Amazon Bedrock (Claude 3 Haiku) para extrair automaticamente metadados estruturados de cada documento e salvá-los no Amazon DynamoDB:
- Nome e Tipo do Documento
- Data da Reunião
- Lista de Participantes
- Decisões Aprovadas (IDs)
- Responsáveis e Prazos das Ações
Isso permite que a busca no Amazon OpenSearch Serverless faça um Filtro Híbrido (Busca Semântica + Filtro exato por responsável ou data).
🔮 O Oráculo: Respostas em Linguagem Natural com Citação de Fontes
Com os dados limpos, enriquecidos e vetorizados pelo Amazon Bedrock Knowledge Bases, a experiência do usuário se torna simples. Ao perguntar:
"Quais foram as decisões tomadas sobre a campanha do terceiro trimestre?"
O assistente (Bedrock Agent) responde de forma clara e cita a fonte exata:
"De acordo com a ata de reunião de 08/07/2026 (ata_reuniao_vendas_sa.pdf), foi aprovada por consenso a execução da campanha Rota 120 (Decisão D-004), com o objetivo de gerar R$ 6.000.000 em pipeline qualificado sob responsabilidade das gerências regionais."💡 Principais Aprendizados
- Arquitetura orientada ao dado: Nem todo documento que entra na nuvem deve seguir o mesmo caminho. Classificar antes de processar economiza recursos.
- RAG não é bala de prata: Tabelas numéricas exigem técnicas híbridas (Narrativa + SQL via Athena) para que a IA não invente números.
- Resiliência e Governança: O uso de Step Functions para orquestrar o pipeline com Retry em falhas e o Cognito / KMS para controle de acesso tornam a proposta pronta para ambiente de produção.
🔗 Repositório do Projeto
Você pode conferir a solução técnica completa, incluindo as Quests preenchidas e a estrutura dos metadados no meu repositório do GitHub:
👉https://github.com/Diofbjr/laboratorio-wiki-aws-diofbjr
Gostou da abordagem? Se esse artigo te ajudou a destravar o desafio ou trouxe ideias para suas arquiteturas na AWS, deixe seu comentário ou reação! 🚀



