Dados com Python e Claude: o que a imersão mostrou sobre transformar prompt em skill
Fala, comunidade tech!
Na terça, 22/09, eu fiz a Imersão em Dados com Python e Claude. Foram mais de três horas com o Claude Code aberto, trabalhando em cima de uma base de dados cheia de problema, do jeito que ela chega no mundo real.
Logo no começo eu deixei um aviso para o chat. O que eu queria mostrar ali era um processo, com etapas e refinamento. Ele vale para o Claude Code, para o Codex, para o Antigravity ou para a próxima ferramenta que aparecer. Separei aqui o que mais rendeu.
A diferença entre o chat e uma IA que trabalha no seu computador
No chat, a IA fica presa numa janela. Você copia, cola e copia de novo. O Claude Code roda no seu computador e, com a sua permissão, lê arquivos, edita, executa e confere o resultado. Ele planeja, pede autorização, testa, corrige e repete até a tarefa ficar de pé.
Isso muda o tipo de trabalho que dá para entregar. Mas eu insisti num ponto: a IA funciona como copiloto. Ela acelera o jeito que você já trabalharia, seguindo os seus padrões. Se você não sabe o que quer, ela também não sabe.
Também conversamos sobre a diferença entre automação e agente. Uma automação segue um roteiro fixo e quebra quando alguma coisa muda, como o nome de um arquivo ou o ID de um botão. O agente recebe um objetivo, lê o erro e procura outro caminho.
Dar acesso ao computador exige limite
Esse poder tem um custo. Contei na live o caso de um agente que ficou rodando por 24 horas e decidiu comprar um recurso pago com o cartão salvo no navegador. Ninguém tinha dito que ele não podia.
A lição é definir o que o agente não pode fazer. Na prática, isso significa restringir o acesso a uma pasta, usar sandbox ou uma máquina separada, exigir aprovação em ações críticas e não deixar o modo automático ligado o tempo todo. No meu dia a dia, eu uso aprovação manual. Na live, liguei o automático só para ganhar tempo.
Com dados, vale outro cuidado: nada de dado sensível em ferramenta que você não controla. As versões Enterprise permitem bloquear o uso dos seus dados para treino.
Modelo melhor custa mais token
Expliquei do zero o que é uma LLM, o cérebro artificial que dá inteligência ao agente. O Claude Code deixa você escolher o modelo, e cada um tem um custo em tokens, parecido com crédito de celular.
Para mapear os dados, usei o Opus, que é um modelo intermediário. O Fable, o mais capaz, seria desperdício para essa tarefa. Na hora de reorganizar arquivos, desci para o Sonnet. Tarefa simples não precisa do modelo mais caro.
Prompt bom tem objetivo, contexto e formato de saída
Um pedido como "arruma esses dados aí" faz a IA chutar, fazer o que você não pediu e gastar mais. Um prompt bom deixa claro o objetivo, dá o contexto e diz em que formato você quer a resposta. Não precisa ser um texto de vinte páginas.
Premissa zero: nunca mexer na fonte de verdade
A parte prática começou pela regra mais importante da área de dados. Os arquivos originais ficaram numa pasta RAW, que ninguém edita. Tudo o que for tratado sai dali como cópia.
Antes de pedir qualquer código, criei duas pastas: specs, para as especificações, e python, para os scripts. Primeiro a spec, depois o código.
A base era um dataset fictício de vendas de jogos de PlayStation por região, com cerca de 15 mil registros. E tinha de tudo. Brasil escrito com S e com Z, Colômbia com e sem acento, "digital" e "download" como se fossem coisas diferentes, texto em coluna numérica, 9999 como valor suspeito, venda negativa e data em formatos diferentes.
O dicionário de dados evita que a IA adivinhe
O primeiro pedido foi um mapeamento de cada arquivo, em Markdown, com o nome da coluna, o significado, o tipo de dado, o formato esperado, as validações e a forma de checar a consistência.
Esse documento decide o que acontece com cada registro. Se um código de produto precisa seguir um padrão, como "PS" seguido de quatro dígitos, traço e seis dígitos, o registro que foge dele vai para quarentena ou é normalizado. Sem esse mapa, a IA adivinha.
Deixei o dataset e o mapeamento com o mesmo nome, como ps_sales.csv e ps_sales.md. Assim existe uma única fonte de verdade para cada base.
Prompt, skill e script
Quando o mapeamento ficou bom, eu pedi para o Claude transformar aquilo em uma skill. A skill é uma receita escrita uma vez, que o agente reutiliza sem você precisar explicar tudo de novo. Nasceu ali a csv-data-dictionary, com o passo a passo e um script Python com pandas embutido.
Depois apliquei a mesma skill na base de consoles, sem reescrever o prompt, e o resultado saiu no mesmo formato.
Daí veio a ideia que eu mais quero que você leve dessa imersão. Pense numa pirâmide. O prompt serve para explorar e é o que mais gasta. A skill serve para um processo que você já conhece e gasta menos. O script Python não gasta token nenhum, porque quem roda é o Python. Sempre que der, transforme prompt em skill e skill em script.
Python e IA se completam aqui. O Python abre, limpa e cruza os dados de forma previsível. A IA ajuda a montar o script e a interpretar o resultado.
Organize o projeto para a IA não se perder
Movi a skill para dentro do projeto, na pasta .claude/skills, para qualquer pessoa do time conseguir usar. Rodei o /init, que gera o CLAUDE.md, o arquivo que explica os padrões do projeto e o papel de cada pasta.
E mostrei o erro que muita gente comete, que é mover pasta na mão no meio do processo. O CLAUDE.md fica desatualizado e a IA se perde. Se precisar mover, avise o que mudou e peça para ela remapear.
Duas ferramentas ajudam nessa rotina. O modo Plan, no Shift+Tab, faz o Claude planejar antes de executar. O /context mostra quanto da memória da sessão já foi usado. Quando ela enche, a conversa é compactada e o fio se perde.
O resultado: um relatório que roda de novo sem custo
No fim, com datasets, mapeamentos, skills, scripts e CLAUDE.md organizados, os pedidos novos já não partiam do zero. O script final lê a base de consoles, compara com o mapeamento e gera um relatório de inconsistências, com uma tabela de-para para normalizar os valores. Rodar de novo não gasta token.
Os próximos passos são deixar o script dinâmico, montar um ETL, mandar os dados para uma API ou um banco e tratar a quarentena.
Um case pedido no chat
Alguém pediu um exemplo fora de tecnologia, e fizemos um para corretor de imóveis. Com o Claude no navegador, um agente leu anúncios de alto padrão em São Paulo e listou os pontos de interesse e o perfil ideal de cliente. Um segundo agente usou essa base para montar um relatório com eventos, comunidades e perfis onde encontrar cada público, de executivos a famílias com pets.
É o mesmo raciocínio da parte de dados, aplicado a outro trabalho.
Onde continuar
Se você está começando, a formação de Fundamentos de IA, com cerca de 10 horas, é o melhor ponto de partida. Depois vale escolher uma ferramenta, como n8n, CrewAI ou Lovable. Para quem trabalha com análise, a formação de Excel que eu gravei, com 29 horas, e os conteúdos de AI Reports ajudam a levar isso para o dia a dia.
A gravação da imersão, o repositório e os slides ficam na aba de Mentorias, para quem é DIO PRO, com certificado.
Na quinta, 24/09, às 19h, tem a Imersão em Inteligência Artificial com Claude Design e Claude Code. O acesso vai ser enviado no grupo: https://c.dio.me/imersoes-tech-ia
Se você quer acesso a tudo isso, a bolsa de estudo do DIO PRO Vitalício, patrocinada por grandes empresas parceiras da DIO, inclui:
✅ Acesso para sempre a matrículas ilimitadas em todos os bootcamps da DIO
✅ Acesso para sempre a +2.150 cursos, projetos e formações em agentes de IA, back-end, front-end, cloud, data, games, mobile e DevOps
✅ Acesso a 5.000 créditos para utilizar o AI Job Hunter e conquistar sua próxima vaga 3x mais rápido
✅ +65 formações incluindo: Excel com IA, GPT for Devs, AI Builder com Lovable, AI Automation com N8N e Formação Github Copilot
✅ Garantia total de 7 dias



