O que a Cognition prometeu quando lançou o Devin
Em março de 2024, a Cognition AI apresentou o Devin como "o primeiro engenheiro de software com IA do mundo". O vídeo de lançamento mostrava a ferramenta recebendo uma tarefa em linguagem comum, abrindo um terminal, escrevendo código, encontrando um erro, corrigindo o próprio erro e entregando o resultado. Sem intervenção humana no meio do caminho.
A diferença em relação a ferramentas como Copilot ou Cursor era o grau de autonomia. Essas outras trabalham dentro do editor de código, ao lado de um programador que aprova cada passo. O Devin foi vendido como algo que recebe a tarefa e some por horas, voltando com o trabalho pronto. É a diferença entre um assistente que completa suas frases e um funcionário que recebe uma demanda e some até entregar.
Alguns termos que vão aparecer aqui:
- Agente autônomo: um sistema de IA que executa várias etapas sozinho (planejar, escrever, testar, corrigir) sem pedir aprovação a cada passo.
- Pull request (ou PR): a forma como um programador propõe uma mudança no código para que outra pessoa revise antes de entrar no sistema de verdade.
- Bug: um defeito no código. Pode ser visível (a tela quebra) ou silencioso (o cálculo do frete sai errado só em certos casos).
- Legado: código antigo que já está rodando no seu negócio, geralmente mal documentado e cheio de particularidades.
O que o Devin realmente entrega em 2026
Depois de dois anos de uso real por times de tecnologia, dá para separar o que funciona do que continua no vídeo de marketing.
Onde entrega bem: tarefas pequenas, bem delimitadas e repetitivas. Atualizar uma biblioteca desatualizada em vinte arquivos. Escrever testes para código que já existe. Corrigir um erro cuja mensagem é clara. Migrar um trecho de uma tecnologia para outra seguindo um padrão já definido. Nesses casos, o agente abre um PR razoável e o programador humano gasta minutos revisando em vez de horas escrevendo.
Onde não entrega: qualquer coisa que exija entender o negócio. Se a regra de comissão da sua equipe de vendas tem três exceções que só existem na cabeça do gerente comercial, nenhum agente vai adivinhar. Ele vai implementar algo plausível, que passa nos testes e está errado.
Um padrão consistente relatado por times que usaram agentes autônomos: a taxa de tarefas concluídas de forma aceitável cai bastante quando a tarefa envolve mais de um ou dois arquivos e um sistema grande já existente. Não existe um número universal aqui — depende brutalmente do quão organizado é o seu código —, mas a direção é clara: quanto mais bagunçado e antigo o sistema, pior o resultado do agente.
Onde a promessa de substituir o dev não se sustenta
Se você é gestor e está olhando para o custo da equipe técnica, esta é a parte que importa. São quatro pontos em que a matemática de "corto o time e uso IA" não fecha.
1. Alguém precisa saber se o código está certo
Um agente entrega código que roda. Roda não é a mesma coisa que está correto. A diferença entre as duas coisas só é percebida por alguém que sabe ler código. Se você demite o time e fica só com o agente, ninguém no seu negócio tem condição de dizer se aquele PR resolve o problema ou cria três novos. O erro aparece meses depois, em produção, com cliente reclamando.
2. Especificar bem é trabalho de engenheiro
Agentes falham por instrução ruim mais do que por incapacidade técnica. Escrever a instrução boa — dizer exatamente qual comportamento se espera, quais casos limite existem, o que não pode quebrar — é justamente a parte difícil da engenharia de software. Você não eliminou o engenheiro, você mudou o que ele digita.
3. O custo não é só a assinatura
Agentes autônomos rodam por tempo, consumindo processamento. Cobram por assinatura mensal e, em vários casos, por volume de uso adicional. Os valores variam bastante e mudam com frequência, então não confie em número que você viu num post antigo. O ponto relevante é outro: some ao custo da ferramenta o tempo de revisão humana e o custo de corrigir o que passou batido. Muita economia aparente na planilha desaparece nessa conta.