Barato para gerar, caro para verificar: o custo oculto das saídas de IA
DeepMind
Google/DeepMind
Anthropic
OpenAI
DeepSeek
O artigo explora a assimetria introduzida pela IA: enquanto gerar rascunhos e respostas agora é barato, verificar sua precisão continua difícil e caro. Destaca pesquisas que mostram que mesmo fatos individualmente verdadeiros podem se combinar em conclusões falsas, e que ferramentas de verificação, tanto humanas quanto automatizadas, têm limitações significativas.
O artigo discute o desafio de verificar conteúdo gerado por IA, enfatizando a assimetria entre o baixo custo de geração e o alto custo de verificação. Pesquisadores da National Taiwan University descobriram que modelos de linguagem podem combinar fatos verificáveis sobre pessoas diferentes em uma única biografia de uma pessoa inexistente; métricas padrão de factualidade não detectaram isso, e após ajustar para ambiguidade de entidades, as pontuações de quatro modelos abertos caíram mais de 10%. Um estudo chamado Verify with Caution testou cinco métricas de factualidade em onze conjuntos de dados, encontrando inconsistências e erros, especialmente quando o texto de apoio estava distante da afirmação. Em experimentos com humanos, a assistência de IA acelerou a verificação, mas levou a uma confiança excessiva quando o modelo deu explicações convincentes, porém erradas; mostrar prós e contras mitigou isso, mas não ofereceu vantagem significativa sobre a busca. O artigo compara a verificação em diferentes domínios: código tem compiladores e testes, matemática usa verificação formal de provas (por exemplo, AlphaProof e AlphaGeometry 2 resolveram quatro problemas na Olimpíada Internacional de Matemática de 2024), mas análise e estratégia são mais difíceis de verificar. Sugestões incluem apresentar fontes primeiro, como em Atribuir Primeiro, depois Gerar, e usar recompensas de processo (ThinkPRM) para verificar etapas de raciocínio. O artigo também menciona a abordagem baseada em risco do NIST e o Ato de IA Europeu, que exigem mais documentação e supervisão para sistemas de alto risco.
Fonte: Habr — хаб ИИ —
original
