Barato generar, caro verificar: el costo oculto de los resultados de IA
DeepMind
Google/DeepMind
Anthropic
OpenAI
DeepSeek
El artículo explora la asimetría introducida por la IA: mientras que generar borradores y respuestas ahora es barato, verificar su precisión sigue siendo difícil y costoso. Destaca investigaciones que muestran que incluso hechos individualmente verdaderos pueden combinarse en conclusiones falsas, y que las herramientas de verificación, tanto humanas como automatizadas, tienen limitaciones significativas.
El artículo aborda el desafío de verificar contenido generado por IA, enfatizando la asimetría entre el bajo costo de generación y el alto costo de verificación. Investigadores de la Universidad Nacional de Taiwán descubrieron que los modelos de lenguaje pueden combinar hechos verificables sobre diferentes personas en una sola biografía de una persona inexistente; las métricas estándar de factualidad no detectaron esto, y después de ajustar por ambigüedad de entidades, las puntuaciones de cuatro modelos abiertos cayeron más del 10%. Un estudio llamado Verify with Caution probó cinco métricas de factualidad en once conjuntos de datos, encontrando inconsistencias y errores, especialmente cuando el texto de apoyo estaba lejos de la afirmación. En experimentos con humanos, la asistencia de IA aceleró la verificación pero condujo a una excesiva confianza cuando el modelo daba explicaciones convincentes pero erróneas; mostrar pros y contras mitigó esto pero no ofreció una ventaja significativa sobre la búsqueda. El artículo compara la verificación en distintos dominios: el código tiene compiladores y pruebas, las matemáticas utilizan verificación formal de pruebas (por ejemplo, AlphaProof y AlphaGeometry 2 resolvieron cuatro problemas en la Olimpiada Internacional de Matemáticas de 2024), pero el análisis y la estrategia son más difíciles de verificar. Las sugerencias incluyen presentar las fuentes primero, como en Attribute First, luego Generate, y usar recompensas de proceso (ThinkPRM) para verificar los pasos de razonamiento. El artículo también menciona el enfoque basado en riesgos del NIST y la Ley de IA de la Unión Europea, que requieren más documentación y supervisión para sistemas de alto riesgo.
Fuente: Habr — хаб ИИ —
original
