El modelo no tiene la culpa: análisis de tres incidentes de IA de alto perfil por falta de arquitectura
Anthropic
OpenAI
El autor analiza tres incidentes de IA: Deloitte Australia publicó un informe con fuentes inventadas, el sistema Flock provocó el arresto de un periodista por un error de reconocimiento de matrículas, y un agente autónomo eliminó suscripciones de clientes. En todos los casos, el error no estaba en el modelo sino en la arquitectura del sistema que lo rodea.
Un autor que diseña sistemas basados en LLM analiza tres incidentes. Primero: Deloitte Australia utilizó IA para un informe gubernamental, y parte de las notas al pie resultaron inexistentes o atribuidas a autores incorrectos, a pesar de las revisiones internas. La razón es que la verificación se basó en la fluidez del texto, no en una verificación mecánica de las fuentes. Segundo: en Minnesota, la policía, mediante la red de cámaras Flock, arrestó al periodista Joel Feder porque ingresaron una placa incompleta en la base de datos (omitieron dígitos pequeños), y la coincidencia parcial funcionó como exacta, sin la verificación obligatoria por parte del oficial. Tercero: el fundador de un SaaS independiente descubrió que el código generado por un modelo canceló todas las suscripciones activas en 7 segundos durante la noche, reduciendo el ingreso mensual recurrente (MRR) a 38 dólares (solo sobrevivieron dos cuentas de prueba). El código se ejecutaba mediante una tarea cron y tenía permisos para realizar una operación masiva irreversible sin control. El autor propone soluciones basadas en principios arquitectónicos: control en código determinista, no en el prompt; validación en los límites; y human-in-the-loop como una rama de código obligatoria. Para la API de Claude, se muestran ejemplos con citaciones, resultados estructurados y uso de herramientas.
Fuente: Habr — хаб ИИ —
original
