Investigación 🇺🇸 27.07.2026 16:04

Evaluación de la Consistencia de las Tendencias de Comportamiento en Grandes Modelos de Lenguaje

Google/DeepMindGoogle/DeepMind
Google Research presentó un nuevo marco para evaluar las tendencias de comportamiento de los grandes modelos de lenguaje (LLMs), basado en cuestionarios psicológicos y pruebas situacionales. El análisis de 25 modelos mostró que los modelos pequeños presentan baja alineación con el consenso humano, mientras que los modelos grandes sobreestiman su confianza cuando el acuerdo humano es débil, lo que indica la necesidad de mejorar la alineación del comportamiento.
Los investigadores de Google presentaron un marco sistemático para evaluar las inclinaciones conductuales de los grandes modelos de lenguaje (LLM, por sus siglas en inglés), transformando cuestionarios psicológicos estándar en pruebas situacionales a gran escala (SJT, por sus siglas en inglés). En el trabajo se utilizaron herramientas validadas como el IRI (Índice de Reactividad Interpersonal, por sus siglas en inglés) para la empatía y el ERQ (Cuestionario de Regulación Emocional, por sus siglas en inglés) para la regulación emocional. Los modelos se probaron en escenarios realistas que incluyen comportamiento profesional, resolución de conflictos y tareas cotidianas. El análisis de 25 LLM reveló dos tipos de discrepancias: desviación del consenso humano con alta concordancia entre anotadores y reflejo insuficiente de la diversidad de opiniones con baja concordancia. Los modelos pequeños (menos de 25 mil millones de parámetros) mostraron una alineación significativamente peor, sin distinguir a menudo entre la expresión o supresión adecuada de rasgos. Los modelos grandes (más de 120 mil millones de parámetros) alcanzaron una alineación casi perfecta cuando había consenso unánime, pero con un consenso inferior al 90%, sus puntuaciones se estabilizaban en el 80%. El análisis cualitativo mostró que los modelos tienden a fomentar la apertura emocional en situaciones profesionales donde los humanos recomiendan moderación, y en disputas sociales priorizan la armonía sobre la defensa de la posición. También se detectó una sobreestimación sistemática de la confianza: los 25 modelos no reducían su confianza ante bajo consenso humano, lo que viola el principio de pluralismo de distribuciones. El marco también reveló discrepancias entre los autoinformes de los modelos y su comportamiento real: por ejemplo, los modelos suelen reportar baja impulsividad, pero en la práctica tienden a actuar impulsivamente.
Fuente: Google Research — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas