InvestigaciónSeguridad de IA 🇺🇸 27.07.2026 16:04

Google evalúa la alineación de tendencias conductuales en modelos de lenguaje grandes

Google/DeepMindGoogle/DeepMind
Google Research presenta un marco que convierte cuestionarios psicológicos en pruebas de juicio situacional (SJT) para evaluar la alineación conductual de los LLM. Al probar 25 modelos, se revela que los modelos más pequeños a menudo se desvían del consenso humano, mientras que los modelos más grandes muestran una alineación mejorada pero imperfecta. El estudio también encuentra que los modelos son demasiado confiados cuando las opiniones humanas divergen.
Google Research presenta un marco para evaluar las disposiciones de comportamiento en los LLM mediante la adaptación de cuestionarios psicológicos establecidos en pruebas de juicio situacional. El marco evalúa modelos en escenarios realistas como la compostura profesional y la resolución de conflictos. El análisis de 25 LLM muestra que los modelos más pequeños (menos de 25 mil millones de parámetros) tienen una alineación direccional marcadamente menor, a menudo a niveles cercanos al azar, mientras que los modelos fronterizos más grandes (más de 120 mil millones) logran una alineación casi perfecta bajo consenso humano unánime, pero se estancan en el rango bajo a medio de los 80 cuando el consenso es menor. Los modelos tienden a fomentar la apertura emocional donde los humanos recomiendan compostura, priorizan la armonía sobre la asertividad y muestran una mayor impulsividad. El estudio también revela que los modelos son sistemáticamente demasiado confiados cuando los anotadores humanos discrepan, sin representar la variedad de opiniones. Esto destaca la necesidad de una mejor alineación conductual para navegar adecuadamente las dinámicas sociales.
Fuente: Google Research — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas