Agentes RSS

Agentes 🇷🇺

416 pruebas y un botón 'destruir todo': dónde fallan los proyectos de agentes

Un análisis de seis proyectos de agentes revela fallos recurrentes: la seguridad como mero texto, acciones irreversibles sin compuertas de seguridad y cero pruebas de comportamiento. Incluso un proyecto maduro de código abierto con pruebas de regresión aún carece de salvaguardas para el envío irreversible de correos electrónicos. El autor propone diez preguntas de diagnóstico para evaluar la madurez de los sistemas de agentes.

AnthropicAnthropic
Habr — хаб ИИ28.07 · 10:02
Agentes 🇨🇳

Primer modelo de difusión agéntico del mundo: se autocorrige mientras actúa, con un contexto de 128K que iguala a los modelos autorregresivos

El equipo inclusionAI de Ant Group lanzó LLaDA 2.2, el primer modelo de difusión agéntico a gran escala del mundo, con un contexto nativo de 128K. Integra edición Levenshtein, aprendizaje por refuerzo a partir de la retroalimentación del entorno y la arquitectura BlockRouting, logrando un rendimiento cercano a los mejores modelos autorregresivos en benchmarks de agentes, al tiempo que ofrece un mayor rendimiento.

QbitAI 量子位28.07 · 09:03
Noticias frescas