Seguridad de IAAgentes 🇨🇳 10.08.2026 09:01

Claude Code pasa al modo automático por defecto en 5 días; Anthropic asume los costos adicionales

AnthropicAnthropic OpenAIOpenAI
Anthropic convertirá el modo automático en la opción por defecto para Claude Code dentro de cinco días, alegando una baja tasa de rechazo de aprobaciones manuales de permisos y un mejor rendimiento de seguridad por parte del clasificador. El costo adicional de tokens por llamada a herramienta en el modo automático no se cargará a los usuarios. Plataformas en la nube como Amazon, Google y Microsoft tienen un mes para cambiar al modo automático por defecto.
Anthropic habilitará el modo automático por defecto en todas las instalaciones de Claude Code en cinco días, tras comprobar que solo el 3% de las solicitudes de permiso son rechazadas por los usuarios. El clasificador del modo automático consume un pequeño número de tokens adicionales por llamada a herramienta, pero Anthropic no trasladará este coste a los usuarios. Las plataformas en la nube como Amazon, Google y Microsoft, que actualmente ofrecen el modo automático como opción, deberán cambiarlo a modo automático por defecto en un plazo de un mes. El equipo interno de Anthropic ya utiliza exclusivamente el modo automático, según el 'padre de Claude Code'. Anthropic justifica el cambio con datos: la aprobación manual se ha vuelto habitual, con una tasa de aceptación del 97% en las solicitudes de permiso, mientras que la tasa de rechazo de solicitudes de permiso individuales es solo del 3%. En un experimento controlado con 1053 evaluadores remunerados, los participantes humanos interceptaron un comando claramente peligroso el 13,6% de las veces, mientras que el modo automático lo interceptó el 89% de las veces; el modo automático bloqueó 800 comandos que los humanos permitieron, mientras que los humanos bloquearon solo 6 comandos que el modo automático permitió. El rendimiento humano disminuyó con la duración de la sesión, pasando de alrededor del 17% al principio a aproximadamente el 5% después de 50 mensajes, mientras que la tasa de interceptación del modo automático se mantuvo constante. Los datos de producción reevaluados en una escala de gravedad de 0 a 10 mostraron que, en un nivel de gravedad 7 o superior, el 6,3% de las sesiones aprobadas manualmente implicaban acciones perjudiciales no solicitadas explícitamente por el usuario, en comparación con el 2,4% del modo automático. El clasificador fue sometido a pruebas adversarias con Apollo Research, que inyectó ataques sintéticos en trazas de código reales; tras el endurecimiento, el modo automático recuperó aproximadamente la mitad de los ataques previamente no detectados, reduciendo la tasa de fallos del 12% al 7% en conjuntos de datos combinados. En las pruebas de inyección de mensajes realizadas por Trajectory Labs, Claude Fable 5, Opus 5 y Sonnet 5 en modo automático no se vieron comprometidos en 720 intentos, mientras que GPT-5.6 Sol en modo de revisión automática de Codex tuvo una tasa de éxito del 5,83% y del 19,03% en modo de acceso completo. Tres casos públicos de interceptación incluyen el bloqueo de un plan para publicar un informe en un sitio público de intercambio de código, el bloqueo de una terminación masiva de procesos en 2000 pods y la señalización de un rol en la nube con permisos de administrador totales. Las nuevas capacidades incluyen la denegación estricta de la exfiltración de datos, la diferenciación del acceso a información clave y sensible, la comprobación del estado de git antes de comandos como git reset --hard y la detección de intentos de inyección en el lado de la API. Los usuarios pueden cambiar de modo con Shift+Tab en la interfaz de línea de comandos o con el menú desplegable de modo en el escritorio; los administradores pueden establecer valores por defecto a nivel de organización o desactivar por completo el modo automático. Anthropic señala que el modo automático reduce, pero no elimina, el riesgo, y recomienda revisar los cambios de alto riesgo.
Fuente: QbitAI 量子位 — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas