IA11 ago 2026 · 6 min

Auto mode por defecto en Claude Code: los números que llevaron a Anthropic a confiar más en un clasificador que en un desarrollador

Desde el 14 de agosto, Claude Code arranca en auto mode por defecto para las cuentas Pro, Max y Team: en vez de preguntar antes de cada acción, un clasificador bloquea solo lo irreversible, destructivo o dirigido fuera del entorno. Los datos que publicó Anthropic explican la decisión — y plantean qué controles necesita hoy un equipo que corre estos agentes contra sistemas de producción.

El 7 de agosto Anthropic anunció que, a partir del 14, las cuentas Pro, Max y Team de Claude Code van a arrancar en auto mode por defecto. El cambio venía probándose desde marzo como opción, pero ahora pasa a ser el comportamiento de fábrica: en vez de mostrar un prompt de aprobación antes de cada acción —leer un archivo, ejecutar un comando, hacer un commit—, un clasificador revisa cada llamada a herramienta y solo interrumpe cuando detecta algo irreversible, destructivo o dirigido fuera del entorno de trabajo. Si el clasificador bloquea algo, Claude por lo general encuentra un camino más seguro por su cuenta o le pregunta directamente al usuario; si no puede avanzar —tres bloqueos seguidos, o veinte en una misma sesión— Claude Code cae de nuevo a aprobación manual. Para cuentas Enterprise, la API, y los despliegues en AWS, Google Cloud y Microsoft Foundry, el modo sigue siendo opcional por ahora, con el mismo cambio planeado para "el próximo mes" según Anthropic.

Lo interesante no es la función en sí —el auto mode ya existía— sino los datos que Anthropic publicó para justificar por qué confía más en el clasificador que en la revisión manual promedio. Vale la pena mirarlos, porque son el tipo de evidencia que cualquier equipo debería exigir antes de dejar que un agente de código opere sin supervisión constante contra sus propios sistemas.

Por qué la revisión manual dejó de ser el control más seguro

El dato de partida es incómodo: según Anthropic, los usuarios de Claude Code aprueban el 97% de los prompts de permisos que se les presentan. Es una cifra que sugiere hábito más que juicio — la mayoría de esos prompts son para comandos rutinarios y seguros, pero una tasa de aprobación tan alta también implica que buena parte de las decisiones se toman por reflejo, no por revisión real. El contraste con otro tipo de interacción es revelador: cuando Claude presenta un plan completo para aprobación, los usuarios lo rechazan el 39% de las veces. Frente a un plan, la gente piensa. Frente a un prompt de permiso individual, hace clic.

Para probar si eso importa, Anthropic contrató a 1.053 testers pagos para un estudio ciego: en algún punto de la sesión, un prompt de permiso normal se reemplazaba por uno claramente peligroso, sin que el tester supiera que estaba siendo evaluado en eso específicamente. Los testers detectaron el comando peligroso el 13,6% de las veces (143 de 1.053). El auto mode lo bloqueó el 89% de las veces (937 de 1.053). Cara a cara, el clasificador bloqueó 800 comandos que un humano había aprobado; los humanos bloquearon solo 6 que el clasificador había dejado pasar. Y el patrón empeora con el tiempo: la tasa de detección humana cae de 17% al principio de una sesión a 5% después de 50 o más prompts previos, mientras que el clasificador se mantiene estable sin importar cuán larga sea la sesión.

En sesiones reales marcadas por el pipeline de seguridad de Anthropic entre mayo y junio de 2026, las que pasaron por aprobación manual tuvieron más del doble de probabilidad de contener un daño real no solicitado explícitamente por el usuario, en comparación con las que corrieron en auto mode: 6,3% contra 2,4% en el nivel de severidad más alto medido (acciones equivalentes a borrar filas de una base de datos de producción). Del lado de la productividad, los equipos de Teams y Enterprise que ya adoptaron auto mode como default envían aproximadamente 25% más pull requests.

Tres incidentes que el clasificador frenó puertas adentro

Anthropic también corre auto mode como default interno, y compartió tres casos concretos donde el clasificador evitó un daño real. En el primero, una carga a un drive interno falló y el intento de respaldo de Claude fue publicar el mismo reporte en un sitio público de código compartido — el clasificador bloqueó ese fallback y le preguntó al usuario cómo seguir. En el segundo, durante una sesión larga, Claude intentó matar procesos en unos dos mil pods y encoló eliminaciones que habrían tirado abajo cientos de GPUs de trabajos de entrenamiento en curso; el clasificador marcó los comandos destructivos antes de ejecutarlos. En el tercero, al pedirle acceso de solo lectura a un sistema de facturación, Claude fue a buscar un rol de nube que otorgaba control administrativo total a nivel de cuenta raíz — el clasificador detectó el desajuste entre lo pedido y lo que ese rol realmente habilitaba.

Los tres casos comparten algo: no son ataques externos, son errores de sobre-alcance que cualquier agente que opera en loop, sin que un humano mire cada paso, puede cometer sin intención maliciosa. Es la misma preocupación que ya señalamos en esta columna al hablar de agentes en loops autónomos — la diferencia es que acá Anthropic construyó, y publicó con números, la capa de contención pensada para ese riesgo específico.

La otra cara: hard denies y menos superficie para el ataque externo

El auto mode no reemplaza las reglas de permisos existentes — las respeta primero, salvo un caso: reglas de allow-list demasiado amplias, como Bash(python:*), que dejarían pasar cualquier ejecución de código sin pasar por el clasificador, se dejan de lado mientras el modo está activo. Anthropic reporta que, a junio de 2026, el 49,5% de los usuarios activos de la CLI había creado manualmente alguna regla de allow para Bash, con ese porcentaje creciendo cerca de 5 puntos cada 5 semanas — una tendencia hacia menos fricción que el auto mode busca revertir sin volver a los prompts constantes.

Para exfiltración de datos —enviar código o secretos a un destino externo— el clasificador aplica denegación dura: no hay forma de aprobarla desde el modo automático, hay que salir de él o correr el comando a mano. Esas reglas son configurables, así que una organización puede sumar las propias. En una evaluación de terceros contra 72 escenarios de inyección de prompt, ningún ataque tuvo éxito contra Claude en auto mode, frente a 5,83% de éxito contra GPT-5.6 Sol en el modo Auto-review de Codex.

Qué hacer con esto esta semana

Si tu equipo usa Claude Code en un plan Pro, Max o Team, el cambio llega automáticamente el 14 de agosto salvo que ya tengas un modo por defecto fijado — decidilo de forma consciente antes de esa fecha en lugar de dejar que el aviso in-product decida por vos: revisá qué modo tenés activo con Shift+Tab en la CLI o el selector del desktop, y si administrás una organización, definí defaultMode en la configuración gestionada en vez de dejarlo a criterio de cada developer. Segundo, si trabajás con datos sensibles o infraestructura de producción, sumá tus propias reglas de hard deny para los destinos que nunca deberían recibir un push o una llamada saliente, sin confiar solo en las reglas por defecto de Anthropic. Tercero, y esto lo dice la misma Anthropic: para cambios de alto impacto en producción, seguir revisando manualmente sigue siendo lo recomendado — el auto mode reduce el riesgo del clic reflejo en el 97% de los prompts rutinarios, no elimina la necesidad de mirar con atención el 3% que de verdad importa.