La compañía de inteligencia artificial presenta un modelo centrado en ingeniería de software que incorpora por primera vez filtros automáticos para bloquear usos ofensivos en ciberseguridad

Claude Opus 4.7, la nueva apuesta de Anthropic en la carrera por la programación autónomaE. M.
Actualizado
OpenAI, Anthropic, Google y el resto de empresas de inteligencia artificial se han dado cuenta de que el mayor impacto de sus herramientas (y el mayor retorno económico) está de momento en la programación. Los modelos de lenguaje han resultado increíblemente competentes a la hora de generar código y en pocos meses se han convertido en una herramienta casi imprescindible.
Claude Opus 4.7, la última iteración del modelo de inteligencia artificial de Anthropic, lo deja claro. Acaba de ser lanzado al público general, pero con un planteamiento muy enfocado a los desarrolladores. Su mayor ventaja frente a Opus 4.6, según la compañía, es que resuelve tareas largas de programación con un rigor que sus versiones anteriores no alcanzaban, verifica sus propios resultados antes de darlos por buenos y sigue instrucciones con una precisión que hasta ahora no era posible.
El lanzamiento llega apenas una semana después de que Anthropic presentara Project Glasswing, la iniciativa con la que ha decidido ralentizar el despliegue de Mythos Preview (su modelo más potente) para evitar su uso en ataques informáticos. Opus 4.7 es en cierta forma un conejillo de indias de esa estrategia. Durante su entrenamiento, según explica la propia empresa, se han aplicado métodos para que no pueda ser utilizado en la búsqueda de vulnerabilidades o planificación de ataques. A eso se suma un sistema de filtros que detecta y bloquea automáticamente las peticiones que apuntan a usos prohibidos o de alto riesgo.
Los números de la propia Anthropic apuntan a un salto sustancial en las capacidades de Opus 4.7 para programación. En CursorBench, un test que mide la capacidad de completar tareas reales de código, Opus 4.7 supera el 70% de acierto frente al 58% de Opus 4.6. En una evaluación interna de Rakuten, ha resuelto tres veces más tareas de producción que su predecesor.
Pero el dato que mejor ilustra lo que Anthropic quiere vender es otro. Scott Wu, director ejecutivo de Cognition (la empresa detrás de Devin, uno de los agentes de programación más conocidos del mercado), afirma que el modelo "trabaja de forma coherente durante horas, incluso en problemas difíciles, en lugar de rendirse". La capacidad de mantener la concentración durante ejecuciones largas, sin desorientarse ni abandonar las tareas, es uno de los mayores problemas de estos modelos de lenguaje y obligan a menudo a los programadores a dividir las tareas en pasos sencillos o manejar multiples agentes de forma coordinada para obtener el resultado deseado.
A pesar de estar muy enfocado al mercado e la programación, Claude 4.7 también ha mejorado en visión. Puede procesar imágenes de hasta 2.576 píxeles, más del triple que versiones anteriores. Eso abre la puerta a usos que hasta ahora resultaban frustrantes como lectura de capturas de pantalla densas, o la extracción de datos de diagramas técnicos. XBOW, una empresa de pruebas de seguridad automatizadas, sitúa la precisión visual del nuevo modelo en el 98,5% frente al 54,5% de Opus 4.6.
Anthropic, eso sí, reconoce en su propia web que Opus 4.7 no es perfecto. El informe señala que el modelo es "mayoritariamente fiable, aunque no plenamente ideal en su comportamiento". En algunas métricas supera a Opus 4.6 (es más honesto y resiste mejor los ataques de inyección de prompts), pero en otras es ligeramente peor, como la tendencia a dar consejos excesivamente detallados sobre el uso de sustancias prohibidas. Mythos Preview sigue siendo, según la compañía, su modelo mejor alineado, pero de momento sigue sin estar disponible para el público general.
El precio de Opus 4.7 se mantiene en los mismos cinco dólares por millón de tokens de entrada y veinticinco por millón de salida (un token equivale más o menos a una palabra, aunque no siempre) que Opus 4.6. Sin embargo, el coste real a la hora de usarlo puede subir. Anthropic advierte de que el nuevo "tokenizador" del modelo puede procesar el texto de entrada generando un 35% más de tokens, y que en niveles de esfuerzo altos el modelo "piensa" más y produce por tanto más texto de salida, consumiendo más recursos
Es una admisión que posiblemente no guste a los usuarios más avanzados, que en las últimas semanas se han quejado de lo fácil que es llegar a los límites que Anthropic impone a las cuentas de suscripción a precio fijo, o el elevado coste en tokens de diferentes consultas.























