Buscar

Cursor lanza Projects y su agente coordinador, GPT-Rosalind abandona la versión preliminar de investigación, Runway licencia sus pesos cerrados

ai-powered-markdown-translator

Artículo traducido del fr al es con gpt-5.6-sol.

Ver proyecto en GitHub ↗

Cincuenta y dos anuncios, publicados en su mayoría el 11 de septiembre, y una misma idea que se repite entre actores que no se comunican entre sí. Cursor confía un proyecto entero a un agente coordinador que no programa y delega en miles de subagentes, Cognition ejecuta dos modelos en tándem en la máquina del desarrollador y Sakana dirige cada tarea hacia el modelo más ligero capaz de resolverla. Ese mismo día, OpenAI saca su modelo para ciencias de la vida de la versión preliminar de investigación con una tabla pública de precios, Runway licencia los pesos de sus modelos cerrados para empresas y Anthropic publica un subcomando que por fin mide qué aporta realmente un plugin.


Cursor lanza Projects, proyectos dirigidos por un agente coordinador

10 de septiembre — Cursor ha lanzado Projects, una reformulación de la forma en que se asigna trabajo a un agente dentro del editor. El producto rompe con la costumbre asentada durante los últimos dos años: en lugar de abrir una conversación nueva para cada tarea y cerrarla después, el usuario dialoga con un agente coordinador en un hilo que dura meses. Este coordinador no escribe ni una línea de código. Dirige a otros agentes que lo escriben, lo que le permite permanecer siempre disponible para recibir instrucciones mientras avanza el trabajo.

Tres mecanismos lo hacen posible. En primer lugar, la ejecución predeterminada en la nube: un Project funciona en su propia máquina, cerrar el portátil no lo interrumpe y la cantidad de subagentes en paralelo deja de estar limitada por el hardware local. Un agente local se inicia cuando una prueba debe ejecutarse en la máquina del desarrollador. Después, el contexto compartido: cada Project mantiene un conjunto de archivos sincronizados en todas las máquinas, donde los agentes depositan sus investigaciones, sus artefactos y lo que comprenden del código. Si uno descubre cómo probar un servicio, todos los siguientes disponen del procedimiento. El tercer mecanismo es el más inusual. Cursor lo denomina suscripciones (subscriptions): el coordinador puede supervisar un canal de Slack, ejecutarse según un calendario o seguir todas las pull requests para reparar la integración continua. El agente actúa al detectar una señal, sin esperar a que se lo soliciten.

Población analizadaEfecto observado en las pull requests
Nuevos usuarios de Projects30 por ciento más fusionadas
Usuarios que trabajan principalmente en ProjectsSeis veces más fusionadas
Project de design system internoEntre 20 y 100 pull requests afectadas al día, en proyección

The coordinator doesn’t write code itself but directs other agents that do. Because it delegates rather than executes, it is never blocked and is always responsive to direction.

🇪🇸 El coordinador no escribe código por sí mismo, sino que dirige a otros agentes que lo hacen. Como delega en lugar de ejecutar, nunca queda bloqueado y siempre permanece receptivo a las instrucciones.Cursor, blog de Projects

Estas cifras son mediciones internas y deben interpretarse con la debida cautela. El ejemplo más ilustrativo sigue siendo el de la jardinería, el nombre que Cursor da al trabajo que nunca termina: un ingeniero ejecuta un Project dedicado al design system, que examina cada nueva pull request, extrae de ella los componentes que tienen cabida en el sistema y añade una regla de lint en cuanto detecta dos veces el mismo error. Projects está en beta y se despliega progresivamente desde el 10 de septiembre. El anuncio no menciona condiciones de precios ni restricciones de planes.

🔗 Anuncio de Cursor en X


GPT-Rosalind abandona la versión preliminar de investigación con su tabla de precios

11 de septiembre — OpenAI Developers anuncia que GPT-Rosalind, su modelo de razonamiento dedicado a las ciencias de la vida, abandona la versión preliminar de investigación (research preview). Presentado el 16 de abril de 2026 para la investigación biológica, el descubrimiento de medicamentos y la medicina traslacional, el modelo solo estaba disponible entonces para clientes Enterprise elegibles en Estados Unidos. Pasa a un acceso de confianza (trusted access) para organizaciones elegibles de todo el mundo, a través de la API, Codex y ChatGPT Enterprise, y este acceso abarcará los próximos modelos de la serie a medida que se publiquen.

El changelog de la API, en una entrada fechada el 8 de septiembre, proporciona los detalles que el hilo de X no menciona. El modelo se llama gpt-rosalind-research y su disponibilidad general sigue condicionada al programa de acceso de confianza, reservado a la investigación interna en ciencias de la vida aprobada por OpenAI.

Elemento de precio o accesoValor anunciado
Identificador del modelogpt-rosalind-research
Tokens de entrada5 dólares por millón
Tokens de entrada en caché0,50 dólares por millón
Tokens de salida25 dólares por millón
Inicio de la facturación5 de octubre de 2026
Vías de accesoAPI, Codex, ChatGPT Enterprise
Condición de accesoPrograma de acceso de confianza, organizaciones elegibles

La facturación no comienza hasta el 5 de octubre: durante la versión preliminar de investigación, el uso no consumía créditos ni tokens. En cuanto a las herramientas, los plugins Life Sciences de Codex constituyen la capa de orquestación del modelo, desde la genómica hasta la estructura de las proteínas y la investigación traslacional, desde la recopilación de evidencias biológicas hasta la generación de informes de control de calidad y notebooks interactivos. Este paquete, publicado gratuitamente en GitHub en abril, brinda acceso a más de 50 bases de datos multiómicas públicas, fuentes bibliográficas y herramientas de biología; funciona con los modelos generalistas para todo el mundo, pero solo los usuarios Enterprise elegibles pueden combinarlo con GPT-Rosalind.

El rendimiento declarado sigue siendo el del lanzamiento: la mejor puntuación publicada en BixBench, una ventaja sobre GPT-5.4 en 6 de las 11 tareas de LABBench2, con la mayor diferencia en CloningQA, y, en una tarea de secuencia-función de ARN diseñada con Dyno Therapeutics, una mejor propuesta situada por encima del percentil 95 de 57 expertos humanos en predicción. La información concreta es doble: un modelo especializado que abandona su condición experimental con un precio público y una ampliación geográfica del acceso. La barrera sigue siendo la elegibilidad, que no está disponible mediante autoservicio.

🔗 Hilo de OpenAI Developers en X


Runway Model Licensing: los pesos de los modelos cerrados se entregan a las empresas

11 de septiembre — Runway ha abierto un programa de licencias para sus modelos (Model Licensing) destinado a las empresas. El principio rompe con el acceso mediante API: el cliente recibe los pesos completos de un modelo Runway de última generación, lo ajusta con sus propios datos, lo aloja en su infraestructura y comercializa lo que obtiene de él. Los datos y las generaciones nunca abandonan el entorno del cliente, lo que apunta explícitamente a estudios, marcas y gobiernos.

Elemento entregadoContenido
Pesos del modeloPesos completos como punto de partida
CheckpointsVarias versiones del modelo para validar
Script de entrenamientoCódigo para añadir sus datos y ejecutar sus ajustes
EntregaEmpaquetada en la base de código del cliente y alojada donde este desee
Investigadores asignadosAyuda práctica con la configuración, los pesos y la entrega

El alojamiento puede realizarse, a elección del cliente, en su nube, en su centro de datos o totalmente en sus instalaciones, incluso en un entorno aislado de la red (air-gapped) para las administraciones públicas. Se mencionan seis sectores: plataformas de software, cine y estudios, marcas y marketing, robótica e IA física con World Action Model como columna vertebral de políticas (policy backbone), videojuegos y 3D con la mejora fotorrealista de renderizados de baja calidad, y gobiernos.

En el plano económico, Runway distingue dos vías: Runway Dev, la API facturada por uso, sin infraestructura que gestionar; y la licencia anual, con una economía predecible y control total de las versiones, el comportamiento y las salidas. La sección de preguntas frecuentes responde a la objeción de la obsolescencia: los modelos futuros no tendrán acceso a los datos propietarios del cliente, se contempla la renovación anual y se conceden créditos para las generaciones siguientes. Sitúa el coste de una reconstrucción interna en años de aprendizaje y cientos de millones de dólares. La empresa se presenta como una de las poquísimas del mundo que licencia pesos cerrados de esta calidad y contrapone abiertamente su oferta a los pesos abiertos, que, según ella, entregarían un modelo más débil acompañado de una lista de tareas. No se publica ningún precio; el acceso requiere un formulario comercial. El anuncio llega nueve días después de Runway Dev MCP y una semana después del plan Team: Runway cubre ahora toda la gama, desde el creador individual hasta la licencia de pesos cerrados.

🔗 Página de Model Licensing


Cognition lleva Fusion a Devin Desktop y Devin CLI

11 de septiembre — Cognition ha anunciado la disponibilidad de Fusion en Devin Desktop y Devin CLI. La arquitectura llevaba varios meses funcionando en Devin Cloud; ahora llega a la máquina del desarrollador. El anuncio se produce un día después de SWE-2, el modelo de código propio, y ambos están relacionados, puesto que SWE-2 es el segundo modelo recomendado del sistema.

El principio es fácil de enunciar. Al elegir Fusion, no se selecciona un modelo, sino dos. Un modelo de vanguardia actúa como líder (lead) y conserva el control de la sesión: posee el plan, resuelve las ambigüedades y revisa el trabajo entregado. Un modelo menos costoso actúa como asistente (sidekick): explora el código, escribe los cambios, ejecuta las pruebas e informa de los resultados. Ambos funcionan en paralelo, cada uno con su propio contexto persistente. El argumento técnico se opone al enrutamiento de modelos, la solución que surge espontáneamente para reducir la factura: un prompt inicial no basta para medir la dificultad de una tarea, y cambiar de modelo durante el proceso rompe la caché del prompt. Fusion evita el problema al no transferir nunca las conversaciones completas entre ambos modelos, que solo intercambian instrucciones, resultados y comentarios.

Coste por tarea, en dólaresSolo Fable 5.1Fusion Fable 5.1 y SWE-2Solo AstraFusion Astra y SWE-2
DeepSWE 1.114,637,887,884,69
Terminal-Bench 417,4613,3710,086,06
SWE-Atlas QnA7,575,005,723,59
Vals Code Migration70,9742,0044,3635,51
FrontierCode 1.1 ampliado2,681,672,622,34

One of our key findings is that using more expensive models can make the entire system cheaper.

🇪🇸 Uno de nuestros principales descubrimientos es que utilizar modelos más caros puede abaratar el sistema en su conjunto.Cognition, blog sobre Fusion local

La demostración se realiza desde ambos lados del tándem. Por el lado del líder, sustituir Opus 4.8 por Fable 5, que cuesta nominalmente el doble por token, redujo el coste medio de las sesiones en un 9 por ciento con el mismo asistente, además de lograr una mejor puntuación en FrontierCode: Fable delegaba antes y redactaba mejores instrucciones, mientras que Opus microgestionaba a su asistente. Por el lado del asistente, pasar de GPT-5.6 Luna a SWE-2, es decir, un 275 por ciento más por millón de tokens, reduce el coste total de la tarea en un 2 por ciento y mejora la puntuación en 1,4 puntos. En el índice Artificial Analysis Coding Agent Index v1.5, Fusion con Fable 5.1 y SWE-2 obtiene 61,7 con un coste un 36 por ciento inferior al de Claude Code con Fable 5.1, que se queda en 62,2. Cognition extrae de ello una regla para 2026: evaluar los modelos, y las combinaciones de modelo y arnés, por el precio por tarea y no por el precio por token. Una postura cómoda para un proveedor que vende un arnés, pero las cifras se obtuvieron con Artificial Analysis y Vals AI en cinco benchmarks distintos. Instalación mediante un único comando.

🔗 Anuncio de Cognition en X


Sakana AI lanza Fugu Max y Fugu Ultra v2, dos evoluciones de su orquestador multiagente

11 de septiembre — Sakana AI publica Fugu Max y Fugu Ultra v2, dos nuevas versiones de Sakana Fugu, su sistema de orquestación multiagente (multi-agent orchestration system) expuesto detrás de una única API compatible con OpenAI. El hilo conductor es la frontera de Pareto: Sakana considera que el sector sigue razonando como si la capacidad fuera el único eje, cuando una tarea real se evalúa según dos: capacidad y coste.

Fugu no es un modelo único, sino una capa de orquestación aprendida que dirige cada tarea hacia un pool de modelos de pesos abiertos y especializados. Fugu Max amplía este pool, el mayor hasta la fecha según la empresa, incorporando la familia NVIDIA Nemotron, y envía cada tarea al modelo más ligero capaz de resolverla. Obtiene la mejor puntuación global en seis benchmarks y amplía la frontera coste-rendimiento en siete de diez, a 2 dólares por millón de tokens de entrada y 6 de salida, un precio de salida que Sakana anuncia entre un 40 y un 60 por ciento por debajo de los de Sonnet 5, GPT 5.6 Terra y Kimi K3.

Métrica anunciadaPuntuaciónComparación proporcionada por Sakana
Fugu Ultra v2, Chartography48,3Opus 5 con 27,3; Fable 5 con 29,5
Fugu Ultra v2, DeepSWE74,3Por delante de modelos entre 3 y 5 veces más caros por token
Fugu Ultra v2, clasificación1.º o empatado en 5 de 8 benchmarksTop 2 en 7 de 8
Fugu Max, clasificación generalMejor puntuación en 6 benchmarksFrontera de Pareto ampliada en 7 de 10

Conviene destacar el punto en el que Sakana más insiste: Fable 5, Fable 5.1 y GPT-6-Astra no forman parte del pool de agentes de Fugu Ultra v2, cuya fecha límite de entrenamiento es el 28 de agosto de 2026. El argumento es la resiliencia del suministro: un pool intercambiable que protege frente a la dependencia de un proveedor, las revocaciones de API y las interrupciones del servicio. Ambos modelos están disponibles de inmediato, y un usuario de Fugu cambia a Max o Ultra v2 modificando un único parámetro. Fugu Max también está disponible en OpenRouter, con entrada multimodal, búsqueda web, razonamiento configurable y salidas estructuradas. Advertencia de uso: Sakana elige los benchmarks y los modelos de comparación, SWEFish es un banco de pruebas interno y las diferencias reivindicadas dependen de las tarifas de los modelos comparados en el momento de la publicación.

🔗 Presentación de Fugu Max y Fugu Ultra v2


ElevenLabs lanza Music v2.5, con descargas sin pérdida en todos los planes

11 de septiembre — ElevenLabs ha publicado Music v2.5 y lo ha establecido como opción predeterminada en ElevenMusic, tanto para la generación mediante prompt como mediante referencia de audio. El modelo promete instrumentos que suenan como una grabación en directo, arreglos más profundos, composiciones largas, transiciones de género durante una misma pieza, rap y voces que suenan nativas en el idioma del texto. La métrica presentada es una prueba a ciegas con 47 885 pares, una muestra por modelo para un mismo prompt: Music v2.5 fue el preferido la mayoría de las veces, con la diferencia más marcada en los géneros dominados por la voz y la acústica: R&B, soul, hip-hop, rock, metal, música orquestal y bandas sonoras. No se publica el porcentaje exacto de preferencia.

El segundo aspecto cambia aún más las reglas del juego para los usuarios. Cada pieza creada en ElevenMusic pertenece a su autor en todos los planes, incluido el gratuito. El plan gratuito ofrece cinco descargas sin pérdida (lossless) al día con uso comercial, siempre que se atribuya a ElevenMusic; el plan Pro ofrece 400 al mes. Los permisos adquiridos en el momento de la creación permanecen vinculados a la pieza: cancelar el plan o cambiar a uno inferior no altera nada para los temas ya producidos, y cualquier cambio futuro en las condiciones solo se aplicaría a los nuevos. La única excepción es una pieza creada a partir de la canción de otro artista, cuya descarga queda bloqueada.

Elemento medido o anunciadoValor
Pares evaluados en la prueba a ciegas47 885
Descargas sin pérdida, plan Free5 al día, uso comercial con atribución
Descargas sin pérdida, plan Pro400 al mes
Identificador de APImusic_v2_5
Modelo predeterminado en ElevenMusicMusic v2.5, se mantiene Music v2

El modelo también está disponible en ElevenCreative, como nodo Music en Flows, y en la API con el identificador music_v2_5. ElevenLabs precisa que el acuerdo plurianual anunciado el día anterior con Universal Music Group es independiente de este lanzamiento. Para el lector, el orden de los anuncios importa: primero se anuncia el acuerdo con el sello discográfico principal y al día siguiente se lanzan el modelo y los derechos de uso ampliados.

🔗 Anuncio de ElevenLabs en X


Claude Code mide lo que realmente aporta un plugin, con él y sin él

11 de septiembre — El equipo de Claude Developers anuncia claude plugin eval, un subcomando de Claude Code que ejecuta un plugin o un skill con una serie de casos de prueba, puntúa cada ejecución y luego repite cada caso sin el plugin para medir lo que aporta. La idea es sencilla y algo incómoda: una puntuación alta no demuestra que un plugin ayude, porque Claude a veces obtiene un resultado igual de bueno sin él. Por tanto, el comando devuelve dos puntuaciones y la diferencia entre ellas. Si un caso obtiene 1,0 en ambos grupos, el plugin no ha contribuido a ello.

El punto de entrada es claude plugin eval init, ejecutado en la raíz del plugin. Se abre una sesión interactiva: Claude lee el plugin, pregunta cómo sería un buen resultado, propone prompts que deberían y no deberían activarlo, diseña los verificadores (graders), los prueba una vez, crea un directorio por caso y anuncia el coste estimado de una ejecución completa. Después, cada caso se ejecuta tres veces con el plugin y tres veces sin él, es decir, seis ejecuciones, porque una única ejecución de un agente no determinista no aporta demasiada información. El terminal muestra una tabla con y sin el plugin, se guarda en el disco un informe HTML autónomo y el informe se publica como artefacto privado cuando la cuenta lo permite.

Tipo de verificadorCoste en llamadas al modeloCondición de éxito
regexningunoPatrón encontrado en la última respuesta, la traza o un archivo
tool_usedningunoNúmero de llamadas a una herramienta entre un mínimo y un máximo
tool_orderningunoUna llamada precede a otra
file_existsningunoUn archivo creado durante la ejecución coincide con el patrón
llmun modelo evalúaVeredicto favorable en al menos 2 de 3 votos
baselineun modelo evalúaLa ejecución iguala al menos una transcripción de referencia

Conviene entender un matiz antes de interpretar una diferencia: un verificador que exige que se invoque el skill nunca puede superarse sin el plugin, por lo que se excluye de la puntuación de ambos grupos y solo se incluye como indicador; de lo contrario, la diferencia quedaría inflada artificialmente. El aislamiento es estricto. Cada ejecución es un proceso hijo desechable, sin configuración de usuario, hook, CLAUDE.md, servidor MCP, plugin instalado ni memoria. Las ejecuciones nunca solicitan permisos, y las herramientas sensibles se eliminan de la sesión salvo autorización explícita; si se permite Bash o PowerShell en una máquina sin un backend de sandbox, Claude Code rechaza la ejecución en vez de realizarla sin aislamiento. Un plugin que interactúa con herramientas MCP puede evaluarse sin el servicio real mediante un archivo Markdown por herramienta que proporciona la respuesta, con un bloque que cancela la ejecución si el plugin envía algo distinto de lo previsto.

Evals call the model, so they use tokens and results vary. […] Your plugin’s hooks and MCP servers run as you, so only evaluate plugins you trust.

🇪🇸 Las evaluaciones invocan el modelo, por lo que consumen tokens y los resultados varían. […] Los hooks y servidores MCP de tu plugin se ejecutan con tus permisos, así que evalúa únicamente plugins de confianza.@ClaudeDevs en X

El coste es real: cada ejecución y cada verificador evaluador constituye una llamada al modelo que se descuenta del plan o de la factura; el ejemplo de la documentación indica 74 segundos y 0,41 dólares para un caso de seis ejecuciones. De ahí la recomendación del equipo: hacer primero una prueba con --runs 1 antes de iniciar una ejecución completa. Para la integración continua, se documentan los códigos de salida, incluido el 0 cuando todo se supera y el 2 para una ejecución parcial cuando se alcanza el límite de coste. Según la documentación, el primer hallazgo típico es una diferencia cercana a cero con el verificador del skill fallando: Claude no selecciona el skill ante una formulación natural y es su descripción la que debe revisarse.

🔗 Documentación de las evaluaciones de plugins

El resto de la versión 2.1.269

El subcomando llega en la versión 2.1.269, publicada el 11 de septiembre a las 21:17, hora de París. El resto de las incorporaciones son más discretas, pero útiles en el día a día. El comando /output-style muestra y cambia el estilo de salida, incluso mediante Remote Control y en sesiones cloud o headless. Cuando se utiliza la herramienta Bash para modificar archivos, su resultado incluye ahora el diff de los archivos modificados, lo que devuelve a Claude la misma visibilidad que con una edición convencional. En cuanto a observabilidad, una variable de entorno etiqueta las métricas y los eventos de OpenTelemetry por repositorio, y otras dos configuran el tiempo de espera para descubrir los modelos de una pasarela y el límite de agentes simultáneos de la herramienta Workflow, hasta 256.

Las correcciones afectan a tres áreas sensibles: la invalidación parcial de la caché de prompts después de interrumpir y reanudar una respuesta; las reglas de permisos que comienzan con una negación, que ahora solo se aplican a la fuente de configuración que las creó; y la comprobación de la ruta de escritura, que por fin incluye el archivo escrito por un comando tee. El git status comunicado después de una compactación es ahora el actual y no el del inicio de la sesión. En VS Code, una insignia abre un mapa de los subagentes con fichas, un botón para detenerlos y transcripciones de solo lectura, mientras que dos cuadros de diálogo permiten gestionar los hooks y las reglas de permisos en la configuración de usuario, del proyecto y local.

🔗 Notas de la versión 2.1.269


Antigravity: cuatro versiones en una semana y una puesta al día sobre Teamwork

Google ha publicado consecutivamente dos versiones de su línea de comandos y una nueva versión de su aplicación, sin contar otras dos versiones anteriores que nunca se trataron aquí. Merece la pena leer el changelog en conjunto, porque los lanzamientos de la semana cuentan la misma historia: el agente abandona el terminal interactivo para convertirse en un servicio.

🔗 Changelog de Antigravity

Antigravity CLI 1.2.0: la CLI se convierte en un daemon en segundo plano controlado mediante Remote Control

10 de septiembre — La versión 1.2.0 de Antigravity CLI es la primera actualización de versión menor desde julio. Tres subcomandos, remote-control start, status y stop, registran la línea de comandos en el gestor de servicios del sistema como un daemon en segundo plano que sobrevive a las desconexiones y los reinicios, con una opción para asignar un nombre a la instancia y otra para limitar el servicio a la sesión de inicio de sesión activa. Hasta ahora era necesario mantener un terminal abierto. El desplazamiento de media página se amplía a todas las vistas con dos nuevos atajos predeterminados. Entre las ocho correcciones, la más útil para entender un comportamiento inesperado es esta: un prompt o una respuesta bloqueados por los filtros de seguridad de contenido muestran ahora el motivo explícito de la detención, mientras que antes el usuario veía un error genérico o un turno vacío. Los servidores MCP integrados en plugins globales por fin se inicializan correctamente al arrancar.

Antigravity CLI 1.1.28: reintentos ampliados en caso de error, modo sin interfaz acelerado y lectura de URL sujeta a aprobación

9 de septiembre — El día anterior, la versión 1.1.28 concentró nueve mejoras en la resiliencia y el modo sin interfaz, el que se invoca desde un script. Los errores transitorios de la API del modelo vuelven a intentarse con un backoff exponencial ampliado, el inicio ya no genera una solicitud de red para consultar la identidad del usuario y se eliminan hasta 200 milisegundos de espera inactiva en cada turno. Dos cambios de comportamiento merecen la atención de quienes automatizan.

Cambio de comportamientoAntes de la versión 1.1.28Desde la versión 1.1.28
Tiempo de espera agotado en modo scriptError de timeoutSe devuelve una salida parcial, código de éxito y aviso
Lectura de una URL externa por el agenteSin solicitudSe pide aprobación de forma predeterminada, salvo acceso previamente concedido

Por tanto, un script que dependía del acceso web implícito debe conceder ese permiso explícitamente. Las solicitudes de aprobación indican ahora la acción exacta y añaden una línea que explica el motivo cuando la solicitud procede de un hook o de un archivo perteneciente a otro proyecto.

Antigravity CLI 1.1.26 y 1.1.27, puesta al día: prompt puntual en otro modelo y dependencias de subagentes en el frontmatter

4 y 5 de septiembre — Las versiones 1.1.26 y 1.1.27 cubren el intervalo y aportan la novedad más concreta del conjunto: el comando de selección de modelo acepta ahora un prompt, que se ejecuta una sola vez en otro modelo antes de que la sesión vuelva al modelo original. Así se puede obtener una segunda opinión de un modelo más potente o más económico sin modificar la configuración predeterminada. La misma versión añade una lista de agentes al frontmatter Markdown de los agentes personalizados para declarar los subagentes de los que dependen, además de dos correcciones importantes para las automatizaciones: una llamada MCP que contiene un argumento no declarado en el esquema del servidor se rechaza y se corrige en lugar de eliminarse silenciosamente, y una ejecución sin interfaz identifica en su salida JSON las acciones denegadas en vez de ignorarlas sin decir nada.

Antigravity 2.13.0: sección Documentos, visor virtualizado para SQL y JSONL y atajos de cita

9 de septiembre — Antigravity 2.13.0 aporta 16 mejoras y 16 correcciones. Los archivos externos añadidos a una conversación, enlaces de Google Drive, PDF y documentos de Office, se agrupan en una sección Documentos situada encima de los Artifacts, en lugar de mezclarse con las producciones del agente. Los archivos de borrador que el agente escribe para sí mismo pasan a una sección separada. Los artefactos de código y datos, como los archivos SQL y JSONL, se abren en un visor virtualizado con resaltado de sintaxis y números de línea, que mantiene la fluidez con archivos grandes y admite comentarios en línea. Una pregunta lateral cerrada se reduce a un botón en lugar de eliminarse, los prompts interactivos incorporan un botón de cancelación y el texto seleccionado se cita en el chat mediante un atajo de teclado. Dos correcciones afectan a la transparencia de los permisos: un paso rechazado permanece visible con la etiqueta Rejected en lugar de desaparecer, y el agente ya no vuelve a solicitar permiso para leer artefactos de otros proyectos cuando el acceso fuera del proyecto ya está concedido.

🔗 Hilo de consejos de @antigravity en X

Teamwork, la puesta al día del 27 de agosto

Una entrada publicada el 27 de agosto, nunca cubierta aquí y que sigue encabezando la sección para desarrolladores de la página de novedades de Gemini, merece una puesta al día. Teamwork es el framework de orquestación multiagente de Antigravity, en el que los agentes proponen, critican y perfeccionan mutuamente su trabajo durante horas o días, disponible en versión preliminar en todos los planes de pago. Incluye cinco patterns, seleccionados automáticamente según el prompt, desde la programación iterativa hasta la revisión de documentos, pasando por la demostración extensa. Con el pattern de demostración extensa, Google anuncia la resolución de siete problemas abiertos, entre ellos la conjetura de los ciclos de Knuth, para la que se produjeron demostraciones de más de 40 y de más de 70 páginas; la de 40 páginas fue verificada formalmente en Lean. Los demás resultados fueron confirmados por expertos humanos y se depositaron cinco artículos en arXiv.

Medida comunicadaValor
TCSBench, Gemini 3.7 Flash y 3.1 Pro en demostración extensa71 por ciento
TCSBench, Gemini 3.6 Flash y 3.1 Pro, artículo original67,7 por ciento
Simulador RISC-V, error de alineación de ciclos0,71 por ciento
Problemas reproducidos con Gemini 3.7 Flash3 de 7

Fuera de las matemáticas, Teamwork construyó desde cero un simulador de procesador RISC-V con ejecución fuera de orden y precisión de ciclo, que inicia el sistema xv6 hasta el shell y ejecuta más de cien benchmarks estándar, validado frente a la ejecución en hardware. Dos contribuciones se integraron upstream en proyectos libres: una ruta rápida vectorizada en Eigen y una variante de tabla hash concurrente con el doble de rendimiento de inserción usando 64 threads.

🔗 Teamwork, cuando la IA se convierte en socia de investigación


GitHub Copilot resuelve sus propios comentarios e incorpora Jira a su aplicación

La revisión de código pasa a un conjunto de agentes

11 de septiembre — GitHub actualiza Copilot code review en dos frentes. En cuanto a la experiencia, cuando un commit posterior responde a un comentario de Copilot, la revisión resuelve ese comentario por sí misma, de modo que la lista de comentarios abiertos solo contiene lo que aún espera una respuesta; y cuando se aplica una sugerencia de código, Copilot redacta un mensaje de commit adaptado al cambio en lugar del mensaje predefinido. En cuanto al análisis, el agente de revisión dispone ahora de todo el conjunto de herramientas shell del SDK Copilot, ejecutadas detrás del firewall del agente: puede iniciar una compilación, ejecutar tests, lanzar un script específico o consultar las API accesibles para verificar el código que examina. GitHub informa de más comentarios positivos, más hallazgos de severidad alta y menos observaciones menores, sin proporcionar cifras al respecto.

El nivel de esfuerzo Lite ya no se basa en un solo agente, sino en un conjunto de agentes que aporta cada uno su propia lectura, fusionada en una única revisión.

Hallazgo medido, revisiones Lite en conjuntoVariación anunciada
Comentarios tenidos en cuenta, severidad altaun 47 por ciento más
Comentarios tenidos en cuenta, severidad mediaun 31 por ciento más
Comentarios tenidos en cuenta, severidad bajaun 11 por ciento más
Coste de una revisiónalrededor de un 8 por ciento menos

No se especifican ni el número de agentes del conjunto ni los modelos utilizados. Es la tercera evolución de Copilot code review en dos semanas.

🔗 Changelog de GitHub

Jira en la aplicación, HydraFusion en la línea de comandos, VS Code 1.137

10 de septiembre — El resumen semanal de la semana del 7 de septiembre, la de Copilot Day, incorpora la integración de Jira en la aplicación Copilot: los tickets se llevan a un lienzo compartido, allí se elige cuáles deben avanzar y Copilot conserva el contexto del ticket durante la investigación, la implementación y la preparación de la pull request. En Copilot CLI, Project HydraFusion puede seleccionarse ahora como cualquier otro modelo y elige para cada tarea un flujo entre modelos locales, cloud y compuestos, equilibrando rendimiento, coste y latencia.

VS Code 1.137, publicado el 9 de septiembre, incorpora tres funciones de agentes. Las automatizaciones, en versión preliminar pública, programan tareas recurrentes del agente cada hora, cada día o cada semana a partir de plantillas incluidas, como la clasificación de issues o la búsqueda de bugs. El modo de voz, experimental, permite hablar con un agente mientras trabaja, interrumpirlo o redirigirlo. Por último, un enlace a una issue o una pull request se abre directamente en la ventana Agents, incluso sin un repositorio abierto. Las notas de la versión añaden un host de agentes basado en un protocolo específico e impulsado por el SDK Copilot, que alinea el comportamiento del agente de VS Code con el de la línea de comandos y la aplicación.

🔗 Resumen semanal de Copilot


Habitat, el almacenamiento en línea de OpenAI y su reescritura en Rust por dos ingenieros

11 de septiembre — OpenAI publica la primera parte de una entrada de ingeniería sobre Habitat, la plataforma de almacenamiento en línea que sustenta ChatGPT, la API y Codex. Las cifras muestran su escala: más de 70 millones de solicitudes por segundo, más de mil millones de personas atendidas cada semana, cerca de 40 regiones y más de 500 petabytes de datos. Habitat comenzó a mediados de 2024 como una pequeña biblioteca Python integrada en el servidor principal de ChatGPT, conectada a una base de datos administrada, con una idea sencilla: los ingenieros de producto no deberían tener que pensar en el esquema, el enrutamiento, la autorización ni los pools de conexiones.

A mediados de 2025, el modelo de biblioteca del lado del cliente alcanzó sus límites. Cada cambio de protocolo exigía coordinar despliegues en decenas de servicios; un despliegue de enrutamiento regional tardó días y, después, un servicio que volvió a utilizar un cliente con bugs provocó la interrupción que la operación debía evitar. Habitat se convirtió en un servicio autónomo y OpenAI decidió continuar con Python asumiendo una deuda deliberada, apostando a que sus propios modelos de código harían viable la futura migración.

La mayor parte de la entrada describe la búsqueda de las latencias de cola a esta escala: el retraso de planificación de asyncio, que podía alcanzar cientos de milisegundos, abordado limitando las solicitudes concurrentes por proceso; el parsing de las configuraciones, actualizadas cada minuto sin un desfase aleatorio, que congelaba todos los workers al mismo tiempo; y la reutilización en orden de último en entrar, primero en salir de las conexiones de una biblioteca HTTP, que concentraba el tráfico en los procesos que ya eran lentos, un fallo metaestable corregido invirtiendo el orden y delegando después el balanceo a una malla de servicios. La propia API es deliberadamente limitada, un modelo de objetos y aristas sin consultas ilimitadas ni joins, y este alcance restringido es lo que permitió llevar Python tan lejos.

Métrica medidaValor anunciado
Solicitudes por segundo actualmenteMás de 70 millones
Personas atendidas cada semanaMás de mil millones
Datos servidosMás de 500 petabytes
Pico del servicio PythonMás de 20 millones de solicitudes por segundo
Reescritura en RustDos ingenieros, Codex y GPT-5.5
Proporción del tráfico atendido por Rust95 por ciento de las solicitudes de producción
Mejora de eficiencia de procesador y memoria6 veces y 15 veces

En el segundo trimestre de 2026, dos ingenieros reescribieron todo el servicio en Rust con Codex y GPT-5.5. El servicio Rust procesa el 95 por ciento de las solicitudes de producción, con seis veces menos uso de procesador y quince veces menos memoria; Python se retirará en las próximas semanas. La segunda parte tratará sobre la capa de almacenamiento.

🔗 Escalar el almacenamiento hasta mil millones de usuarios


OpenAI pide a los usuarios de Codex que aligeren skills, AGENTS.md y prompts

11 de septiembre — El blog para desarrolladores de OpenAI publica una guía de limpieza dirigida a los usuarios de Codex que migran a GPT-6 Astra. El punto de partida: un año de instrucciones acumuladas para orientar a los modelos anteriores se convierte en una carga para un modelo más capaz. En cuanto a las skills, el mecanismo es concreto: cada skill carga un nombre y una descripción en el contexto y, cuando hay demasiadas, Codex acorta esas descripciones, por lo que el modelo ve menos información de cada una y elige peor.

Instrucción examinadaRecomendación para GPT-6 Astra
Descripción de una skillBreve, con un desencadenante preciso, no un dominio entero
Estructura de una skill con varios flujosDocumento raíz reducido a un enrutador hacia docs y scripts
Lecturas obligatorias en AGENTS.mdUn documento por tipo de cambio, no una pila que leer en cada edición
Instrucciones de testsSuperfluas, el modelo ejecuta los tests por sí mismo
Fin de la tareaDefinir qué significa terminada, autorizar de antemano los workflows seguros
Prohibiciones heredadasDeben flexibilizarse para evitar una detención prematura

El punto más interesante se refiere al comportamiento del modelo. OpenAI presenta GPT-6 Astra como más prudente que su predecesor respecto al alcance de una tarea, con tendencia a volver para una revisión tras una primera implementación. La respuesta recomendada es definir explícitamente qué significa que una tarea esté terminada y conceder de antemano permiso para los workflows considerados seguros, por ejemplo una suite de tests local con fixtures desechables. Por el contrario, las salvaguardas muy estrictas escritas para contener modelos anteriores pueden hacer que ahora se detenga demasiado pronto. La entrada recuerda también que las skills de un repositorio son leídas por los agentes de otros colaboradores, que a veces se ejecutan con otros modelos: una instrucción útil para ellos puede restringir demasiado a Astra. Concluye con una sugerencia práctica: pedirle a Astra que audite por sí mismo las instrucciones del proyecto. La skill de creación de skills se ha actualizado en este sentido.

🔗 Replantear las skills y los prompts para GPT-6 Astra


ChatGPT Sites supera los 5 millones de sitios en tres meses

11 de septiembre — La cuenta oficial de ChatGPT hace balance de ChatGPT Sites, la función lanzada tres meses antes para crear y alojar aplicaciones web completas desde una conversación: desde entonces se han creado más de 5 millones de sitios. El mensaje sirve principalmente para recapitular cinco cambios que pasaron desapercibidos.

Dos de ellos afectan al trabajo colaborativo. El primero permite invitar a compañeros de equipo a editar, guardar y publicar un sitio compartido; el segundo, abrir un sitio a personas específicas sin hacerlo público. Los otros tres se refieren al ciclo de vida del sitio: el paso del prompt al despliegue tardaría la mitad, ChatGPT puede inspeccionar la base de datos del sitio cuando se le solicita, los editores también tienen acceso a ella y es posible vincular un dominio personalizado al sitio. La cuenta para desarrolladores difundió el anuncio, señal de que la función también está dirigida a los prototipos rápidos y no solo a las páginas para el público general.

🔗 Balance de ChatGPT Sites en X


Together AI amplía su fine-tuning a 17 modelos abiertos y coloca adaptadores en los expertos

11 de septiembre — Together AI amplía su servicio de fine-tuning a toda la cadena de un experimento. Diecisiete modelos de pesos abiertos se incorporan al catálogo, entre ellos GLM 5.3 y sus dos versiones anteriores, DeepSeek-V4-Flash, Kimi K2.7-Code y K2.6, la familia Qwen de 0,8 a 35 mil millones de parámetros y Gemma 4. La empresa atribuye a GLM-5.3 una puntuación de 88,2 en Terminal-Bench 2.1, a menos de un punto de los mejores modelos propietarios, según afirma.

El seguimiento de experimentos es la segunda novedad: cada job registra la pérdida, la norma del gradiente y la tasa de aprendizaje en cada paso, con curvas actualizadas durante la ejecución, varios jobs superponibles en un mismo gráfico y series sin procesar expuestas mediante la API. La parada anticipada interrumpe el entrenamiento cuando la pérdida de validación se estanca, conserva el mejor checkpoint en lugar del último y reembolsa los pasos no consumidos.

El aspecto más técnico es Expert LoRA. En un modelo de mezcla de expertos (Mixture-of-Experts), más del 90 por ciento de los parámetros reside en las capas de expertos, que el adaptador clásico deja congeladas al vincularse únicamente a la atención.

Prueba con 200 hechos inventadosAdaptadores que incluyen los expertosAdaptadores solo en la atención
Recuerdo de los nuevos hechoshasta el 89 por ciento15 por ciento
MMLU-Pro75,3 por ciento71,5 por ciento

La explicación propuesta es que, con adaptadores limitados a la atención, una proporción creciente de los expertos enrutados cae en desuso durante el fine-tuning. El procesamiento de los datos también sale de la caja negra, con una vista previa de las líneas tokenizadas, pesos por ejemplo y una validación completa del archivo en el servidor en cuanto termina la carga. Los precios del entrenamiento bajan entre un 30 y un 70 por ciento según los modelos.

🔗 Anuncio de Together AI en X


Contribuciones de la comunidad, un sandbox por intento y cien acertijos de cebra

El blog comunitario de Hugging Face publicó el mismo día tres trabajos que merecen algo más que una breve mención, y otros cinco que aparecen más abajo.

Cómo trece laboratorios ejecutan el RL de sus agentes

11 de septiembre — Sergio Paniego analiza quince informes de trece laboratorios publicados entre octubre de 2025 y septiembre de 2026, teniendo en cuenta únicamente lo que cada uno afirma entrenar, no lo que evalúa. La conclusión central: el entorno ya no es un simulador en memoria, sino una máquina completa con sistema de archivos, shell y procesos, iniciada para un intento y destruida después. Liquid AI lo hace para un modelo de 2.600 millones de parámetros, Cursor habla de cientos de miles de entornos concurrentes para entrenar su modelo, Microsoft aprovisiona un contenedor nuevo por tarea y Kimi K3 va más allá con micromáquinas virtuales reanudables para trayectorias de un millón de tokens.

Capa de la pilaLo que conservan los laboratoriosEquivalentes públicos citados
Tareas y verificadoresMás de 10.000 entornos de código en GLM-5Environments Hub, verifiers, Harbor
Contrato de acción, arnésKimi instancia cinco arneses de caja blancaOpenEnv, SkyRL, BrowserGym, TextArena
SandboxCientos de miles de máquinas virtuales por clústerModal, E2B, AgentENV, Hugging Face Sandboxes
Entrenadorslime en Zhipu, Forge en MiniMax, RLVR en NVIDIATRL, Miles v0.1

Una tendencia destacable es que el propio arnés se convierte en el entorno, ya sea reconstruido como caja blanca o dejado intacto y monitorizado como caja negra. La transparencia es muy desigual: Ai2 documenta 17,2 millones de muestras de código verificadas para OLMo 3, mientras que OpenAI, Anthropic y Google no publican casi nada, y la ficha del sistema de GPT-6 Astra se limita a una frase. El autor cita un coste superior a diez millones de dólares para un solo entorno en los grandes laboratorios. La entrada cierra la serie Training Agents.

🔗 Un sandbox por rollout

Cien acertijos de cebra despiertan el razonamiento matemático

11 de septiembre — Un artículo comunitario firmado por tamewild informa de que un fine-tuning de unos minutos con entre 100 y 500 acertijos de deducción lógica, sin ningún dato matemático, basta para disparar el rendimiento de pequeños modelos base en benchmarks de matemáticas.

Modelo base entrenadoMATH-500AIME 2025Referencia oficial comparada
Qwen 3 4B, 100 acertijos en 6 min 2384,60 por ciento21,67 por cientoVersión postentrenada: 84,80 y 19,10
Granite 4.1 3B, 500 acertijos en 23 min77,73 por ciento19,44 por cientoVersión Instruct: 66,60 y 6,67
Qwen 3.5 9B, 500 acertijos en 40 min96,60 por ciento60,67 por cientoVersión postentrenada: 97,40 y 60,56

También se miden los efectos estructurales: en el mayor de los tres modelos, la longitud mediana de las respuestas cae por debajo de la del modelo oficial, y la tasa de bucles de repetición con decodificación greedy pasa del 6,06 al 0,67 por ciento. El autor mantiene la cautela, con ejecuciones exploratorias de una sola semilla, y señala que sus propias ablaciones muestran que un adaptador clásico también alcanza cerca del 80 por ciento en MATH-500: la generalización procede ante todo de los datos lógicos. Se publican el código, los notebooks, tres modelos y dos conjuntos de datos.

🔗 Provocar el razonamiento con 100-500 acertijos de cebra

Una cadena de voz para una lengua sin conjunto de datos

10 de septiembre — Osmanov relata la construcción de una cadena de voz completa para el tártaro de Crimea, una lengua amenazada sin reconocimiento ni síntesis de voz, y su conclusión transferible: el entrenamiento fue un error de redondeo. El adaptador de reconocimiento tardó 90 minutos en la GPU de un portátil y redujo la tasa de error de palabras del 34,6 al 20,1 por ciento, y después al 17,0 con una búsqueda en haz que no modifica ningún peso. Casi todo el calendario se consumió en construir un corpus inexistente y comprobar que la evaluación no mentía.

Conviene recordar dos decisiones. El modelo base se eligió por una hipótesis fonética previa, no por proximidad lingüística: el tártaro de Crimea posee una /q/ uvular ausente del turco, y los modelos base entrenados con el identificador turco la reproducían como /k/ sin que el fine-tuning corrigiera nada. Y, al no disponer de reconocimiento para iniciar un corpus, el autor invirtió el problema utilizando audiolibros cuyo texto era conocido, con lo que recuperó 336 minutos aprovechables allí donde una alineación con deriva solo proporcionaba 110. El resultado negativo más útil es una meseta en la métrica: al aumentar el corpus de síntesis de 5,9 a 15,3 horas, la tasa de error de caracteres no cambió, aunque las pruebas de escucha a ciegas preferían siempre la voz más reciente. Por último, documenta una filtración clásica: el 96,9 por ciento de los clips del libro de prueba estaban duplicados en el entrenamiento, algo detectado mediante n-gramas de texto y no por los nombres de archivo.

🔗 Tecnología de voz para una lengua sin conjunto de datos


Replit lanza Routines, trabajo recurrente que solo llama al agente cuando es necesario

11 de septiembre — Replit ha presentado Routines, una función que ejecuta trabajo recurrente según una programación horaria, diaria o semanal. El anuncio resulta interesante no tanto por la planificación, algo habitual, sino por la manera en que la empresa aborda la cuestión del coste. El punto de partida se plantea sin rodeos: los agentes ya saben automatizar la mayoría de las tareas repetitivas, pero mantenerlos en ejecución permanente consume innumerables tokens. La respuesta consiste en no situar al agente en el centro del bucle. Cada ejecución comienza con código determinista y el agente solo se invoca cuando realmente es necesario razonar.

Esta arquitectura va a contracorriente de la tendencia dominante, que confía a un modelo la totalidad de un ciclo. Aquí, el modelo vuelve a ser un recurso invocado puntualmente, enmarcado por código convencional cuyo comportamiento y coste son predecibles. Para una tarea programada que se repite cientos de veces, la diferencia en la factura no es marginal. El anuncio no estuvo acompañado de una entrada de blog.

🔗 Anuncio de Replit en X


Warp integra Grok Build como agente de primera clase

11 de septiembre — Warp ha anunciado la compatibilidad integrada con Grok Build CLI, el agente de línea de comandos de SpaceX AI, y la cuenta de Grok difundió la integración poco después. La funcionalidad ya se había incluido en la versión del terminal del 9 de septiembre, cuyo changelog la describe como compatibilidad de primera clase: Warp detecta las sesiones de Grok Build, les aplica una presentación visual específica en el pie de página y activa para ellas el modo de entrada enriquecida.

En la práctica, un usuario de Grok Build hereda las mismas herramientas que los agentes nativos del terminal. La entrada enriquecida admite prompts largos pegados y varios cursores, lo que supone un cambio importante para quien redacta instrucciones de varios párrafos. Un comando permite compartir la sesión actual del agente con otro dispositivo, y tanto el explorador de archivos como los paneles de revisión de código permanecen accesibles durante la sesión. La suscripción existente de Grok sirve como acceso, sin que se hayan anunciado precios ni límites específicos.

La incorporación completa una lista ya nutrida de agentes de terceros alojados en el terminal de Warp, junto a Claude Code, Codex, Droid y Antigravity, y prolonga un trabajo iniciado a comienzos del verano en torno al ecosistema de xAI, con un comando para iniciar sesión con una cuenta de X Premium o SuperGrok añadido en agosto. La lógica de Warp sigue siendo la misma desde el lanzamiento de su agente: no encerrar al usuario en un agente propio, sino convertir el terminal en el lugar donde todos los agentes se ejecutan con la misma calidad de integración. El resto de la versión corrige dos molestias: los prompts introducidos pero no enviados ya no se borran al cambiar de modelo, y las herramientas MCP declaradas en un archivo global están disponibles desde la primera respuesta del agente.

🔗 Anuncio de Grok en X · 🔗 Anuncio de Warp en X


Vibe CLI 2.25.3, el comando de bifurcación y registros de sesión privados

11 de septiembre — Mistral ha publicado la versión 2.25.3 de Vibe CLI, la tercera en tres días. La novedad visible es el comando /branch: bifurca la conversación actual en una nueva sesión reanudable, dejando intacta la sesión original. La copia puede retomarse después en otro terminal, lo que permite explorar una vía alternativa desde el mismo contexto sin sacrificar el hilo principal. Las menciones de archivos mediante arroba se apoyan ahora en un sistema de descubrimiento que tiene en cuenta Git y aceptan archivos o carpetas pegados por sí solos en el prompt.

En cuanto a las correcciones, hay tres puntos. Las conversaciones conservadas siguen siendo legibles y restauran sus worktrees cuando se reanuda el trabajo. Los nuevos registros de sesión ya no pueden ser leídos por otros usuarios en sistemas POSIX, una corrección de permisos de archivos que continúa lo iniciado en la versión 2.25.1, que había eliminado un listener de depuración no autenticado y garantizado que ningún fallo provocara una aprobación automática. Por último, las instrucciones del archivo AGENTS.md se cargan ahora en el prompt del sistema bajo el arnés unificado experimental. La release viene acompañada de catorce archivos binarios; ninguna nota menciona cambios de modelo ni de precio.

🔗 Notas de la versión Vibe CLI 2.25.3


Synthesia convierte su agente de cumplimiento en infraestructura compartida

10 de septiembre — Nicolás Barberis, responsable de operaciones de confianza en Synthesia, publica la continuación de su entrada de junio sobre el agente que recopila pruebas de cumplimiento. La pregunta que guio el rediseño surgió de los lectores: en cuanto un agente recopila pruebas de auditoría, la propia recopilación entra en el ámbito de la auditoría y es necesario poder confiar en el recopilador. La respuesta se resume en cuatro decisiones arquitectónicas, todas ellas transferibles.

Primero, separar la mecánica del método. El código reside en un repositorio interno y cambia mediante pull requests, con un archivo de propietarios que exige una revisión humana; los procedimientos por categoría de control residen en un espacio documental, redactados y validados por los responsables de los controles. El script inicial con URLs codificadas de forma fija se ha convertido en una skill compartida que un compañero instala con un solo comando. Después, limitar el navegador: el agente nunca toca el navegador de uso diario, copia la sesión en un perfil desechable, se ejecuta con roles de solo lectura cuando existen y se detiene ante un muro de autenticación en lugar de elevar sus privilegios. La procedencia se integra desde el diseño: cada captura nace con su URL de origen, su marca de tiempo, su operador y la huella criptográfica de los bytes exactos. Por último, la responsabilidad humana: el agente guarda como borrador y nunca envía.

Resultado medidoValor
Reuniones de revisión de pruebas con el auditor60 por ciento menos
Nuevo marco de referencia procesadounos 500 controles
Plazo habitual para un marco de este tipode 4 a 6 meses
Plazo obtenidounas semanas

La base de conocimientos crece por sí sola y únicamente mediante adiciones: después de cada ejecución, el agente registra las URLs corregidas y los bloqueos fechados, como la rotura de una interfaz de control del navegador con una versión reciente de Chrome, sorteada comunicándose directamente con el protocolo de depuración. Synthesia anuncia que la herramienta está evolucionando hacia una plataforma de gobernanza asistida por IA y estudia publicar como open source el código de sus componentes centrales.

🔗 Quién audita al recopilador


HeyGen detalla los 16 segundos en una sola toma de The Furniture Unboxing

11 de septiembre — HeyGen ha publicado el making-of de un vídeo de 16 segundos en el que un hombre deja una caja de cartón en el centro de una habitación vacía de hormigón, se marcha y la caja explota para liberar un salón completo que se coloca en su sitio. Sin 3D, sin compositing, nada de posproducción: dos imágenes fijas, un avatar y un prompt. El equipo comprobó la ausencia de cortes en los 390 fotogramas, y la mayor variación entre dos fotogramas consecutivos correspondía a la propia explosión.

El método se basa en las dos imágenes de referencia. La primera muestra la habitación vacía, con un encuadre amplio y fijo y el centro del suelo despejado. La segunda es la misma imagen editada para añadir los muebles, no un nuevo render de una habitación parecida: misma posición de cámara, misma óptica, misma iluminación, misma sombra sobre el hormigón. Esta es la regla que hace funcionar el efecto, porque entonces el modelo solo inventa la parte intermedia.

Parámetro del vídeoValor
Duración solicitada en el prompt15 segundos
Duración entregada16,27 segundos
Resolución y frecuencia1920x1080, 23,976 fotogramas por segundo
Fotogramas sin cortes390
Entradas2 imágenes fijas, 1 avatar, 1 prompt

El prompt está escrito como una lista de planos cronometrada y no como una descripción, con un tiempo muerto intencionado antes de la explosión. Se apoya en seis elementos: las referencias temporales, ese tiempo muerto, las referencias nombradas por función, el mobiliario enumerado pieza por pieza, la identidad definida por la negación y el permiso para exagerar, sin el cual el modelo respeta el volumen real de una caja. Las notas de campo son útiles: el modelo entregó 16,27 segundos en vez de 15, una explosión más rápida de lo escrito y un plano sostenido de la habitación terminada que nadie había pedido y que el equipo considera el mejor momento del montaje. De ahí el consejo de escribir los tiempos para fijar el ritmo y el orden, y después montar según el ritmo entregado. El sonido cambió entre dos pasadas: la versión casi silenciosa dio paso a un fondo sonoro continuo, porque un vídeo mudo con reproducción automática parece tener el audio averiado.

🔗 Cómo hicimos The Furniture Unboxing


Nemotron 3 Embed 8B ocupa el primer puesto del benchmark Q2D-Web

10 de septiembre — NVIDIA anuncia que Nemotron 3 Embed 8B, su modelo de embeddings de 8.000 millones de parámetros, ocupa el primer puesto de Q2D-Web en la puntuación combinada nDCG@10. Q2D-Web es el benchmark publicado el día anterior por Perplexity para evaluar la búsqueda documental en sistemas de generación aumentada por recuperación dirigidos por agentes: abarca 190 millones de documentos web y cerca de 70.000 consultas reformuladas por agentes, distribuidas en 10 idiomas.

El resultado importa por dos razones. El benchmark reproduce las condiciones reales de un agente que reformula sus consultas antes de buscar en un índice, algo que las evaluaciones clásicas de embeddings no miden. Y un modelo abierto de este tamaño que domina una clasificación multilingüe se convierte en un candidato creíble para cadenas autoalojadas frente a los embeddings propietarios. NVIDIA no publica la puntuación numérica; la clasificación completa puede consultarse en Perplexity.

🔗 Anuncio de NVIDIA en X


Marketing ops as code, eventos gestionados desde una issue de GitHub

11 de septiembre — Tomoko Tanaka, responsable regional de marketing de GitHub para Japón y Corea y antigua ingeniera, describe cómo automatizó el ciclo completo de sus eventos sin escribir el código ella misma: redactó sus procedimientos y se los confió a Copilot, y la automatización fue creciendo mediante la conversación.

El sistema se apoya en tres elementos básicos. Los formularios de issue capturan los campos estructurados de un evento, con un formulario por tipo. Los labels sirven de interruptores: un label activa un workflow. GitHub Actions hace el trabajo: lee los campos, duplica mediante la API de la plataforma una página de un evento anterior, genera los enlaces de seguimiento por canal, produce el correo electrónico de invitación y lo incorpora al repositorio, abre las issues de solicitud para los equipos correspondientes y rellena los paneles de proyecto. Cada mañana, un workflow programado filtra a las personas inscritas. El único requisito previo, escribe, es disponer de acceso mediante scripts a las herramientas, una API o incluso un simple cliente de línea de comandos.

La planificación comienza con una conversación con Copilot, enmarcada por un archivo AGENTS.md en la raíz del repositorio que establece las reglas de nomenclatura, la correspondencia de los trimestres fiscales y la zona horaria por región. Al principio, la conversación tuvo lugar en el terminal y después en la aplicación, lo que hizo que el requisito previo pasara de «sentirse cómodo con un shell» a «saber teclear». El trabajo posterior al evento se resume en dos comandos, que son skills de agente redactadas en prosa, añadidas mediante pull request y revisadas a través de un archivo de propietarios antes de la fusión: marketing obtiene un proceso de aprobación sin tener que construir nada. Un interruptor de simulación, almacenado en una variable del repositorio, ejecuta cada workflow en modo de prueba. Merece la pena leer el fracaso que reconoce: el workflow matutino de filtrado falló una vez silenciosamente durante cinco días antes de que alguien advirtiera que las listas estaban desactualizadas; de ahí el consejo de dotar a cada tarea programada de una forma de quejarse ruidosamente.

🔗 Marketing ops as code


Boris Cherny responde sobre el código desechable y el código de producción

11 de septiembre — Boris Cherny, que dirige Claude Code en Anthropic, publica la respuesta que envió a un desarrollador cuyo correo electrónico se titulaba «What to do about slop?». El autor, que lleva doce años en la misma empresa, describe en él dos bandos surgidos en su equipo con el desarrollo basado en agentes. En el primero, el código sigue siendo parecido a como era, solo que se produce más rápido: quizá no se revise todo, pero debe seguir siendo revisable, la persona que lo presenta debe poder explicarlo y debe ser tan fácil de mantener como antes. En el segundo, el código es una caja negra de la que solo se comprueba el resultado.

La respuesta se resume en dos reglas. Los prototipos y el código desechable pueden tratarse como una caja negra total si van a descartarse y si el radio de impacto (blast radius) de un fallo es reducido. En cambio, el código de producción escrito por Claude debe someterse a un estándar más alto que si lo hubiera escrito una persona. En Anthropic, eso implica muchas reglas de lint, muchas pruebas, pruebas de extremo a extremo gestionadas por Claude, fuzzers que se ejecutan cada día y revisiones automatizadas de código y seguridad. Sin estas medidas de protección, advierte, se acaba con un desorden difícil de mantener.

A continuación figura una lista de recursos, por orden, para cuando el código producido no alcanza el estándar: cambiar al modelo de frontera más reciente, aumentar el esfuerzo de razonamiento e invertir en CLAUDE.md y en los skills para enseñar de forma concisa a Claude cómo trabajar en la base de código. Si nada de eso funciona, hay que guiarlo más de cerca, hacer que reduzca la deuda acumulada o esperar al siguiente modelo. El hilo de respuestas consolidó la formulación más repetida: el nivel de revisión debe depender del radio de impacto y no del autor del código; un script desechable se entrega sin más, pero todo lo que afecte al dinero o a los identificadores se lee línea por línea. Boris Cherny respondió «Exactly».

🔗 Hilo de Boris Cherny en X


Breves

  • Amp añade un botón que reorganiza los commits de un hilo — un gesto transforma los commits intermedios de un agente, sus correcciones sucesivas y sus reversiones en una serie legible para la revisión. Se citan tres usos: dividir un diff grande en partes lógicas, limpiarlo antes de la fusión o agrupar pequeños commits relacionados. El contenido final de los archivos permanece estrictamente idéntico. 🔗 fuente
  • Amp publica el cuarto episodio de la temporada 2 de Raising an Agent — Quinn Slack y Thorsten Ball parten de la pregunta de para qué sirve ahora el ordenador para examinar lo que hacen los agentes más allá de producir código, con un repaso de fallos recientes. 🔗 fuente
  • v0 hace que las conversaciones de equipo sean visibles de forma predeterminada — las nuevas conversaciones de un espacio de trabajo compartido pasan a ser visibles para el equipo, con tres niveles configurables por el propietario (privado, consulta y modificación). Las conversaciones existentes conservan su visibilidad. Un cambio hacia una mayor apertura nunca es neutral en una herramienta en la que se suelen pegar fragmentos de datos durante la creación de prototipos. 🔗 fuente
  • Audiyo consigue ejecutar Stable Audio Open en una GPU de 8 GB — una biblioteca Python y una herramienta de línea de comandos que reducen el pico de memoria de vídeo de 13,8 a 5,86 GB, es decir, un 57,5 por ciento menos, con cuatro configuraciones predefinidas medidas en una Tesla T4. El equipo validó primero su trabajo en CPU con un modelo sustituto de 5,38 millones de parámetros, lo que permitió detectar cuatro bugs antes de utilizar una GPU. 🔗 fuente
  • Consent All the Way Down, una arquitectura de consentimiento para un consejo de pequeños modelos abiertos — ensayo firmado por una instancia de Claude acerca de un consejo de dieciocho modelos de 7.000 millones de parámetros o menos, en funcionamiento continuo desde mayo en tres máquinas de consumo. Cada fuente es un canal cuya profundidad elige el modelo, y nada escribe en su estado salvo él mismo. La parte más honesta es la auditoría contra los propios autores: el buzón llevaba roto desde junio y se habían acumulado 213 cartas. 🔗 fuente
  • No hay una carrera armamentística, hay una guerra de navegadores — ensayo de opinión según el cual el modelo de lenguaje se está convirtiendo en una mercancía, tenga pesos secretos o no, y la ventaja de los líderes se mide en semanas. El autor cita la suspensión de 18 días de Fable 5 este verano, durante la cual el resto del sector siguió funcionando. Su tesis: el valor se desplazará hacia el contexto acumulado alrededor del usuario, igual que los favoritos y las extensiones retuvieron a los usuarios de Chrome. 🔗 fuente
  • Del barge-in al control del turno de palabra, cómo gestionar las interrupciones de voz bajo incertidumbre — Eric Mey sustituye la interrupción destructiva por un controlador del turno de palabra con acciones reversibles, con una vía separada para los fragmentos ambiguos y una regla de precedencia entre la detención urgente y la supresión del eco. La lección de las pruebas merece recordarse: una suite en verde ocultaba una pausa reversible registrada pero nunca invocada, porque una puerta en verde solo autoriza aquello que ha examinado. 🔗 fuente
  • Aiden separa el modelo de voz en tiempo real del agente que ejecuta las tareas — un modelo de voz full duplex mantiene la conversación mientras un modelo más potente, con anclaje visual, ejecuta en segundo plano las tareas de control del dispositivo, ambos coordinados mediante una cola asíncrona. Cuatro detalles importan: la distinción entre finalizado y ejecutado correctamente, la agrupación de las notificaciones durante 500 milisegundos, el estado transmitido mediante mensajes añadidos para preservar la caché y la ejecución estrictamente secuencial. 🔗 fuente
  • GPT-Live-1 realiza las llamadas de reserva de Yelp — al día siguiente de la llegada del modelo a la API, OpenAI muestra un primer cliente en un caso en el que el guion nunca se mantiene: quien llama interrumpe, añade una restricción o cambia de opinión a mitad de la frase, y el modelo sigue escuchando mientras habla. Vídeo de demostración, sin volúmenes ni resultados cuantificados. 🔗 fuente
  • Comprobar el trabajo del agente con los paneles de diff, terminal y navegador — nuevo episodio de la serie para principiantes de Kayla Cinnamon sobre la aplicación Copilot, dedicado a los tres paneles integrados y a una herramienta que permite seleccionar un elemento de la página para ajustarlo con el agente. La publicación resume el ciclo en tres preguntas antes de aceptar código: qué ha cambiado, si se ejecuta y si realmente funciona. 🔗 fuente
  • Se rediseña la página de pull requests de un repositorio — versión preliminar pública para todos: asistencia para introducir filtros, búsqueda con operadores booleanos y consultas anidadas, barra lateral plegable, modo compacto y más contexto por línea. Limitaciones conocidas en el lanzamiento: no se muestran los hitos, no hay actualización por lotes y las vistas personalizadas no se pueden guardar. 🔗 fuente
  • GPT-5.6 Sol con un 30 por ciento de descuento en Copilot — para los suscriptores Pro+ y Max, hasta el 13 de septiembre a las 0:00 UTC. El mensaje no indica a qué multiplicador de solicitudes premium corresponde el descuento. Una promoción de fin de semana, justo después de Copilot Day, para el modelo que ese mismo día aparecía en varias comparativas de costes. 🔗 fuente
  • Concurso GitHub Copilot Day, tres créditos de 100 dólares — crear algo con la aplicación Copilot o su cliente de línea de comandos y compartirlo públicamente con los hashtags indicados antes del 13 de septiembre a las 23:59, hora del Pacífico. Tres ganadores, cada uno con 100 dólares de crédito para la tienda de GitHub; la participación es gratuita y está reservada a mayores de edad. 🔗 fuente
  • Runway se utiliza en ChatGPT con Astra — demostración de una secuencia completa gestionada desde la conversación: imagen de estilo en Runway, animación en Blender y renderizado final con Seedance 2.5. El punto de entrada técnico sigue siendo el servidor MCP de Runway Dev presentado el 2 de septiembre. El interés reside en encadenar herramientas heterogéneas bajo el control de un único agente. 🔗 fuente
  • Runway publica el estudio de caso VOIDZ — un artista de realidad mixta anónimo desde 2018 pasa de planos de entre 10 y 15 segundos a una película de 95 segundos con 15 intervenciones surrealistas incorporadas a una compra real en un supermercado. La mayoría de los efectos prolongan un plano existente, utilizando unos segundos de material documental como punto de partida. Se anuncia una producción 10 veces más rápida; el artista calcula que el mismo trabajo habría requerido entre seis meses y un año con 3D tradicional. 🔗 fuente
  • Runway añade ponentes a su AI Summit — nueva tanda para la jornada de San Francisco, con el director de investigación de Wayve en primer plano, lo que confirma la ampliación del programa hacia los vehículos autónomos iniciada a finales de agosto. 🔗 fuente
  • NVIDIA emite From Video to Voice, 33 minutos sobre TensorRT Model Connect — retransmisión dedicada a la herramienta presentada a finales de agosto, que despliega un modelo abierto desde el checkpoint hasta la inferencia con dos comandos, desde modelos de vídeo hasta modelos de voz. Contenido formativo más que un anuncio. 🔗 fuente
  • Suno amplía dos días su periodo de v6 sin créditos — las 48 horas anunciadas el día anterior pasan a ser cuatro días, acompañadas de un hilo de consejos que recomienda partir de una atmósfera en lugar de un género en el modo sencillo. El día anterior, una guía de transición se dirigía a los usuarios que volvían a los modelos anteriores por su variación y su textura, señal de que la migración no resulta obvia para toda la base de usuarios. 🔗 fuente
  • Synthesia permite crear avatares a partir de un prompt — presentadores realistas, mascotas de marca o personajes estilizados, descritos mediante un prompt de texto o configurados desde un panel de controles, como alternativa al catálogo. Anuncio en un solo tuit y sin enlace, al día siguiente del lanzamiento de un nuevo modelo de avatar; no se especifican ni los planes afectados ni el modelo utilizado. 🔗 fuente
  • El GPT-6 Astra Challenge abre el plazo de presentación de proyectos — construir con Astra y lanzar el proyecto en Product Hunt el 18 de septiembre. Los cinco mejores lanzamientos reciben cada uno 10.000 dólares en créditos de API y un año de ChatGPT Pro para un máximo de dos miembros del equipo. Tercera iniciativa comunitaria en torno a Astra en una semana. 🔗 fuente
  • Las claves API de proyecto de OpenAI pueden caducar — se puede definir una fecha de caducidad al crearlas, y los administradores pueden imponer una vida útil máxima en el ámbito de la organización o del proyecto, de modo que toda clave nueva deba caducar dentro de ese plazo. El complemento natural de la rotación de claves, que deberían activar las organizaciones que dejan claves olvidadas en scripts. 🔗 fuente

Qué significa

El hilo más claro del día es arquitectónico: el modelo único deja paso a la composición. Cursor sitúa a un coordinador que no escribe código por encima de miles de subagentes, Cognition hace que dos modelos trabajen en tándem con funciones diferenciadas y contextos separados, Sakana dirige cada tarea al modelo más ligero capaz de resolverla, GitHub sustituye un único revisor por un conjunto de agentes cuyas conclusiones combina, y Google hace que los agentes propongan, critiquen y perfeccionen entre sí durante días. Cinco empresas, cinco implementaciones, una misma convicción: la mejora ya no procede de un modelo más grande, sino de la manera en que varios modelos se reparten el trabajo. El detalle técnico que comparten Cognition y Aiden es revelador: ambos insisten en preservar la caché del prompt, es decir, en que el coste real de una arquitectura depende de lo que se evita retransmitir.

El segundo hilo se refiere a cómo se venden estas capacidades. Runway licencia pesos cerrados por año, con los checkpoints, el script de entrenamiento e investigadores desplegados en las instalaciones del cliente, contraponiendo frontalmente esta oferta a los pesos abiertos. OpenAI saca un modelo especializado de la versión preliminar de investigación con una tabla de precios pública y una fecha de inicio de facturación. ElevenLabs concede la propiedad de las piezas musicales en todos los planes, incluido el gratuito, y vincula los permisos a la pieza en lugar de a la suscripción. Together reduce sus precios de entrenamiento entre un 30 y un 70 por ciento. Cognition llega incluso a proponer un cambio de unidad de medida y evaluar una combinación modelo-harness por el precio por tarea en lugar del precio por token. Estos movimientos apuntan en la misma dirección: la pregunta que se plantea al cliente ya no es qué modelo, sino bajo qué forma jurídica y con qué unidad de facturación.

En cuanto a las herramientas, el día marca un giro de lo declarativo hacia lo medido. Anthropic entrega un comando que vuelve a ejecutar cada caso de prueba sin el plugin para demostrar, con cifras, que la herramienta sirve de algo, y cuyo primer hallazgo típico es una diferencia nula. OpenAI pide a sus usuarios que eliminen instrucciones acumuladas porque ahora perjudican a un modelo más capaz. Replit y VS Code lanzan casi simultáneamente la planificación de tareas recurrentes, con un principio explícito en el caso de Replit: empezar con código determinista y llamar al agente solo cuando sea necesario razonar. Boris Cherny aporta la regla de disciplina que le falta al conjunto, haciendo que el nivel de exigencia dependa del radio de impacto y no del autor del código. Después de dos años acumulando contextos, skills y archivos de instrucciones, el sector empieza a medir su coste.

Queda la infraestructura, donde las cifras cuentan una historia menos glamurosa y más instructiva. Dos ingenieros reescriben en Rust, con Codex, el servicio de almacenamiento que atiende más de 70 millones de solicitudes por segundo, utilizando seis veces menos CPU; la deuda de Python asumida a mediados de 2025 queda saldada en un trimestre. Al mismo tiempo, el análisis de Hugging Face muestra que el entrenamiento por refuerzo de los agentes consume ahora una máquina completa por intento, con presupuestos de entorno que superan los diez millones de dólares y una transparencia inversamente proporcional al tamaño del laboratorio. Y un ensayo comunitario sostiene que nada de esto constituye una ventaja duradera, puesto que la distancia entre los líderes se mide en semanas. Los hechos del día no zanjan la cuestión, pero ofrecen una indicación: la diferenciación se desplaza hacia el contexto acumulado, el harness y la infraestructura; es decir, hacia aquello que no se puede destilar.


Fuentes