Buscar

Gemini 3.8 Flash al nivel de los modelos de gama alta por un tercio del precio, Muse Spark 1.3 en Meta, Qwen3.8-Max-0902 lidera Code Arena WebDev

ai-powered-markdown-translator

Artículo traducido del fr al es con gpt-5.6-sol.

Ver proyecto en GitHub ↗

Cuarenta y nueve anuncios en la jornada del 2 de septiembre, el tercer volumen más alto desde el inicio de este seguimiento. Tres modelos destacados se lanzaron el mismo día —Gemini 3.8 Flash de Google, Muse Spark 1.3 de Meta Superintelligence Labs y Qwen3.8-Max-0902 de Alibaba— y ninguno de ellos hizo hincapié en la carrera por las puntuaciones brutas.

Cuatro corrientes atraviesan esta edición. Primero, el precio, convertido en el argumento central de los tres lanzamientos. Después, la inferencia local, con la generación de vídeo llegando a un equipo de escritorio y un motor de inferencia para Apple Silicon cuyo código se abre esa misma noche. La gobernanza de modelos en la empresa, donde GitHub impone la retención de datos para un modelo y permite elegir el valor predeterminado para todos los demás. Y la ciberseguridad, con un modelo específico reservado a defensores seleccionados y una alianza que se incorpora a la Linux Foundation.


Gemini 3.8 Flash y 3.8 Flash Cyber, un modelo que trabaja más al mismo precio

2 de septiembre — Google presentó dos modelos de la mano de Tulsee Doshi (Senior Director, Product Management) y Raluca Ada Popa (Gemini Security Lead, Google DeepMind): Gemini 3.8 Flash y Gemini 3.8 Flash Cyber. Es el tercer lanzamiento Flash en seis semanas, y 3.7 Flash apenas llevaba tres semanas disponible.

Ambas variantes comparten la misma inteligencia de base, y Google atribuye explícitamente parte de los avances en código y razonamiento a un entrenamiento intensivo en el ámbito de la ciberseguridad: el trabajo realizado para el modelo defensivo impulsó también al modelo generalista. El precio introductorio no cambia respecto a 3.7 Flash.

Característica de Gemini 3.8 FlashValor medido
Precio de entrada0,75 dólares por millón de tokens
Precio de salida3,75 dólares por millón de tokens
HLE-Verified54,9 %

Hay un aspecto que merece la atención de los desarrolladores, porque Google lo expresa sin rodeos: el modelo consume más. La mejora de fiabilidad procede de una decisión de diseño: en las tareas complejas, 3.8 Flash ejecuta pasos adicionales de razonamiento y llama a las herramientas de forma iterativa. Por tanto, con niveles de esfuerzo elevados, la factura en tokens aumenta, y Google recomienda reducir el nivel de esfuerzo o mantenerse en 3.7 Flash para las cargas en las que prime la eficiencia computacional. La versión anterior sigue contando con soporte completo.

La variante Cyber es la más inusual. Reservada a defensores de confianza mediante el programa Fairwind, lanzado ese mismo día, está orientada al descubrimiento autónomo de vulnerabilidades y, sobre todo, a su corrección automática.

Prueba de ciberseguridadGemini 3.8 Flash CyberPuntos de comparación
CyberGym Pass@1 (detección de fallos en C/C++)86,2 %GPT-5.5-Cyber 85,6 % · Mythos 5 83,8 % · GPT-5.6 Sol 83,6 % · 3.5 Flash Cyber 77,5 %
Benchmark interno en 20 lenguajesmás del 70 %Alcance más amplio que únicamente C/C++
CWE-Bench pass@1 (corrección, Collinear)47,2 %Modelo de frontera líder con un 47,8 %, pero a un coste considerablemente superior

Las cifras de despliegue interno respaldan el posicionamiento de coste/rendimiento más que una superioridad bruta: el equipo de Chrome Security obtiene 2,6 veces más correcciones válidas que con los mejores modelos comerciales, mucho más grandes; Wiz mide una cobertura entre un 7,5 y un 9,7 % superior en su benchmark de pruebas de intrusión, con un coste entre 2,3 y 5,2 veces menor; y el equipo de Cloud Vulnerability Research identificó una vulnerabilidad fundamental crítica en menos de dos horas, cuando este tipo de investigación suele requerir meses. El modelo generalista ya está desplegado en Antigravity, la API de Gemini mediante Google AI Studio y Android Studio, la generación de interfaces de Stitch y Gemini Enterprise, así como para los suscriptores de Google AI Pro y Ultra en la aplicación Gemini, el AI Mode de Google Search y Google Sheets.

🔗 Anuncio de Gemini 3.8 Flash y 3.8 Flash Cyber

La puntuación de CursorBench que documenta el lanzamiento

Cursor añadió Gemini 3.8 Flash a su selector de modelos pocas horas después de la presentación, y su propio banco de pruebas ofrece la mejor medición disponible del rendimiento del modelo en condiciones agénticas. El registro de CursorBench, fechado ese mismo día, indica que 3.8 Flash asciende a la categoría de versión Gemini «Latest» y que 3.7 Flash pasa a una posición secundaria.

Modelo y nivel de esfuerzoPuntuación CursorBench 3.2Coste medio por tareaPasos por tarea
Fable 5.1 Max73,4 %9,64 dólares70
Grok 4.6 Extra High70,8 %2,81 dólares46
Fable 5.1 High69,4 %4,80 dólares44
Opus 5 Extra High69,3 %7,35 dólares72
Gemini 3.8 Flash High69,2 %2,38 dólares161
Gemini 3.8 Flash Medium67,0 %1,93 dólares136
Gemini 3.7 Flash High61,6 %1,20 dólares99

La lectura es inmediata: con un 69,2 %, Gemini 3.8 Flash High obtiene una puntuación equivalente a la de Fable 5.1 High por aproximadamente la mitad del precio, y a la de Opus 5 Extra High por un tercio. La diferencia respecto a la generación anterior es de 7,6 puntos. Sin embargo, la columna de pasos recuerda el coste oculto de la decisión de diseño de Google: 161 pasos por tarea, frente a 44 para Fable 5.1 High. El propio Cursor señala dos reservas al pie de la página: los resultados presentan variabilidad y el coste mostrado se reconstruye a partir de las tarifas públicas por millón de tokens, no se mide en una factura.

🔗 Gemini 3.8 Flash en Cursor · 🔗 Resultados de CursorBench


Muse Spark 1.3, el modelo agéntico de Meta Superintelligence Labs

2 de septiembre — Meta Superintelligence Labs publicó Muse Spark 1.3, sucesor de Muse Spark 1.2, desplegado ese mismo día en Muse Code y en la Meta Model API accesible desde dev.meta.ai. Es el segundo lanzamiento del laboratorio en dos días, después de Muse Voice Transcribe.

El enfoque declarado no es la carrera por las puntuaciones, sino la utilidad real. El modelo está diseñado para abordar trabajos de largo alcance gestionando varios flujos en un único hilo: ante un objetivo abierto, utiliza herramientas para construir su propio contexto a partir de fuentes desordenadas y contradictorias, corrige las carencias de su plan y lleva un registro de lo aprendido. La parte más inusual se refiere a la colaboración: Muse Spark 1.3 está entrenado para formular preguntas aclaratorias cuando una instrucción es ambigua, pedir ayuda al usuario cuando se bloquea y solicitar confirmación antes de ejecutar una acción con consecuencias. Las comparaciones realizadas por ingenieros de Meta le atribuyen aproximadamente un 20 % menos de llamadas a herramientas y un 25 % menos de tokens que la versión 1.2, una diferencia que se refleja directamente en la factura.

Categoría evaluadaBenchmarkMuse Spark 1.3Muse Spark 1.2GPT-5.6 SolOpus 5
AgenteGDPVal-AA v2 (trabajo intelectual)1754161517101824
AgenteOSWorld 2.0 (uso agéntico del equipo)66,947,662,768,3
AgenteDeepSearchQA (navegación agéntica)89,485,993,090,4
AgenteAutomationBench (flujo empresarial de extremo a extremo)49,438,246,750,3
Contexto largoMRCR 512K-1M98,155,573,8
CodificaciónDeepSWE v1.1 (código agéntico de largo alcance)75,455,073,074,0
CodificaciónSWEAtlas CodeBase QnA59,446,253,552,7

Esta tabla merece una lectura atenta. Muse Spark 1.3 domina claramente en contexto largo y codificación, pero Opus 5 lo supera en las cuatro pruebas agénticas aquí incluidas. Sobre todo, la comparación no se realiza en igualdad de condiciones, y así lo indica la metodología publicada por Meta: Muse Spark 1.3 y 1.2 se evaluaron con el nivel de esfuerzo xhigh, mientras que Claude Opus 5 y GPT-5.6 Sol se evaluaron en modo max. Solo hay una excepción, DeepSWE v1.1, donde Muse Spark 1.3 se midió en max, precisamente el modo que todavía no está disponible; Meta indica que llegará cuando finalicen las pruebas de seguridad adicionales.

Un párrafo de la hoja de ruta llama la atención para el ecosistema abierto.

Stay tuned for more updates soon, including bigger models, Muse Spark open weights, and more.

🇪🇸 Estad atentos a más noticias próximamente, incluidos modelos más grandes, los pesos abiertos de Muse Spark y mucho más.@AIatMeta en X

Después de un año en el que Meta redujo notablemente sus lanzamientos con pesos abiertos, el compromiso es significativo; queda por ver a qué versión afectará, ya que no se han proporcionado fechas ni detalles sobre su alcance.

🔗 Presentación de Muse Spark 1.3


Qwen3.8-Max-0902 alcanza el primer puesto de Code Arena WebDev

2 de septiembre — Qwen publicó una actualización de su modelo insignia: Qwen3.8-Max-0902, un snapshot fechado que también responde al alias qwen3.8-max-2026-09-02. El modelo conserva las características estructurales de la versión de agosto —2,4 billones de parámetros y una ventana de contexto de 1 millón de tokens—, pero recibió una fase adicional de postentrenamiento orientada a «Coding & Cowork».

Característica del modeloValor publicado
Parámetros2,4 T
Ventana de contexto1 M tokens
Entrada máxima991 K tokens (983 K en modo thinking)
Salida máxima131 K tokens
Presupuesto de razonamiento262 K tokens
Precio de entrada y de salida2 dólares y 6 dólares por millón de tokens
Lectura explícita de caché0,17 dólares por millón de tokens
Lectura implícita de caché0,25 dólares por millón de tokens
Creación explícita de caché2,50 dólares por millón de tokens
Límites de rendimiento1 M tokens por minuto, 15 K solicitudes por minuto

El modelo acepta imágenes, texto y vídeo como entrada, y ofrece cinco herramientas integradas mediante la Responses API: intérprete de código, búsqueda de imagen a imagen, búsqueda de texto a imagen, extractor web y búsqueda web. Está disponible mediante la API en QwenCloud desde ese mismo día.

Ese mismo día, Arena.ai publicó sus resultados en Code Arena WebDev. Qwen3.8-Max-0902 entra directamente en el primer puesto de la clasificación general con 1 691 puntos, 22 puntos más que la versión anterior, 3 puntos por delante de Claude Opus 5 con la configuración Max y 17 puntos por delante de Kimi K3 con la configuración Max. Con un precio combinado de 5 dólares por millón de tokens, el modelo ocupa la posición mejor valorada de la frontera de Pareto de Arena, es decir, la mejor relación entre puntuación y coste de toda la clasificación.

El desglose por categoría matiza el panorama: primero en Data & Analytics y Consumer Product; segundo en Brand & Marketing, Gaming y Simulations; tercero en Content Creation Tools y Reference-Based Design. Por tanto, la fortaleza del modelo se centra más en las aplicaciones de datos y los productos de consumo que en las tareas predominantemente creativas. Arena anuncia próximas puntuaciones de Agent Arena.

🔗 Anuncio de Qwen3.8-Max-0902


La inferencia abandona la nube: vídeo en un equipo de escritorio, un motor local con licencia abierta

Es la corriente de fondo del día, y no cabe en ningún anuncio considerado de forma aislada. Dos publicaciones importantes y cuatro señales más discretas apuntan en la misma dirección: ejecutar localmente lo que ayer requería una GPU de centro de datos.

2 de septiembre — El equipo FastVideo del Hao AI Lab (UCSD) ha publicado la adaptación local de FastH3, su versión destilada del modelo de vídeo abierto MiniMax H3. Hasta ahora, generar conjuntamente vídeo y audio requería una GPU de centro de datos; el modelo ahora se ejecuta en una NVIDIA DGX Spark, dos DGX Spark conectadas mediante un enlace QSFP o un Mac Apple Silicon con al menos 36 GB de memoria unificada.

La principal limitación no es la potencia de cálculo, sino la memoria. La DGX Spark incorpora 128 GB de LPDDR5X unificada a unos 270 GB/s, aproximadamente una décima parte del ancho de banda de una HBM de centro de datos, de los cuales 121 GB están realmente disponibles para una carga. Por tanto, el pipeline avanza por fases: codificar el prompt, liberar el codificador de texto, cargar el transformer, eliminar el ruido, liberarlo y, después, cargar el VAE. En una GPU discreta, copiar los pesos de vuelta al host libera la memoria del dispositivo; en Spark, esa copia vuelve a caer en el mismo pool. El equipo la ha eliminado en favor de una carga DiT directa en la GPU: la carga del transformer baja de 445 s a 39 s, y una ejecución a 768×1344 con 124 imágenes, de 772 s a 336 s.

Máquina de pruebaPrimera generaciónGeneración repetida
Apple M4 Max504 s465 s
DGX Spark264 s243 s
4x GB20010,2 s5,1 s

Frente a la receta pública de vLLM-Omni para DGX Spark, que necesita 1 881 s a 1024×576 para cinco segundos de vídeo y 50 pasos, FastH3 baja a 268 s en cuatro pasos, es decir, cerca de 7x; la proporción sube a 8,4x a 832×480 y vuelve a bajar a 7,9x a 1344×768. En M4 Max, la codificación de un prompt no almacenado en caché pasa de unos 80 s a unos 17 s, y el decodificador TAEH3 reduce la decodificación de 102 s a 1 s, al tiempo que rebaja el pico de memoria de 11,0 a 3,6 GiB. Los pesos MLX se publican en INT8, INT6 e INT4 en Hugging Face, acompañados del FastVideo Cookbook, publicado por primera vez. El próximo objetivo anunciado: la familia RTX, incluidas las 5090 y 4090.

Esa misma noche, Perplexity abrió el código de Lily, el motor de inferencia local que ejecuta en el dispositivo la parte de su computación híbrida en Mac. El motor se había presentado el día anterior en una publicación de investigación; la novedad es la publicación del código con licencia Apache-2.0 en el repositorio perplexityai/pplx-garden, donde se une a fabric-lib y pplx-unigram.

El código confirma una apuesta por la especialización extrema. Lily no es un motor genérico: solo carga un único checkpoint, Qwen3.6-35B-A3B cuantizado en 4 bits affine en formato MLX con un tamaño de grupo de 64, verificado durante la carga. Se rechazan explícitamente los checkpoints Qwen densos, las variantes más pequeñas, BF16, GGUF, AWQ, GPTQ, int8 y fp8. Escrito en Rust con kernels Metal compilados desde el código fuente al iniciarse, no utiliza ni PyTorch ni MLX en su ruta de ejecución y requiere una GPU Apple de la familia 10 o posterior —un M5 o más reciente— con macOS 26 como mínimo. La superficie de la API es igualmente reducida: solo tres rutas, decodificación siempre greedy, y parámetros de muestreo, streaming, herramientas y contenido multimodal rechazados en vez de ignorados. Esta estrechez es el punto interesante: Perplexity no ofrece un competidor de MLX-LM, sino la demostración de que un motor hecho a medida para una plataforma y un modelo determinados supera a un framework generalista.

Otras cuatro publicaciones del día apuntan en la misma dirección y se recogen en Breves: TranslatePsy-Nano, modelos de traducción de entre 17 y 42 MB que cubren diecisiete idiomas; el trabajo de i64 Systems sobre expertos de un modelo MoE residentes en NVMe sin cambiar un solo byte de la salida; la publicación de Cohere en defensa del dimensionamiento adecuado de los modelos pequeños en las empresas; y el directo de NVIDIA sobre DGX Spark dedicado a la ejecución local del Portable Computer de Perplexity. Ninguna tiene mucho peso de forma aislada, pero todas desplazan la computación del centro de datos al dispositivo.

🔗 FastH3 en local · 🔗 Apertura del código de Lily · 🔗 Repositorio pplx-garden


Anthropic abre el código de Claude Commerce Agents

2 de septiembre — Anthropic ha publicado como open source Claude Commerce Agents, un repositorio de referencia con licencia Apache 2.0 para crear agentes de comercio. El anuncio llega deliberadamente antes de la temporada navideña, periodo en el que los equipos de e-commerce planifican sus despliegues.

El blueprint contiene dos agentes completos. El agente de compras vive en la aplicación de la empresa: busca en el catálogo, reúne un conjunto de artículos para una petición formulada en lenguaje natural, recuerda las preferencias del cliente, muestra productos, comparaciones y el carrito dentro de la conversación, y después transfiere el control al checkout; además, responde a las preguntas de atención al cliente en el mismo hilo. El agente para comerciantes está dirigido a los equipos que gestionan la tienda: analiza las ventas, avisa de que un artículo se agotará antes de una promoción, ofrece recomendaciones de precios basadas en el historial y redacta campañas.

Elemento del repositorioContenido incluido
Agentes incluidosAgente de compras (cliente) y agente para comerciantes (back-office)
Verticales ejecutablesRetail, viajes, telecomunicaciones, venta de entradas
RuntimesMessages API, Claude Agent SDK, Claude Managed Agents (beta)
Plataformas de despliegueClaude API, Amazon Bedrock, Microsoft Foundry, Google Cloud Vertex AI
Plugin de Claude Codecommerce-builder@claude-commerce-agents
Requisitos técnicosPython 3.11 o posterior, Node 22
Resultados ya observadosEntre los minoristas que ejecutan agentes de compras con Claude: carritos hasta un 35 % más grandes y compradores un 60 % más propensos a finalizar

La separación entre lo que decide el modelo y lo que se ejecuta realmente es estructural, no declarativa. Del lado del consumidor, la interfaz backend a la que llama el agente simplemente no incluye ningún método de pago. Del lado del comerciante, cada herramienta de escritura genera un cambio pendiente acompañado de un identificador creado en el servidor, y la función apply_change solo se completa para identificadores aprobados mediante una auténtica interfaz de validación humana. Anthropic precisa que se trata de una implementación de referencia sin mantenimiento que no acepta contribuciones: un punto de partida para hacer un fork, no una dependencia que deba seguirse. Todas las empresas de las demostraciones son ficticias, y nada realiza pedidos ni carga importes en tarjetas.

🔗 Anuncio de Claude Commerce Agents · 🔗 Repositorio commerce-agents

El apartado técnico: caché, latencia y salvaguardas en el código

Publicado el mismo día y firmado por Ali Shazal y Matthew Koen, el manual de ingeniería que acompaña al blueprint resume un año de trabajo con minoristas, marketplaces y empresas del sector de los viajes. Su primer consejo va a contracorriente: ante un agente que debe cubrir numerosas categorías, no hay que crear un subagente por dominio. Una conversación comercial es una única sesión fuertemente acoplada, y dividirla degrada la calidad: las capacidades proceden de las skills, no de multiplicar los agentes.

Tema tratadoReferencia cuantitativa proporcionada por Anthropic
Respuesta comercial generadaDe 500 a 700 tokens de salida
Lectura de tokens en cachéUna décima parte del coste de los tokens nuevos
Escritura en cachéCoste adicional de alrededor de 1,25x, amortizado desde el segundo uso
Tasa de aciertos de caché objetivoDel 90 al 99 %
Velocidad de las lecturas en cachéEntre 1,5 y 2x más rápidas en torno a los 100 000 tokens
Mejora aportada por la memoriaUn 13 % más de recuerdo factual en la batería de evaluación interna
Casos de evaluación por flujoDe 50 a 100 para empezar

Sobre la elección del modelo, la recomendación es comenzar con Opus para los agentes de comerciantes, donde predomina el análisis, y con Sonnet para los agentes de consumidores, donde la latencia tiene más peso; después, ejecutar toda la batería de evaluación con cada modelo y cada nivel de esfuerzo, midiendo el coste por tarea completada en vez de por llamada al modelo. La sección sobre seguridad, por su parte, es inequívoca.

The prompt is where safe behavior starts, but in commerce it can’t be where safety is enforced. The failures are financial and often irreversible, and a prompt rule is one injection or one bad sample away from being skipped.

🇪🇸 El prompt es donde comienza el comportamiento seguro, pero, en el comercio, no puede ser donde se aplique la seguridad. Los fallos tienen consecuencias financieras y a menudo son irreversibles, y una regla del prompt puede eludirse con una sola inyección o una muestra inadecuada.Anthropic, Guía sobre la anatomía de los agentes de comercio eficaces

Por tanto, se aplican cuatro reglas en el código, definidas una sola vez para compartirlas entre los tres runtimes: el modelo prepara, pero una persona o una política ejecuta; las escrituras y los renderizados solo aceptan identificadores emitidos por el servidor; las transacciones con límite deben resistir solicitudes repetidas; el contenido de terceros se sanea.


El control del ordenador pasa a segundo plano en Claude Code y Claude Cowork

2 de septiembre — El control del ordenador (computer use) por parte de Claude ya no monopoliza la pantalla. Hasta ahora, iniciar una tarea de este tipo equivalía a ceder la máquina: las demás ventanas se ocultaban mientras Claude trabajaba en la aplicación aprobada. Ahora, tanto en Claude Cowork como en la pestaña Code de la aplicación de escritorio, la tarea continúa en segundo plano mientras el usuario sigue haciendo otras cosas.

El cambio está en beta, reservado para los planes Pro y Max y limitado a macOS, mientras que computer use sigue estando disponible en research preview para macOS y Windows. Quienes ya utilizaban la función no tienen que activar nada; los demás la encontrarán en Settings > General, teniendo en cuenta que macOS también requiere los permisos del sistema de Accesibilidad y Grabación de pantalla.

El marco de seguridad no cambia. A diferencia de la herramienta Bash, que se ejecuta en un sandbox, computer use se ejecuta en el escritorio real. Los niveles de acceso siguen establecidos por categoría de aplicación y no pueden modificarse: solo visualización para navegadores y plataformas de trading, solo clics para terminales e IDE —lo que empuja a Claude a utilizar la herramienta específica en vez del control de pantalla— y control total para el resto. Una aprobación es válida para la sesión en curso o durante treinta minutos en una sesión iniciada desde Dispatch.

🔗 Anuncio de computer use en segundo plano


Cursor ejecuta sus agentes cloud en máquinas gestionadas por el cliente

2 de septiembre — Cursor ha publicado una entrada de producto firmada por Jack Pertschuk que abre sus agentes cloud a infraestructuras propiedad del cliente. Hasta ahora, un agente cloud de Cursor se ejecutaba en una máquina virtual dedicada en la nube del proveedor. Con Self-Hosted Machines, la ejecución de las herramientas se traslada a máquinas situadas en la red de la empresa, mientras que el bucle del agente, la inferencia y la planificación permanecen en Cursor.

La cifra que justifica la maniobra se ofrece desde el principio: los agentes cloud generan ahora más del 60 % de las pull requests que Cursor fusiona internamente. Cuando una proporción creciente del trabajo pasa por estos agentes, la máquina en la que se ejecutan deja de ser un detalle. El proveedor identifica tres situaciones que llevan a un equipo a utilizar sus propias máquinas: ejecutar las herramientas en contacto directo con el gestor de código fuente y los servicios internos, disponer de hardware específico, como GPU o Mac para el desarrollo de iOS, o ejecutar un sistema operativo difícil de empaquetar en una imagen de agente cloud.

Aspecto del sistemaDetalle técnico
Comando de registroagent worker start, conexión HTTPS saliente de larga duración
Sentido de la conexiónCursor nunca inicia una conexión entrante hacia la red del cliente
Configuraciones disponiblesMy Machines (equipo o VM individual) y Pools (cola compartida del equipo)
Reanudación tras inactividadHibernación mediante snapshot, restauración con el mismo identificador de worker
Proveedores de sandboxesAWS Lambda, Cloudflare, Coder, Daytona, E2B, Modal, Namespace, Vercel
Control del ordenadorAhora compatible con Linux, además de Mac, mediante Chrome o Chromium

Los pools escalan mediante un controlador que supervisa la cola de solicitudes e inicia máquinas con un script proporcionado por el equipo; si no hay ningún worker disponible, la solicitud espera. Para el caso intermedio entre reiniciar una máquina y mantenerla encendida, costoso en ambos sentidos, Cursor introduce la hibernación: se crea un snapshot de la máquina inactiva y se apaga; si llega una nueva solicitud dentro del periodo de reconexión, se restaura el snapshot. Como un pool no está vinculado a un repositorio, una misma cola puede servir a varios.

Una salvedad, señalada por la propia publicación: solo se traslada el entorno de ejecución. Las salidas de las herramientas se envían de vuelta a Cursor para la inferencia y pueden contener código, y las transcripciones de los agentes pueden procesarse y almacenarse allí. Por tanto, no se trata de un aislamiento completo, sino de un cambio del lugar de ejecución.

🔗 Self-Hosted Machines


Claude Fable 5.1 alcanza la disponibilidad general en los integradores

1 y 2 de septiembre — El mismo día de su lanzamiento, Claude Fable 5.1 alcanzó la disponibilidad general en GitHub Copilot; al día siguiente, Genspark lo integró en su Code Agent y en Claw. Dos integradores en dos días, con el mismo modelo: es una ola de adopción, no dos noticias aisladas.

En GitHub, la cobertura es amplia —Visual Studio Code, Visual Studio, Copilot CLI, el coding agent, la aplicación GitHub Copilot, github.com, GitHub Mobile en iOS y Android, los IDE de JetBrains, Xcode y Eclipse— para los planes Pro+, Max, Business y Enterprise, con un despliegue progresivo y una facturación según la tarifa pública del proveedor. Pero el aspecto más destacable de esta puesta a disposición no es técnico, sino contractual.

Condición de accesoLo que se aplica a Fable 5.1
Política del administradorDesactivada de forma predeterminada, debe activarse explícitamente
Retención de datosObligatoria de forma predeterminada, para los clasificadores de seguridad de Anthropic
Uso de los datos retenidosSin entrenamiento de los modelos de Anthropic
Otros modelos ClaudeSe mantiene la retención nula, excepto para Fable 5 y Fable 5.1
Exención de retención nulaEmpresas elegibles, hasta el final del año natural
Después de la exenciónSe requieren Enterprise Frontier Safeguards

A diferencia de los demás modelos Claude de Copilot, Fable 5.1 exige la retención de datos de forma predeterminada: Anthropic conserva los prompts y las salidas para hacer funcionar sus clasificadores de seguridad. Activar la política supone, por tanto, aceptar explícitamente esta condición, y mantenerla desactivada simplemente hace que el modelo no esté disponible. La vía de escape es temporal y selectiva: las empresas elegibles pueden mantener la retención nula hasta el final del año natural, mientras Anthropic despliega sus Enterprise Frontier Safeguards, que deben aportar supervisión automatizada de la seguridad y claves de almacenamiento y cifrado controladas por el cliente. La elegibilidad no puede obtenerse mediante autoservicio: debe tramitarse a través del equipo comercial de GitHub, un proceso que el soporte no puede eludir, e incluso una vez aprobada no activa nada automáticamente.

Por su parte, Genspark afirma haberlo integrado desde el primer día en Genspark Code Agent y en Claw, sin benchmarks ni detalles sobre precios. El editor se suma a la lista de plataformas agénticas que adoptaron el modelo en las horas posteriores a su lanzamiento, junto con Cursor, Devin, Warp, v0, Amp y Perplexity Computer.

🔗 Fable 5.1 en GitHub Copilot · 🔗 Anuncio de Genspark


GitHub explica cómo abarató Copilot sin degradar la calidad

2 de septiembre — GitHub publicó un artículo de ingeniería firmado por Erik Kristensen, con Napalys Klicius, sobre la reducción del coste de Copilot. El texto es poco habitual en este ámbito: aporta cifras, describe los experimentos que fracasaron y explica por qué una optimización evidente puede resultar contraproducente.

La tesis inicial es contraintuitiva. Contar los tokens de una interacción aislada no mide la eficiencia: una respuesta concisa de una herramienta que omite información necesaria para el agente lo obliga a ejecutar de nuevo el comando, lo que hace que la tarea sea, en conjunto, más lenta y costosa. GitHub ilustra el problema con RTK (Rust Token Killer), una utilidad que acorta la salida del shell antes de leerla. Efectivamente acortaba algunas respuestas, pero los pasos posteriores para recuperar información añadían turnos: tokens ahorrados localmente, gastados globalmente. No se implementó.

Cambio evaluadoMejora medida
Eliminación de los números de línea, en pruebas offlineAproximadamente un 5 % menos de coste de inferencia
Eliminación de los números de línea, en producción en el CLIAproximadamente un 3 % menos de coste medio diario por usuario
Compresión del prompt de la herramienta task1 300 tokens eliminados por turno, un 2,9 % menos de coste normalizado por hora activa
Entrega directa del trabajo en segundo plano completadoAproximadamente un 2,3 % menos de uso relacionado con tokens, medido en AI Credits
Números de línea y compresión en Copilot code reviewAproximadamente un 5 % de tokens de prompt por revisión, para cada una de las dos medidas
Migración anterior a las herramientas de archivos compartidosAproximadamente un 20 % menos de coste por revisión
RTK (Rust Token Killer)Descartado, coste global superior en la configuración probada

La política de compresión adoptada es deliberadamente conservadora y consta de tres partes: conservar intactas las salidas que parecen código fuente, reorganizar los resultados de búsqueda sin eliminar nada y comprimir únicamente el ruido repetitivo de la instalación, el build y las pruebas. La compresión de git diff formaba parte de las primeras versiones; se eliminó después de que las tareas de benchmark mostraran que los agentes volvían a abrir la salida original.

El episodio más instructivo se refiere a la compresión del prompt. Un bucle de meta-prompting, en el que Copilot reescribe iterativamente su propia instrucción, redujo a la mitad el prompt de la herramienta task; sin embargo, el primer experimento online reveló una regresión que las evaluaciones offline no habían detectado: el bucle había convertido una instrucción prudente sobre el paralelismo en una regla estricta de orden de ejecución, serializando agentes independientes. La corrección sustituyó las listas blancas y negras por una sola frase que dejaba la decisión al modelo. La última lección, y la más útil: las mejoras no se trasladan de un producto a otro. Un conjunto de instrucciones más conciso, inspirado en los buenos resultados obtenidos en Copilot code review, hizo aumentar el coste en Copilot CLI.

None of these changes made the model smarter. They removed work the model never needed to do.

🇪🇸 Ninguno de estos cambios hizo que el modelo fuera más inteligente. Eliminaron trabajo que el modelo nunca había necesitado hacer.Blog de GitHub, Cómo hacemos más rentable la programación con IA


El catálogo de modelos de Copilot se reorganiza

1 y 2 de septiembre — Dos changelogs publicados en el mismo periodo describen las dos caras de una misma reorganización: qué sale del catálogo de Copilot y quién decide ahora el modelo predeterminado.

Seis modelos quedaron obsoletos el 1 de septiembre en la mayoría de las experiencias de Copilot —Copilot Chat, ediciones online, modos ask y agent, y completado de código—.

Modelo retiradoAlternativa sugerida por GitHub
Gemini 3.1 ProGemini 3.7 Flash
Claude Opus 4.5Claude Opus 4.7, Claude Opus 4.8 o Claude Opus 5
Claude Opus 4.6Claude Opus 4.7, Claude Opus 4.8 o Claude Opus 5
Claude Sonnet 4.5Claude Sonnet 5
Claude Sonnet 4.6Claude Sonnet 5
Raptor MiniMAI-Code-1.1-Flash

Se mantiene una excepción: Claude Sonnet 4.6 sigue estando disponible para los suscriptores individuales con un plan anual. No es necesaria ninguna acción por parte del usuario, pero es posible que los administradores de Copilot Enterprise deban activar explícitamente los modelos de sustitución en sus políticas; de lo contrario, estos no aparecerán ni en VS Code ni en github.com.

Al mismo tiempo, la configuración gestionada de las empresas permite ahora establecer cualquier modelo como predeterminado para las conversaciones nuevas. La granularidad va más allá de la empresa: al declarar la clave model como overridable y editar los archivos de configuración de los equipos en team-mappings.json, un administrador puede permitir que cada equipo elija su propio modelo predeterminado, mientras que los usuarios no incluidos heredan la configuración global. La función está en disponibilidad general en Copilot Business y Copilot Enterprise, en la aplicación GitHub Copilot, Copilot CLI y Visual Studio Code.

🔗 Modelos obsoletos · 🔗 Modelo predeterminado en la empresa


El Ship Log de agosto: Copilot en Slack y Teams, y contenido multimedia en el CLI

1 y 2 de septiembre — El resumen mensual publicado por GitHub en forma de artículo en X es un ejercicio promocional, pero revela una novedad de agosto de la que no se había informado: GitHub Copilot ya está disponible desde Slack y Microsoft Teams. La integración lleva las capacidades agénticas de Copilot CLI y de la aplicación GitHub Copilot a las conversaciones de equipo: mencionar a GitHub permite planificar cambios, investigar un problema o transmitir una tarea de programación sin salir del hilo.

Elemento del Ship Log de agostoLo que se entregó
Copilot en Slack y Microsoft TeamsCapacidades agénticas de Copilot CLI y de la aplicación Copilot
Copilot code review, profundidad BalancedDisponibilidad general, junto a Lite; valor predeterminado configurable por organización o repositorio
Nuevos modelos recordadosGemini 3.7 Flash, MAI-Code-1.1-Flash, Kimi K3 alojado por Fireworks AI
Promoción de GPT-5.6 SolMitad de precio hasta el 3 de septiembre
Promoción de la selección automática30 % de descuento para los usuarios de Copilot Max
GitHub Copilot Day10 de septiembre de 2026

El resumen también documenta la profundidad Balanced de Copilot code review, que alcanzó la disponibilidad general junto a Lite: Balanced busca ofrecer un análisis más exhaustivo de las pull requests, Lite se orienta a los cambios directos y la profundidad predeterminada puede configurarse a nivel de organización o repositorio.

Otra novedad del mes completa el panorama en la línea de comandos: el flag repetible --attach de GitHub CLI, disponible desde gh v2.99.0, carga una imagen o un vídeo local y lo referencia online en una issue, una pull request o un comentario. Funciona en los seis comandos que escriben Markdown, y el detalle que lo hace práctico es el tratamiento del Markdown existente: una ruta local ya referenciada en el cuerpo se reescribe in situ, de modo que ![alt](./login.png) conserva su texto alternativo y apunta al asset cargado. El texto alternativo se indica después de un # en la ruta. Formatos admitidos: PNG, JPEG, GIF, WebP, SVG, MP4, MOV y WebM, con un límite de 10 MB para las imágenes y 100 MB para los vídeos en los planes de pago. GitHub Enterprise Server no es compatible con esta versión. GitHub destaca explícitamente que los agentes de programación heredan esta capacidad y ahora pueden mostrar un resultado en lugar de describirlo.

🔗 Ship Log de agosto de 2026 · 🔗 Contenido multimedia en GitHub CLI


Fairwind Program, la ciberdefensa de Google reservada a defensores de confianza

2 de septiembre — El mismo día que Gemini 3.8 Flash Cyber, Google lanzó Fairwind Program, el canal mediante el que se distribuye este modelo. El razonamiento expuesto por Four Flynn, vicepresidente de seguridad y privacidad, parte de un dilema concreto para los equipos defensivos: adoptar modelos de frontera enormes, costosos y difíciles de controlar en bases de código empresariales, o recurrir a modelos de pesos abiertos más pequeños que tienen dificultades para corregir vulnerabilidades complejas.

La respuesta combina Gemini 3.8 Flash Cyber con CodeMender, el sistema de corrección automática de Google. El argumento central no es la detección, sino la remediación: identificar debilidades genera conciencia y miedo, mientras que encontrarlas y corregirlas automáticamente aporta seguridad. La promesa es generar correcciones verificadas y desplegables en minutos, en lugar de semanas, dentro del entorno cloud seguro de la organización cliente.

El acceso se ofrece deliberadamente por fases, con tres grupos prioritarios: gobiernos y autoridades nacionales de ciberseguridad; operadores de infraestructuras críticas en los sectores sanitario, de telecomunicaciones, energético y de redes financieras; y plataformas tecnológicas centrales. Las organizaciones participantes aceptan restricciones estrictas: limitar el acceso a sus equipos internos de ciberseguridad, respuesta a incidentes o pruebas de intrusión, e implementar protecciones como la autenticación multifactor. Google anuncia más de 650 socios participantes en todo el mundo. Fuera del programa, cualquier cliente de Google Cloud puede utilizar CodeMender con modelos disponibles públicamente en Gemini Enterprise Agent Platform, como complemento de AI Threat Defense. La empresa señala además que ha superado los 100 millones de dólares de financiación acumulada para ciberseguridad a través de Google.org, incluidos 36 millones para 35 clínicas de ciberseguridad que han apoyado a más de 1 250 hospitales, distritos escolares y servicios municipales estadounidenses.

🔗 Fairwind Program


Las herramientas de línea de comandos de Google: tres versiones en dos días

1 y 2 de septiembre — Google lanzó tres versiones dentro del mismo ámbito en dos días, y el conjunto refleja una prioridad clara: menos funcionalidades, más aislamiento y estabilidad.

Versión publicadaFechaContenido dominante
Gemini CLI v0.58.01 de septiembreSiete cambios centrados en la seguridad, promoción al canal estable
Antigravity CLI 1.1.231 de septiembreDos mejoras, once correcciones
Antigravity 2.12.02 de septiembreSiete mejoras, nueve correcciones

El canal estable de Gemini CLI pasó a v0.58.0, una promoción que pasó inadvertida porque se produjo treinta y dos minutos después de la publicación de la preview v0.59.0. El contenido es casi totalmente defensivo. La corrección más sustancial afecta al sandbox de macOS: el perfil Seatbelt aísla ahora los sockets y binarios de Docker y de los runtimes de contenedores, lo que cierra una vía clásica de evasión — un proceso confinado que alcanza el socket Docker del host puede, en la práctica, escapar de él. Otras dos endurecen el núcleo: la evaluación de los enlaces simbólicos pasa a ser coherente en la gestión de las rutas ignoradas, y los verificadores de seguridad de primer nivel se declaran explícitamente en la configuración de la política de escritura.

Antigravity 2.12.0 incorpora dos novedades funcionales. La cita de respuestas permite resaltar una parte de una respuesta para reinyectarla como contexto en el siguiente prompt, una respuesta directa a un problema cotidiano de las sesiones agénticas largas. Y el comando /boost, reservado a los usuarios de pago, intensifica el esfuerzo de reflexión mediante un pipeline de razonamiento multiagente. Llega el mismo día que Gemini 3.8 Flash, del que Google reconoce que trabaja más intensamente a costa de más tokens: ambos movimientos apuntan en la misma dirección, la de un control explícito por parte del usuario sobre el nivel de esfuerzo. El resto aborda molestias reales: los ajustes generales indican qué proyectos sobrescriben una configuración, las disposiciones de terminal en pantalla dividida sobreviven a las recargas de la ventana y se puede enviar un mensaje mientras el dictado está activo.

Antigravity CLI 1.1.23, por último, aligera el streaming de los subagentes enviando los metadatos de trayectoria una vez por subtrayectoria en lugar de hacerlo en cada etapa, y acepta mediante Tab el nombre de modelo sugerido como texto fantasma en /model. Sus once correcciones revelan defectos molestos en el día a día: fallos provocados por los hooks de prompt, identificadores de llamadas a herramientas omitidos al reconstruir el historial para los modelos Gemini, solicitudes de permiso que mostraban títulos genéricos en vez de descripciones de acciones comprensibles — un verdadero problema, ya que se pide autorizar una acción que no se describe — y subagentes declarados con enable_mcp_tools=true que fallaban por carecer de dispatcher MCP.

🔗 Notas de la versión Gemini CLI v0.58.0 · 🔗 Registro de cambios de Antigravity


Los Short Video Overviews de Gemini Notebook llegan a más de 70 idiomas

1 de septiembre — Gemini Notebook amplió sus Short Video Overviews a más de 70 idiomas, añadiendo tres nuevas variantes del inglés. La funcionalidad transforma las fuentes de un notebook en vídeos verticales de unos 60 segundos, que ahora pueden generarse en el idioma del usuario.

El despliegue abarca la web y los dispositivos móviles, y sigue reservado a los suscriptores Ultra y Pro; el equipo precisó en el mismo hilo que la distribución entre los usuarios Pro todavía no se ha completado. Dos detalles complementan el anuncio: la cantidad de fuentes presentes en un notebook no entra en el cálculo del consumo de tokens, y los usuarios Pro conservan la generación de Cinematic Video Overviews en inglés. El paso del inglés a 70 idiomas hace que la funcionalidad deje de ser una demostración para convertirse en una herramienta realmente utilizable fuera del mundo anglófono.

🔗 Anuncio de Gemini Notebook


Los editores se convierten en multiplexores de modelos

1 y 2 de septiembre — Dos anuncios sin relación aparente describen el mismo movimiento: el entorno de desarrollo se convierte en un punto de acceso a modelos de terceros, y el factor diferenciador se desplaza de la calidad del modelo a las condiciones en las que se ejecuta.

Zed publicó su versión estable 1.18.0, cuyo contenido más significativo se encuentra en la sección de IA de las notas de la versión. El editor incorpora de una vez varios lanzamientos recientes: la ventana de contexto de 1 millón de tokens de GPT-5.6 es compatible con Amazon Bedrock, Gemini 3.5 Flash-Lite se suma a los modelos de Google AI, Grok 4.5 y Grok 4.6 se incorporan a los modelos de xAI, y mejora la compatibilidad con Claude Fable 5.1, lanzado el día anterior. Dos de estas cuatro incorporaciones son contribuciones externas acreditadas en las notas. A ello se añaden elementos de usabilidad propios del trabajo con agentes — recarga de una conexión rota con un agente externo sin necesidad de reiniciar, menor consumo de memoria durante sesiones largas, errores de conexión que identifican el host inaccesible — y una corrección relevante para quienes conectan servidores MCP: la autenticación OAuth fallaba con los servidores que exigían scopes no estándar.

Mistral, por su parte, habilitó GLM 5.2 en Vibe Code, su agente de programación, para los planes Pro y Team. Lo destacable no es el modelo, sino la forma en que se ofrece: Mistral lo aloja en Europa en su propia infraestructura. Por tanto, un desarrollador europeo que utiliza GLM 5.2 desde Vibe Code dirige sus solicitudes a una inferencia operada por Mistral, sin que estas transiten por los servidores de Z.ai. Es la materialización concreta del posicionamiento de inferencia regional que la empresa defiende desde agosto, y la situación resulta doblemente reveladora, ya que Mistral cuenta con su propia familia Devstral y, aun así, decide ofrecer en su herramienta un modelo de pesos abiertos desarrollado por un laboratorio competidor.

🔗 Notas de la versión Zed 1.18.0 · 🔗 GLM 5.2 en Vibe Code


NVIDIA: dos artículos de ingeniería y una alianza que cambia de tutela

2 de septiembre — NVIDIA publicó tres contenidos el mismo día: dos técnicos y uno sobre gobernanza.

El primer artículo, tercera entrega de la serie sobre el codiseño de modelos, ofrece cinco reglas para ajustar el speculative decoding. La técnica es conocida: un pequeño modelo de draft propone varios tokens que el modelo objetivo verifica en una pasada paralela. La cuestión práctica sigue abierta: cuántos tokens especular y con qué mecanismo. Durante la verificación, el cálculo crece con (1 + D), pero los accesos a memoria permanecen sin cambios; por tanto, hay que aumentar la longitud de draft D hasta el punto en que la verificación pase de memory-bound a compute-bound. En un GEMM de experto representativo, D = 7 permite alcanzar este régimen con una octava parte del tamaño de batch necesario con D = 0. Cuando la atención domina el tiempo de decodificación, la longitud óptima pasa a ser D = 128/G − 1, donde G es el número de cabezas de consulta que comparten una cabeza KV, y a partir de ese punto conviene elegir valores en los que G × (1 + D) sea múltiplo de 128, el tamaño de tile del kernel de atención. Las mediciones se basan en SPEED-Bench, el benchmark de speculative decoding de NVIDIA: con Qwen 3.5 122B A10B como objetivo, el draft externo 35B A3B alcanza una longitud de aceptación de 6 con D = 9. El artículo insiste en un aspecto que suele pasarse por alto — una mayor aceptación no implica una mayor aceleración — y termina con una advertencia: un fine-tuning del objetivo modifica su distribución de salida, de modo que un drafter entrenado para un checkpoint determinado puede perder aceptación incluso cuando el objetivo mejora.

El segundo artículo es un recorrido de optimización CUDA en seis etapas, construido alrededor de un único ejemplo: convertir tres imágenes RGB a escala de grises y después calcular la mediana de cada tile de 32 × 32 píxeles. El punto de partida es un código deliberadamente defectuoso, que Compute Sanitizer diagnostica de inmediato: una escritura fuera de límites en la memoria compartida, causada por usar un índice global donde se esperaba un índice de bloque.

Etapa de optimizaciónTiempo totalMejora de la etapa
Código inicial6,8 s
CUB (DeviceTransform y BlockRadixSort)635 msaproximadamente 10x
Contenedores de memoria agrupadosunos 244 msaproximadamente 2,6x
Memoria fijada25 msaproximadamente 10x
Un stream CUDA por imagen23 msaproximadamente 300x acumulado

La sustitución del algoritmo de ordenamiento de burbuja casero por cub::BlockRadixSort reduce por sí sola el cálculo de las medianas de 2,142 s a 773 µs, un factor de 2717. Ninguna de estas etapas corresponde a una optimización de bajo nivel: son sustituciones de API.

Por último, la Open Secure AI Alliance, que NVIDIA ayudó a fundar, se incorpora a la Linux Foundation. La tesis defendida por la alianza desplaza el foco del debate habitual: un agente no es solo un modelo de lenguaje, sino un sistema de software compuesto por modelos, arneses que le proporcionan contexto y salvaguardas que delimitan lo que puede hacer. Sin embargo, la conversación sobre la seguridad se ha centrado en gran medida únicamente en el modelo, aunque la seguridad depende del conjunto: arneses, mecanismos de alineación, entornos de ejecución, identidad, políticas, observabilidad y recuperación. Está abierta una convocatoria de comentarios sobre SAFE (Shared AI Findings Exchange), un mecanismo de recopilación confidencial de incidentes y cuasiincidentes relacionados con la IA, en colaboración con OpenSSF.

🔗 Speculative decoding · 🔗 Optimización CUDA paso a paso · 🔗 Open Secure AI Alliance


Equinix Inference Exchange: modelos abiertos en 280 centros de datos

2 de septiembre — Equinix anunció Equinix Inference Exchange, un programa de inferencia de IA distribuida que amplía su colaboración con NVIDIA e incorpora a Together AI. La arquitectura se basa en tres capas: Equinix proporciona la infraestructura física conectada a las nubes mediante Equinix Fabric, NVIDIA aporta sus arquitecturas de referencia empresariales validadas y Together AI ejecuta la plataforma por encima, con compatibilidad para más de 200 modelos open source, tanto en despliegues compartidos como en entornos dedicados de un único tenant.

El argumento se centra en la ubicación de la inferencia más que en la elección del modelo, con tres casos de uso previstos: inferencia en el edge metropolitano para reducir la latencia, migración de cargas desde modelos propietarios cerrados hacia alternativas abiertas e IA soberana para empresas reguladas. Las cifras de presencia dan una idea de la magnitud de la red movilizada: más de 280 centros de datos en 77 áreas metropolitanas, 230 rampas de acceso a la nube y más de 10 500 empresas interconectadas.

Sin embargo, conviene prestar atención al calendario: el comunicado de Equinix indica expresamente que la solución estará disponible a partir del primer trimestre de 2027, mientras que el mensaje de Together AI describe su plataforma como ya activa en los centros de datos de Equinix de todo el mundo. Se trata de un anuncio de asociación y de una hoja de ruta, no de una puesta en servicio.

🔗 Comunicado de Equinix


BenchMIRT, el método de Ai2 para auditar qué miden realmente los benchmarks

1 de septiembre — Ai2 publicó BenchMIRT, un método que plantea una pregunta que rara vez se aborda de frente: ¿mide realmente un benchmark la capacidad que afirma medir? En lugar de razonar a partir de la puntuación final, desciende al nivel de cada pregunta y estima qué capacidades determinan realmente el éxito, apoyándose en la teoría de respuesta al ítem (Item Response Theory) procedente de la psicometría, en su variante multidimensional. El entrenamiento se realizó con los resultados de 100 modelos de pesos abiertos, 16 benchmarks y más de 34 000 preguntas.

El resultado más sólido es metodológico: sin indicarle qué debía medir supuestamente cada benchmark, BenchMIRT hizo emerger por sí mismo dos dimensiones dominantes, la seguridad y el razonamiento general, que aparecieron de forma idéntica al repetir el análisis desde cero.

Benchmark auditadoCorrelación con el razonamientoCorrelación con la seguridadVeredicto de la auditoría
MMLU-Pro0,97-0,21Se ajusta a su objetivo declarado
BBQ0,85-0,06Refleja el razonamiento pese a su condición de prueba de seguridad
WMDP-0,890,21Mide la ausencia de conocimientos peligrosos
ToxiGen0,40-0,32Débil en ambas dimensiones, benchmark saturado al 92 %

BBQ, diseñado para comprobar si un modelo se apoya en estereotipos sociales, presenta por tanto una correlación de 0,85 con el razonamiento general y ninguna con la seguridad: una mala puntuación quizá diga más sobre el razonamiento del modelo que sobre su comportamiento. La segunda contribución es práctica: al clasificar las preguntas por su poder discriminante, Ai2 muestra que, conservando solo el 10 %, se mantiene aproximadamente la misma clasificación de los modelos, y que el método predice correctamente la respuesta a una pregunta no observada el 79 % de las veces, frente al 70 % de un enfoque ingenuo. Dos limitaciones reconocidas: todos los modelos de entrenamiento son anteriores a marzo de 2025, y las dimensiones descubiertas dependen del conjunto de benchmarks proporcionado.

🔗 BenchMIRT


Runway Dev MCP: el agente de programación toma el control de la integración multimedia

2 de septiembre — Runway lanzó Runway Dev MCP, un servidor MCP alojado que conecta su plataforma para desarrolladores directamente con la herramienta de programación utilizada a diario: Claude, ChatGPT, Codex o Cursor. El argumento se resume en una frase: el agente que escribió la integración ahora puede elegir el modelo adecuado para ella, configurar las herramientas en las que se apoya y depurarla.

El servicio cubre los tres momentos de una integración. Antes de la primera llamada a la API, el agente consulta el catálogo para saber qué modelos puede utilizar un proyecto, a qué precio y con qué entradas, y luego obtiene el esquema exacto de solicitud del modelo elegido; el objetivo es realizar correctamente la llamada en el primer intento, en vez de adivinar. En producción, crea y configura un Model Router que arbitra entre varios modelos según el coste, la latencia o la calidad, con un límite de coste por generación, y puede averiguar qué modelo eligió el router para una llamada determinada. La misma lógica se aplica a los Characters. El tercer momento es la depuración: cuando falla una generación, el agente consulta la tarea mediante una herramienta definida y lee el motivo exacto del rechazo — rechazo de moderación, límite de tamaño del asset, cuerpo de la solicitud malformado — antes de corregirla y volver a ejecutarla. Un menú Quickstart crea la clave de API y luego abre Claude Code, Codex o Cursor con un mensaje ya redactado.

🔗 Runway Dev MCP


DreamX-Creator 1.0, generación nativa de audio y vídeo en 2K a partir de una sola imagen

2 de septiembre — El equipo AMAP de Alibaba presentó DreamX-Creator 1.0, un modelo de 7.000 millones de parámetros bajo licencia Apache 2.0 que parte de una sola imagen y de un prompt de texto para producir un flujo de vídeo y un flujo de audio sincronizados de forma nativa en 2K, sin encadenar en cascada un modelo de vídeo y uno de audio.

Tres componentes estructuran el sistema: una atención cruzada intermodal con compuertas (Gated Cross-Modal Attention) asociada a un entrenamiento conjunto progresivo, que permite una interacción bidireccional entre ambos flujos; un aprendizaje por refuerzo de audio y vídeo alimentado por una retroalimentación multimodal sensible a la modalidad; y un refinamiento autorregresivo en un solo paso que eleva el vídeo a 2K preservando el movimiento y la sincronización temporal del audio.

La publicación sigue siendo parcial por ahora. El repositorio de GitHub, inicializado el día anterior, contiene la presentación del proyecto y su hoja de ruta, y el informe técnico se publicó en arXiv. Los pesos validados, el código de inferencia, las configuraciones y las herramientas de evaluación aún figuran como hitos pendientes. El trabajo se apoya en Wan2.2 y en MOVA de OpenMOSS, ambos reconocidos explícitamente.

🔗 Anuncio de DreamX-Creator 1.0


La API de OpenAI distingue entre un aumento de carga demasiado rápido y una sobrecarga del modelo

2 de septiembre — OpenAI modificó la forma en que su API señala dos situaciones que hasta ahora las aplicaciones cliente no podían distinguir.

Estado HTTPCódigo de errorSignificadoMedidas que adoptar
429slow_downEl ritmo de solicitudes aumentó demasiado rápidoRespetar Retry-After, reducir el ritmo y luego aumentarlo progresivamente
503server_is_overloadedEl modelo solicitado está temporalmente sobrecargadoRespetar Retry-After y volver a intentarlo; ampliar la espera si el error persiste

La distinción tiene una consecuencia práctica inmediata para cualquier código de reintento. La documentación precisa que puede producirse un error slow_down incluso cuando el tráfico se mantiene dentro de los límites de solicitudes y tokens por minuto de la organización: no indica que se haya agotado una cuota, sino una aceleración considerada demasiado brusca; en otras palabras, una aplicación puede verse limitada sin haber superado ninguno de los límites mostrados. La guía de límites de velocidad propone una regla empírica: una vez que el tráfico alcance un millón de tokens de entrada por minuto, no aumentarlo más de un 50 % cada quince minutos. Cuando falta la cabecera Retry-After, OpenAI recomienda un backoff exponencial acompañado de un pequeño retraso aleatorio, para evitar que todas las instancias de un mismo servicio vuelvan a intentarlo simultáneamente. Las organizaciones cuyo tráfico de pago por uso se topa habitualmente con estos límites son dirigidas a Scale Tier y, para GPT-5.6 y modelos posteriores, a Reserved Tier.

🔗 Registro de cambios de la API de OpenAI


Breves

  • Claude Code 2.1.258 — versión exclusivamente correctiva: se restablece el inicio en macOS 12 Monterey, roto desde la versión 2.1.255, y las sesiones remotas y programadas ya no fallan tras volver a aprobar un permiso. 🔗 CHANGELOG
  • Claude Campus Ambassadors — las candidaturas están abiertas con tres itinerarios distintos este año: grado, posgrado, doctorado y posdoctorado. 🔗 Anuncio
  • Nokia analiza 50 millones de líneas de código con Cursor — dos ingenieros de la división Core Networks lo hicieron en dos semanas, cuando el equipo estimaba que tendría que movilizar a una docena de expertos durante varios meses. Estudio de caso del proveedor, sin protocolo de medición independiente. 🔗 Estudio de caso
  • TranslatePsy-Nano — Tether AI Research publica dos familias de modelos compactos de traducción, EuroNano para nueve lenguas europeas y AfriNano para ocho lenguas africanas, en variantes de 42, 31 y 17 MB con un único punto de control por grupo lingüístico. 🔗 Anuncio
  • Puffin-World — un modelo multimodal unificado que representa el mundo mediante tres estados nativos: física, geometría y apariencia, publicado junto con el conjunto de datos Puffin-16M. 🔗 Presentación
  • Los expertos de un MoE alojados en NVMe — i64 Systems mantiene los pesos de los expertos en NVMe con verificación mediante un manifiesto SHA-256 y mide salidas idénticas byte por byte entre la ruta cargada y la ruta residente. 🔗 Artículo técnico
  • Sakana AI en la CiNet International Conference — Llion Jones, director técnico, y el investigador Kai Arulkumaran impartirán una conferencia sobre los vínculos entre neurociencia y aprendizaje automático del 5 al 7 de octubre de 2026 en Osaka. 🔗 Anuncio
  • Gemini CLI, nightly del 2 de septiembre — un único cambio: la mejora de la validación de destinos y del enrutamiento de conexiones en las utilidades de recuperación web, siguiendo la línea de las medidas de refuerzo de la red iniciadas a finales de agosto. 🔗 Notas de la versión
  • MrBeast firma una colaboración plurianual con Google — el acuerdo amplía más allá de YouTube la relación con Beast Industries, hacia Gemini y Google Health, con un primer vídeo el 5 de septiembre en el que Gemini ayuda a sobrevivir en la selva, el desierto y el Ártico. 🔗 Anuncio
  • Resumen de los anuncios de IA de Google en agosto — artículo mensual que reúne elementos ya tratados a lo largo del mes, sin novedades propias. 🔗 Resumen
  • Enterprise Live Migrations ya está disponible de forma general — migración de repositorios de GitHub Enterprise Server a la nube con residencia de datos y una interrupción casi nula, gestionada mediante la extensión gh elm. Sin relación con la IA; se señala para garantizar la exhaustividad. 🔗 Registro de cambios
  • ElevenLabs nombra a Ashley Kramer directora de ingresos — única publicación de la empresa durante el período, ya que el registro de cambios de su producto no se actualiza desde el 24 de agosto. 🔗 Anuncio
  • NVIDIA emite un directo sobre DGX Spark en el Portable Computer de Perplexity — veintiséis minutos dedicados a su ejecución local, sin texto descriptivo ni transcripción. Es la segunda demostración del día que convierte a DGX Spark en un objetivo de adaptación local. 🔗 Emisión
  • Kling AI documenta los Elements de su servidor MCP — tutorial sobre cómo conservar la identidad de un personaje entre planos; material educativo sobre el producto, no un lanzamiento. 🔗 Tutorial
  • Codex CLI 0.152.1 — versión correctiva publicada unas veinte horas después de la 0.152.0: la revisión de aprobación de Guardian ahora respeta las políticas del REPL de Node transmitidas mediante los metadatos del modelo. 🔗 Notas de la versión
  • Cohere defiende la apuesta por los modelos pequeños en la empresa — el proveedor reúne Command R7B, Tiny Aya con 3.350 millones de parámetros y North Mini Code, al que se atribuye una puntuación de 33,4 en el Coding Index de Artificial Analysis, para defender un dimensionamiento adecuado. Ningún lanzamiento. 🔗 Artículo
  • Perplexity publica dos guías educativas — sobre los asistentes personales y la detección de alucinaciones. La segunda describe un posentrenamiento en dos etapas: la primera desarrolla los comportamientos del producto y la segunda se apoya en tareas de investigación más difíciles. 🔗 Guía

Qué significa

El precio se ha convertido en el argumento principal, incluso entre los modelos de frontera. Tres lanzamientos el mismo día y ninguno destaca una puntuación récord. Google mantiene la tarifa de la generación anterior para Gemini 3.8 Flash y admite que su modelo consume más tokens, un reconocimiento poco habitual que desplaza la cuestión del precio anunciado hacia el coste real de una tarea. Qwen reivindica explícitamente la cima de la frontera de Pareto de Arena en lugar del primer puesto absoluto. Meta cuantifica su mejora no en puntos de benchmark, sino en un 20 % menos de llamadas a herramientas y un 25 % menos de tokens. Y la tabla de CursorBench aporta la medida más reveladora del día: con un 69,2 %, Gemini 3.8 Flash cuesta 2,38 dólares por tarea, mientras que una puntuación equivalente requería 4,80 con Fable 5.1 y 7,35 con Opus 5. Sin embargo, la columna de pasos recuerda que este precio se paga por otro lado: 161 pasos frente a 44.

La ingeniería del arnés se convierte en una palanca económica cuantificable. El artículo de GitHub es el documento más útil del día para cualquiera que construya sobre estos modelos: cuatro optimizaciones que no modifican el modelo y que recortan entre un 2 y un 5 % cada una, con los experimentos fallidos documentados. La guía de ingeniería de Anthropic dice lo mismo desde el otro extremo: aspirar desde el diseño a una tasa de aciertos de caché del 90 al 99 % y medir el coste por tarea completada, no por llamada. Ambas convergen en un punto que la carrera de los modelos oculta: con el modelo constante, el arnés determina una parte significativa de la factura, y las mejoras no se trasladan de un producto a otro. GitHub lo demuestra al observar que una optimización eficaz para la revisión de código aumentaba el coste en la CLI.

La inferencia llega al puesto de trabajo y la ubicación del cómputo se convierte en un parámetro de diseño. FastH3 hace posible la generación de vídeo en un Mac o un equipo de escritorio, Perplexity abre el código de un motor que solo ejecuta un modelo en un único tipo de hardware, Tether publica traductores de 17 MB, i64 Systems mantiene expertos de MoE en NVMe y Cohere aboga por un dimensionamiento adecuado. Este movimiento converge desde arriba con el de Equinix, NVIDIA y Together AI, que distribuyen la inferencia en 280 centros de datos por motivos de latencia y soberanía. El hilo conductor no es la miniaturización, sino la especialización: Lily triunfa porque rechaza todo lo que no sea Qwen3.6-35B-A3B en Apple Silicon, y la apuesta de Perplexity es que esa estrechez constituye una ventaja, no una limitación.

El control y la gobernanza se endurecen, y ahora pasan tanto por el contrato como por la técnica. GitHub impone la retención de datos para Fable 5.1, con una exención que vence al final del año natural, al tiempo que permite a cada equipo empresarial elegir el modelo predeterminado y retira seis modelos del catálogo el mismo día. Cursor traslada la ejecución de los agentes a la red del cliente, aunque precisa que las transcripciones siguen procesándose en sus sistemas. Google reserva su modelo de ciberdefensa a 650 socios seleccionados, bajo condiciones operativas escritas. Mistral ofrece un modelo chino desde Europa y lo convierte en su argumento. Por último, BenchMIRT recuerda que las herramientas de evaluación en las que se apoyan algunas de estas decisiones también merecen una auditoría: un benchmark de sesgo social que presenta una correlación de 0,85 con el razonamiento general y de -0,06 con la seguridad no mide lo que indica su etiqueta.


Fuentes