Buscar

GPT-6 Astra llega al público general, Claude formaliza el último teorema de Fermat, GitHub orquesta varios modelos con HydraFusion

ai-powered-markdown-translator

Artículo traducido del fr al es con gpt-5.6-sol.

Ver proyecto en GitHub ↗

GPT-6 Astra sale del despliegue restringido veinticuatro horas después de su lanzamiento: el modelo pasa a estar disponible para los planes Pro, Enterprise y Business Premium, alcanza la disponibilidad general en GitHub Copilot y obtiene la mejor puntuación jamás registrada por Perplexity en su banco de pruebas de investigación documentada. Por su parte, Anthropic publica la primera demostración del último teorema de Fermat verificada por ordenador, escrita en once días por Claude. GitHub abre HydraFusion, un modo que elige por sí mismo el modelo y el workflow para cada tarea; Google publica Lyria 3.5 en la aplicación Gemini, y SpaceXAI abre Grok Bot a las empresas y documenta un agente de compras que encontró más de 100 000 dólares de ahorro en su propia empresa.


GPT-6 Astra sale del despliegue restringido y alcanza la disponibilidad general en Copilot

4 de septiembre — OpenAI anuncia a las 22:13, hora de París, que GPT-6 Astra abandona su despliegue restringido. El modelo está disponible para todos los usuarios Pro, Enterprise y Business Premium en ChatGPT Work y en Codex, y la API ya lo ofrece sin restricciones, mientras que el anuncio del 3 de septiembre todavía supeditaba su acceso al despliegue progresivo. Los suscriptores Plus y los usuarios Business tendrán que esperar unos días más, según se precisa en el mismo mensaje.

Superficie afectadaAcceso a 4 de septiembre
API de OpenAIDisponible sin restricciones
ChatGPT Work y Codex, ProDisponible
Enterprise y Business PremiumDisponible
Plus y otros BusinessUnos días de espera

🔗 Anuncio de OpenAI en X

Disponibilidad general en GitHub Copilot, al precio público desde el primer día

Ese mismo día, GPT-6 Astra alcanza la disponibilidad general en GitHub Copilot. GitHub pone el acento en el método de trabajo del modelo más que en sus puntuaciones: en sus pruebas internas, Astra planifica y valida durante la ejecución, agrupa el diagnóstico con la verificación y confirma por sí mismo sus resultados antes de declarar finalizada una tarea, lo que le permite rendir mejor en tareas largas con menos pasos que los modelos anteriores de OpenAI. El anuncio no incluye ninguna cifra de benchmark.

El modelo aparece en diez superficies, desde Visual Studio Code hasta los IDE de JetBrains, pasando por Copilot CLI, GitHub Mobile, Xcode y Eclipse, pero sigue reservado a los planes Pro+, Max, Business y Enterprise. Copilot Pro queda excluido. Conviene señalar el aspecto de la facturación: Astra se cobra al precio público del proveedor en la modalidad de pago por uso, sin periodo promocional, mientras que Gemini 3.8 Flash, llegado el día anterior, disfruta de un precio de lanzamiento hasta el 31 de diciembre de 2026.

🔗 Registro de cambios de GitHub

Perplexity le otorga su mejor puntuación en WANDR

Perplexity publicó el 3 de septiembre a las 23:10 el resultado de Astra en WANDR, su banco de pruebas propio para la investigación documentada a gran escala. El modelo obtiene 0,682 por 11,98 dólares por tarea, la puntuación más alta de todos los modelos probados por la empresa.

Modelo evaluadoPuntuación WANDRCoste por tareaMedición publicada el
GPT-6 Astra0,68211,98 dólares3 de septiembre de 2026
Claude Fable 5.10,60112,76 dólares1 de septiembre de 2026

Perplexity también ofrece dos diferencias relativas: un 13,5 por ciento más de puntuación que Claude Fable 5.1 con un coste un 6,1 por ciento menor, y un 27,0 por ciento más que Opus 5 con un coste un 3,3 por ciento mayor. Cabe hacer dos salvedades. WANDR es un banco de pruebas propietario cuya metodología detallada no se ha publicado, y Perplexity también es cliente de los modelos que clasifica. No se ha comunicado ningún valor absoluto para Opus 5.

🔗 Medición de Perplexity en X

Tres correcciones de Codex CLI completan la integración

En la línea de comandos, la versión 0.153.0 publicada durante la noche del 3 de septiembre fue seguida por tres correcciones en menos de dos días, todas dedicadas a Astra. La 0.153.1 permite configurar el modelo mediante la API sin cambiar el modelo predeterminado ni mostrarlo en el selector. La 0.153.2 corrige una etiqueta: el nivel Fast se describe como capaz de ofrecer el doble de velocidad, no 1,5 veces más, sin modificar la forma de procesar las solicitudes. La 0.153.3, publicada el 4 de septiembre a las 21:01, añade Astra al selector de modelos de Amazon Bedrock para las rutas Mantle y Runtime, y corrige la instrucción dada al modelo para las preguntas de aclaración asíncronas.

OpenAI completó la jornada con tres experiencias: dos entradas del blog para desarrolladores, una sobre un juego procedural de exploración espacial creado en Codex y otra sobre el diseño de una casa explorada con Blender y Unreal Engine 5, además de un artículo de Dominik Kundel sobre cinco cambios en su forma de utilizar Codex.

🔗 Notas de la versión Codex CLI 0.153.3 · 🔗 Crear un juego con Astra


Claude firma la primera demostración formalizada del último teorema de Fermat

4 de septiembre — Anthropic publica la primera demostración del último teorema de Fermat completamente verificada por ordenador. Claude trabajó durante once días, en gran medida de forma autónoma, para escribirla en Lean. La empresa la describe como la mayor demostración en Lean jamás construida.

Métrica medidaValor registrado
Duración del trabajo de Claude11 días
Líneas de Lean escritas13 millones
Teoremas intermedios demostrados29 500
Primera demostración humana, por Wiles1995, 129 páginas
Tiempo entre la conjetura y su pruebamás de 350 años

El teorema afirma que ningún trío de enteros positivos satisface la ecuación de Fermat para un exponente superior a dos. Pierre de Fermat lo garabateó hacia 1637 en el margen de su ejemplar de la Aritmética de Diofanto. La primera demostración correcta se debe a Sir Andrew Wiles en 1995: 129 páginas, meses de verificación humana y una primera versión presentada en 1993 en la que un revisor descubrió un fallo crítico dos meses después.

Los primeros intentos fracasaron: los agentes lograban éxitos rápidos antes de perder el hilo. El avance decisivo llegó de Prove2Me, una plataforma colaborativa abierta de formalización, asociada a un arnés multiagente basado en Claude Code. La plataforma mantiene un grafo acíclico dirigido de los enunciados que sirve a los agentes para elegir la siguiente demostración que deben intentar, separa los enunciados y las pruebas en archivos distintos para acelerar la compilación de Lean y conserva una descripción en lenguaje natural de cada enunciado para facilitar su búsqueda y reutilización. La demostración obtenida sigue la exposición simplificada de Wiles debida a Henri Darmon, Fred Diamond y Richard Taylor.

This extraordinary autoformalization achievement, which Anthropic researchers say only took 11 days, proves Fermat’s Last Theorem with no assumptions other than the axioms of mathematics.

🇪🇸 Este extraordinario logro de autoformalización, que según los investigadores de Anthropic solo requirió once días, demuestra el último teorema de Fermat sin más supuestos que los axiomas de las matemáticas. — Kevin Buzzard, revisor del resultado, citado en la página de investigación de Anthropic

Anthropic presenta el reto como una cuestión de verificación más que de descubrimiento, a diferencia de los trabajos recientes realizados por la IA sobre la hipótesis de Riemann, que producían matemáticas nuevas. A medida que aumenta el volumen de demostraciones, la revisión por pares se convierte en un cuello de botella que se mide en años.

🔗 Demostración completa en GitHub


Project HydraFusion: GitHub deja que la herramienta elija el modelo en lugar del desarrollador

4 de septiembre — GitHub abre Project HydraFusion en vista previa de investigación, un modo que ya no designa un modelo, sino un workflow. Mientras que el selector de Copilot pedía elegir entre más de veinte modelos, HydraFusion decide por sí mismo, para cada solicitud, qué modelo se ocupa de la tarea y con qué esquema de ejecución. Se selecciona como cualquier modelo, pero orquesta varios detrás de esa única elección.

Por ahora existen tres esquemas. El modo Single encarga la tarea a un único modelo. El modo Cascade hace que un modelo eficiente redacte una primera solución y, a continuación, una puerta de calidad decide si la acepta o si escala a un modelo más capaz. El modo Critique hace que un crítico independiente de solo lectura, perteneciente a otra familia de modelos, revise el borrador.

Benchmark evaluadoDiferencia de coste frente a Opus 5Diferencia de calidad frente a Opus 5
TerminalBench 2.167 por ciento menos4,9 puntos más
DeepSWE36 por ciento menos1,5 puntos menos
CheckpointBench65 por ciento menos0,1 puntos menos

Cinco principios de ingeniería rigen la ejecución: contabilidad agregada del coste de cada etapa, plazo de expiración y cancelación explícitos, revisión en un contexto aislado y sin herramientas, aplicación con seguridad integrada que no aplica ninguna corrección si el workflow falla, y validación del enrutamiento antes de la ejecución. GitHub asume una concesión en la interfaz al mostrar las etapas, pero ocultar los borradores intermedios hasta el resultado final, y reconoce que la espera sin suficiente visibilidad constituye un verdadero inconveniente.

La documentación del desarrollo es inusualmente franca: GitHub considera TerminalBench 2.1 como la secuencia de runs más completa, precisa que el progreso no fue lineal y reconoce que dos fallos operativos del arnés de evaluación produjeron runs no válidos entre el 11 y el 25 de agosto. Estos runs se excluyeron de la tendencia y después se corrigieron, y la empresa sitúa el 25 de agosto los mejores puntos de funcionamiento de la serie registrada. El acceso se realiza mediante Copilot CLI en todos los planes, al precio estándar basado en el total de tokens del workflow, después de /update y luego /experimental on.

🔗 Project HydraFusion


Lyria 3.5 llega a la aplicación Gemini y a la API

4 de septiembre — Google publica Lyria 3.5, que presenta como su modelo de generación musical con la mejor reproducción sonora, voces más expresivas y arreglos más ricos.

En la aplicación Gemini, la actualización viene acompañada de tres cambios en la interfaz. El usuario puede seleccionar o describir su género musical y elegir entre una versión cantada o instrumental. Nuevas plantillas listas para usar (templates) sirven como punto de partida, ya sea para música de fondo o para una canción de cumpleaños personalizada. La duración de la pieza pasa a ser configurable, entre formato corto y formato largo.

Tipo de superficieAcceso a Lyria 3.5
Público generalAplicación Gemini web y móvil, en todo el mundo
Creación profesionalGoogle Flow Music
DesarrolladoresAPI Gemini, Google AI Studio, Google Vids

Google sitúa el uso previsto en las necesidades cotidianas más que en la producción profesional: una pista de acompañamiento para un vídeo, un jingle de marca o un tono de llamada personalizado. La distribución es amplia, sin restricciones de suscripción mencionadas. Sin embargo, la entrada no ofrece ninguna cifra sobre la calidad de audio, ninguna comparación con la versión anterior de Lyria ni ningún precio para el acceso mediante API.

🔗 Anuncio de Google


SpaceXAI pone a Grok a trabajar en la empresa y publica el prompt de sistema de su agente de compras

3 y 4 de septiembre — SpaceXAI abre Grok Bot a las empresas. Lanzado el 12 de agosto, el producto pasa de una oferta destinada a suscriptores individuales y equipos de Cursor a una versión dotada de controles de acceso, red y auditoría. El trabajo de cada usuario se ejecuta en un entorno aislado, y un Bot no tiene acceso predeterminado: solo puede acceder a las cuentas a las que se lo conecta explícitamente. Los clientes de Grok Enterprise y Cursor Enterprise disponen de él gratuitamente durante dos semanas y pueden invitar a toda su organización, incluidas las personas que no tengan una licencia existente. SpaceXAI cita a Legora, Supermicro y ServiceTitan, y afirma que miles de organizaciones han adoptado el producto desde su lanzamiento.

El aspecto más interesante del anuncio es que el uso más intenso se produce fuera de la ingeniería: prospección nocturna y matrices de evaluación en contratación, borradores de correos electrónicos y actualización de presentaciones en ventas, y extracción de preguntas y respuestas de un webinar en marketing.

Al día siguiente, la empresa publica el estudio de caso de un Bot desplegado en sus propias compras. Bautizado como Haggle Bot y conectado a Slack, Notion, Drive, Gmail, Hex y Ramp, anuncia más de 100 000 dólares de ahorro directo.

Hallazgo del agenteImporte identificado
Ahorro directo totalmás de 100 000 dólares
Licencias inactivas durante 90 días, primer producto43 licencias, 14 220 dólares
Referencias sin utilizar, producto mensual85 662 dólares al año

El interés editorial de la entrada va más allá de estas cifras: SpaceXAI publica la plantilla del prompt de sistema del agente, presentada como un modelo para rellenar con los datos de la propia organización, cuyos valores se proporcionan como ejemplo entre corchetes angulares. Su sección de permisos distingue tres regímenes permanentes. El primero nunca requiere autorización; entre sus ejemplos figuran la lectura de datos de gasto y los mensajes a compañeros. El segundo exige la aprobación explícita del operador en cada ocasión, y se da como ejemplo cualquier envío a un proveedor. El tercero permanece prohibido en todas las circunstancias, y los ejemplos citados incluyen firmar, comprar, suscribirse, aprobar gastos y asumir cualquier compromiso vinculante. La entrada precisa que el equipo permitió al agente realizar por sí solo la investigación interna y la coordinación, pero exigió una aprobación explícita para gastar, aceptar condiciones o escribir a un proveedor.

🔗 Grok Bot para empresas · 🔗 Haggle Bot desplegado en las compras


Grok se conecta a las cuentas bancarias estadounidenses mediante Plaid

4 de septiembre — Grok ya puede conectarse a las cuentas financieras de sus usuarios. La conexión se realiza mediante Plaid, el intermediario técnico que conecta aplicaciones y entidades bancarias en Estados Unidos, y la función está disponible de inmediato únicamente en ese país.

Los tres ejemplos seleccionados por SpaceXAI delimitan el ámbito previsto: saber adónde fue el dinero del mes pasado, seguir el rendimiento de las inversiones y comprobar si uno realmente puede permitirse lo que tiene en el carrito. En otras palabras, análisis de gastos pasados, seguimiento de cartera y ayuda para tomar una decisión de compra en el momento en que surge. El anuncio es breve y no dice nada sobre el tratamiento de los datos ni sobre las entidades compatibles, más allá de mencionar una conexión segura.

Amplía una serie de integraciones financieras iniciada con el acercamiento a Interactive Brokers del 25 de junio, pero cambia su naturaleza: mientras que Interactive Brokers estaba dirigido a los inversores activos, Plaid abre el asistente a las cuentas corrientes del público general.

🔗 Anuncio de Grok en X


Claude Code 2.1.260 y 2.1.261: panel de diff, auditoría de skills y permisos reforzados

4 de septiembre — Dos versiones de Claude Code se publican el mismo día y se complementan: la primera aporta visibilidad sobre el trabajo en curso y la segunda sobre lo que consume la sesión.

Versión publicadaHora de publicaciónAportaciones destacadas
2.1.2604 de septiembre, 01:48Panel /diff, diagnóstico de caché en /cost, correcciones de permisos
2.1.2614 de septiembre, 21:58/skill-doctor, salidas de hasta 128 000 caracteres, prompt de subagente en un archivo

La 2.1.260 abre un panel de diff junto a la conversación en modo de pantalla completa, que muestra los cambios sin commit a medida que se realizan las ediciones. Sobre todo, corrige varios fallos en la evaluación de permisos: las reglas Edit, Write y Read cuya ruta contenía paréntesis eran rechazadas como no válidas o ignoradas por el sandbox de Bash, lo que permitía escribir en carpetas que debían ser de solo lectura, y los comandos zsh que ocultaban una sustitución de comando dentro de una asignación REPORTTIME se aprobaban automáticamente.

La 2.1.261 añade /skill-doctor, que enumera las skills cargadas que no se han utilizado y el coste de contexto de cada una. Su modo automático ahora trata como un envío a un sitio de terceros cualquier enlace que empaquete contenido en la URL de un generador público de diagramas.

🔗 Notas de la versión 2.1.260 · 🔗 Notas de la versión 2.1.261


El comando ant apply convierte los Managed Agents en archivos versionados

4 de septiembre — Anthropic añade ant apply a su CLI ant. El comando traslada a los Managed Agents el modelo declarativo conocido por los equipos de infraestructura: el estado deseado se describe en archivos del repositorio y el comando concilia los recursos de la API con esa descripción.

Abarca cinco tipos de recursos: los entornos de Managed Agent, los propios agentes, las skills, los almacenes de memoria (memory stores) y los despliegues. Hasta ahora, estos objetos se creaban mediante llamadas a la API o desde la consola, sin dejar rastro en el repositorio. Describirlos en archivos los incorpora a la revisión de código, el control de versiones y los pipelines de integración continua. El interés práctico reside en la reproducibilidad: un entorno de agente descrito en un archivo puede recrearse de manera idéntica, compararse entre ramas o desplegarse desde un pipeline sin intervención manual.

🔗 Anuncio en X


La oleada de NVIDIA: memoria persistente de los agentes, razonamiento en Jetson e identidad federada

3 y 4 de septiembre — Tres publicaciones del blog técnico de NVIDIA el mismo día, sobre tres capas diferentes de la pila.

La primera es una receta abierta construida sobre NemoClaw: un agente jefe de gabinete que mantiene una memoria persistente del trabajo de su usuario. La tesis se resume en una frase: una memoria de agente útil requiere estructura, recuperación selectiva y gobernanza, no solo almacenamiento. El sistema se basa en un modelo de sí mismo (self model), una capa de conocimiento legible por humanos escrita en páginas Markdown estructuradas, complementada por un registro SQLite que conserva obligaciones, clasificaciones, correcciones y eventos de auditoría. La ejecución se realiza mediante NVIDIA OpenShell, que aplica en un sandbox las políticas de acceso al sistema de archivos, a los procesos y a la red, mientras las credenciales permanecen fuera del sandbox.

Métrica medidaBase de RAG agénticoModelo de sí mismoDiferencia observada
Exactitud global, sobre 186 preguntas82,8 por ciento90,9 por cientomás 8,1 puntos
Preguntas difíciles, sobre 31 preguntas67,7 por ciento87,1 por cientomás 19,4 puntos
Seguimiento de hechos cambiantes, sobre 560,0 por ciento100,0 por cientomás 40,0 puntos
Fidelidad al corpus, sobre 13 preguntas100,0 por ciento92,3 por cientomenos 7,7 puntos

Context can inform an action, but it cannot authorize one.

🇪🇸 El contexto puede fundamentar una acción, pero no puede autorizarla.Artículo de NVIDIA sobre la memoria de los agentes

La segunda publicación es una guía de despliegue que confirma un cambio para la IA integrada: la cuantificación NVFP4 combinada con la decodificación especulativa alcanza hasta 6,28 veces el rendimiento de decodificación de BF16 en Jetson AGX Thor y Orin. La configuración ganadora varía según el modelo, y NVIDIA insiste en este punto en lugar de proclamar un vencedor universal: Nemotron 3.5 Lightning obtiene su mejor resultado con DSpark, entre 123 y 138 tokens de salida por segundo, y Qwen3.8-27B con DFlash2, entre 27,7 y 34,4 tokens por segundo. La advertencia final es metodológica: el rendimiento varía según la carga, por lo que hay que validar la configuración con prompts representativos de la aplicación prevista. La tercera, más modesta, describe la propagación de la identidad de un usuario entre plataformas Kubernetes federadas y plataformas de IA.

🔗 Razonamiento en el edge con Jetson · 🔗 Identidad entre plataformas federadas


Las herramientas de línea de comandos de Google: Gemini CLI pasa a la serie 0.60.0 y Antigravity abre Flash a las empresas

3 y 4 de septiembre — El canal nightly de Gemini CLI abandona la serie 0.59.0 para pasar a la 0.60.0, con una entrega centrada principalmente en la seguridad. La corrección más destacada elimina una clave de API de Google CrUX codificada de forma rígida en el componente chrome-devtools-mcp. Otros dos cambios refuerzan el aislamiento: el sandbox macOS Seatbelt recibe un directorio temporal aislado y el cargador de extensiones aplica una resolución de rutas reforzada junto con una validación de límites. El cuarto exige en el flujo OAuth de los servidores MCP la identificación del emisor conforme a la RFC 9207, una protección contra los ataques de sustitución de autoridad.

Antigravity 2.12.2, publicado el día anterior, contiene una sola mejora y ninguna corrección: los usuarios empresariales acceden a los modelos de razonamiento Gemini 3.8 Flash autenticándose mediante las credenciales predeterminadas de la aplicación (Application Default Credentials). El interés práctico es conectar el modelo con el modo de autenticación estándar de los despliegues de Google Cloud, sin una clave de API individual.

🔗 Gemini CLI v0.60.0 nightly · 🔗 Changelog de Antigravity


La IA al servicio de la ciencia: un emulador climático acoplado y el conectoma completo de una mosca de la fruta macho

3 y 4 de septiembre — Dos publicaciones aplican el aprendizaje automático a objetos científicos de enorme escala, en dos disciplinas sin relación entre sí.

Ai2 publica SamudrACE-E3SMv3 con licencia Apache 2.0 en el Hub de Hugging Face, un emulador climático atmósfera-océano completamente acoplado. El objetivo del trabajo es reproducir el comportamiento de E3SM, el modelo climático de referencia del Departamento de Energía de Estados Unidos, con un coste computacional muy inferior: filtrar hipótesis antes de ejecutar el propio E3SM y producir grandes conjuntos que muestreen la variabilidad climática a bajo coste. Los emuladores atmosférico (ACE) y oceánico (Samudra) se preentrenan primero por separado antes de acoplarse y, después, se evalúan con 400 años de datos de E3SM nunca vistos, en los que se mantiene el clima medio. Ai2 señala una limitación explícita: el emulador captura las precipitaciones diarias hasta el percentil 99,99, pero las subestima por encima de este.

El HHMI Janelia Research Campus, Google Research y sus colaboradores publican, por su parte, el primer mapa completo del cerebro y del sistema nervioso central de una mosca de la fruta macho adulta: más de 166 000 neuronas, un récord, distribuidas en 11 691 tipos celulares clasificados con ayuda de la IA y validados por expertos humanos. El método se basa en obtener imágenes de cortes finos y después recomponer por ordenador millones de imágenes bidimensionales en formas neuronales tridimensionales. El interés reside en la comparación con el mapa de la hembra publicado anteriormente: la mayoría de las neuronas son idénticas en ambos sexos, una minoría es específica y una tercera categoría, denominada dimórfica, existe en ambos, pero se conecta con vecinos diferentes. Tres estudios complementarios aplican el mapa a la visión, el gusto y el comportamiento social.

🔗 SamudrACE-E3SMv3 en X · 🔗 Mapa del cerebro de la mosca de la fruta macho


Meta abre al público el nivel de razonamiento max de Muse Spark 1.3

4 de septiembre — Meta hace público el nivel de razonamiento max de Muse Spark 1.3, dos días después del anuncio del propio modelo. El nivel está disponible en Muse Code y en la Meta Model API.

Lo que cambia, por tanto, no es el modelo, sino la apertura efectiva de su nivel de razonamiento más costoso. Alexandr Wang, chief AI officer de Meta, precisa que la mejora afecta a la programación y a las tareas agénticas, y recomienda volver a probar el modelo incluso a quienes ya habían probado los niveles high y xhigh. Añade que el lanzamiento se produce después de completar las pruebas de seguridad. Para activarlo, hay que seleccionar Muse Spark 1.3 y después ajustar el nivel de razonamiento a max.

Esta puesta a disposición no viene acompañada de ninguna cifra de benchmark: el hilo no publica ninguna puntuación ni comparación, solo una valoración cualitativa de su autor.

🔗 Anuncio de AI at Meta


Percept-Lens, el protocolo de Sakana AI para evaluar la detección de imágenes generadas

3 de septiembre — Sakana AI presenta Percept-Lens, un marco de evaluación fuera de distribución para detectar imágenes generadas por IA, aceptado en ECCV 2026. El punto de partida es que los detectores de imágenes sintéticas fallan en cuanto cambian varios factores a la vez: el generador, el estilo o el prompt y el dominio de origen. Percept-Lens unifica la evaluación en 39 conjuntos de datos públicos, equivalentes a 7,1 millones de imágenes.

El estudio de representación plantea una pregunta directa: ¿aporta todavía algo el entrenamiento de una cabeza de clasificación, más allá de lo que los codificadores modernos ya separan? Los autores construyen una escala de discriminantes gaussianos condicionados por el a priori, es decir, cabezas en forma cerrada construidas a partir de las estadísticas de primer y segundo orden de las características. El mejor peldaño de esta escala compite a menudo con las cabezas de detección publicadas y, en ocasiones, las supera, siempre que se comparen con el mismo a priori y codificador. Los autores abogan por informar los resultados al nivel del triplete a priori, codificador y cabeza.

🔗 Artículo de Sakana AI · 🔗 Artículo en arXiv


TAOT, la colocación de réplicas de expertos que tiene en cuenta la topología de red

4 de septiembre — El equipo Baige de Baidu detalla TAOT, un método de colocación de réplicas de expertos para entrenar modelos mixture-of-experts, incluido en su framework open source LoongForge.

El problema es concreto. Cuando un entrenamiento MoE se ralentiza, la causa rara vez es la potencia de las GPU, sino la incapacidad de reequilibrar la carga a tiempo: unos pocos expertos se convierten en puntos calientes y todos los demás rangos esperan. La solución clásica consiste en replicar temporalmente los pesos de un experto caliente en un rango inactivo, pero en cuanto el dominio de paralelismo supera un nodo, no todas las GPU inactivas son equivalentes: la comunicación dentro del nodo pasa por NVLink, la comunicación entre nodos por InfiniBand, y el coste puede variar en un orden de magnitud.

Métrica medidaValor observado
Tiempo por iteración, antes y después155,4 ms y después 108,8 ms, es decir, 1,43x
Aceleración de EP4 a EP16hasta 1,79x
Coste de comunicación frente a LPLBhasta un 74 por ciento menor en EP32
Sobrecoste de planificación en líneamenos del 1 por ciento del tiempo del pase hacia delante

TAOT se presenta como el primer método que incorpora en una única función objetivo el beneficio de recortar los picos y el coste de trasladar los pesos entre nodos. Mientras que LPLB de DeepSeek restringe las rutas mediante grafos predefinidos, TAOT utiliza una matriz continua de costes de comunicación con una preferencia topológica flexible: se favorece la comunicación dentro del nodo, mientras que la comunicación entre nodos sigue siendo válida, pero resulta más cara. El paso del emparejamiento por filas al emparejamiento por columnas reduce el desequilibrio residual del 7-10 por ciento al 1-2 por ciento.

🔗 Artículo en Hugging Face


Open Yap 1K, mil horas de conversación full-duplex de libre uso comercial

3 de septiembre — The Agentic Data Company publica Open Yap 1K, un corpus de conversaciones en inglés con dos canales separados, diseñado para modelos de voz full-duplex.

Elemento del corpusMuestra públicaCorpus completo
Duración total8,9 horas1 000 horas
Conversaciones161 602
Licencia aplicadaCC BY 4.0Open Yap, uso comercial libre
Modalidad de accesoHub de Hugging FacePrevia solicitud

Los autores posicionan explícitamente el corpus como una alternativa a los corpus de voz existentes, como Fisher, Switchboard y CANDOR, con un argumento ante todo técnico: el artículo compara un extracto de Fisher English, muestreado a 8 kHz en banda telefónica, con un extracto de Open Yap 1K para ilustrar la diferencia de calidad de audio. El método de recopilación, la demografía de los hablantes, el control de calidad, el consentimiento y la privacidad están documentados.

🔗 Artículo en Hugging Face


Daily Brief pasa a ser gratuito para más usuarios estadounidenses de Gemini

4 de septiembre — Google amplía gratuitamente el acceso a Daily Brief para un mayor número de usuarios de la aplicación Gemini en Estados Unidos. La función se había introducido el 21 de mayo.

Daily Brief trabaja en segundo plano y conecta las aplicaciones de Google del usuario: correos electrónicos, calendario, conversaciones e intereses se condensan en una única lista navegable de tareas y prioridades, presentada como punto de partida de la jornada. El anuncio sigue limitado a Estados Unidos y no precisa ni el porcentaje de usuarios afectados ni el calendario de una expansión internacional.

🔗 Anuncio de Gemini en X


Runway lanza Team, un plan de autoservicio para equipos de dos a nueve puestos

4 de septiembre — Runway lanza Team, que cubre el vacío entre los planes individuales y una oferta Enterprise reservada a grandes cuentas. El cambio reestructura el catálogo: Standard, Pro y Max pasan a ser explícitamente planes individuales, y todo nuevo miembro pasa ahora por Team, mientras que los espacios existentes conservan su acceso y su tarifa.

Característica del planValor anunciado
Tarifa mensual por puesto69 dólares
Tarifa anual por puesto55 dólares, es decir, un 20 por ciento de descuento
Número de puestos permitidos2 a 9
Créditos mensuales por puesto6 900, depositados en una reserva común
Proyectos compartidos y almacenamientohasta 100 proyectos, 1 TB

El plan se organiza en torno a proyectos compartidos donde se alojan activos, referencias, Brand Kits, sesiones y workflows. Runway defiende la propuesta desde la perspectiva de la coherencia de los resultados: cuando todo el equipo genera a partir de las mismas referencias, el décimo vídeo se parece al primero. Los créditos no utilizados se transfieren durante un mes, un equipo comparte hasta 20 habilidades de agente y los Agent Connectors conectan Figma, Dropbox y Notion con el agente creativo.

🔗 Anuncio de Runway


ElevenLabs amplía su iniciativa 1 Million Voices a Brasil

4 de septiembre — ElevenLabs lleva su programa de impacto a Brasil y lo ilustra con una primera historia brasileña. Eliane perdió la voz durante la infancia y Alberto quedó ciego a los 46 años; la empresa dio a Eliane una voz parecida a la de su familia, lo que le permite comunicarse por primera vez con el hombre al que ama mediante una voz que expresa su identidad.

El anuncio viene acompañado de dos alianzas locales. La Associação Brasileira de Esclerose Lateral Amiotrófica, que atiende hasta a 10 000 personas con esclerosis lateral amiotrófica en el país, permite que estos pacientes obtengan acceso gratuito para clonar su voz. Por su parte, la Sociedade Brasileira de Fonoaudiologia formará a los logopedas brasileños en clonación de voz, y la empresa apuesta por la soltura de los profesionales para ampliar el número de pacientes beneficiarios. La iniciativa 1 Million Voices es un compromiso en especie de mil millones de dólares que ha llegado a más de 11 000 personas en todo el mundo desde su lanzamiento.

🔗 Artículo de ElevenLabs


Kimi Code 0.41.0 añade un modo multiagente y elimina una salvaguarda de hace dos días

4 de septiembre — Moonshot AI publica Kimi Code 0.41.0. La novedad visible es tower, un modo experimental de colaboración multiagente en la interfaz web, activado mediante el comando /tower o el menú de más opciones del compositor, que acepta una rama base como argumento. La gestión del contexto recibe dos ajustes: se avisa al modelo de su presupuesto de contexto antes de una compactación automática y después se lo redirige al registro de eventos de la sesión para recuperar los detalles exactos. El historial de archivos en el ámbito del turno pasa a ser permanente.

El punto más destacable es una marcha atrás. La versión 0.40.0, publicada el 2 de septiembre, había introducido el bloqueo de comandos destructivos como shutdown, reboot o rm -rf en el modo de permisos automáticos. La versión 0.41.0 revierte esta decisión y deja de bloquear los comandos peligrosos, así como aquellos que no pueden analizarse estáticamente, en ese mismo modo. La salvaguarda habrá durado dos días. El motivo no se explica en las notas, pero el análisis estático de comandos shell genera fácilmente falsos positivos que bloquean trabajo legítimo.

🔗 Notas de la versión Kimi Code 0.41.0


Perplexity detalla Ivy, Tulip y ROSE, la infraestructura propia que sirve sus embeddings

4 de septiembre — Perplexity publica un artículo de ingeniería que muestra el funcionamiento interno de la infraestructura que sirve sus modelos de embedding y clasificación (ranking). La empresa entrena y sirve sus propios modelos, entre ellos pplx-embed, y describe su índice de búsqueda como de escala exabyte.

Componente de la infraestructuraLenguaje utilizadoFunción en el servicio
IvyRustPasarela HTTP, tokenización, segmentación y distribución de lotes
TulipRust, tokio, tonicServidor de inferencia gRPC, planificación y procesamiento por lotes
ROSEPythonEjecución de modelos, kernels y grafos CUDA

La idea central es reutilizar el código de inferencia de los LLM. Perplexity observa que el embedding por lotes se parece a la fase de precarga (prefill), limitada por la capacidad de cálculo, mientras que el embedding en línea de una consulta corta se asemeja a la fase de decodificación (decode), limitada por la memoria. Por tanto, los mismos kernels (kernels) sirven para pplx-embed y la decodificación de Qwen3.5, sin una caché clave-valor instanciada para los embeddings y con variantes de atención que aceptan entradas irregulares (ragged) y evitan el relleno innecesario. Para los kernels de atención, el equipo mantiene FlashInfer 2, FlashInfer 3 y FlashAttention 4 en paralelo en vez de elegir uno solo; la elección se hace caso por caso según el número y la dimensión de las cabezas. Las mediciones se comparan con vLLM v0.22.0, pero sus resultados numéricos solo aparecen en gráficos.

🔗 Artículo de ingeniería de Perplexity


Zed y Replit hacen anuncios en X, sin artículo ni notas de versión

4 de septiembre — Dos anuncios de herramientas de programación de terceros llegan el mismo día, y ambos se basan en una única publicación en X, sin artículo de blog ni notas de versión que los respalden.

Zed indica que Delta ya está disponible para las personas inscritas en la beta en Windows, en respuesta a una solicitud de un usuario del 2 de septiembre. La distinción es importante: Delta es el entorno multijugador de programación con agentes lanzado el 12 de agosto, que permite a varios miembros de un equipo trabajar con agentes en un proyecto compartido. El editor Zed, por su parte, ya se distribuye para macOS, Linux y Windows. Por tanto, el anuncio no se refiere al editor, sino a Delta, cuya disponibilidad en Windows seguía pendiente desde agosto. Se desconocen el alcance exacto de esta beta y sus modalidades de inscripción.

Por su parte, Replit emitió una sesión en directo de una hora y 58 minutos titulada «Replit MCP: Controla tu agente desde cualquier lugar». El título anuncia un servidor MCP que expone el agente de la plataforma a clientes compatibles con el protocolo, con el objetivo de iniciar una tarea y seguir su progreso desde un editor, un terminal o un asistente de terceros, sin pasar por la interfaz web. El mensaje no incluye ningún otro texto aparte de ese título, ni un enlace a un artículo ni una formulación explícita de lanzamiento.

🔗 Delta en Windows · 🔗 Replit MCP en directo


Breves

  • Un endpoint de API devuelve el historial de estrellas sin revelar a los usuarios — la API REST de GitHub devuelve los recuentos de estrellas con marca temporal sin identificar las cuentas que las otorgaron, en sustitución de los endpoints de listado restringidos a administradores a principios de año. 🔗 Registro de cambios
  • npm admite varias configuraciones de publicación de confianza por paquete — tres novedades disponibles de forma general: configuraciones OIDC múltiples y acumulativas por paquete, una aprobación bloqueada mientras se ejecuta el análisis antimalware y el historial de preproducción visible en la pestaña de versiones. 🔗 Registro de cambios
  • GitHub Actions añade una API de obsolescencia de runners — la API REST proporciona las fechas de fin de soporte de una versión de runner, un permiso vulnerability-alerts habilita el acceso de solo lectura a las alertas de Dependabot y cuatro propiedades del contexto job proporcionan a los workflows reutilizables su identidad de origen. 🔗 Registro de cambios
  • El documental The Story of VS Code se estrena el 4 de septiembre — GitHub difunde el estreno del documental oficial sobre Visual Studio Code en el canal de YouTube del editor, tras un tráiler publicado el 1 de septiembre. 🔗 Anuncio
  • Replit destaca una aplicación construida en una semana — Pep AI, creada en la plataforma por Cédric Roberge en aproximadamente una semana, generaría unos 130 000 dólares al mes según Replit, en un hilo promocional seguido de consejos sobre precios. 🔗 Hilo de Replit
  • Zed publica un anuncio visual cuyo contenido no pudo verificarse — un mensaje de cuatro palabras acompañado de una única imagen, publicado el 4 de septiembre a las 22:14. La imagen no se cargó durante el escaneo y la publicación no va acompañada de ningún artículo ni nota de versión: nada permite determinar qué anuncia. 🔗 Mensaje
  • Un ecosistema LLM abierto completo para el armenio — una colección de Hugging Face reúne el corpus web ArmWeb, el conjunto de datos científicos verificado ArmSTEM y el modelo arm-gemma-e4b, con un artículo anunciado próximamente. 🔗 Artículo
  • VLM Run Gateway reúne modelos OCR y de visión de pesos abiertos detrás de una sola API — la pasarela expone mediante un único punto de entrada modelos de reconocimiento óptico, visión-lenguaje y visión de pesos abiertos, entre ellos PaddleOCR-VL-1.6. 🔗 Artículo
  • Sakana AI abre las puertas de su equipo de ingeniería el 5 de octubre — el Engineer Open House vuelve a celebrarse el lunes 5 de octubre de 2026, de 18:00 a 21:00, en Toranomon o en línea, con inscripción en connpass. 🔗 Anuncio
  • Google detalla los sprints de su programa de experiencia para desarrolladores de Gemini Enterprise — artículo metodológico sin lanzamiento: el sprint descrito se centra en la gobernanza de la IA empresarial y ofrece documentación actualizada y ejemplos de código estandarizados para Agent Gateway y Semantic Governance. 🔗 Artículo
  • Suno bautiza su próxima generación de modelos como la familia v6 — en una respuesta a un usuario, la cuenta oficial la presenta como su mejor trabajo hasta la fecha, sin fecha ni detalles técnicos, un día después de la entrada en vigor de los nuevos límites de descarga. 🔗 Respuesta
  • MiniMax y Together AI organizan una velada sobre la economía de los modelos abiertos en Londres — el evento conjunto Open by Design: The Economics of AI in Production se celebrará el 16 de septiembre y es la única publicación de MiniMax durante el periodo. 🔗 Anuncio
  • Mistral lleva de nuevo la conferencia AI Engineer a París los días 23 y 24 de septiembre — el regreso a Station F reúne al vicepresidente de ingeniería Lélio Renard-Lavaud con Black Forest Labs, Cognition y Hugging Face, tras una edición anterior que agotó las plazas. 🔗 Anuncio
  • WebMCP Challenge cierra el plazo de presentación de proyectos — el cierre llega tras el aplazamiento de doce horas provocado por la caída del 3 de septiembre; los proyectos están en fase de revisión y los ganadores se anunciarán próximamente. 🔗 Anuncio

Qué significa

La velocidad con la que el ecosistema absorbe un modelo de frontera se ha convertido en el verdadero indicador. GPT-6 Astra se anunció el 3 de septiembre; el día 4 ya está disponible sin restricciones en la API, con disponibilidad general en diez superficies de Copilot, medido por un tercero que lo utiliza en producción e integrado mediante tres parches sucesivos de Codex CLI. Este plazo de veinticuatro horas no existía hace un año. Traslada la cuestión del lanzamiento a la facturación: GitHub aplica a Astra la tarifa pública del proveedor sin periodo promocional, mientras que Gemini 3.8 Flash disfruta de precios introductorios hasta finales de año. Cuando todos los modelos llegan al día siguiente de su anuncio, el precio vuelve a ser el único factor diferenciador visible para el usuario final.

HydraFusion aborda el problema desde el extremo opuesto, y es la noticia más estructural del día para las herramientas. Elegir entre veinte modelos es un trabajo que pocos desarrolladores hacen en serio, y GitHub propone dejar de hacerlo por completo: se selecciona un workflow y la herramienta decide el modelo en cada solicitud. Las cifras —4,9 puntos más de calidad con un coste un 67 por ciento menor frente a Opus 5 en TerminalBench— importan sobre todo por lo que sugieren: la mejora procede de la orquestación, no de un modelo superior. Si este resultado se mantiene fuera de las condiciones del banco de pruebas, el modelo deja de ser el producto y se convierte en un componente intercambiable detrás de una puerta de calidad.

Los agentes empresariales salen del ámbito de la ingeniería y la gobernanza los sigue. SpaceXAI lo afirma explícitamente: el uso más intenso de Grok Bot se produce fuera del código, y la cifra más reveladora del día procede de una auditoría de puestos de software: 43 suscripciones pagadas sin actividad durante 90 días. Pero el verdadero contenido de estos anuncios es el mecanismo de permisos. La plantilla de prompt del sistema publicada por SpaceXAI distingue tres regímenes —siempre autorizado, autorizado caso por caso y nunca autorizado—, y NVIDIA formula el mismo principio en su artículo sobre la memoria de los agentes: el contexto puede fundamentar una acción, pero no puede autorizarla. Dos actores sin relación entre sí llegan el mismo día a la conclusión de que un agente útil se define ante todo por aquello que se le prohíbe.

En las herramientas de línea de comandos, la seguridad avanza en zigzag, no en línea recta. Gemini CLI elimina una clave de API codificada directamente y refuerza su sandbox, Claude Code corrige reglas de permisos que permitían escribir en carpetas que debían ser de solo lectura, y Kimi Code elimina el bloqueo de comandos destructivos dos días después de haberlo añadido. Este último caso es el más instructivo: el análisis estático de comandos shell genera suficientes falsos positivos como para que una salvaguarda correcta sobre el papel resulte insoportable en la práctica. La seguridad de estas herramientas no depende del anuncio de una protección, sino de su supervivencia al contacto con los usuarios.

Queda la jornada en matemáticas y ciencias, la más difícil de evaluar en el momento. La prueba de Fermat formalizada en once días no produce ninguna matemática nueva: verifica un resultado de hace treinta años. Eso es precisamente lo que la hace interesante, porque la revisión por pares es el cuello de botella que se mide en años, y Kevin Buzzard señala que estos artefactos ya son lo bastante sólidos como para servir de base a otros trabajos. El emulador climático de Ai2 y el conectoma de la drosófila responden a la misma lógica: ninguno de los dos descubre, pero ambos hacen viable un trabajo cuyo coste impedía realizarlo a gran escala. Es un uso menos espectacular que el descubrimiento autónomo y probablemente más cercano a lo que la IA cambia realmente en la práctica científica.


Fuentes