ai-powered-markdown-translatorArtículo traducido del fr al es con gpt-5.6-sol.
GPT-6 Astra sale del despliegue restringido veinticuatro horas después de su lanzamiento: el modelo pasa a estar disponible para los planes Pro, Enterprise y Business Premium, alcanza la disponibilidad general en GitHub Copilot y obtiene la mejor puntuación jamás registrada por Perplexity en su banco de pruebas de investigación documentada. Por su parte, Anthropic publica la primera demostración del último teorema de Fermat verificada por ordenador, escrita en once días por Claude. GitHub abre HydraFusion, un modo que elige por sí mismo el modelo y el workflow para cada tarea; Google publica Lyria 3.5 en la aplicación Gemini, y SpaceXAI abre Grok Bot a las empresas y documenta un agente de compras que encontró más de 100 000 dólares de ahorro en su propia empresa.
GPT-6 Astra sale del despliegue restringido y alcanza la disponibilidad general en Copilot
4 de septiembre — OpenAI anuncia a las 22:13, hora de París, que GPT-6 Astra abandona su despliegue restringido. El modelo está disponible para todos los usuarios Pro, Enterprise y Business Premium en ChatGPT Work y en Codex, y la API ya lo ofrece sin restricciones, mientras que el anuncio del 3 de septiembre todavía supeditaba su acceso al despliegue progresivo. Los suscriptores Plus y los usuarios Business tendrán que esperar unos días más, según se precisa en el mismo mensaje.
| Superficie afectada | Acceso a 4 de septiembre |
|---|---|
| API de OpenAI | Disponible sin restricciones |
| ChatGPT Work y Codex, Pro | Disponible |
| Enterprise y Business Premium | Disponible |
| Plus y otros Business | Unos días de espera |
Disponibilidad general en GitHub Copilot, al precio público desde el primer día
Ese mismo día, GPT-6 Astra alcanza la disponibilidad general en GitHub Copilot. GitHub pone el acento en el método de trabajo del modelo más que en sus puntuaciones: en sus pruebas internas, Astra planifica y valida durante la ejecución, agrupa el diagnóstico con la verificación y confirma por sí mismo sus resultados antes de declarar finalizada una tarea, lo que le permite rendir mejor en tareas largas con menos pasos que los modelos anteriores de OpenAI. El anuncio no incluye ninguna cifra de benchmark.
El modelo aparece en diez superficies, desde Visual Studio Code hasta los IDE de JetBrains, pasando por Copilot CLI, GitHub Mobile, Xcode y Eclipse, pero sigue reservado a los planes Pro+, Max, Business y Enterprise. Copilot Pro queda excluido. Conviene señalar el aspecto de la facturación: Astra se cobra al precio público del proveedor en la modalidad de pago por uso, sin periodo promocional, mientras que Gemini 3.8 Flash, llegado el día anterior, disfruta de un precio de lanzamiento hasta el 31 de diciembre de 2026.
🔗 Registro de cambios de GitHub
Perplexity le otorga su mejor puntuación en WANDR
Perplexity publicó el 3 de septiembre a las 23:10 el resultado de Astra en WANDR, su banco de pruebas propio para la investigación documentada a gran escala. El modelo obtiene 0,682 por 11,98 dólares por tarea, la puntuación más alta de todos los modelos probados por la empresa.
| Modelo evaluado | Puntuación WANDR | Coste por tarea | Medición publicada el |
|---|---|---|---|
| GPT-6 Astra | 0,682 | 11,98 dólares | 3 de septiembre de 2026 |
| Claude Fable 5.1 | 0,601 | 12,76 dólares | 1 de septiembre de 2026 |
Perplexity también ofrece dos diferencias relativas: un 13,5 por ciento más de puntuación que Claude Fable 5.1 con un coste un 6,1 por ciento menor, y un 27,0 por ciento más que Opus 5 con un coste un 3,3 por ciento mayor. Cabe hacer dos salvedades. WANDR es un banco de pruebas propietario cuya metodología detallada no se ha publicado, y Perplexity también es cliente de los modelos que clasifica. No se ha comunicado ningún valor absoluto para Opus 5.
Tres correcciones de Codex CLI completan la integración
En la línea de comandos, la versión 0.153.0 publicada durante la noche del 3 de septiembre fue seguida por tres correcciones en menos de dos días, todas dedicadas a Astra. La 0.153.1 permite configurar el modelo mediante la API sin cambiar el modelo predeterminado ni mostrarlo en el selector. La 0.153.2 corrige una etiqueta: el nivel Fast se describe como capaz de ofrecer el doble de velocidad, no 1,5 veces más, sin modificar la forma de procesar las solicitudes. La 0.153.3, publicada el 4 de septiembre a las 21:01, añade Astra al selector de modelos de Amazon Bedrock para las rutas Mantle y Runtime, y corrige la instrucción dada al modelo para las preguntas de aclaración asíncronas.
OpenAI completó la jornada con tres experiencias: dos entradas del blog para desarrolladores, una sobre un juego procedural de exploración espacial creado en Codex y otra sobre el diseño de una casa explorada con Blender y Unreal Engine 5, además de un artículo de Dominik Kundel sobre cinco cambios en su forma de utilizar Codex.
🔗 Notas de la versión Codex CLI 0.153.3 · 🔗 Crear un juego con Astra
Claude firma la primera demostración formalizada del último teorema de Fermat
4 de septiembre — Anthropic publica la primera demostración del último teorema de Fermat completamente verificada por ordenador. Claude trabajó durante once días, en gran medida de forma autónoma, para escribirla en Lean. La empresa la describe como la mayor demostración en Lean jamás construida.
| Métrica medida | Valor registrado |
|---|---|
| Duración del trabajo de Claude | 11 días |
| Líneas de Lean escritas | 13 millones |
| Teoremas intermedios demostrados | 29 500 |
| Primera demostración humana, por Wiles | 1995, 129 páginas |
| Tiempo entre la conjetura y su prueba | más de 350 años |
El teorema afirma que ningún trío de enteros positivos satisface la ecuación de Fermat para un exponente superior a dos. Pierre de Fermat lo garabateó hacia 1637 en el margen de su ejemplar de la Aritmética de Diofanto. La primera demostración correcta se debe a Sir Andrew Wiles en 1995: 129 páginas, meses de verificación humana y una primera versión presentada en 1993 en la que un revisor descubrió un fallo crítico dos meses después.
Los primeros intentos fracasaron: los agentes lograban éxitos rápidos antes de perder el hilo. El avance decisivo llegó de Prove2Me, una plataforma colaborativa abierta de formalización, asociada a un arnés multiagente basado en Claude Code. La plataforma mantiene un grafo acíclico dirigido de los enunciados que sirve a los agentes para elegir la siguiente demostración que deben intentar, separa los enunciados y las pruebas en archivos distintos para acelerar la compilación de Lean y conserva una descripción en lenguaje natural de cada enunciado para facilitar su búsqueda y reutilización. La demostración obtenida sigue la exposición simplificada de Wiles debida a Henri Darmon, Fred Diamond y Richard Taylor.
This extraordinary autoformalization achievement, which Anthropic researchers say only took 11 days, proves Fermat’s Last Theorem with no assumptions other than the axioms of mathematics.
🇪🇸 Este extraordinario logro de autoformalización, que según los investigadores de Anthropic solo requirió once días, demuestra el último teorema de Fermat sin más supuestos que los axiomas de las matemáticas. — Kevin Buzzard, revisor del resultado, citado en la página de investigación de Anthropic
Anthropic presenta el reto como una cuestión de verificación más que de descubrimiento, a diferencia de los trabajos recientes realizados por la IA sobre la hipótesis de Riemann, que producían matemáticas nuevas. A medida que aumenta el volumen de demostraciones, la revisión por pares se convierte en un cuello de botella que se mide en años.
🔗 Demostración completa en GitHub
Project HydraFusion: GitHub deja que la herramienta elija el modelo en lugar del desarrollador
4 de septiembre — GitHub abre Project HydraFusion en vista previa de investigación, un modo que ya no designa un modelo, sino un workflow. Mientras que el selector de Copilot pedía elegir entre más de veinte modelos, HydraFusion decide por sí mismo, para cada solicitud, qué modelo se ocupa de la tarea y con qué esquema de ejecución. Se selecciona como cualquier modelo, pero orquesta varios detrás de esa única elección.
Por ahora existen tres esquemas. El modo Single encarga la tarea a un único modelo. El modo Cascade hace que un modelo eficiente redacte una primera solución y, a continuación, una puerta de calidad decide si la acepta o si escala a un modelo más capaz. El modo Critique hace que un crítico independiente de solo lectura, perteneciente a otra familia de modelos, revise el borrador.
| Benchmark evaluado | Diferencia de coste frente a Opus 5 | Diferencia de calidad frente a Opus 5 |
|---|---|---|
| TerminalBench 2.1 | 67 por ciento menos | 4,9 puntos más |
| DeepSWE | 36 por ciento menos | 1,5 puntos menos |
| CheckpointBench | 65 por ciento menos | 0,1 puntos menos |
Cinco principios de ingeniería rigen la ejecución: contabilidad agregada del coste de cada etapa, plazo de expiración y cancelación explícitos, revisión en un contexto aislado y sin herramientas, aplicación con seguridad integrada que no aplica ninguna corrección si el workflow falla, y validación del enrutamiento antes de la ejecución. GitHub asume una concesión en la interfaz al mostrar las etapas, pero ocultar los borradores intermedios hasta el resultado final, y reconoce que la espera sin suficiente visibilidad constituye un verdadero inconveniente.
La documentación del desarrollo es inusualmente franca: GitHub considera TerminalBench 2.1 como la secuencia de runs más completa, precisa que el progreso no fue lineal y reconoce que dos fallos operativos del arnés de evaluación produjeron runs no válidos entre el 11 y el 25 de agosto. Estos runs se excluyeron de la tendencia y después se corrigieron, y la empresa sitúa el 25 de agosto los mejores puntos de funcionamiento de la serie registrada. El acceso se realiza mediante Copilot CLI en todos los planes, al precio estándar basado en el total de tokens del workflow, después de /update y luego /experimental on.
Lyria 3.5 llega a la aplicación Gemini y a la API
4 de septiembre — Google publica Lyria 3.5, que presenta como su modelo de generación musical con la mejor reproducción sonora, voces más expresivas y arreglos más ricos.
En la aplicación Gemini, la actualización viene acompañada de tres cambios en la interfaz. El usuario puede seleccionar o describir su género musical y elegir entre una versión cantada o instrumental. Nuevas plantillas listas para usar (templates) sirven como punto de partida, ya sea para música de fondo o para una canción de cumpleaños personalizada. La duración de la pieza pasa a ser configurable, entre formato corto y formato largo.
| Tipo de superficie | Acceso a Lyria 3.5 |
|---|---|
| Público general | Aplicación Gemini web y móvil, en todo el mundo |
| Creación profesional | Google Flow Music |
| Desarrolladores | API Gemini, Google AI Studio, Google Vids |
Google sitúa el uso previsto en las necesidades cotidianas más que en la producción profesional: una pista de acompañamiento para un vídeo, un jingle de marca o un tono de llamada personalizado. La distribución es amplia, sin restricciones de suscripción mencionadas. Sin embargo, la entrada no ofrece ninguna cifra sobre la calidad de audio, ninguna comparación con la versión anterior de Lyria ni ningún precio para el acceso mediante API.
SpaceXAI pone a Grok a trabajar en la empresa y publica el prompt de sistema de su agente de compras
3 y 4 de septiembre — SpaceXAI abre Grok Bot a las empresas. Lanzado el 12 de agosto, el producto pasa de una oferta destinada a suscriptores individuales y equipos de Cursor a una versión dotada de controles de acceso, red y auditoría. El trabajo de cada usuario se ejecuta en un entorno aislado, y un Bot no tiene acceso predeterminado: solo puede acceder a las cuentas a las que se lo conecta explícitamente. Los clientes de Grok Enterprise y Cursor Enterprise disponen de él gratuitamente durante dos semanas y pueden invitar a toda su organización, incluidas las personas que no tengan una licencia existente. SpaceXAI cita a Legora, Supermicro y ServiceTitan, y afirma que miles de organizaciones han adoptado el producto desde su lanzamiento.
El aspecto más interesante del anuncio es que el uso más intenso se produce fuera de la ingeniería: prospección nocturna y matrices de evaluación en contratación, borradores de correos electrónicos y actualización de presentaciones en ventas, y extracción de preguntas y respuestas de un webinar en marketing.
Al día siguiente, la empresa publica el estudio de caso de un Bot desplegado en sus propias compras. Bautizado como Haggle Bot y conectado a Slack, Notion, Drive, Gmail, Hex y Ramp, anuncia más de 100 000 dólares de ahorro directo.
| Hallazgo del agente | Importe identificado |
|---|---|
| Ahorro directo total | más de 100 000 dólares |
| Licencias inactivas durante 90 días, primer producto | 43 licencias, 14 220 dólares |
| Referencias sin utilizar, producto mensual | 85 662 dólares al año |
El interés editorial de la entrada va más allá de estas cifras: SpaceXAI publica la plantilla del prompt de sistema del agente, presentada como un modelo para rellenar con los datos de la propia organización, cuyos valores se proporcionan como ejemplo entre corchetes angulares. Su sección de permisos distingue tres regímenes permanentes. El primero nunca requiere autorización; entre sus ejemplos figuran la lectura de datos de gasto y los mensajes a compañeros. El segundo exige la aprobación explícita del operador en cada ocasión, y se da como ejemplo cualquier envío a un proveedor. El tercero permanece prohibido en todas las circunstancias, y los ejemplos citados incluyen firmar, comprar, suscribirse, aprobar gastos y asumir cualquier compromiso vinculante. La entrada precisa que el equipo permitió al agente realizar por sí solo la investigación interna y la coordinación, pero exigió una aprobación explícita para gastar, aceptar condiciones o escribir a un proveedor.
🔗 Grok Bot para empresas · 🔗 Haggle Bot desplegado en las compras
Grok se conecta a las cuentas bancarias estadounidenses mediante Plaid
4 de septiembre — Grok ya puede conectarse a las cuentas financieras de sus usuarios. La conexión se realiza mediante Plaid, el intermediario técnico que conecta aplicaciones y entidades bancarias en Estados Unidos, y la función está disponible de inmediato únicamente en ese país.
Los tres ejemplos seleccionados por SpaceXAI delimitan el ámbito previsto: saber adónde fue el dinero del mes pasado, seguir el rendimiento de las inversiones y comprobar si uno realmente puede permitirse lo que tiene en el carrito. En otras palabras, análisis de gastos pasados, seguimiento de cartera y ayuda para tomar una decisión de compra en el momento en que surge. El anuncio es breve y no dice nada sobre el tratamiento de los datos ni sobre las entidades compatibles, más allá de mencionar una conexión segura.
Amplía una serie de integraciones financieras iniciada con el acercamiento a Interactive Brokers del 25 de junio, pero cambia su naturaleza: mientras que Interactive Brokers estaba dirigido a los inversores activos, Plaid abre el asistente a las cuentas corrientes del público general.
Claude Code 2.1.260 y 2.1.261: panel de diff, auditoría de skills y permisos reforzados
4 de septiembre — Dos versiones de Claude Code se publican el mismo día y se complementan: la primera aporta visibilidad sobre el trabajo en curso y la segunda sobre lo que consume la sesión.
| Versión publicada | Hora de publicación | Aportaciones destacadas |
|---|---|---|
| 2.1.260 | 4 de septiembre, 01:48 | Panel /diff, diagnóstico de caché en /cost, correcciones de permisos |
| 2.1.261 | 4 de septiembre, 21:58 | /skill-doctor, salidas de hasta 128 000 caracteres, prompt de subagente en un archivo |
La 2.1.260 abre un panel de diff junto a la conversación en modo de pantalla completa, que muestra los cambios sin commit a medida que se realizan las ediciones. Sobre todo, corrige varios fallos en la evaluación de permisos: las reglas Edit, Write y Read cuya ruta contenía paréntesis eran rechazadas como no válidas o ignoradas por el sandbox de Bash, lo que permitía escribir en carpetas que debían ser de solo lectura, y los comandos zsh que ocultaban una sustitución de comando dentro de una asignación REPORTTIME se aprobaban automáticamente.
La 2.1.261 añade /skill-doctor, que enumera las skills cargadas que no se han utilizado y el coste de contexto de cada una. Su modo automático ahora trata como un envío a un sitio de terceros cualquier enlace que empaquete contenido en la URL de un generador público de diagramas.
🔗 Notas de la versión 2.1.260 · 🔗 Notas de la versión 2.1.261
El comando ant apply convierte los Managed Agents en archivos versionados
4 de septiembre — Anthropic añade ant apply a su CLI ant. El comando traslada a los Managed Agents el modelo declarativo conocido por los equipos de infraestructura: el estado deseado se describe en archivos del repositorio y el comando concilia los recursos de la API con esa descripción.
Abarca cinco tipos de recursos: los entornos de Managed Agent, los propios agentes, las skills, los almacenes de memoria (memory stores) y los despliegues. Hasta ahora, estos objetos se creaban mediante llamadas a la API o desde la consola, sin dejar rastro en el repositorio. Describirlos en archivos los incorpora a la revisión de código, el control de versiones y los pipelines de integración continua. El interés práctico reside en la reproducibilidad: un entorno de agente descrito en un archivo puede recrearse de manera idéntica, compararse entre ramas o desplegarse desde un pipeline sin intervención manual.
La oleada de NVIDIA: memoria persistente de los agentes, razonamiento en Jetson e identidad federada
3 y 4 de septiembre — Tres publicaciones del blog técnico de NVIDIA el mismo día, sobre tres capas diferentes de la pila.
La primera es una receta abierta construida sobre NemoClaw: un agente jefe de gabinete que mantiene una memoria persistente del trabajo de su usuario. La tesis se resume en una frase: una memoria de agente útil requiere estructura, recuperación selectiva y gobernanza, no solo almacenamiento. El sistema se basa en un modelo de sí mismo (self model), una capa de conocimiento legible por humanos escrita en páginas Markdown estructuradas, complementada por un registro SQLite que conserva obligaciones, clasificaciones, correcciones y eventos de auditoría. La ejecución se realiza mediante NVIDIA OpenShell, que aplica en un sandbox las políticas de acceso al sistema de archivos, a los procesos y a la red, mientras las credenciales permanecen fuera del sandbox.
| Métrica medida | Base de RAG agéntico | Modelo de sí mismo | Diferencia observada |
|---|---|---|---|
| Exactitud global, sobre 186 preguntas | 82,8 por ciento | 90,9 por ciento | más 8,1 puntos |
| Preguntas difíciles, sobre 31 preguntas | 67,7 por ciento | 87,1 por ciento | más 19,4 puntos |
| Seguimiento de hechos cambiantes, sobre 5 | 60,0 por ciento | 100,0 por ciento | más 40,0 puntos |
| Fidelidad al corpus, sobre 13 preguntas | 100,0 por ciento | 92,3 por ciento | menos 7,7 puntos |
Context can inform an action, but it cannot authorize one.
🇪🇸 El contexto puede fundamentar una acción, pero no puede autorizarla. — Artículo de NVIDIA sobre la memoria de los agentes
La segunda publicación es una guía de despliegue que confirma un cambio para la IA integrada: la cuantificación NVFP4 combinada con la decodificación especulativa alcanza hasta 6,28 veces el rendimiento de decodificación de BF16 en Jetson AGX Thor y Orin. La configuración ganadora varía según el modelo, y NVIDIA insiste en este punto en lugar de proclamar un vencedor universal: Nemotron 3.5 Lightning obtiene su mejor resultado con DSpark, entre 123 y 138 tokens de salida por segundo, y Qwen3.8-27B con DFlash2, entre 27,7 y 34,4 tokens por segundo. La advertencia final es metodológica: el rendimiento varía según la carga, por lo que hay que validar la configuración con prompts representativos de la aplicación prevista. La tercera, más modesta, describe la propagación de la identidad de un usuario entre plataformas Kubernetes federadas y plataformas de IA.
🔗 Razonamiento en el edge con Jetson · 🔗 Identidad entre plataformas federadas
Las herramientas de línea de comandos de Google: Gemini CLI pasa a la serie 0.60.0 y Antigravity abre Flash a las empresas
3 y 4 de septiembre — El canal nightly de Gemini CLI abandona la serie 0.59.0 para pasar a la 0.60.0, con una entrega centrada principalmente en la seguridad. La corrección más destacada elimina una clave de API de Google CrUX codificada de forma rígida en el componente chrome-devtools-mcp. Otros dos cambios refuerzan el aislamiento: el sandbox macOS Seatbelt recibe un directorio temporal aislado y el cargador de extensiones aplica una resolución de rutas reforzada junto con una validación de límites. El cuarto exige en el flujo OAuth de los servidores MCP la identificación del emisor conforme a la RFC 9207, una protección contra los ataques de sustitución de autoridad.
Antigravity 2.12.2, publicado el día anterior, contiene una sola mejora y ninguna corrección: los usuarios empresariales acceden a los modelos de razonamiento Gemini 3.8 Flash autenticándose mediante las credenciales predeterminadas de la aplicación (Application Default Credentials). El interés práctico es conectar el modelo con el modo de autenticación estándar de los despliegues de Google Cloud, sin una clave de API individual.
🔗 Gemini CLI v0.60.0 nightly · 🔗 Changelog de Antigravity
La IA al servicio de la ciencia: un emulador climático acoplado y el conectoma completo de una mosca de la fruta macho
3 y 4 de septiembre — Dos publicaciones aplican el aprendizaje automático a objetos científicos de enorme escala, en dos disciplinas sin relación entre sí.
Ai2 publica SamudrACE-E3SMv3 con licencia Apache 2.0 en el Hub de Hugging Face, un emulador climático atmósfera-océano completamente acoplado. El objetivo del trabajo es reproducir el comportamiento de E3SM, el modelo climático de referencia del Departamento de Energía de Estados Unidos, con un coste computacional muy inferior: filtrar hipótesis antes de ejecutar el propio E3SM y producir grandes conjuntos que muestreen la variabilidad climática a bajo coste. Los emuladores atmosférico (ACE) y oceánico (Samudra) se preentrenan primero por separado antes de acoplarse y, después, se evalúan con 400 años de datos de E3SM nunca vistos, en los que se mantiene el clima medio. Ai2 señala una limitación explícita: el emulador captura las precipitaciones diarias hasta el percentil 99,99, pero las subestima por encima de este.
El HHMI Janelia Research Campus, Google Research y sus colaboradores publican, por su parte, el primer mapa completo del cerebro y del sistema nervioso central de una mosca de la fruta macho adulta: más de 166 000 neuronas, un récord, distribuidas en 11 691 tipos celulares clasificados con ayuda de la IA y validados por expertos humanos. El método se basa en obtener imágenes de cortes finos y después recomponer por ordenador millones de imágenes bidimensionales en formas neuronales tridimensionales. El interés reside en la comparación con el mapa de la hembra publicado anteriormente: la mayoría de las neuronas son idénticas en ambos sexos, una minoría es específica y una tercera categoría, denominada dimórfica, existe en ambos, pero se conecta con vecinos diferentes. Tres estudios complementarios aplican el mapa a la visión, el gusto y el comportamiento social.
🔗 SamudrACE-E3SMv3 en X · 🔗 Mapa del cerebro de la mosca de la fruta macho
Meta abre al público el nivel de razonamiento max de Muse Spark 1.3
4 de septiembre — Meta hace público el nivel de razonamiento max de Muse Spark 1.3, dos días después del anuncio del propio modelo. El nivel está disponible en Muse Code y en la Meta Model API.
Lo que cambia, por tanto, no es el modelo, sino la apertura efectiva de su nivel de razonamiento más costoso. Alexandr Wang, chief AI officer de Meta, precisa que la mejora afecta a la programación y a las tareas agénticas, y recomienda volver a probar el modelo incluso a quienes ya habían probado los niveles high y xhigh. Añade que el lanzamiento se produce después de completar las pruebas de seguridad. Para activarlo, hay que seleccionar Muse Spark 1.3 y después ajustar el nivel de razonamiento a max.
Esta puesta a disposición no viene acompañada de ninguna cifra de benchmark: el hilo no publica ninguna puntuación ni comparación, solo una valoración cualitativa de su autor.
Percept-Lens, el protocolo de Sakana AI para evaluar la detección de imágenes generadas
3 de septiembre — Sakana AI presenta Percept-Lens, un marco de evaluación fuera de distribución para detectar imágenes generadas por IA, aceptado en ECCV 2026. El punto de partida es que los detectores de imágenes sintéticas fallan en cuanto cambian varios factores a la vez: el generador, el estilo o el prompt y el dominio de origen. Percept-Lens unifica la evaluación en 39 conjuntos de datos públicos, equivalentes a 7,1 millones de imágenes.
El estudio de representación plantea una pregunta directa: ¿aporta todavía algo el entrenamiento de una cabeza de clasificación, más allá de lo que los codificadores modernos ya separan? Los autores construyen una escala de discriminantes gaussianos condicionados por el a priori, es decir, cabezas en forma cerrada construidas a partir de las estadísticas de primer y segundo orden de las características. El mejor peldaño de esta escala compite a menudo con las cabezas de detección publicadas y, en ocasiones, las supera, siempre que se comparen con el mismo a priori y codificador. Los autores abogan por informar los resultados al nivel del triplete a priori, codificador y cabeza.
🔗 Artículo de Sakana AI · 🔗 Artículo en arXiv
TAOT, la colocación de réplicas de expertos que tiene en cuenta la topología de red
4 de septiembre — El equipo Baige de Baidu detalla TAOT, un método de colocación de réplicas de expertos para entrenar modelos mixture-of-experts, incluido en su framework open source LoongForge.
El problema es concreto. Cuando un entrenamiento MoE se ralentiza, la causa rara vez es la potencia de las GPU, sino la incapacidad de reequilibrar la carga a tiempo: unos pocos expertos se convierten en puntos calientes y todos los demás rangos esperan. La solución clásica consiste en replicar temporalmente los pesos de un experto caliente en un rango inactivo, pero en cuanto el dominio de paralelismo supera un nodo, no todas las GPU inactivas son equivalentes: la comunicación dentro del nodo pasa por NVLink, la comunicación entre nodos por InfiniBand, y el coste puede variar en un orden de magnitud.
| Métrica medida | Valor observado |
|---|---|
| Tiempo por iteración, antes y después | 155,4 ms y después 108,8 ms, es decir, 1,43x |
| Aceleración de EP4 a EP16 | hasta 1,79x |
| Coste de comunicación frente a LPLB | hasta un 74 por ciento menor en EP32 |
| Sobrecoste de planificación en línea | menos del 1 por ciento del tiempo del pase hacia delante |
TAOT se presenta como el primer método que incorpora en una única función objetivo el beneficio de recortar los picos y el coste de trasladar los pesos entre nodos. Mientras que LPLB de DeepSeek restringe las rutas mediante grafos predefinidos, TAOT utiliza una matriz continua de costes de comunicación con una preferencia topológica flexible: se favorece la comunicación dentro del nodo, mientras que la comunicación entre nodos sigue siendo válida, pero resulta más cara. El paso del emparejamiento por filas al emparejamiento por columnas reduce el desequilibrio residual del 7-10 por ciento al 1-2 por ciento.
Open Yap 1K, mil horas de conversación full-duplex de libre uso comercial
3 de septiembre — The Agentic Data Company publica Open Yap 1K, un corpus de conversaciones en inglés con dos canales separados, diseñado para modelos de voz full-duplex.
| Elemento del corpus | Muestra pública | Corpus completo |
|---|---|---|
| Duración total | 8,9 horas | 1 000 horas |
| Conversaciones | 16 | 1 602 |
| Licencia aplicada | CC BY 4.0 | Open Yap, uso comercial libre |
| Modalidad de acceso | Hub de Hugging Face | Previa solicitud |
Los autores posicionan explícitamente el corpus como una alternativa a los corpus de voz existentes, como Fisher, Switchboard y CANDOR, con un argumento ante todo técnico: el artículo compara un extracto de Fisher English, muestreado a 8 kHz en banda telefónica, con un extracto de Open Yap 1K para ilustrar la diferencia de calidad de audio. El método de recopilación, la demografía de los hablantes, el control de calidad, el consentimiento y la privacidad están documentados.
Daily Brief pasa a ser gratuito para más usuarios estadounidenses de Gemini
4 de septiembre — Google amplía gratuitamente el acceso a Daily Brief para un mayor número de usuarios de la aplicación Gemini en Estados Unidos. La función se había introducido el 21 de mayo.
Daily Brief trabaja en segundo plano y conecta las aplicaciones de Google del usuario: correos electrónicos, calendario, conversaciones e intereses se condensan en una única lista navegable de tareas y prioridades, presentada como punto de partida de la jornada. El anuncio sigue limitado a Estados Unidos y no precisa ni el porcentaje de usuarios afectados ni el calendario de una expansión internacional.
Runway lanza Team, un plan de autoservicio para equipos de dos a nueve puestos
4 de septiembre — Runway lanza Team, que cubre el vacío entre los planes individuales y una oferta Enterprise reservada a grandes cuentas. El cambio reestructura el catálogo: Standard, Pro y Max pasan a ser explícitamente planes individuales, y todo nuevo miembro pasa ahora por Team, mientras que los espacios existentes conservan su acceso y su tarifa.
| Característica del plan | Valor anunciado |
|---|---|
| Tarifa mensual por puesto | 69 dólares |
| Tarifa anual por puesto | 55 dólares, es decir, un 20 por ciento de descuento |
| Número de puestos permitidos | 2 a 9 |
| Créditos mensuales por puesto | 6 900, depositados en una reserva común |
| Proyectos compartidos y almacenamiento | hasta 100 proyectos, 1 TB |
El plan se organiza en torno a proyectos compartidos donde se alojan activos, referencias, Brand Kits, sesiones y workflows. Runway defiende la propuesta desde la perspectiva de la coherencia de los resultados: cuando todo el equipo genera a partir de las mismas referencias, el décimo vídeo se parece al primero. Los créditos no utilizados se transfieren durante un mes, un equipo comparte hasta 20 habilidades de agente y los Agent Connectors conectan Figma, Dropbox y Notion con el agente creativo.
ElevenLabs amplía su iniciativa 1 Million Voices a Brasil
4 de septiembre — ElevenLabs lleva su programa de impacto a Brasil y lo ilustra con una primera historia brasileña. Eliane perdió la voz durante la infancia y Alberto quedó ciego a los 46 años; la empresa dio a Eliane una voz parecida a la de su familia, lo que le permite comunicarse por primera vez con el hombre al que ama mediante una voz que expresa su identidad.
El anuncio viene acompañado de dos alianzas locales. La Associação Brasileira de Esclerose Lateral Amiotrófica, que atiende hasta a 10 000 personas con esclerosis lateral amiotrófica en el país, permite que estos pacientes obtengan acceso gratuito para clonar su voz. Por su parte, la Sociedade Brasileira de Fonoaudiologia formará a los logopedas brasileños en clonación de voz, y la empresa apuesta por la soltura de los profesionales para ampliar el número de pacientes beneficiarios. La iniciativa 1 Million Voices es un compromiso en especie de mil millones de dólares que ha llegado a más de 11 000 personas en todo el mundo desde su lanzamiento.
Kimi Code 0.41.0 añade un modo multiagente y elimina una salvaguarda de hace dos días
4 de septiembre — Moonshot AI publica Kimi Code 0.41.0. La novedad visible es tower, un modo experimental de colaboración multiagente en la interfaz web, activado mediante el comando /tower o el menú de más opciones del compositor, que acepta una rama base como argumento. La gestión del contexto recibe dos ajustes: se avisa al modelo de su presupuesto de contexto antes de una compactación automática y después se lo redirige al registro de eventos de la sesión para recuperar los detalles exactos. El historial de archivos en el ámbito del turno pasa a ser permanente.
El punto más destacable es una marcha atrás. La versión 0.40.0, publicada el 2 de septiembre, había introducido el bloqueo de comandos destructivos como shutdown, reboot o rm -rf en el modo de permisos automáticos. La versión 0.41.0 revierte esta decisión y deja de bloquear los comandos peligrosos, así como aquellos que no pueden analizarse estáticamente, en ese mismo modo. La salvaguarda habrá durado dos días. El motivo no se explica en las notas, pero el análisis estático de comandos shell genera fácilmente falsos positivos que bloquean trabajo legítimo.
🔗 Notas de la versión Kimi Code 0.41.0
Perplexity detalla Ivy, Tulip y ROSE, la infraestructura propia que sirve sus embeddings
4 de septiembre — Perplexity publica un artículo de ingeniería que muestra el funcionamiento interno de la infraestructura que sirve sus modelos de embedding y clasificación (ranking). La empresa entrena y sirve sus propios modelos, entre ellos pplx-embed, y describe su índice de búsqueda como de escala exabyte.
| Componente de la infraestructura | Lenguaje utilizado | Función en el servicio |
|---|---|---|
| Ivy | Rust | Pasarela HTTP, tokenización, segmentación y distribución de lotes |
| Tulip | Rust, tokio, tonic | Servidor de inferencia gRPC, planificación y procesamiento por lotes |
| ROSE | Python | Ejecución de modelos, kernels y grafos CUDA |
La idea central es reutilizar el código de inferencia de los LLM. Perplexity observa que el embedding por lotes se parece a la fase de precarga (prefill), limitada por la capacidad de cálculo, mientras que el embedding en línea de una consulta corta se asemeja a la fase de decodificación (decode), limitada por la memoria. Por tanto, los mismos kernels (kernels) sirven para pplx-embed y la decodificación de Qwen3.5, sin una caché clave-valor instanciada para los embeddings y con variantes de atención que aceptan entradas irregulares (ragged) y evitan el relleno innecesario. Para los kernels de atención, el equipo mantiene FlashInfer 2, FlashInfer 3 y FlashAttention 4 en paralelo en vez de elegir uno solo; la elección se hace caso por caso según el número y la dimensión de las cabezas. Las mediciones se comparan con vLLM v0.22.0, pero sus resultados numéricos solo aparecen en gráficos.
🔗 Artículo de ingeniería de Perplexity
Zed y Replit hacen anuncios en X, sin artículo ni notas de versión
4 de septiembre — Dos anuncios de herramientas de programación de terceros llegan el mismo día, y ambos se basan en una única publicación en X, sin artículo de blog ni notas de versión que los respalden.
Zed indica que Delta ya está disponible para las personas inscritas en la beta en Windows, en respuesta a una solicitud de un usuario del 2 de septiembre. La distinción es importante: Delta es el entorno multijugador de programación con agentes lanzado el 12 de agosto, que permite a varios miembros de un equipo trabajar con agentes en un proyecto compartido. El editor Zed, por su parte, ya se distribuye para macOS, Linux y Windows. Por tanto, el anuncio no se refiere al editor, sino a Delta, cuya disponibilidad en Windows seguía pendiente desde agosto. Se desconocen el alcance exacto de esta beta y sus modalidades de inscripción.
Por su parte, Replit emitió una sesión en directo de una hora y 58 minutos titulada «Replit MCP: Controla tu agente desde cualquier lugar». El título anuncia un servidor MCP que expone el agente de la plataforma a clientes compatibles con el protocolo, con el objetivo de iniciar una tarea y seguir su progreso desde un editor, un terminal o un asistente de terceros, sin pasar por la interfaz web. El mensaje no incluye ningún otro texto aparte de ese título, ni un enlace a un artículo ni una formulación explícita de lanzamiento.
🔗 Delta en Windows · 🔗 Replit MCP en directo
Breves
- Un endpoint de API devuelve el historial de estrellas sin revelar a los usuarios — la API REST de GitHub devuelve los recuentos de estrellas con marca temporal sin identificar las cuentas que las otorgaron, en sustitución de los endpoints de listado restringidos a administradores a principios de año. 🔗 Registro de cambios
- npm admite varias configuraciones de publicación de confianza por paquete — tres novedades disponibles de forma general: configuraciones OIDC múltiples y acumulativas por paquete, una aprobación bloqueada mientras se ejecuta el análisis antimalware y el historial de preproducción visible en la pestaña de versiones. 🔗 Registro de cambios
- GitHub Actions añade una API de obsolescencia de runners — la API REST proporciona las fechas de fin de soporte de una versión de runner, un permiso
vulnerability-alertshabilita el acceso de solo lectura a las alertas de Dependabot y cuatro propiedades del contextojobproporcionan a los workflows reutilizables su identidad de origen. 🔗 Registro de cambios - El documental The Story of VS Code se estrena el 4 de septiembre — GitHub difunde el estreno del documental oficial sobre Visual Studio Code en el canal de YouTube del editor, tras un tráiler publicado el 1 de septiembre. 🔗 Anuncio
- Replit destaca una aplicación construida en una semana — Pep AI, creada en la plataforma por Cédric Roberge en aproximadamente una semana, generaría unos 130 000 dólares al mes según Replit, en un hilo promocional seguido de consejos sobre precios. 🔗 Hilo de Replit
- Zed publica un anuncio visual cuyo contenido no pudo verificarse — un mensaje de cuatro palabras acompañado de una única imagen, publicado el 4 de septiembre a las 22:14. La imagen no se cargó durante el escaneo y la publicación no va acompañada de ningún artículo ni nota de versión: nada permite determinar qué anuncia. 🔗 Mensaje
- Un ecosistema LLM abierto completo para el armenio — una colección de Hugging Face reúne el corpus web ArmWeb, el conjunto de datos científicos verificado ArmSTEM y el modelo arm-gemma-e4b, con un artículo anunciado próximamente. 🔗 Artículo
- VLM Run Gateway reúne modelos OCR y de visión de pesos abiertos detrás de una sola API — la pasarela expone mediante un único punto de entrada modelos de reconocimiento óptico, visión-lenguaje y visión de pesos abiertos, entre ellos PaddleOCR-VL-1.6. 🔗 Artículo
- Sakana AI abre las puertas de su equipo de ingeniería el 5 de octubre — el Engineer Open House vuelve a celebrarse el lunes 5 de octubre de 2026, de 18:00 a 21:00, en Toranomon o en línea, con inscripción en connpass. 🔗 Anuncio
- Google detalla los sprints de su programa de experiencia para desarrolladores de Gemini Enterprise — artículo metodológico sin lanzamiento: el sprint descrito se centra en la gobernanza de la IA empresarial y ofrece documentación actualizada y ejemplos de código estandarizados para Agent Gateway y Semantic Governance. 🔗 Artículo
- Suno bautiza su próxima generación de modelos como la familia v6 — en una respuesta a un usuario, la cuenta oficial la presenta como su mejor trabajo hasta la fecha, sin fecha ni detalles técnicos, un día después de la entrada en vigor de los nuevos límites de descarga. 🔗 Respuesta
- MiniMax y Together AI organizan una velada sobre la economía de los modelos abiertos en Londres — el evento conjunto Open by Design: The Economics of AI in Production se celebrará el 16 de septiembre y es la única publicación de MiniMax durante el periodo. 🔗 Anuncio
- Mistral lleva de nuevo la conferencia AI Engineer a París los días 23 y 24 de septiembre — el regreso a Station F reúne al vicepresidente de ingeniería Lélio Renard-Lavaud con Black Forest Labs, Cognition y Hugging Face, tras una edición anterior que agotó las plazas. 🔗 Anuncio
- WebMCP Challenge cierra el plazo de presentación de proyectos — el cierre llega tras el aplazamiento de doce horas provocado por la caída del 3 de septiembre; los proyectos están en fase de revisión y los ganadores se anunciarán próximamente. 🔗 Anuncio
Qué significa
La velocidad con la que el ecosistema absorbe un modelo de frontera se ha convertido en el verdadero indicador. GPT-6 Astra se anunció el 3 de septiembre; el día 4 ya está disponible sin restricciones en la API, con disponibilidad general en diez superficies de Copilot, medido por un tercero que lo utiliza en producción e integrado mediante tres parches sucesivos de Codex CLI. Este plazo de veinticuatro horas no existía hace un año. Traslada la cuestión del lanzamiento a la facturación: GitHub aplica a Astra la tarifa pública del proveedor sin periodo promocional, mientras que Gemini 3.8 Flash disfruta de precios introductorios hasta finales de año. Cuando todos los modelos llegan al día siguiente de su anuncio, el precio vuelve a ser el único factor diferenciador visible para el usuario final.
HydraFusion aborda el problema desde el extremo opuesto, y es la noticia más estructural del día para las herramientas. Elegir entre veinte modelos es un trabajo que pocos desarrolladores hacen en serio, y GitHub propone dejar de hacerlo por completo: se selecciona un workflow y la herramienta decide el modelo en cada solicitud. Las cifras —4,9 puntos más de calidad con un coste un 67 por ciento menor frente a Opus 5 en TerminalBench— importan sobre todo por lo que sugieren: la mejora procede de la orquestación, no de un modelo superior. Si este resultado se mantiene fuera de las condiciones del banco de pruebas, el modelo deja de ser el producto y se convierte en un componente intercambiable detrás de una puerta de calidad.
Los agentes empresariales salen del ámbito de la ingeniería y la gobernanza los sigue. SpaceXAI lo afirma explícitamente: el uso más intenso de Grok Bot se produce fuera del código, y la cifra más reveladora del día procede de una auditoría de puestos de software: 43 suscripciones pagadas sin actividad durante 90 días. Pero el verdadero contenido de estos anuncios es el mecanismo de permisos. La plantilla de prompt del sistema publicada por SpaceXAI distingue tres regímenes —siempre autorizado, autorizado caso por caso y nunca autorizado—, y NVIDIA formula el mismo principio en su artículo sobre la memoria de los agentes: el contexto puede fundamentar una acción, pero no puede autorizarla. Dos actores sin relación entre sí llegan el mismo día a la conclusión de que un agente útil se define ante todo por aquello que se le prohíbe.
En las herramientas de línea de comandos, la seguridad avanza en zigzag, no en línea recta. Gemini CLI elimina una clave de API codificada directamente y refuerza su sandbox, Claude Code corrige reglas de permisos que permitían escribir en carpetas que debían ser de solo lectura, y Kimi Code elimina el bloqueo de comandos destructivos dos días después de haberlo añadido. Este último caso es el más instructivo: el análisis estático de comandos shell genera suficientes falsos positivos como para que una salvaguarda correcta sobre el papel resulte insoportable en la práctica. La seguridad de estas herramientas no depende del anuncio de una protección, sino de su supervivencia al contacto con los usuarios.
Queda la jornada en matemáticas y ciencias, la más difícil de evaluar en el momento. La prueba de Fermat formalizada en once días no produce ninguna matemática nueva: verifica un resultado de hace treinta años. Eso es precisamente lo que la hace interesante, porque la revisión por pares es el cuello de botella que se mide en años, y Kevin Buzzard señala que estos artefactos ya son lo bastante sólidos como para servir de base a otros trabajos. El emulador climático de Ai2 y el conectoma de la drosófila responden a la misma lógica: ninguno de los dos descubre, pero ambos hacen viable un trabajo cuyo coste impedía realizarlo a gran escala. Es un uso menos espectacular que el descubrimiento autónomo y probablemente más cercano a lo que la IA cambia realmente en la práctica científica.
Fuentes
- GPT-6 Astra disponible para Pro, Enterprise y Business Premium
- GPT-6 Astra disponible de forma general en GitHub Copilot
- Perplexity evalúa GPT-6 Astra en WANDR
- Codex CLI 0.153.3
- Crear un juego con Astra
- Formalizing Fermat’s Last Theorem
- Demostración del último teorema de Fermat en GitHub
- Project HydraFusion
- Lyria 3.5 en la aplicación Gemini
- Grok Bot for Enterprise
- Haggle Bot, el agente de compras de SpaceXAI
- Grok se conecta a cuentas financieras mediante Plaid
- Claude Code 2.1.260
- Claude Code 2.1.261
- El comando ant apply
- Un agente impulsado por la memoria con NVIDIA NemoClaw
- El razonamiento de frontera llega a Jetson
- Transferir la identidad del usuario entre plataformas Kubernetes federadas
- Gemini CLI v0.60.0 nightly
- Registro de cambios de Antigravity
- SamudrACE-E3SMv3 de Ai2
- El conectoma completo de una mosca de la fruta macho
- Muse Spark 1.3 max disponible públicamente
- Percept-Lens de Sakana AI
- Artículo sobre Percept-Lens en arXiv
- TAOT en LoongForge
- Open Yap 1K
- Daily Brief ampliado en Estados Unidos
- Runway lanza el plan Team
- 1 Million Voices llega a Brasil
- Kimi Code 0.41.0
- Embeddings rápidos en GPU en Perplexity
- Delta disponible en Windows en versión beta
- Replit MCP en directo
- Endpoint con protección de la privacidad para el historial de estrellas
- Múltiples configuraciones de publicación de confianza de npm
- Actualizaciones de GitHub Actions de principios de septiembre
- The Story of VS Code
- Pep AI creada en Replit
- Anuncio visual publicado por Zed
- Un ecosistema LLM abierto para el armenio
- VLM Run Gateway
- Jornada de puertas abiertas para ingenieros de Sakana AI
- Los sprints del programa DevEx de Gemini Enterprise
- Suno habla de la familia v6
- Open by Design en Londres
- AI Engineer vuelve a París
- Cierre del WebMCP Challenge