Buscar

GPT-5.6 Sol unifica ChatGPT, Kimi K3 en disponibilidad general en Copilot, WeatherNext predice ciclones con cinco días de antelación

Artículo generado por inteligencia artificial
GPT-5.6 Sol unifica ChatGPT, Kimi K3 en disponibilidad general en Copilot, WeatherNext predice ciclones con cinco días de antelación

ai-powered-markdown-translator

Artículo traducido del fr al es con gpt-5.4-mini.

Ver proyecto en GitHub ↗

El 6 de agosto de 2026, OpenAI unifica la experiencia de ChatGPT en torno a una versión compartida de GPT-5.6 Sol para los modos rápido y de razonamiento para los abonados de pago, con un 68% menos de errores factuales, mientras que GPT-5.6 Luna pasa a chats ilimitados gratuitos. El mismo día, Kimi K3 llega a disponibilidad general en GitHub Copilot, Google DeepMind publica en Nature WeatherNext, su modelo abierto que predice los ciclones con cinco días de antelación, y Alibaba abre la beta pública de Wan3.0 para la generación de vídeo de 30 segundos. Meta completa la semana con benchmarks de Artificial Analysis que sitúan a Muse Spark 1.2 casi en la frontera y un balance de cinco resultados de nivel oro en unas Olimpiadas científicas internacionales, mientras una quincena de anuncios cubren las herramientas de código agéntico (Amp, Devin, Replit, Warp, Cursor), el ecosistema open-weight (Hugging Face, Sakana, Together AI) y la generación de medios (ElevenLabs, Suno).


ChatGPT se pasa a GPT-5.6 Sol unificado, GPT-5.6 Luna pasa a ilimitado gratuito

6 de agosto — OpenAI unifica la experiencia de conversación en ChatGPT en torno a una versión actualizada de GPT-5.6 Sol para los abonados de pago. Hasta ahora, los usuarios Plus y Pro alternaban manualmente entre un modelo rápido (Instant) y un modelo de razonamiento profundo. A partir de ahora, GPT-5.6 Sol gestiona ambos modos en una sola experiencia, con un control deslizante de esfuerzo de razonamiento (slider) ajustable sobre la marcha — una simplificación directa de la interfaz, en respuesta a los comentarios de los usuarios sobre la confusión entre los dos modos anteriores.

En fiabilidad, OpenAI aporta una cifra concreta: en su evaluación de factualidad de alto riesgo (finanzas, medicina, derecho), la nueva versión de GPT-5.6 Sol produce un 68% menos de respuestas que contienen errores factuales, en comparación con GPT-5.5 Instant. Ese es el argumento central de esta actualización, presentada como una mejora de fiabilidad más que como un salto de capacidades brutas.

En cuanto a la oferta gratuita, los usuarios Free y Go también heredan un acceso ampliado a GPT-5.6 Luna: conversaciones textuales ilimitadas a partir del 7 de agosto, y la aparición de un botón «Think» para activar más razonamiento en las preguntas difíciles — una función hasta ahora reservada a las ofertas de pago.

Elemento seguidoDetalle numérico
Errores factuales finanzas/medicina/derecho-68% vs GPT-5.5 Instant
GPT-5.6 Sol + control deslizante (Plus/Pro)disponible desde el 6 de agosto
Chats ilimitados GPT-5.6 Luna (Free/Go)disponible desde el 7 de agosto

Un punto de alcance a tener en cuenta: esta actualización solo afecta a la experiencia de Chat de ChatGPT — la versión de GPT-5.6 Sol que alimenta ChatGPT Work y Codex no se ve modificada por este anuncio.

🔗 Anuncio oficial de OpenAI


Kimi K3 disponible en versión general en GitHub Copilot

6 de agosto — GitHub anuncia la disponibilidad general de Kimi K3, el modelo open-weight de Moonshot AI, en Copilot. El despliegue es progresivo en las ofertas Pro, Pro+, Max, Business y Enterprise, y el modelo es accesible desde todas las superficies de Copilot: Visual Studio Code, Visual Studio, Copilot CLI, el agente cloud, la app GitHub Copilot, github.com, GitHub Mobile, así como los plugins de JetBrains, XCode y Eclipse.

📣 @Kimi_Moonshot’s Kimi K3, an open-weight model, is now generally available and rolling out in GitHub Copilot. The model shows frontier-level abilities on agentic coding with highly cost-effective pricing. It is hosted by @FireworksAI_HQ.

🇪🇸 📣 Kimi K3 de @Kimi_Moonshot, un modelo de pesos abiertos, ya está en disponibilidad general y se está desplegando en GitHub Copilot. El modelo muestra capacidades de nivel frontera en código agéntico, con una tarificación muy competitiva. Está alojado por @FireworksAI_HQ.@github en X

El modelo está alojado a través de Fireworks AI, con una facturación por uso alineada con las tarifas del proveedor — el changelog no detalla ni precios precisos ni ventana de contexto. Para las organizaciones en Business y Enterprise, Kimi K3 está desactivado por defecto: los administradores deben activar explícitamente la política del modelo antes de que los equipos puedan acceder a él. Esta llegada se inscribe en la estrategia multmodelo de Copilot, que ya había integrado Kimi K2.7 Code a principios de agosto.

🔗 Changelog de GitHub


WeatherNext: Google DeepMind predice los ciclones con cinco días de antelación, pesos abiertos

6 de agosto — Google DeepMind publica en la revista Nature los resultados de WeatherNext, su modelo de IA dedicado a la predicción de ciclones tropicales. El modelo alcanza una precisión de vanguardia para predecir la trayectoria y la intensidad de una tormenta, ofreciendo de media 24 horas adicionales para prepararse con respecto a los métodos anteriores.

Predicting cyclones accurately can help save lives - and every hour of lead time counts. Published in @Nature, our AI model WeatherNext achieves state-of-the-art accuracy in forecasting a storm’s track and intensity, giving us a critical extra 24 hours to prepare on average.

🇪🇸 Predecir con precisión los ciclones puede salvar vidas — y cada hora de margen cuenta. Publicado en @Nature, nuestro modelo de IA WeatherNext alcanza una precisión de vanguardia en la predicción de la trayectoria y la intensidad de una tormenta, dándonos de media 24 horas adicionales para prepararnos.@GoogleDeepMind en X

Durante el huracán Melissa, WeatherNext proporcionó predicciones tempranas de su llegada a tierra como categoría 5, con cinco días de antelación y un nivel de confianza del 80%. El modelo, entrenado con varios años de datos atmosféricos globales y casi 5 000 ciclones históricos, genera cada escenario de previsión probabilista a 15 días en menos de un minuto sobre un chip TPU. Google DeepMind ofrece ahora 1 000 previsiones probabilistas por tormenta, accesibles a través de la herramienta WeatherLab.

Indicador medidoValor medido
Tiempo adicional de preparación+24h de media
Alerta del huracán Melissa (categoría 5)5 días de antelación, confianza 80%
Ciclones históricos en el entrenamiento~5 000

Punto notable para el ecosistema: el código y los pesos del modelo son abiertos en GitHub, disponibles libremente tanto para la investigación académica como para la previsión operativa.


Wan3.0 (Alibaba) entra en beta pública con vídeos nativos de 30 segundos

6 de agosto — Alibaba lanza la beta pública de Wan3.0, la nueva generación de su modelo de generación de vídeo, con tres ejes destacados: una generación de vídeo nativa que puede alcanzar hasta 30 segundos en una sola pasada, un acabado visual calificado de «reality-grade» (personajes más expresivos, mejor coherencia de las referencias de una escena a otra), y una función de Omni-Reference que amplía la comprensión del modelo más allá del texto, la imagen, el audio y el vídeo: Wan3.0 ahora puede leer documentos estructurados (doc, xls, ppt, pdf, etc.) y generar un vídeo directamente a partir de su contenido.

La beta está disponible desde ahora en Alibaba Cloud Model Studio y Qwen Cloud, con una llegada próxima a la aplicación Wan reservada a los miembros.

Resolución de vídeoPrecio API (por segundo generado)
480p0,05 $
720p0,10 $
1080p0,20 $

El acceso completo a la API debe abrirse progresivamente en las próximas semanas. Este lanzamiento sitúa a Wan3.0 frente a los anuncios recientes de la competencia sobre generación de vídeo de larga duración con control multimodal fino — FLUX 3 Video de Black Forest Labs, Seedance 2.5 de ByteDance, MiniMax H3 — un segmento en el que la capacidad de generar clips de 20 a 30 segundos con un control de referencia rico se convierte en un argumento central de diferenciación.

🔗 Anuncio @Alibaba_Wan


Muse Spark 1.2 de Meta se acerca a la frontera, según Artificial Analysis

5-6 de agosto — La firma de análisis independiente Artificial Analysis publica su evaluación completa de Muse Spark 1.2, el modelo de Meta lanzado en paralelo al agente Muse Code. En el AA Intelligence Index, obtiene una puntuación de 54 (variante xhigh), una subida de 3 puntos respecto a Muse Spark 1.1 (51) y de 11 puntos respecto a Muse Spark 1.0 (43, publicado en abril) — su tercera salida en cuatro meses. Esta puntuación lo sitúa en igualdad efectiva con GPT-5.5 (xhigh, 55) y Grok 4.5 (high, 54), justo detrás de los modelos punteros actuales: Claude Opus 5 (max, 61), Claude Fable 5 (max, 60), GPT-5.6 Sol (max, 59) y Kimi K3 (max, 57).

El principal avance se centra en el trabajo de conocimiento agéntico, punto débil identificado durante el lanzamiento de Muse Spark 1.1: la puntuación GDPval-AA v2 Elo sube de 1371 a 1631, situando al modelo 5.º entre todos los modelos evaluados, por delante de Claude Opus 4.8 (1588).

Indicador medidoMuse Spark 1.1Muse Spark 1.2
AA Intelligence Index (xhigh)5154
GDPval-AA v2 Elo13711631
Terminal-Bench 2.178%80%
Coste por tarea (Intelligence Index)0,29 $0,40 $

En costes, Muse Spark 1.2 sigue siendo uno de los modelos más eficaces de su nivel de inteligencia, con 0,40 $ por tarea para una tarificación API sin cambios (1,25 $ / 4,25 $ por millón de tokens de entrada/salida). Solo Grok 4.5 y GPT-5.6 Sol (medium) son más baratos dentro de su grupo. En el Vals Index, Muse Spark 1.2 también entra en el top 5 con solo 0,69 $ por prueba — tres veces más barato que Kimi K3, diez veces más barato que Claude Fable 5, Opus 5 y GPT-5.6 Sol.

🔗 Hilo de Artificial Analysis


Meta reivindica resultados de nivel oro en cinco Olimpiadas científicas internacionales

6 de agosto — Meta Superintelligence Labs (MSL) anuncia haber inscrito versiones internas de la familia Muse Spark en cinco competiciones científicas internacionales de alto nivel en 2026, para medir los progresos reales en razonamiento en lugar de en benchmarks sintéticos — un balance acumulado tras una primera medalla de física ya comunicada en julio.

To understand whether we’re making genuine progress on reasoning, we entered our AI models in five international STEM Olympiad competitions this year. The results: Asian Physics Olympiad (APhO): Perfect score on the theory exam — gold medal. International Physics Olympiad (IPhO): Perfect score — gold medal. International Mathematical Olympiad (IMO): Gold medal, top 4% of human participants. International Chemistry Olympiad (IChO): Gold-medal level. Romanian Masters of Mathematics (RMM): Gold-medal level.

🇪🇸 Para saber si estamos progresando de verdad en razonamiento, este año hemos inscrito nuestros modelos de IA en cinco competiciones internacionales de ciencias. Resultados: Olimpiada Asiática de Física (APhO) — puntuación perfecta en la prueba teórica, medalla de oro. Olimpiada Internacional de Física (IPhO) — puntuación perfecta, medalla de oro. Olimpiada Internacional de Matemáticas (IMO) — medalla de oro, top 4% de los participantes humanos. Olimpiada Internacional de Química (IChO) — nivel medalla de oro. Romanian Masters of Mathematics (RMM) — nivel medalla de oro.@shuchaobi en X

Competición científicaResultado obtenido
APhO (física, Asia)Puntuación perfecta en la prueba teórica — oro
IPhO (física, internacional)Puntuación perfecta en la prueba teórica — oro
IMO (matemáticas)Oro, top 4% de los participantes humanos
IChO (química)Nivel medalla de oro
RMM (matemáticas, Rumanía)Nivel medalla de oro

Tres de estas competiciones (APhO, IPhO, IMO) eran pruebas en vivo, corregidas por los jueces oficiales según los mismos baremos que para los candidatos humanos. Meta precisa que los modelos utilizados no tenían acceso a ninguna herramienta externa — ni búsqueda web, ni intérprete de código, ni calculadora — con una orquestación multiagente en razonamiento paralelo.

🔗 Relé @AIatMeta


Herramientas de desarrollo IA: Portals, sandbox remotos, enrutamiento de modelos

Cinco anuncios estrechan esta semana la distancia entre desarrollo local y entornos remotos o multmodelo.

Amp lanza los Portals — vista previa en vivo de las apps en los Orbs

6 de agosto — Amp añade los Portals, disponibles desde ahora en todos los orbs (el entorno de desarrollo remoto de Amp), una función que expone directamente en el navegador los servicios HTTP que se ejecutan dentro de un orb. Hasta ahora, probar en directo los cambios realizados por el agente requería configurar una VPN o lidiar con puertos. Técnicamente, el agente crea o detecta un archivo .amp/services.yaml y ejecuta amp orb services ensure para iniciar la aplicación, que luego se expone mediante una conexión HTTPS segura. Los Portals son accesibles para cualquiera que tenga acceso al hilo, lo que permite que varios miembros de un equipo vean los mismos cambios en directo, incluso cuando el orb se despierta tras un modo de suspensión.

🔗 Amp — Portals

Devin Outposts ahora funciona sobre Vercel Sandbox

5 de agosto — Cognition amplía Devin Outposts (lanzado a finales de julio para ejecutar Devin de forma nativa en cualquier ordenador) con una integración con Vercel Sandbox, disponible desde ahora. El agente ahora puede construir y probar una aplicación en una microVM aislada sobre la infraestructura de Vercel, con acceso a Docker, conexión a redes privadas mediante VPN, y reanudación desde una instantánea del sistema de archivos que conserva intactos el repositorio, las dependencias y el estado de compilación. Esta integración acerca Devin Outposts a las ofertas de entornos cloud efímeros similares a las de Amp (Orbs) o Warp, con la ventaja de apoyarse en la infraestructura de Vercel ya utilizada por muchos equipos front-end.

🔗 @cognition en X

Replit ejecuta sus análisis de seguridad durante la compilación, con Semgrep

5 de agosto — Replit anuncia, en colaboración con Semgrep, que sus análisis de seguridad ahora se ejecutan durante la construcción de la aplicación en lugar de solo al final — una evolución que responde directamente a una petición de los usuarios. Estos análisis están activos por defecto y se integran en todo el conjunto de funciones de Replit Auto-Protect, que asegura automáticamente las aplicaciones generadas por el agente. Replit indica que su Agent ya ejecuta más de 100 000 análisis al día, una cifra que ilustra la escala a la que se utiliza la herramienta para vibe coding en producción, con detección y corrección de vulnerabilidades antes de su puesta en línea.

🔗 @Replit en X

Warp introduce enrutadores de modelos personalizados

5 de agosto — Poco más de una semana después del lanzamiento del Warp Agent CLI, Warp añade enrutadores de modelos personalizados, disponibles desde ahora para todos los usuarios. Ahora es posible definir sus propias reglas de enrutamiento en lenguaje natural («envía las tareas simples a Minimax», «envía las correcciones de bugs a Kimi K3»), y cada solicitud se dirige automáticamente después al modelo que se considere más adecuado. Estos enrutadores se suman al enrutamiento automático ya integrado en el CLI y funcionan con modelos open weight, en BYOK (bring your own key), o mediante una suscripción SuperGrok — una respuesta directa a la tendencia observada en varias herramientas competidoras de orquestar varios modelos según la tarea en lugar de apostar por un único modelo frontera.

🔗 @warpdotdev en X

Cursor detalla Cursor Router — hasta un 68% de ahorro sin pérdida de calidad

6 de agosto — Cursor publica un artículo técnico que detalla el funcionamiento de Cursor Router, su sistema de selección automática de modelo lanzado el 22 de julio — es decir, no un lanzamiento, sino un artículo en profundidad con datos inéditos. El router funciona en dos etapas: «Compass» estima primero la complejidad de la tarea prediciendo la probabilidad de satisfacción del usuario, y luego un clasificador por taxonomía (dominio, tipo de tarea, modificadores como cambios visuales) selecciona el modelo frontera más eficaz para esa categoría precisa. El router distribuye las solicitudes entre Grok (tareas rutinarias), Sol/GPT-5.6 (planificación), Opus (ejecución) y Fable (depuración) — Opus 5 se añadió después del lanzamiento inicial. Cursor aporta cifras concretas: el modo «Auto Intelligence» ofrecería una satisfacción del usuario superior a la de Fable por sí solo con un coste un 68% menor, y el modo «Auto Balance» superaría a Opus 4.8 con un 41% menos de coste.

🔗 Cursor — cómo funciona Cursor Router


Ecosistema open-weight: inferencia, almacenamiento e investigación autónoma

Tres anuncios consolidan la infraestructura en torno a los modelos de peso abierto, tanto del lado del alojamiento como del de la investigación.

Baseten se convierte en proveedor oficial de inferencia en Hugging Face

6 de agosto — Baseten, plataforma de infraestructura de IA especializada en inferencia serverless, se une a los Inference Providers de Hugging Face. La integración permite lanzar inferencia alojada por Baseten directamente desde las páginas de modelos del Hub, mediante la interfaz web o los SDK de Python y JavaScript. La compatibilidad inicial cubre tres modelos open-weight principales: DeepSeek V4 Flash, Kimi K3 y GLM-5.2, con otros tipos de tareas previstos más adelante. Los suscriptores PRO reciben 2 $ de créditos mensuales de inferencia válidos en todos los proveedores, mientras que las cuentas gratuitas disponen de cuotas más limitadas. La integración expone un formato de API compatible con OpenAI a través del router de Hugging Face, lo que simplifica el cambio de proveedor sin reescribir el código de llamada.

🔗 Hugging Face — Baseten

Ai2 amplía su asociación con Hugging Face — almacenamiento elevado a ~2 petabytes

5 de agosto — Ai2 (Allen Institute for AI) amplía su asociación con Hugging Face para acelerar la difusión de sus trabajos en ciencia abierta. El almacenamiento asignado en el Hub casi se triplica, pasando a unos 2 petabytes, y el tráfico deja de estar sujeto a los límites de caudal estándar — una mejora notable para la descarga de los conjuntos de datos más grandes y de modelos con múltiples checkpoints. Ai2 precisa que sus recursos se han descargado más de 50 millones de veces desde la primavera de 2024, y que los artefactos vinculados a su modelo MolmoAct 2 han superado las 400.000 descargas en tres semanas. La asociación cubre todo el portafolio de Ai2: los modelos Olmo y Molmo, el modelo de observación terrestre OlmoEarth, así como varios conjuntos de evaluación. Según Ai2, la organización publica cada año más artefactos nuevos en el Hub que cualquier otra entidad seguida por Hugging Face, con más de 900 modelos y 1.200 conjuntos de datos en su haber.

🔗 Ai2 — asociación Hugging Face

Sakana Marlin — agente de investigación autónoma y lanzamiento de Marlin Insights

6 de agosto — Sakana AI destaca Sakana Marlin, descrito como un «Virtual CSO» (director científico virtual) capaz de razonar y llevar a cabo investigaciones de forma autónoma durante varias horas. La empresa indica que esta capacidad se apoya en dos piezas de investigación publicadas por sus equipos: AB-MCTS, aceptado en spotlight en NeurIPS 2025, y AI Scientist, publicado en Nature. Sakana AI también ha lanzado Marlin Insights, una serie de proyectos de investigación producidos por Marlin; el primer número analiza el desenlace de la crisis del estrecho de Ormuz y las razones por las que Estados Unidos, pese a su superioridad militar, tiene dificultades para encontrar una salida. Este lanzamiento ilustra la estrategia de Sakana AI de transformar su investigación fundamental en productos de análisis autónomo orientados a la empresa, en continuidad con sus despliegues comerciales recientes (Daiwa Securities, Namazu).

🔗 @SakanaAILabs sur X


GitHub Copilot y el ecosistema: datos abiertos, diseño reutilizable, comandos slash

Actualización Q1 2026 del GitHub Innovation Graph

5 de agosto — GitHub publica la actualización trimestral (Q1 2026) de su Innovation Graph, un proyecto de datos abiertos que sigue la actividad global de desarrollo. El hilo de tuits destaca una aceleración de la actividad de push de Git en varios países fuera de los mercados tradicionales, así como un aumento del 16% trimestre a trimestre de la colaboración open source transfronteriza en Q1 2026, con avances notables para la Unión Europea, India y Singapur desde 2020.

País seguidoGit pushes (Q1 2020 → Q1 2026)
India4,4M → 45M
Vietnam630K → 5,1M
Pakistán240K → 3,5M

El conjunto de datos sigue siendo abierto y descargable, lo que permite explorar con más detalle estas dinámicas por país y por período.

🔗 Hilo @github — Innovation Graph

Genspark Design — sistema de diseño reutilizable entre proyectos

6 de agosto — Genspark lanza Genspark Design, una función disponible desde ahora que transforma automáticamente un proyecto ya construido (colores, tipografía, componentes) en un sistema de diseño reutilizable para los proyectos siguientes. El objetivo es evitar empezar de cero la identidad visual en cada nuevo proyecto: una landing page generada después hereda el mismo estilo que una app existente, sin rehacerlo manualmente. Este anuncio se suma a los esfuerzos recientes de Genspark en torno a la generación de interfaces y suites ofimáticas (GenOffice), y se dirige a los usuarios que encadenan varios proyectos generados por IA buscando coherencia visual sin configuración repetida.

🔗 @genspark_ai sur X

Guía de comandos slash en la app de GitHub Copilot

6 de agosto — GitHub publica una guía que detalla los seis comandos slash disponibles en la app de escritorio de GitHub Copilot, accesibles al escribir « / » en la zona de chat. Cubren todo el ciclo de trabajo: planificación, prueba de una aproximación, implementación automatizada, revisión cruzada por otro modelo, creación de interfaces interactivas y orquestación multirrepositorio — distinguiéndose de los comandos slash del CLI, que apuntan al terminal en lugar de a la app de escritorio.

Comando slashFunción asegurada
/planDivide la tarea antes de programar
/sparAbogado del diablo para cuestionar un enfoque
/autopilotConvierte un plan en código
/rubber-duckRevisión independiente por otro modelo
/orchestrateCoordina el trabajo entre varios repositorios

🔗 GitHub — guía de comandos slash


Generación de medios: doblaje y transparencia de audio

ElevenLabs lanza Dubbing v2 en ElevenAPI

6 de agosto — ElevenLabs pone en disponibilidad general en ElevenAPI la versión 2 de su motor de doblaje (Dubbing v2), que ya existía en el producto, para permitir a los desarrolladores integrar el doblaje IA directamente en sus propias aplicaciones. Técnicamente, Dubbing v2 se condiciona directamente sobre el rendimiento de audio original en lugar de sobre una transcripción plana, lo que preserva el tono, la emoción y la cadencia de la voz fuente. El modelo adapta la cadencia para una dicción natural en más de 90 idiomas, con una traducción «sync-aware» que alinea automáticamente los comienzos y finales de las réplicas sin ajuste manual. Para casos de uso empresarial, un modo de edición granular permite importar la propia transcripción y regenerar solo los segmentos modificados en lugar del doblaje completo — exponiéndose todo el pipeline (traducción, clonación de voz, doblaje, sincronización) mediante una sola API.

🔗 @ElevenLabs sur X

Suno despliega herramientas de transparencia y actualiza sus normas comunitarias

6 de agosto — Suno publica un artículo firmado por su CEO Mikey Shulman, exponiendo los principios que la empresa dice querer seguir para construir «responsablemente» el futuro de la música generada por IA. En concreto, el anuncio introduce un despliegue de tecnologías de watermarking y fingerprinting de audio para identificar los temas generados en la plataforma, presentadas como resistentes a la falsificación sin degradar la escucha, así como restricciones próximas sobre las descargas destinadas a limitar la distribución masiva hacia las plataformas de streaming, preservando al mismo tiempo los usos profesionales y creativos. El anuncio va acompañado de una actualización de las Community Guidelines que ahora prohíbe explícitamente la recreación de canciones existentes, el uso de la voz o de la imagen de una persona sin consentimiento, y las prácticas de spam o de evasión automatizada de la moderación, con sanciones que van desde la advertencia hasta la expulsión definitiva.

🔗 @suno sur X


Agentes y plugins: estándares abiertos y modelos subagente

Agent Plugins — estándar abierto para plugins de agentes

6 de agosto — OpenAI anuncia Agent Plugins, un nuevo estándar abierto diseñado con AWS, Cursor, GitHub, VS Code y Vercel para empaquetar Agent Skills y configuraciones de servidores MCP en un formato común. El objetivo es permitir a los desarrolladores construir un plugin una sola vez y reutilizarlo en varios clientes de agentes compatibles, en lugar de duplicar la integración para cada herramienta. En el lanzamiento, los clientes compatibles enumerados son Codex, ChatGPT, Cursor, GitHub Copilot, Kiro y VS Code — un ámbito amplio que cubre tanto el ecosistema de OpenAI como varios competidores directos en el terreno de los agentes de código. Los tuits no detallan la mecánica técnica precisa (formato de manifiesto, proceso de publicación) ni una fecha de disponibilidad general más allá del lanzamiento anunciado.

🔗 @OpenAIDevs sur X

Perplexity Computer despliega GPT-5.6 Terra y Luna como modelos subagente

6 de agosto — Perplexity despliega dos nuevos modelos GPT-5.6 dentro de Computer, su plataforma de subagentes y automatizaciones: Terra y Luna. Terra se convierte en el modelo por defecto para todos los subagentes de Computer y también actúa como modelo orquestador; Luna se posiciona como el modelo principal de las automatizaciones programadas. Según Perplexity, Terra está diseñado para el trabajo complejo orientado a objetivos, un perfil adecuado para el rol de subagente que debe descomponer una tarea y ejecutarla de forma autónoma. En el benchmark WANDR, Terra obtendría una puntuación 11 puntos superior a la de Claude Sonnet, ofreciendo al mismo tiempo una reducción de costes de un orden de magnitud. Esta introducción de modelos especializados por rol ilustra una arquitectura de agentes cada vez más diferenciada en Perplexity.

🔗 @perplexity_ai sur X


Breves

  • Together AI afirma que Kimi K3 es casi dos veces mejor que Claude Fable 5 en el benchmark jurídico Harvey LAB-AA — Sin detalle metodológico publicado, debe tomarse como una reivindicación de marketing de proveedor de inferencia. 🔗 fuente
  • Hugging Face destaca Cadena, un decompilador de mallas 3D a CAD editable — Demostración en Spaces que convierte un archivo 3D fijo en un programa CAD modificable paso a paso, por ejemplo para ensanchar un agujero sin reconstruir el modelo. 🔗 fuente
  • El CEO de Hugging Face defiende una regulación de IA por capas — Clément Delangue apoya el nuevo marco regulatorio estadounidense que distingue pesos de modelos, API y aplicaciones, y que considera protector para el open source. 🔗 fuente
  • Together AI detalla su arquitectura multacentro de datos con un 99,9% de disponibilidad — Tráfico repartido en directo entre dos sitios simultáneamente, con capacidad para absorber la pérdida completa de un centro de datos sin interrupción del servicio. 🔗 fuente
  • Gemini Omni: generación gratuita de 10 vídeos ampliada hasta el 11 de agosto — La oferta, que debía terminar el 4 de agosto, sigue accesible hasta el 11 de agosto de 2026, 23:59 (hora del Pacífico). 🔗 fuente
  • GenOffice disponible en Linux — La suite ofimática IA de código abierto de Genspark, ya disponible en macOS y Windows, ahora también puede compilarse y utilizarse en Linux. 🔗 fuente
  • Flux 3 disponible en el agente de vídeo IA de Genspark — Integración de Flux 3 (Black Forest Labs) con audio nativo y diálogo multilingüe, para clips de hasta 20 segundos en 1080p. 🔗 fuente
  • Qwen3.8-Max escala en las clasificaciones públicas — Alibaba reivindica el 5.º puesto del Artificial Analysis Intelligence Index y el 1.er puesto del Agentic Index, tras un 2.º puesto en el Image-to-WebDev Arena el día anterior. 🔗 fuente
  • Qwen-Image-3.0-Pro desplegado en Qwen Cloud y fal.ai — El modelo de generación de imágenes de Alibaba, ya clasificado 5.º a nivel mundial, pasa a estar accesible directamente en Qwen Cloud y en la plataforma de terceros fal.ai. 🔗 fuente
  • OpenAI y la American Psychological Association se asocian sobre IA y salud mental juvenil — Asociación para desarrollar recomendaciones y salvaguardas basadas en evidencia en torno al bienestar de los usuarios jóvenes. 🔗 fuente
  • OpenAI publica datos Signals sobre el uso mundial de ChatGPT — Nuevos indicadores por país sobre adopción y tendencias de uso, sin detalle cuantitativo accesible a esta fecha. 🔗 fuente
  • Cohere se asocia con la Universidad de Waterloo para un certificado en transformación IA — El nuevo certificado «AI Transformation & Change Management» debe preparar a los estudiantes para la adopción responsable de la IA en la empresa. 🔗 fuente

Lo que significa

La semana ilustra un claro cambio: la inteligencia de vanguardia se está convirtiendo en la opción predeterminada en lugar de un complemento de pago adicional. OpenAI unifica ChatGPT en torno a un GPT-5.6 Sol que maneja tanto la rapidez como el razonamiento profundo, al mismo tiempo que vuelve Luna ilimitado y gratuito para las cuentas Free y Go. GitHub sigue una lógica similar del lado de los desarrolladores al generalizar Kimi K3, un modelo open-weight, en Copilot para el conjunto de sus ofertas de pago. En ambos casos, la novedad no es un salto en capacidades brutas, sino un cambio en la distribución: modelos antes reservados a los niveles premium o a las integraciones a medida se convierten en la configuración estándar, lo que desplaza la competencia hacia la fiabilidad percibida y el costo de acceso más que hacia la puntuación bruta en un benchmark.

La medición de la capacidad de IA se convierte, ella misma, en un terreno de competencia estructurado. Muse Spark 1.2 de Meta se acerca casi al límite según Artificial Analysis, con un costo por tarea que sigue estando entre los más bajos de su categoría, mientras Meta Superintelligence Labs reivindica resultados de nivel oro en cinco Olimpiadas científicas internacionales sin uso de herramientas —una demostración pública pensada para convencer más allá de los leaderboards habituales. En paralelo, la infraestructura que sostiene estos modelos abiertos se profesionaliza: Baseten se convierte en proveedor oficial de inferencia en Hugging Face para DeepSeek V4 Flash, Kimi K3 y GLM-5.2, Ai2 casi triplica su almacenamiento en el Hub, y Sakana AI convierte su investigación fundamental en un producto de investigación autónomo con Marlin. El hilo conductor: el valor se desplaza del modelo aislado hacia el ecosistema que lo distribuye, lo aloja y lo verifica.

Las herramientas de código agentico convergen hacia una misma idea: ya ningún modelo único domina todas las tareas, así que hay que enrutar con inteligencia. Cursor detalla cómo su router combina estimación de complejidad y clasificación por taxonomía para reducir los costos hasta en un 68% sin pérdida de satisfacción percibida, Warp introduce reglas de enrutamiento en lenguaje natural, y Amp, al igual que Devin, amplía sus entornos remotos (Portals, integración Vercel Sandbox) para acercar el desarrollo en la nube a la comodidad de lo local. Replit, por su parte, desplaza sus análisis de seguridad Semgrep hacia antes del build en lugar de después, con más de 100 000 análisis por día a esa escala. En conjunto, estos anuncios dibujan una generación de herramientas en la que la inteligencia ya no es la única palanca: la orquestación, la seguridad por defecto y la integración de infraestructura cuentan tanto como ella.

Más allá de los modelos de lenguaje, la semana muestra cómo la IA se instala a la vez en usos de impacto directo y en la producción creativa a gran escala. WeatherNext de Google DeepMind, publicado en Nature y disponible en pesos abiertos, ofrece de media 24 horas adicionales de margen para anticipar un ciclón —una aplicación donde el interés general prima claramente sobre la competencia comercial. En el extremo opuesto, Wan3.0 de Alibaba, ElevenLabs y Suno ilustran la rápida maduración de la generación de medios: vídeo nativo de 30 segundos con control multimodal, doblaje condicionado sobre la interpretación vocal original ahora en disponibilidad general vía API, y herramientas de watermarking desplegadas en respuesta a las preocupaciones sobre la autenticidad de los contenidos generados. Estas dos direcciones, ciencia abierta y creación comercial, avanzan al mismo ritmo pero con desafíos de responsabilidad muy distintos.


Fuentes