ai-powered-markdown-translatorArtículo traducido del fr al es con gpt-5.4-mini.
Gran jornada para las piezas de infraestructura agentiva: Anthropic saca computer use, el browser tool, la Skills API y la Files API de beta en Claude Platform, mientras GitHub Copilot se instala en Slack y Microsoft Teams. En cuanto a los modelos, DeepSeek publica su primer modelo multimodal y Pika Labs lanza un sintetizador de voz que reivindica una relación calidad/precio inédita. Entre ambos, un enorme conjunto de datos egocéntrico, un estudio sobre los sesgos de benchmark en reconocimiento de voz, y una decena de actualizaciones destacables en Google DeepMind, GitHub, Z.ai, Qwen, Harvey y las herramientas de generación de vídeo/audio.
Claude Platform: computer use, browser tool, Skills API y Files API en disponibilidad general
20 de agosto — Anthropic anuncia el paso a disponibilidad general de cuatro piezas para construir agentes en Claude Platform: computer use, el browser tool, la Skills API y la Files API. El objetivo declarado es reducir el número de idas y vueltas necesarias para automatizar una tarea en una aplicación que no tiene API, y permitir construir Claude Managed Agents sobre skills versionadas y archivos reutilizables.
El nuevo computer_toolset_20260801 permite a Claude encadenar varias acciones por turno (clic, escritura, tecla de teclado, captura de pantalla) en lugar de un ida y vuelta por acción aislada. Anthropic indica que los clientes en acceso anticipado han constatado entre un 20 y un 40 % menos de idas y vueltas por tarea. El browser tool evoluciona en paralelo con browser_toolset_20260801 : en lugar de apuntar a píxeles —frágil ante el menor cambio de maquetación— Claude recibe ahora la estructura de la página y puede actuar sobre referencias de elementos.
En el lado de la API, la Skills API permite subir el procedimiento de un equipo una sola vez, versionarlo y fijarlo a un version_id concreto o a latest. La Files API gana un parámetro expires_in_seconds, un límite de tasa 5 veces mayor (500 solicitudes por minuto) y una cuota de 1 TB por organización. Anthropic también ha publicado un adaptador AG-UI para los Managed Agents, que asigna cada hilo de conversación a una sesión gestionada y transmite texto, llamadas a herramientas y razonamiento hacia la interfaz.
| Pieza | Novedad del día |
|---|---|
| Computer use | computer_toolset_20260801, hasta -40% de idas y vueltas por tarea |
| Browser tool | browser_toolset_20260801, objetivo mediante referencia de elemento de página |
| Skills API | Versionado, fijación a version_id o latest |
| Files API | 500 solicitudes/minuto (x5), cuota de 1 TB por organización |
GitHub Copilot llega a Slack y Microsoft Teams
21 de agosto — GitHub Copilot aterriza en vista previa pública en Slack y Microsoft Teams. El principio es idéntico en ambos casos: mencionar @GitHub en un mensaje directo, un canal o un hilo abre una sesión de agente en la nube capaz de responder a preguntas sobre el código y la actividad de GitHub, clasificar informes de errores, investigar fallos, implementar cambios en un entorno seguro de nube aislada y, después, abrir pull requests con un enlace a la conversación original.
En Slack, la integración se apoya en Slack Code, la nueva oferta agentiva de Slack lanzada el mismo fin de semana: GitHub Copilot puede abrir canales de código dedicados donde el equipo consulta los diffs e inspecciona previsualizaciones de renderizado sin ensuciar la conversación original. En Teams, una discusión se convierte en una sesión de agente colectiva que todo el mundo puede seguir y orientar; el trabajo continúa de forma asíncrona en el entorno de nube aislada mientras el equipo hace otra cosa.
Disponibilidad reservada a organizaciones con plan Copilot Business o Enterprise. El administrador activa la política de agente en la nube de Copilot e instala la app para Slack o Teams; los administradores de repositorio pueden exigir una aprobación antes de fusionar los pull requests generados por el agente. El uso consume créditos de IA, y el entorno de nube aislada se factura por separado con presupuestos configurables.
🔗 GitHub Copilot en Slack · 🔗 GitHub Copilot en Teams
DeepSeek-V4-Flash-Vision-Exp: primer modelo multimodal de DeepSeek en la API
21 de agosto — DeepSeek pone en línea DeepSeek-V4-Flash-Vision-Exp, un modelo multimodal experimental disponible bajo el identificador deepseek-v4-flash-vision-exp. En las capacidades puramente textuales —agentes, razonamiento, conocimiento del mundo— el modelo iguala a DeepSeek-V4-Flash. La novedad está en otro sitio: en los benchmarks de agentes multimodales, DeepSeek anuncia un salto claro respecto a V4-Flash, con un rendimiento que se acerca al de Opus-4.8.
El soporte multimodal en la API es completo: entrada mixta texto + imagen (base64, URL externa, o mediante una nueva Files API gratuita lanzada el mismo día), compatible con los tres formatos existentes (Chat Completions, Messages, Responses). La tarifa sigue la tabla de V4-Flash, con una tokenización de imágenes limitada a 384 tokens por imagen. La Files API permite subir una imagen una sola vez y referenciarla mediante file_id, una ganancia de ancho de banda para usos agentivos repetitivos. DeepSeek Harness 0.1.1, el arnés de agente open source lanzado el 13 de agosto, se actualizó el mismo día para dar soporte nativo al nuevo modelo.
| Elemento | Detalle |
|---|---|
| Modelo | deepseek-v4-flash-vision-exp |
| Capacidades texto | Paridad con DeepSeek-V4-Flash |
| Capacidades multimodales | Cercanas a Opus-4.8 en los benchmarks de agentes multimodales |
| Tarifa de imagen | Hasta 384 tokens/imagen, precio V4-Flash |
| APIs compatibles | Chat Completions, Messages, Responses |
| Arnés | DeepSeek Harness 0.1.1 (soporte nativo) |
DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8.
🇪🇸 ¡DeepSeek-V4-Flash-Vision-Exp ya está disponible en la plataforma API de DeepSeek! Este modelo multimodal experimental iguala a DeepSeek-V4-Flash en las capacidades textuales, incluidos los agentes, el razonamiento y el conocimiento del mundo. En los benchmarks de agentes multimodales, V4-Flash-Vision-Exp da un salto importante frente a V4-Flash, acercando el rendimiento de los agentes multimodales al de Opus-4.8. — @deepseek_ai en X
Pika Speech: síntesis de voz 3B a 1,2 segundos por minuto, hasta 9x más barato que ElevenLabs v3
21 de agosto — Pika Labs amplía su gama Pika Audio con Pika Speech, un modelo de síntesis de voz de 3 mil millones de parámetros. El argumento principal es la velocidad: un factor de tiempo real (RTF) de 0,02, es decir, un minuto de habla 48 kHz de calidad de estudio generado en aproximadamente 1,2 segundos en pruebas locales de formato largo, con solicitudes posibles de hasta cinco minutos de habla continua.
En el control del ritmo, Pika Speech innova: en lugar de estirar o comprimir el audio después —el método estándar en la mayoría de los sistemas TTS— el modelo controla el ritmo y la duración directamente gracias a un «latent de fin de habla» (EOS latent), un ancla colocada en la imagen final objetivo. Mover ese ancla antes comprime el flujo; moverla después deja que el texto respire. En cuanto a la arquitectura, el equipo combina flow matching y distillation por ajuste de distribuciones, FlashAttention-3, y un «token packing» que hace que cinco segmentos de frase cuesten aproximadamente el doble que uno solo en lugar de cinco veces.
En costes, Pika reivindica una ventaja que puede llegar a 9x frente a ElevenLabs v3, 4,5x frente a Cartesia y ElevenLabs Turbo, y 2x frente a Fish Audio, sin detallar la metodología exacta más allá de esos ratios. El modelo es accesible a través del Pika API Club.
Let’s talk about Pika Speech, a 3B text-to-speech model at RTF 0.02. […] Pika Speech generates one minute of studio-quality 48 kHz speech in about 1.2 seconds—and supports requests up to five minutes. That efficiency makes it up to 9× more cost-efficient than ElevenLabs v3, 4.5× than Cartesia and ElevenLabs Turbo, and 2× than Fish Audio.
🇪🇸 Hablemos de Pika Speech, un modelo de síntesis de voz de 3 mil millones de parámetros con un factor de tiempo real de 0,02. […] Pika Speech genera un minuto de habla 48 kHz de calidad de estudio en aproximadamente 1,2 segundos —y admite solicitudes de hasta cinco minutos. Esta eficiencia lo hace hasta 9 veces más rentable que ElevenLabs v3, 4,5 veces más que Cartesia y ElevenLabs Turbo, y 2 veces más que Fish Audio. — @pika_labs en X
EgoSuite-Open100K: el mayor conjunto de datos egocéntrico humano abierto
21 de agosto — Lightwheel AI, en colaboración con Hugging Face, open-source EgoSuite-Open100K, presentado como el mayor conjunto de datos egocéntrico humano completamente anotado jamás publicado en acceso libre. El objetivo fijado es 100 000 horas de datos humanos en primera persona; las 10 000 primeras horas ya están disponibles, y el resto se publicará por etapas.
El conjunto de datos cubre más de 15 000 tareas repartidas en más de 15 000 escenas reales —cocinas, dormitorios, almacenes, líneas de ensamblaje— agrupadas en 7 categorías de entornos y 128 tipos de escenas. Cada secuencia está anotada con pose de la mano, pose del cuerpo y semántica a nivel de sub-tareas, y una parte del corpus dispone además de cobertura de cámara en la muñeca. Punto destacable en cuanto a licencia: a diferencia de muchos conjuntos de datos de investigación, EgoSuite-Open100K está licenciado para entrenamiento comercial, no solo académico.
El dataset es presentado por sus creadores como la primera pieza pública de una infraestructura de datos más amplia para la «Physical AI» (robótica e IA encarnada): la idea de que la escalabilidad de los modelos físicos depende ahora de un acceso a datos humanos masivos y compartidos.
🔗 Anuncio de Lightwheel AI · 🔗 Cobertura de Hugging Face
Claude Security pasa a Claude Mythos 5
21 de agosto — Anthropic pone en marcha Claude Security, su herramienta de análisis de vulnerabilidades, sobre Claude Mythos 5, en beta pública para todos los clientes de Claude Enterprise. El argumento: aprovechar el modelo de seguridad más capaz de Anthropic sobre su codebase sin acceso separado al modelo: los análisis se facturan como uso de tokens estándar en el plan existente.
En concreto, la herramienta se conecta a un repositorio GitHub y Mythos 5 analiza el código trazando la circulación de los datos entre archivos y razonando sobre las interacciones entre componentes. Cada resultado vuelve con una categoría CWE, un nivel de confianza, una evaluación de severidad y una corrección sugerida, que se abre directamente en Claude Code en la web. Anthropic aprovecha para lanzar un Defender Advantage Fund dotado con 35 millones de dólares en créditos para la seguridad open source, y prevé ampliar su Cyber Verification Program en las próximas semanas.
Tarificación GPT-5.6 Sol: OpenAI baja sus precios de API, GitHub Copilot sigue
21 de agosto — OpenAI reduce en más de un 20 % los precios de API y créditos de GPT-5.6 Sol durante los próximos tres meses. La medida ya está activa en la API y se despliega en Codex y ChatGPT Work a lo largo del día. Para los usuarios de Codex en planes por tarea (token-based), los créditos comprados llegarán más lejos; el uso incluido en las suscripciones Pro, Plus y Business, en cambio, no cambia —la bajada beneficia por tanto sobre todo a los desarrolladores de API y a los usuarios facturados por token.
GPT-5.6 Sol al -50% en GitHub Copilot
En paralelo, GitHub difunde una promoción distinta: -50 % sobre GPT-5.6 Sol en GitHub Copilot hasta el 3 de septiembre, utilizable en la app, la CLI y el IDE. Es un descuento puntual del lado de Copilot, que no debe confundirse con la bajada tarifaria permanente de OpenAI descrita arriba —dos empresas distintas, dos mecanismos distintos sobre el mismo modelo.
🔗 Bajada tarifaria de OpenAI · 🔗 Promo de GitHub Copilot
GLM-5.3 (Max) sube en Code Arena: WebDev
20 de agosto — LMArena indica que GLM-5.3 (Max) de Z.ai ha movido la frontera de Pareto (relación calidad/coste) del ranking Code Arena: WebDev, dedicado a la evaluación de modelos en tareas de desarrollo web. Con 1597 puntos, el modelo se situaría 2.º entre los modelos de pesos abiertos (una vez publicados) y 8.º en todas las categorías.
| Modelo | Precio ($/M tokens) | Puntos Code Arena: WebDev |
|---|---|---|
| GLM-5.3 (Max) | $3,65 | 1597 |
| Qwen3.8 (Max) | $5,00 | — |
| Gemini-3.7-flash-high | $2,86 | peor puntuación |
| DeepSeek-v4-flash-high | $1,10 | peor puntuación |
A $3,65 por millón de tokens, GLM-5.3 (Max) sigue en un rango de precio comparable al de Qwen3.8 (Max) al tiempo que supera a Gemini-3.7-flash-high y DeepSeek-v4-flash-high en este ranking, una nueva señal de la competitividad de Z.ai en el desarrollo web agentivo, como complemento de los resultados ya conocidos en Terminal-Bench y en la Agent Arena general.
Harvey lanza Tenet, un modelo jurídico construido sobre Kimi K3
20 de agosto — Harvey presenta Tenet, su primer modelo posentrenado para el derecho, a partir de una base Kimi K3 (Moonshot AI) posentrenada con Fireworks AI sobre un corpus de datos jurídicos públicos, datos sintéticos y datos de expertos humanos que simulan trabajo jurídico de larga duración.
Harvey anuncia que este posentrenamiento aumenta la tasa de éxito completa de Tenet en un 82 % en el benchmark LAB y en un 22 % en LAB Contracts, en comparación con el Kimi K3 base, con estado del arte en LAB Contracts y el 2.º puesto en LAB en su conjunto. El coste de explotación de Tenet sería inferior a la cuarta parte del de los modelos de fundación más performantes del mercado. Como complemento, Harvey ha entrenado tres subagentes especialistas: diligencia M&A, revisión de tablas y conocimiento del despacho.
Georgia Tech rastrea los orígenes del razonamiento social de Olmo 3
21 de agosto — Un equipo de Georgia Tech aprovechó el hecho de que la pila Olmo 3 de Ai2 es totalmente abierta — pesos, corpus de preentrenamiento Dolma 3 (1,26 mil millones de documentos), infraestructura — para relacionar estadísticamente capacidades del modelo con los textos que las produjeron, un experimento imposible en un modelo cerrado.
El método se basa en funciones de influencia, aplicadas a aproximadamente 5,68 millones de documentos muestreados en Dolma 3. Resultado principal: los textos ricos en diálogos y escritura interpersonal pesan más en el rendimiento en razonamiento social que en los conocimientos factuales — y al retirar los documentos literarios más influyentes, el rendimiento en el benchmark SocialIQA cayó de forma significativa, confirmando la causalidad.
Sesgo de «optimización de benchmark» detectado en modelos ASR open source
21 de agosto — Un equipo de Hume AI publica en el blog de Hugging Face un estudio sobre un sesgo metodológico en reconocimiento de voz: algunos modelos parecerían optimizados para reproducir las transcripciones de referencia de los benchmarks públicos en lugar de transcribir fielmente el audio.
De los 11 modelos ASR open source probados, alrededor del 40 % de los fragmentos de VoxPopuli analizados contendrían errores en sus referencias, y 6 modelos de 11 reproducían esos errores en lugar de transcribir correctamente el audio. En LibriSpeech, las tasas de recuperación de números ocultos alcanzaban del 30 al 40 %, señal de que algunos modelos «rellenan» el texto en lugar de escucharlo. La conclusión recomienda el uso de conjuntos de evaluación mantenidos en secreto y una separación más estricta entre datos de entrenamiento y de prueba.
SenseNova-U1.5-8B-MoT: modelo de imagen abierto sin VAE ni DiT
21 de agosto — SenseNova publica en pesos abiertos un modelo de generación de imágenes cuyas prestaciones anunciadas serían comparables a Nano Banana 2. El interés técnico reside en la arquitectura: sin VAE, sin codificador de texto separado, sin DiT — el modelo se apoya en una «mixture of transformers», donde los tokens de texto e imagen usan pesos distintos y se atienden mutuamente, y el denoising se hace directamente en el espacio de los píxeles en lugar de en un espacio latente comprimido.
Este enfoque contrasta con la pila estándar de los modelos de difusión texto-imagen, y su apertura en pesos permitirá a la comunidad verificar de forma independiente las comparaciones de rendimiento anunciadas.
Diffusers 0.40.0: Modular Diffusers deja el estado experimental
21 de agosto — Hugging Face publica Diffusers 0.40.0. El cambio más estructural es la salida del estado experimental para Modular Diffusers, el sistema de pipelines modulares de la biblioteca. La versión añade la integración de varios modelos abiertos recientes (LTX2.5, MiniMax H3, MiniMax Music 3, Wan Animate 2), compatibilidad con paralelismo tensorial para una selección de modelos, y dos nuevos backends de cuantización (SDNQ, Nunchaku-Lite).
Google DeepMind explora la IA en los juegos con Fenris Creations
21 de agosto — Google DeepMind anuncia una asociación de investigación con el estudio Fenris Creations, en continuidad con 15 años de trabajos que usan los videojuegos como terreno de experimentación para la IA, desde el dominio de Atari hasta el nivel Grandmaster en StarCraft II. Tras SIMA, que enseñó a agentes a comprender mundos 3D, DeepMind quiere explorar la navegación en dinámicas humanas reales dentro de un universo persistente.
La asociación apunta a cuatro desafíos abiertos: el aprendizaje continuo (adquirir nuevas habilidades sin olvidar las anteriores), sistemas de memoria profunda que van mucho más allá de las ventanas de contexto actuales, la planificación a largo plazo (semanas, meses, años), y las dinámicas multiagente (cooperación, negociación, economía, comportamientos emergentes). El objetivo a largo plazo es doble: crear nuevas experiencias de juego con desarrolladores y reutilizar estos avances para problemas del mundo real y el descubrimiento científico.
Runway Ruby: conversión de vídeo SDR a HDR de 16 bits
21 de agosto — Runway lanza Ruby, un modelo que convierte un vídeo SDR (standard dynamic range) en HDR de 16 bits, con salida en secuencias EXR o ProRes/HEVC de 10-12 bits, en el espacio de color BT.2020 con compatibilidad PQ o HLG — los estándares usados en la postproducción profesional y la emisión HDR.
Ruby funciona igual de bien sobre un vídeo subido por el usuario que sobre un output generado por Runway, con un límite de 30 segundos. La función está disponible desde ahora para los planes Max y Enterprise.
NVIDIA AVO reclama un 100 % en el benchmark ARC-AGI-3
21 de agosto — NVIDIA presenta AVO, un agente de código generalista, con una puntuación de 100 % en ARC-AGI-3, un benchmark de razonamiento interactivo. Según NVIDIA, AVO completó los 183 niveles repartidos en los 25 entornos públicos del benchmark, sin instrucciones explícitas, reglas enunciadas ni objetivos formulados de antemano.
AVO funciona mediante un bucle continuo de inspección, planificación, implementación y evaluación, apoyándose en memoria, herramientas y retroalimentación de ejecución para construir sobre lo que aprende con el tiempo — un enfoque pensado para mantener el progreso en tareas largas en lugar de empezar de cero en cada nueva ventana de contexto.
HeyGen Look Packs: cambiar vestimenta y decorado manteniendo el rostro
21 de agosto — HeyGen lanza Look Packs, una función que cambia la vestimenta y el decorado de un vídeo de avatar conservando fielmente el rostro de la persona — el argumento es que la mayoría de los modelos generativos también modifican los rasgos faciales cuando cambian la apariencia.
El uso previsto es la coherencia de marca personal en distintos contextos profesionales: inmobiliario, jurídico, fitness, educación, bienestar. Un creador de contenido B2B puede así producir vídeos con prendas y decorados adaptados a cada sector sin dejar de ser reconocible de un vídeo a otro. Este anuncio se enmarca en el ritmo sostenido de HeyGen en los últimos días (Retouch el 20 de agosto, Brand Kits y upscale 4K el 18-19 de agosto).
Amp lanza Explain Usage para explicar su consumo de tokens
21 de agosto — Amp añade Explain Usage, una función que permite pedir directamente a Puck, el asistente integrado, que analice su propio consumo de tokens, créditos y tamaño de orb. El usuario formula una pregunta en lenguaje natural — «¿Qué threads han consumido más tokens hoy?» — y Puck lee los datos de uso personales y las métricas por thread para responder.
Existen dos puntos de entrada: plantear la pregunta directamente a Puck, o hacer clic en el botón dedicado en las páginas de uso. Para los usuarios que prefieren los datos en bruto, Amp también expone esta información vía CLI (amp usage --details, amp threads usage <thread-id> --details).
v0 (Vercel) añade Vercel Connect para conectarse a más de 100 servicios
21 de agosto — Las apps y agentes construidos en v0 pueden ahora conectarse directamente a Slack, GitHub, Salesforce y más de 100 otros servicios de terceros mediante Vercel Connect, sin que el desarrollador tenga que gestionar por sí mismo el flujo de autenticación.
El mecanismo se basa en conectores de equipo reutilizables asociados a tokens de vida corta: una vez configurado un conector a nivel de equipo, cada nueva app o agente generado puede reutilizarlo en lugar de volver a solicitar una autenticación completa cada vez. Esto posiciona a v0 como una plataforma capaz de producir agentes integrados en la pila de software de una empresa, no solo interfaces aisladas.
Threads compartidos en Codex y ChatGPT Work
20 de agosto — Codex y ChatGPT Work introducen los «threads compartidos»: un enlace de solo lectura que expone el razonamiento completo de una sesión — enfoque, decisiones, contexto — en lugar de un simple resultado final. El objetivo es evitar reconstruir el contexto de una pull request a partir de capturas de pantalla dispersas durante una revisión de código, una exploración técnica profunda o una entrega de proyecto entre compañeros.
Es una función que se inscribe en la continuidad de los anuncios recientes en torno a ChatGPT Sites (edición colaborativa, personalización de URL) y refuerza el posicionamiento de Codex/ChatGPT Work como herramienta de trabajo en equipo.
Fondos transparentes en preestreno para GPT-Image-2
20 de agosto — La API GPT-Image-2 permite ahora, en preestreno, generar imágenes con fondo transparente. La ventaja práctica es producir assets reutilizables — visuales de producto, elementos de diseño gráfico, maquetas de sitios web, campañas de marketing — que luego se pueden colocar sobre cualquier fondo sin retoque manual de recorte.
Breves
- Zed — Antigravity se instala con un clic desde el ACP Registry de Zed. 🔗 Tweet
- trackio 0.36 — Hugging Face publica una actualización que añade compatibilidad con un nuevo tipo de dato registrable, sin más precisión. 🔗 Tweet
- La IA «full-stack» según Google DeepMind — Paige Bailey descompone el enfoque de extremo a extremo de Google en cinco capas: infraestructura, seguridad, investigación, modelos/herramientas, productos. 🔗 Artículo de Google
- GitHub — mejor gestión de los usuarios bloqueados: búsqueda por nombre, ordenación y paginación de las listas largas. 🔗 Changelog
- GitHub — el anclaje de vistas, proyectos e hitos en la barra lateral del repositorio pasa a disponibilidad general, con varias mejoras relacionadas (avatares de reacciones, densidad del dashboard). 🔗 Changelog
- Manus prolonga el acceso gratuito a Manus 1.6 Lite y Manus 1.6 hasta el 28 de agosto (SGT), dentro del límite de la cuota diaria. 🔗 Tweet
- Manus recuerda a los usuarios notificados que guarden sus datos antes del 23 de agosto a las 7:59 (SGT), antes de su paso a empresa independiente. 🔗 Tweet
- Genspark lanza una promoción hasta el 30 de septiembre: Design + GenTeam al -90 %, GenMail gratis, Slides Ultra Mode al -50 %. 🔗 Tweet
- NVIDIA detalla la repartición entre el arnés de un agente (lo que intenta hacer) y la infraestructura (lo que realmente puede hacer) en un deep dive de seguridad de la pila agéntica. 🔗 Tweet
- NVIDIA publica el balance del Spark Hack Series de Seattle sobre DGX Spark: proyectos ganadores en respuesta a desastres, salud y supervivencia offline con Nemotron y NemoClaw. 🔗 Tweet
- NVIDIA Cosmos 3 — un vídeo de Cosmos Labs muestra el post-training de Cosmos 3 en los socios Aigen y Linker Vision. 🔗 Tweet
- Luma Labs intervendrá sobre agentes creativos durante Summer Signal, organizado con GMI Cloud el 14 de septiembre. 🔗 Tweet
- Synthesia — su CEO es citado en un artículo de Forbes Tech sobre la medición de la adopción de la IA por los resultados y no por el uso. 🔗 Tweet
- Qwen3.8-27B continúa su impulso comunitario: nuevas recetas de inferencia NVFP4 + DFlash2 en el cookbook de SGLang, versiones aligeradas publicadas por Unsloth, 1.ª posición en el ranking del agente de código Cline en cuatro días, y una DGX Station NVIDIA que reporta más de 2713 tokens/segundo en pico agregado en servicio BF16. 🔗 SGLang · 🔗 Unsloth · 🔗 Cline · 🔗 DGX Station
- Qwen3.8-Max ya puede utilizarse en la herramienta de código Kilo Code para la generación de interfaces. 🔗 Tweet
- Kimi Work publica un segundo tutorial para analistas financieros: panel de inversor, actualización de modelos financieros, generación de informes por lotes. 🔗 Tweet
- GLM-5.3 continúa su avance: puntuación de 69 en el ranking oficial DeepSWE, disponibilidad en la plataforma WorkBuddy, y prolongación de Build Week por parte de Z.ai hasta el 23 de agosto a las 18:00 (PT) con 100 millones de tokens gratis para los primeros 50 000 nuevos inscritos en ZCode. 🔗 DeepSWE · 🔗 WorkBuddy · 🔗 Build Week
- GPT-5.6 Sol — tres plataformas de terceros (Router, Cloudflare AI Gateway, OpenCode Zen) ofrecen cada una -50 % hasta mediados de septiembre, además de los descuentos ya cubiertos en Devin, OpenRouter y v0. 🔗 Cloudflare AI Gateway
Lo que esto significa
El anuncio de Anthropic-GitHub de hoy dibuja una tendencia de fondo: la infraestructura agéntica sale de la fase experimental. La GA de computer use y del browser tool en la Claude Platform, combinada con la llegada de Copilot a Slack y Teams, señala que los grandes proveedores ya no se limitan a vender modelos: venden agentes capaces de actuar en las herramientas que los equipos ya usan a diario, sin pasar cada vez por una integración API dedicada. Es un cambio de distribución tanto como de capacidad: el agente va ahora allí donde se hace el trabajo, en lugar de exigir que el trabajo vaya hacia él.
En el terreno de los modelos, DeepSeek-V4-Flash-Vision-Exp confirma que el multimodal se está convirtiendo en un estándar esperado más que en un diferenciador — incluso los actores posicionados en la eficiencia económica (V4-Flash) lo integran ya de forma nativa, con prestaciones que se acercan a las de los mejores modelos cerrados. La competencia en los benchmarks agénticos de código (GLM-5.3 en Code Arena: WebDev, Qwen3.8-27B en Cline) ilustra la misma dinámica del lado de las herramientas de desarrollo: las diferencias de precio entre modelos abiertos y cerrados se estrechan, lo que empuja a OpenAI a bajar sus tarifas API en más de un 20 % sobre GPT-5.6 Sol en la misma línea.
El movimiento hacia la apertura total — no solo de los pesos, sino también de los datos y de la infraestructura de entrenamiento — sigue dando frutos científicos: el estudio de Georgia Tech sobre Olmo 3 simplemente no habría sido posible en un modelo cerrado, del mismo modo que el estudio de Hume AI sobre los sesgos de benchmark ASR recuerda que una puntuación en el leaderboard no garantiza una calidad real de transcripción. Son dos recordatorios útiles en el momento en que la industria multiplica los anuncios de puntuaciones récord.
Por último, la multiplicación de conjuntos de datos masivos con licencia comercial — EgoSuite-Open100K hoy, tras varios anuncios similares en las últimas semanas — confirma que el acceso a datos humanos reales, no solo sintéticos, se está convirtiendo en un reto estratégico para la robótica y la IA encarnada, del mismo modo que el cómputo lo ha sido para los grandes modelos de lenguaje.
Fuentes
- Claude Platform — uso de computadora en GA, herramienta de navegador, Skills API, Files API
- GitHub Copilot en Slack
- GitHub Copilot en Teams
- DeepSeek-V4-Flash-Vision-Exp
- Pika Speech
- Detalle de la arquitectura de Pika Speech
- EgoSuite-Open100K
- Relé de Hugging Face EgoSuite
- Claude Security en Mythos 5
- Bajada de precios de GPT-5.6 Sol (API)
- GPT-5.6 Sol -50% en GitHub Copilot
- GLM-5.3 (Max) en Code Arena: WebDev
- Harvey Tenet
- Georgia Tech traza los orígenes del razonamiento social de Olmo 3
- Sesgo de benchmark optimization en ASR
- SenseNova-U1.5-8B-MoT
- Diffusers 0.40.0
- Google DeepMind × Fenris Creations
- Runway Ruby
- NVIDIA AVO en ARC-AGI-3
- HeyGen Look Packs
- Amp Explain Usage
- v0 Vercel Connect
- Hilos compartidos de Codex / ChatGPT Work
- Fondos transparentes GPT-Image-2
- Zed × Antigravity
- trackio 0.36
- La IA full-stack según Google DeepMind
- GitHub — gestión de usuarios bloqueados
- GitHub — fijado en la barra lateral
- Manus — acceso gratuito ampliado
- Manus — recordatorio de copia de seguridad
- Genspark — promoción
- NVIDIA — seguridad de la pila agéntica
- NVIDIA — hackathon DGX Spark Seattle
- NVIDIA Cosmos 3 — post-training
- DGX Station — Qwen3.8-27B
- Luma Labs — Summer Signal
- Synthesia en Forbes
- Qwen3.8-27B — cookbook SGLang
- Qwen3.8-27B — Unsloth
- Qwen3.8-27B — 1.ª posición en Cline
- Qwen3.8-Max — Kilo Code
- Kimi Work — tutorial para analistas financieros
- GLM-5.3 — puntuación DeepSWE
- GLM-5.3 — WorkBuddy
- GLM-5.3 — Build Week Z.ai
- GPT-5.6 Sol — descuentos de terceros