Buscar

Demis Hassabis propone un Standards Body para los modelos frontera, NVIDIA reivindica 25x de rendimiento por vatio, GPT-5.6 en disponibilidad general en Bedrock

Demis Hassabis propone un Standards Body para los modelos frontera, NVIDIA reivindica 25x de rendimiento por vatio, GPT-5.6 en disponibilidad general en Bedrock

ai-powered-markdown-translator

Artículo traducido del fr al es con gpt-5.4-mini.

Ver proyecto en GitHub ↗

Esta semana está marcada por una toma de posición de Demis Hassabis sobre la gobernanza de la IA frontera, dos publicaciones de NVIDIA cuantificando las ganancias de eficiencia de Blackwell y un nuevo método de investigación guiada por agente, así como la disponibilidad general de GPT-5.6 en Amazon Bedrock. El resto de la actualidad cubre una ola de modelos abiertos (OCR, visión-lenguaje, cuantificación ternaria), varias novedades de GitHub y Manus en herramientas, y la publicación en open source del benchmark WANDR por parte de Perplexity.


Demis Hassabis propone un marco para la IA frontera y un Standards Body

14 de julio — En un largo artículo publicado en X, Demis Hassabis, cofundador y CEO de Google DeepMind, toma posición sobre la trayectoria hacia la inteligencia artificial general (AGI). Considera que un sistema dotado de todas las capacidades cognitivas del cerebro humano probablemente está a solo unos años de distancia, y compara la magnitud de esta ruptura con el descubrimiento de la electricidad o del fuego, con un impacto potencial diez veces superior al de la revolución industrial, a diez veces la velocidad.

Sin embargo, advierte: la carrera comercial y geopolítica actual es tan intensa que no deja el tiempo necesario para comprender bien los riesgos (ciberseguridad y, a medio plazo, riesgos nucleares y biológicos), ni para mantener el control de sistemas cada vez más autónomos y capaces de auto-mejorarse.

Su propuesta central: un Standards Body dedicado a la evaluación de los modelos frontera, sobre el modelo de una asociación público-privada supervisada por el Estado federal estadounidense —al estilo de la FINRA en las finanzas— con un consejo que incluya expertos técnicos independientes y representantes del open source. La financiación, mayoritariamente privada, buscaría atraer talento técnico de primer nivel y financiar el cómputo necesario para pruebas a gran escala. Hassabis sitúa a Estados Unidos como el país mejor posicionado para iniciar esta iniciativa, al tiempo que pide una colaboración internacional sobre las cuestiones de seguridad.

If you stop to think about it, we’ve essentially found a way to make sand think. It’s miraculous. The magnitude of this technology’s impact will be unprecedented, perhaps 10x of the Industrial Revolution at 10x the speed.

🇪🇸 Si lo pensamos bien, básicamente hemos encontrado una forma de hacer pensar a la arena. Es milagroso. La magnitud del impacto de esta tecnología no tendrá precedentes, quizá diez veces la de la revolución industrial, a diez veces la velocidad.@demishassabis en X

🔗 Artículo completo en X


NVIDIA — el rendimiento por vatio, métrica clave de la eficiencia de las infraestructuras de IA

14 de julio — NVIDIA defiende el rendimiento por vatio como la métrica de referencia de la eficiencia de las infraestructuras de IA: en un contexto en el que la potencia eléctrica disponible es la restricción más dura, esta relación determina cuántos tokens puede producir una fábrica de IA dentro de un presupuesto fijo de potencia, y por tanto sus ingresos y su rentabilidad.

La empresa cuantifica las ganancias de su plataforma Blackwell NVL72 frente a la generación Hopper:

Modelo evaluadoGanancia de rendimiento por vatio (Blackwell NVL72 vs Hopper)
DeepSeek V4 Prohasta 25x
GLM 5.1hasta 20x
Kimi K2.6 (cargas agenticas largas)hasta 10x

Parte de estas mejoras proviene del paso de un dominio GPU de 8 unidades (Hopper) a racks integrados de 72 GPU, con un NVLink Switch de sexta generación que integra computación en red (tecnología SHARP). Más allá del hardware, la optimización de software sigue produciendo mejoras sustanciales: hasta 5x de rendimiento adicional en DeepSeek V4 en un solo mes, a través de la pila TensorRT-LLM, Dynamo, SGLang y vLLM.

En el ámbito de la infraestructura eléctrica, la tecnología DSX MaxLPS permitiría hacer funcionar hasta un 40 % más de GPU con el mismo presupuesto de potencia, gracias a la refrigeración por agua templada y al control dinámico de la potencia —teniendo en cuenta que hoy en día solo alrededor del 60 % de la electricidad extraída de la red se convierte realmente en trabajo útil de IA en una fábrica. NVIDIA sitúa este enfoque en la perspectiva de su próxima plataforma Vera Rubin, y cita despliegues en producción en Anthropic, OpenAI, CoreWeave, Perplexity y Fireworks AI.

🔗 Artículo de NVIDIA


NVIDIA — Nemotron Labs: investigación RL autónoma guiada por habilidades de agente

14 de julio — NVIDIA ha presentado «RL Autoresearch», una demostración de investigación en aprendizaje por refuerzo guiada por un agente, apoyada en NeMo RL, NeMo Gym y habilidades reutilizables. El principio: dar a un agente programador un objetivo y un presupuesto de tiempo, y dejarlo construir él mismo el entorno de entrenamiento, entrenar el modelo y evaluarlo, limitándose el investigador a supervisar la orientación general de los trabajos.

En el ejemplo presentado, el agente debía enseñar a un modelo de visión a contar estrellas de colores. El modelo Qwen3-VL-2B pasó del 25 % al 96,9 % de precisión, y el propio agente propuso el siguiente experimento que debía realizarse, sin que se le dictara por parte del investigador.

Un segundo ejemplo, correspondiente al postentrenamiento más que a la investigación autónoma, ilustra un uso parecido: un modelo Cosmos 3 Nano, inicialmente incapaz de detectar un semáforo pese a que era visible en evaluación zero-shot, fue postentrenado con LoRA para la tarea de validación WTS (escenarios de conducción que integran clima, tráfico y señalización). La precisión pasa del 54,41 % al 87,14 % después del LoRA, y luego al 93,35 % al añadir NVIDIA TAO AutoML —todo ello en menos de un día.

We gave a coding agent a goal and a time budget: build a training environment and teach a vision model to count colored stars.

🇪🇸 Le dimos a un agente programador un objetivo y un presupuesto de tiempo: construir un entorno de entrenamiento y enseñar a un modelo de visión a contar estrellas de colores.@NVIDIAAI en X

🔗 Anuncio de Nemotron Labs


Modelos abiertos e investigación

Siete publicaciones marcan esta semana en el ámbito de los modelos abiertos y la investigación, impulsadas especialmente por Hugging Face, Together AI y Sakana AI.

Modelo evaluadoEditorParámetrosLicenciaBenchmark clave
OvisOCR2Autor independiente (HF)0,9 mil millonesApache 2.096,58 en OmniDocBench v1.6
MOSS-VL-RealtimeOpen_MOSS11 mil millonesApache 2.0Contexto de 256 000 tokens
Ternary Bonsai 27BPrismML~27,3 mil millones (ternario)Gratis en Together AI99,20 en MATH-500

OvisOCR2: reconocimiento de documentos con 0,9 mil millones de parámetros

OvisOCR2 reivindica una puntuación de 96,58 en OmniDocBench v1.6 y se presenta como el primer modelo de extremo a extremo en superar a los sistemas en pipeline (OCR, detección de maquetación y análisis tratados por separado). El autor propone una receta que aprovecha Hugging Face Jobs para convertir cualquier conjunto de datos a markdown mediante OCR, sin GPU local. Límite a tener en cuenta: esta puntuación y la calificación de «primer modelo de extremo a extremo» proceden del tuit de anuncio, no verificadas en una ficha de modelo completa.

🔗 Anuncio de OvisOCR2 en X

MOSS-VL-Realtime: visión-lenguaje abierto para vídeo en tiempo real

El equipo Open_MOSS publica un modelo visión-lenguaje de 11 mil millones de parámetros diseñado para el análisis continuo de flujos de vídeo en lugar de imágenes aisladas: sigue observando el vídeo mientras genera su respuesta, puede revisarla si la situación cambia en pantalla, y elige permanecer en silencio cuando no hay suficientes pruebas. Las variantes Base, Instruct y Realtime se publican todas bajo Apache 2.0, con soporte day-0 de los equipos SGLang y LMSYS.

🔗 Anuncio de MOSS-VL-Realtime en X

LeRobot v0.6.0: soporte nativo de profundidad

La biblioteca robótica open source de Hugging Face añade soporte nativo de extremo a extremo para la profundidad (depth): al conectar una cámara Intel RealSense y activar use_depth: true, los mapas de profundidad se sincronizan automáticamente con los flujos RGB, se cuantifican en 12 bits y se codifican en HEVC sin pérdida. La funcionalidad cubre SO-100/101, Koch, OpenArm, reBot y Unitree G1.

🔗 Anuncio de LeRobot v0.6.0 en X

Sakana Marlin: un «Virtual CSO» para la investigación estratégica

Sakana AI lanza un agente de investigación autónomo que realiza un razonamiento en profundidad durante unas 8 horas a través del motor AB-MCTS y un flujo de tipo AI Scientist, para llegar a opciones estratégicas estructuradas en lugar de a un resumen. Los entregables incluyen informe, anexos, referencias y diapositivas. El producto está en beta, con una tarificación por uso (98 yenes por crédito) o una oferta Enterprise bajo presupuesto.

Ternary Bonsai 27B: cuantificación ternaria en formato teléfono

PrismML publica un derivado de Qwen3.6 27B cuantificado en ternario (formato g128, 1,71 bit por peso, unas 9,4 veces más compacto que una base FP16), conservando según el editor el 95 % de la calidad en plena precisión.

Benchmark evaluadoPuntuación
MATH-50099,20
AIME 202590,84
HumanEval+93,90
Media (15 benchmarks thinking)80,49

El modelo admite un contexto de 262 000 tokens y una entrada visual, y se ofrece gratis en la infraestructura serverless de Together AI.

🔗 Anuncio de Ternary Bonsai 27B en X

Flash-BoN: el best-of-N revisitado para la difusión

Sayak Paul (Hugging Face) muestra que el best-of-N constituye una referencia más sólida de lo que se pensaba para la escalada en el momento de la inferencia en difusión, siempre que también se mida el tiempo real de ejecución y no solo el número de evaluaciones de la función. El equipo introduce Flash-BoN, que prioriza una exploración más amplia de las muestras en lugar de validaciones intermedias repetidas.

🔗 Anuncio de Flash-BoN en X

Hugging Face abre ZeroGPU a todos los usuarios

El acceso a las demos ZeroGPU (GPU gratis bajo demanda) ya está disponible para todos los usuarios de Hugging Face, con un agent skill que permite construir una demo directamente desde un prompt en lenguaje natural.


GitHub, Copilot y Manus

El scanning de código muestra detecciones de seguridad por IA en las pull requests

14 de julio — GitHub code scanning ahora muestra detecciones de seguridad asistidas por IA directamente en las pull requests, ampliando la cobertura a lenguajes y frameworks no soportados por CodeQL. La funcionalidad, en preversión pública, sigue siendo informativa: no bloquea la fusión, requiere tener activado el default setup de CodeQL, una licencia de Copilot y consume créditos de IA solo cuando se produce una detección.

🔗 Changelog de GitHub

Dependabot introduce un periodo de latencia por defecto

14 de julio — Dependabot ahora espera tres días por defecto tras la publicación de una nueva versión antes de abrir una pull request de actualización, para limitar la exposición a ataques sobre la cadena de suministro. Este retraso se puede configurar mediante la opción cooldown de .github/dependabot.yml; las actualizaciones de seguridad siguen siendo inmediatas. La funcionalidad llegará a GitHub Enterprise Server a partir de la versión 3.23.

🔗 Changelog de GitHub

/security-review en la app de GitHub Copilot

14 de julio — El comando /security-review está disponible en preversión pública en la app de GitHub Copilot: analiza los cambios de código en curso y devuelve resultados clasificados por severidad y nivel de confianza, con sugerencias aplicables directamente sin salir de la app. Cubre, entre otros, inyecciones, cross-site scripting y path traversal, y está accesible en los planes Free, Pro, Business y Enterprise.

🔗 Changelog de GitHub

Manus genera ahora .pptx nativos

14 de julio — Manus generaba antes diapositivas y luego las convertía en .pptx; ahora produce directamente el archivo PowerPoint nativo, con gráficos realmente editables (se redibujan cuando cambia un valor) y la posibilidad de activar o no las etiquetas, la cuadrícula y la leyenda.

🔗 Anuncio de Manus

Manus lanza la publicación automática de los sitios generados

13 de julio — La nueva opción auto-publish despliega automáticamente cada build exitoso de un sitio en su URL en línea, desactivada por defecto. Combinada con una cola de cambios, elimina el último paso manual entre la construcción y la puesta en producción.

🔗 Anuncio de Manus


Generación de imágenes y vídeo

Wan-Dancer-14B: generación de vídeo de danza en open source

14 de julio — Alibaba libera en open source Wan-Dancer-14B, un modelo ejecutable localmente especializado en la generación de vídeos de danza rítmicos de larga duración, orientado a la sincronización entre movimiento y música en secuencias prolongadas más que a simples clips.

🔗 Anuncio de Alibaba Wan

HeyGen: marca de tiempo palabra por palabra para los avatares en tiempo real

14 de julio — HeyGen documenta un flujo no público de su API Avatar Realtime: un canal de marca de tiempo palabra por palabra ({mot, début, fin}) que permite sincronizar con precisión gestos y habla. La confirmación del envío de un texto llega en unos 70 ms, pero la palabra tarda varios segundos en pronunciarse realmente, de ahí la necesidad de un anclaje recalculado unas cuatro veces por segundo. El mecanismo se ha probado mediante una emisión de Twitch difundida 24h/24, con 9 269 veredictos emitidos en directo.

🔗 Artículo de HeyGen

HeyGen — Figma → HyperFrames, día 9/30

14 de julio — La habilidad /figma importa assets, tokens de marca, componentes, timelines de motion y storyboards directamente desde un archivo Figma. Para la demostración, el equipo importó 27 colores y estilos nombrados y reconstruyó un storyboard de ocho cuadros como un guion de rodaje interpretado en directo.

🔗 Repositorio HyperFrames

NVIDIA — Nemotron: resultados cuantificados de empresas clientes

14 de julio — NVIDIA publica varios casos de clientes cuantificados en torno a los modelos abiertos Nemotron: H Company superó el 76 % de precisión en OSWorld-Verified con Holotron 3 Nano; Harvey postentrenó Nemotron 3 Ultra por un coste por ejecución al menos 10 veces inferior al de alternativas cerradas; Arcee AI reivindica un coste aproximadamente 20 veces menor que un modelo cerrado comparable, situándose al mismo tiempo en segundo lugar en PinchBench; Abridge y YTL AI Labs lo han personalizado respectivamente para conversaciones clínicas y para la lengua malaya.

🔗 Artículo de NVIDIA


Anthropic

Claude for Teachers: acceso gratuito para docentes K-12 en Estados Unidos

14 de julio — Anthropic lanza acceso gratuito a las capacidades premium de Claude para docentes K-12 verificados en Estados Unidos, con una biblioteca de habilidades pedagógicas y una conexión con programas validados a través de Learning Commons, alineados con los estándares de los 50 estados. Las conversaciones nunca se usan para entrenar modelos, y los datos de los alumnos están cubiertos por un acuerdo de tratamiento conforme a la ley FERPA.

🔗 Anuncio de Anthropic

Artifacts : uso compartido público, edición multijugador y creación mediante Claude Tag

13 de julio — Artifacts suma el uso compartido público (cualquiera con el enlace puede consultar), la edición multijugador simultánea (planes Team y Enterprise), y la creación desde Claude Tag en Slack con una simple petición en un hilo de conversación.

🔗 Anuncio de Anthropic


OpenAI

GPT-5.6 en disponibilidad general en Amazon Bedrock

13 de julio — Los tres modelos GPT-5.6 lanzados el 9 de julio — Sol (razonamiento insignia), Terra (intermedio) y Luna (inferencia rápida) — ya están en disponibilidad general en Amazon Bedrock, sobre el nuevo motor de inferencia de Bedrock diseñado para el rendimiento, la seguridad y la escala. Esto amplía los puntos de acceso a GPT-5.6 junto a ChatGPT, la API directa de OpenAI y las integraciones de terceros (Copilot, M365, Warp, Cursor, Devin).

🔗 Anuncio de AWS

Codex, agente recomendado por defecto en JetBrains AI

14 de julio — JetBrains convierte a Codex en el agente recomendado por defecto en JetBrains AI (IntelliJ IDEA, PyCharm, WebStorm), una elección no exclusiva — el usuario puede cambiar a otro agente en cualquier momento — reevaluada cada mes a medida que evolucionan los modelos.

🔗 Anuncio de JetBrains


Gemini

Gemini en Google Chrome lanzado en el Reino Unido

14 de julio — Gemini pasa a ser accesible desde cualquier pestaña de Chrome abierta en el Reino Unido, sin cambiar de contexto: resumir una página, comparar contenidos entre pestañas, responder preguntas sobre lo que se muestra en pantalla.

🔗 Anuncio de Google UK

Primer informe Gemini del Sudeste Asiático: adopción récord y Gemini Spark

14 de julio — Google publica su primer « Gemini Southeast Asia Report »: los usuarios activos se han más que duplicado en un año en los seis principales mercados (Indonesia, Malasia, Filipinas, Singapur, Tailandia, Vietnam), casi el 70 % de las consultas se envían en lengua local, y se han generado 5 mil millones de imágenes mediante Nano Banana durante el último año. Google despliega en esta ocasión Gemini Spark, un agente proactivo capaz de gestionar tareas de Workspace, en lenguas locales para los suscriptores Advanced de la región.

🔗 Informe de Google


Herramientas de dev y agentes

Devin Fusion: un agente preview que enruta hacia Fable 5

13 de julio — Cognition lanza Devin Fusion, un agente en previsualización disponible en Devin Cloud, donde un modelo desempeña el papel de gestor que delega tareas a un modelo más económico en lugar de ejecutarlo todo con un único modelo premium. Según el equipo, Fable 5 se comporta como un gestor que delega redactando especificaciones completas, mientras que otros modelos como Opus 4.8 tienden a microgestionar y a saturar su contexto. Resultado: un coste por tarea inferior al de Opus 4.8, a pesar de un precio unitario de Fable 5 más alto — salvo en la depuración en serie, donde los ahorros siguen siendo más difíciles de conseguir.

🔗 Anuncio de Cognition

Perplexity publica en open source su benchmark WANDR

14 de julio — Perplexity publica WANDR (Wide ANd Deep Research), un benchmark interno diseñado para evaluar agentes de investigación en tareas amplias y profundas: 500 tareas, 170 495 registros verificables individualmente, en tres niveles de dificultad. El corrector vuelve a recuperar cada página citada para verificar que cada afirmación esté respaldada por la evidencia subyacente. En seis sistemas de producción probados, los resultados siguen siendo modestos: 0,363 en F1 flexible y solo 0,133 en F1 estricta, para un coste por tarea que va de 0,03 dólares a 324,83 dólares según la configuración.

🔗 Anuncio de Perplexity en X · Benchmark GitHub


Breves

  • Anthropic compromete 10 millones de dólares canadienses para financiar nuevos trabajos de investigación en IA en Canadá, en colaboración con instituciones locales. 🔗 fuente
  • Cognition cumple un año desde la compra de Windsurf: ingreso anualizado pasado de 73 millones a más de 500 millones de dólares, más de 20 millones de líneas de código escritas, unificación bajo la marca Devin Desktop. 🔗 fuente
  • Amp (Sourcegraph) publica un panel público que muestra en tiempo real el uso de sus modos de agente, tanto para todos los usuarios como para el equipo interno. 🔗 fuente
  • Warp integra Sentry vía MCP, para encadenar análisis de causa raíz (Seer) y creación de pull request sin salir del terminal. 🔗 fuente
  • Composio llega a Warp, conectando los agentes con más de 1 000 aplicaciones (Gmail, Slack, Linear, Google Calendar). 🔗 fuente
  • Zach Lloyd (CEO de Warp) publica un ensayo sobre el paso de los agentes interactivos a unas « cloud software factories » que automatizan todo el ciclo de vida del software. 🔗 fuente
  • Hugging Face Jobs permite ahora montar un directorio local directamente en un Job mediante -v dossier:/chemin, sin paso previo de subida a un repositorio. 🔗 fuente
  • llama.cpp celebra su 10 000.ª publicación (release), sin detalle técnico adicional. 🔗 fuente
  • LlamaCoder v4 (Together AI) genera aplicaciones completas en un solo prompt, reconstruido en torno a GLM 5.2 con un nuevo motor de renderizado WebAssembly, gratuito y open source. 🔗 fuente
  • NotebookLM resume sus funciones recientes (sincronización automática con Drive, fijación de notebooks, reorganización de diapositivas, compartición móvil) a la espera de un próximo anuncio no detallado. 🔗 fuente
  • GitHub permite ahora estimar el coste de licencia de Code Quality (committers activos, proyección mensual) antes de su paso a 10 dólares por committer activo y por mes, previsto para el 20 de julio de 2026. 🔗 fuente
  • NVIDIA lanza « AI Model Co-Design », una nueva serie sobre la sinergia entre dimensiones de los modelos y rendimiento GPU. 🔗 fuente
  • Kling AI presenta el tráiler de ODYSEEUS: The Fall, segundo largometraje de IA del estudio Fountain 0, dirigido por Ash Koosha. 🔗 fuente
  • OpenAI publica una guía Enterprise sobre la dirección de las inversiones en IA en la era agéntica, centrada en la medición del trabajo útil por dólar gastado. 🔗 fuente
  • OpenAI detalla cómo los equipos de ventas utilizan ChatGPT Work para notas de pipeline, preparaciones de reuniones y diagnósticos de acuerdos bloqueados. 🔗 fuente
  • OpenAI detalla cómo los equipos de data science utilizan ChatGPT Work para notas de causa raíz, informes de impacto y especificaciones de paneles de control. 🔗 fuente
  • Cohere copatrocina el hackathon de Hugging Face y premia dos proyectos: Tiny Army (2.ª posición, pista Thousand-Token Wood) y Eyas, agente de videovigilancia (premio al mejor agente). 🔗 fuente

Lo que esto significa

En el plano material, NVIDIA estructura su comunicación en torno a una sola idea: la potencia eléctrica, no el silicio, es ahora la restricción que determina la rentabilidad de una fábrica de IA. Las mejoras de rendimiento por vatio de Blackwell (hasta 25x sobre DeepSeek V4 Pro) y los casos de clientes Nemotron cifrados en decenas de veces menos coste cuentan la misma historia: la eficiencia energética y el coste por token se convierten en el principal argumento de venta, más que la potencia bruta. La demostración de RL Autoresearch va en la misma dirección al aspirar a automatizar el propio ciclo investigación-entrenamiento-evaluación, hasta ahora en gran medida manual.

En cuanto a los modelos abiertos, la semana ilustra una rápida diversificación de nichos: reconocimiento de documentos ultraligero (OvisOCR2), comprensión continua de vídeo (MOSS-VL-Realtime), robótica con profundidad nativa (LeRobot), y sobre todo la cuantificación ternaria de Bonsai 27B, que hace caber una capacidad multimodal de clase 27 mil millones de parámetros en una huella de memoria propia de un teléfono. Estas publicaciones, impulsadas por Hugging Face, Together AI, Sakana AI y equipos independientes, muestran un ecosistema open source que sigue muy de cerca las capacidades de los modelos cerrados al tiempo que reduce de forma importante los costes de inferencia.

En el terreno de la gobernanza, la intervención de Demis Hassabis contrasta con el tono habitual de los anuncios de producto: plantea de forma explícita que la carrera comercial actual deja atrás la comprensión colectiva de los riesgos, y propone un mecanismo concreto — un Standards Body inspirado en la FINRA — en lugar de una simple llamada a la prudencia. Que esta propuesta venga del CEO de Google DeepMind, en plena semana de lanzamientos de producto por lo demás, ilustra la tensión entre ritmo comercial y anticipación regulatoria que atraviesa todo el sector.

Por último, el tooling para desarrolladores sigue reconfigurándose en torno a la delegación entre modelos más que a la carrera por un único modelo más potente: Devin Fusion apuesta por un modelo gestor que delega en un modelo ejecutor más barato, GitHub amplía su escaneo de seguridad asistido por IA directamente en los pull requests, y Perplexity abre su benchmark WANDR para objetivar los límites reales de los agentes de investigación — un recordatorio útil de que incluso los mejores sistemas actuales siguen lejos de una fiabilidad completa en tareas de verificación factual a gran escala.


Fuentes