Buscar

Sol-H3 genera vídeo más rápido que su reproducción, CMS Manhattan apuesta por el procesador, un corpus marca temporalmente 106 892 ruidos en 58 idiomas

Artículo generado por inteligencia artificial
Sol-H3 genera vídeo más rápido que su reproducción, CMS Manhattan apuesta por el procesador, un corpus marca temporalmente 106 892 ruidos en 58 idiomas

ai-powered-markdown-translator

Artículo traducido del fr al es con gpt-5.6-sol.

Ver proyecto en GitHub ↗

NVIDIA Research publica Sol-H3, una pila de inferencia que reduce la generación de cinco segundos de vídeo por debajo de la duración de reproducción del clip, bajo licencia Apache 2.0. Ese mismo día, un editor publica en Hugging Face dos líneas de modelos optimizadas para el procesador, con promesas que ninguna medición respalda, mientras que un equipo indio abre un corpus de habla con ruido en el que cada marca temporal pasa por una cadena de verificación documentada. Google Research amplía además a Asia sus pruebas de rutas aéreas que evitan las estelas de condensación.


Sol-H3 genera cinco segundos de vídeo en 1,653 segundos, más rápido que su reproducción

7 de septiembre — El equipo Efficient AI de NVIDIA Research, junto con su laboratorio de Singapur, publica Sol-H3, una pila de inferencia completa para el modelo de vídeo MiniMax-H3. El resultado cabe en una frase: cinco segundos de vídeo en 1344×768 a 24 fotogramas por segundo, con audio estéreo generado en la misma pasada, producidos en 1,653 segundos en un sistema con ocho aceleradores B300 Blackwell. Por tanto, el modelo crea el clip más rápido de lo que un espectador tarda en verlo.

La comparación abarca perfiles completos, no un simple cambio del kernel de atención. El perfil de referencia, Base H3 Dense, consume 50 pasos del planificador, es decir, 49 pasadas hacia delante de la red DiT; Sol-H3 utiliza solo cuatro.

Configuración de hardwareDuración generadaBase H3, 50 pasosSol-H3, 4 pasosAceleración
8× B3005 s18,250 s1,653 s11,04×
8× B30010 s50,660 s3,732 s13,57×
8× B30015 s99,513 s6,612 s15,05×
4× B3005 s35,328 s2,918 s12,11×
4× B30015 s194,930 s12,542 s15,54×
1× B3005 s129,898 s13,745 s9,45×

La aceleración alcanza un máximo de 15,54×, logrado con cuatro B300 para quince segundos de vídeo. El protocolo es inusualmente explícito: medianas de tres ejecuciones tras el calentamiento, con el mismo prompt y la misma semilla; el cronómetro incluye la codificación del texto, la eliminación de ruido DiT y la decodificación VAE, pero excluye la carga del modelo y la codificación MP4 final.

La pila reúne dos componentes desarrollados por separado: Sol-Engine para el runtime de inferencia de vídeo y Sol-Attn para la atención dispersa (sparse attention) aplicada sobre la marcha, sin reentrenamiento. A ello se añaden kernels fusionados, comunicación entre GPU en INT8 para las proyecciones QKV y en FP8 para las salidas, decodificación VAE paralelizada y procesada por lotes, y almacenamiento en caché de los parámetros AdaLN. La preparación de la atención dispersa baja de 1,206 a 0,285 milisegundos, la decodificación VAE de 7,55 a 0,602 segundos, y se liberan aproximadamente 24 GB de memoria por GPU.

Dos decisiones hacen que la publicación sea útil más allá de la demostración: el código se publica bajo licencia Apache 2.0 y cualquier LoRA de pocos pasos (few-step) ya entrenado para MiniMax-H3 se conecta al mismo runtime. Un acceso API abierto con Reactor desde el primer día evita tener que inmovilizar ocho B300 para probarlo.

For us, the bigger milestone is crossing from “fast generation” into “faster than playback.” That opens the path toward continuous 24 FPS generation and truly interactive video systems.

🇪🇸 Para nosotros, el verdadero hito es pasar de la «generación rápida» a «más rápido que la reproducción». Esto abre el camino hacia la generación continua a 24 FPS y hacia sistemas de vídeo realmente interactivos.@xieenze_jr en X

🔗 Página del proyecto Sol-H3, NVIDIA Research

🔗 Acceso API desde el primer día mediante Reactor


Un corpus abierto marca temporalmente 106 892 ruidos reales en 58 idiomas indios

7 de septiembre — El equipo ARTPARK del Indian Institute of Science publica el Vaani Noise Event Timestamp Dataset, una capa de anotación humana añadida al corpus de habla espontánea Project Vaani. Cada ruido de fondo incluye su tipo y sus instantes de inicio y fin, con precisión de milisegundos.

Propiedad del corpusValor
Audio anotado en totalmás de 122 horas
Eventos de ruido con marca temporal106 892, en 7 categorías
Segmentos de habla y hablantes72 756 segmentos, 38 541 voces
Cobertura lingüística y geográfica58 idiomas, 30 estados
Conjunto verificado y conjunto en brutounas 22 h y unas 100 h

El aspecto metodológico clave es este: el habla y el ruido se captaron juntos, con teléfonos corrientes, sin insertar ruido sintético ni mezclarlos a posteriori. Los sonidos humanos no vocales, la tos y la risa aparecen en aproximadamente el 38 por ciento de los segmentos, pero duran menos de medio segundo; los animales y el tráfico son menos frecuentes y mucho más largos, y juntos representan la mayor parte del tiempo de ruido. Cada marca temporal pasa por una anotación, una verificación de coherencia, una nueva verificación interna y, después, una auditoría independiente sobre una décima parte del corpus seleccionada al azar: si falla una sola, se rehace el lote completo.

🔗 Publicación de ARTPARK-IISc en Hugging Face


CMS Manhattan publica dos líneas de modelos para procesador, sin benchmarks que las respalden

6 de septiembre — El editor CMS Manhattan publica en Hugging Face dos lanzamientos de pesos abiertos destinados a la inferencia en procesador en lugar de tarjeta gráfica. Ambas entradas están autopublicadas por el editor de los modelos, y todo lo que sigue se presenta como tal.

La primera, la serie JiRack Ultra, reúne cuatro modelos con pesos ternarios de 1,58 bits al estilo de BitNet, derivados, según el editor, de la arquitectura DeepSeek-R1-Distill-Qwen-32B. El elemento más interesante no es la cuantización, sino el tokenizer, ampliado con tokens dedicados al enrutamiento, las llamadas a herramientas, las etiquetas de control robótico y los medios, lo que apunta a sistemas de agentes y robótica integrada. La segunda, JiRackDeltaNet_27b, parte de un Qwen 3.8 de 27 mil millones de parámetros migrado a una arquitectura DeltaNet, que alterna atención completa y capas Gated DeltaNet emparentadas con los modelos de espacio de estados, con un contexto anunciado de 262 144 tokens.

Línea de modelosBase anunciada por el editorFormato de los pesos publicadosLicencia y packaging
JiRack Ultra, cuatro tamañosDeepSeek-R1-Distill-Qwen-32Bpesos ternarios de 1,58 bits, GGUF Q2_K a Q4_K_Mpesos en el Hub, imágenes Docker e interfaz mediante suscripción
JiRack DeltaNet 27BQwen 3.8 27B migrado a DeltaNetGGUF llama.cpp ordinarios producidos a partir de FP16pesos bajo licencia MIT, imagen Docker e interfaz por 12 dólares por usuario y por año

Dos reservas son importantes para el lector. Pese a las etiquetas ternary y bitnet del repositorio DeltaNet, la línea GGUF publicada corresponde a cuantizaciones llama.cpp ordinarias y no a un punto de control ternario distinto, algo que la propia entrada reconoce. Y la promesa de una calidad cercana a Opus 4.6 Max que sirve de título a la segunda entrada no está respaldada por ningún resultado de benchmark: falta precisamente eso, una medición comparativa publicada, para evaluar estos modelos más allá de su documentación.

🔗 Serie JiRack Ultra en Hugging Face

🔗 JiRack DeltaNet 27B en Hugging Face


Por qué los entornos de RL funcionan hoy y no en 2016

7 de septiembre — Sergio Paniego publica en el blog de Hugging Face una retrospectiva que parte de una observación desconcertante: la descripción de OpenAI Universe, publicada en diciembre de 2016, podría aparecer tal cual en una entrada de un laboratorio puntero actual. Sin embargo, el repositorio está archivado.

La cronología va desde Arcade Learning Environment en 2012 hasta OpenAI Gym en 2016 y su vocabulario mínimo, reset() y step(), trasladado desde entonces a Gymnasium bajo la Farama Foundation. Después llega la oleada por dominios, desde World of Bits hasta WebArena y luego SWE-bench y Terminal-Bench: una tarea suele comenzar como benchmark antes de convertirse en un terreno de entrenamiento.

El núcleo del análisis se resume en cinco piezas que faltaban en 2016: ningún modelo preentrenado digno de servir como punto de partida, una tarea fuera de alcance, una interfaz diseñada para humanos en vez de máquinas, ninguna receta para las recompensas dispersas y la imposibilidad de orquestar miles de sandboxes desechables. GRPO y las recompensas verificables proporcionan hoy la cuarta. El artículo concluye con OpenEnv, una interfaz estándar anunciada en octubre de 2025 por el equipo de PyTorch de Meta y Hugging Face, y con un mercado de entornos en el que figuran Prime Intellect y Mechanize.

🔗 Retrospectiva sobre los entornos de RL


Google hace que más de 80 vuelos de Cathay Pacific sigan una ruta que evita las estelas

7 de septiembre — Google Research amplía a Asia-Pacífico sus pruebas para evitar las estelas de condensación, con Cathay Pacific como primer socio aéreo comercial de la región. La solución es sencilla sobre el papel: ajustar ligeramente la altitud para rodear las zonas frías y húmedas donde las estelas persisten formando capas que retienen el calor.

Medición de la primera faseValor
Vuelos seleccionados en la red de Cathay Pacificmás de 100
Vuelos que siguieron efectivamente una ruta de evasiónmás de 80
Reducción estimada del impacto de calentamiento de las estelasalrededor del 40 %
Proporción del corredor Hong Kong-Singapur en las mejorasmás del 50 %
Proporción de las estelas en el impacto climático de la aviaciónalrededor de un tercio

El sistema combina predicciones producidas por los modelos de Google, imágenes por satélite y datos meteorológicos avanzados. Las previsiones llegan a la cabina mediante el Wi-Fi de a bordo y el registro de vuelo electrónico de la aerolínea (Electronic Flight Folder), sin interrumpir los procedimientos habituales, y los ajustes se mantienen dentro de los parámetros de seguridad establecidos. Se inicia una segunda fase ampliada, con Contrails.org como socio.

Contrail mitigation remains one of the most immediately available, scalable, and cost-effective ways to reduce aviation’s climate footprint, and it can get started now, with today’s aircrafts and fuel.

🇪🇸 La mitigación de las estelas de condensación sigue siendo una de las formas más inmediatamente disponibles, generalizables y económicas de reducir la huella climática de la aviación, y puede comenzar ahora mismo, con los aviones y los combustibles actuales. — Kemal Armada y Max Vogler, Google Research

🔗 Publicación de Google Research


Genspark añade Muse Spark 1.3 a tres de sus productos

7 de septiembre — Genspark integra Muse Spark 1.3, el modelo de Meta, en AI Chat, Code Agent y Claw, cinco días después de su anuncio. La plataforma retoma las dos cifras expuestas por Meta para justificar la elección: un 20 por ciento menos de llamadas a herramientas y un 25 por ciento menos de gasto en tokens, dos métricas que influyen directamente en el coste de un agente que trabaja en bucle sobre tareas largas.

El ritmo es la verdadera señal. En seis días, Genspark ha integrado cuatro modelos de distintos proveedores: Claude Fable 5.1 el 2 de septiembre, Gemini 3.8 Flash el 3, GPT-6 Astra el 5 y Muse Spark 1.3 el 7. La plataforma se posiciona menos como un modelo y más como una capa de orquestación que absorbe los lanzamientos de todos los laboratorios en los días posteriores a su publicación.

🔗 Anuncio de Genspark en X


Breves

  • Replit abre su primera oficina internacional en Londres — la empresa la convierte en el centro de sus operaciones europeas, junto con el alcalde de Londres Sadiq Khan, el Gobierno británico y London & Partners, y anuncia un programa piloto de capacitación con TLMA para jóvenes londinenses sin empleo ni formación. 🔗 Publicación
  • Tolquane, una biblioteca Python de paralelismo componible — un mismo grafo se ejecuta sin cambiar el código mediante threads, procesos, async, de forma distribuida o secuencial, a 5,6 veces la velocidad de referencia en Python 3.14t sin bloqueo global, frente a 0,9 veces mediante threads con el GIL. La ausencia de bloqueos se establece como regla de diseño, con un error que identifica los nodos bloqueados. 🔗 Entrada
  • Una acción específica para instalar una habilidad de agente — el firmware Aiden ahora dirige una URL de habilidad hacia una acción única que prepara, valida y luego publica de forma atómica. La reproducción con un agente real reduce una traza de múltiples herramientas a una sola llamada. 🔗 Entrada
  • Together AI enfrenta GLM-5.3 Flash a GPT-5.6 Terra en cuanto al coste por tarea — la misma puntuación en el índice de inteligencia de Artificial Analysis, pero un 82 por ciento menos por tarea según el proveedor de alojamiento, que no publica ni el método de cálculo ni una entrada detallada y sirve él mismo el modelo comparado. 🔗 Publicación
  • Un manifiesto por un ecosistema brasileño de IA — texto en portugués que desarrolla la metáfora del ecosistema natural para la comunidad de IA del país, sin modelo, conjunto de datos ni medición. Incluido por exhaustividad. 🔗 Entrada
  • Google DeepMind selecciona 16 organizaciones para su aceleradora AI for the Planet en Asia-Pacífico — primera promoción, iniciada con un curso intensivo (bootcamp) en Singapur y seguida de tres meses de acceso a los modelos AnthroKrishi, ForestCast, AlphaEarth Foundations, SpeciesNet y Perch, distribuidos entre protección de la naturaleza, agricultura sostenible y soluciones de carbono. 🔗 Entrada
  • GitHub vuelve a destacar los canvases de su aplicación Copilot — relanzamiento de un artículo del 17 de agosto que presenta el canvas como una superficie compartida y persistente en la que el estado del trabajo permanece visible, con una cifra pocas veces publicada: entre 2 000 y 3 000 AI Credits para construir cada uno de los dos ejemplos citados. 🔗 Publicación
  • GitHub lanza un generador de alias para GitHub Universe — iniciativa promocional para la comunidad antes de la edición de octubre de 2026, sin relación con la IA ni con una funcionalidad del producto. 🔗 Publicación
  • Synthesia detalla sus tres líneas de investigación para ECCV 2026 — avatares generativos controlados mediante audio, investigación de voz aplicada al reconocimiento de voz y avatares interactivos, bajo la bandera del modelo de mundo centrado en el ser humano. 🔗 Publicación
  • Mati Staniszewski sitúa la prueba de Turing conversacional a seis o doce meses vista — el cofundador y director ejecutivo de ElevenLabs lo afirma en el podcast GDIY, cuya entrevista se ofrece doblada al francés por el servicio de audio de la empresa. 🔗 Publicación
  • QwenCloud publica el resumen de la Qwen Conference Thailand 2026 — cerca de 400 clientes y desarrolladores en Bangkok el 4 de septiembre, y una demostración integral en la que el propio agente es el cliente, desde el registro hasta el pago y la facturación sin intervención humana. 🔗 Publicación
  • Cohere difunde un reportaje de CNN sobre Toronto como centro mundial de la IA — comunicación sin anuncios de producto, que remite al tercer puesto mundial de la ciudad en talento tecnológico según CBRE, a los más de 2 000 millones de dólares comprometidos por la estrategia nacional canadiense y al aumento de las solicitudes de clientes declarado por Cohere tras los controles a la exportación impuestos a los modelos de Anthropic. 🔗 Publicación

Qué significa

El umbral superado por Sol-H3 no es un récord más en una lista. Mientras producir un clip requiera más tiempo que verlo, la generación de vídeo seguirá siendo un trabajo por lotes: se inicia, se espera y se visualiza. Bajar de ese umbral abre otra categoría de uso, aquella en la que la imagen se genera mientras se contempla. El detalle importante para un profesional es que la mejora no procede de un modelo nuevo: el modelo es el mismo; solo cambia la pila de inferencia. Por tanto, el factor 15 se encontraba en la ingeniería de ejecución, no en los pesos, y se publica bajo Apache 2.0 con compatibilidad con los LoRA existentes.

La jornada contrapone dos formas de publicar pesos abiertos. Por un lado, dos entradas autopublicadas cuyas afirmaciones de calidad no se sustentan en ninguna medición comparable, con etiquetas de repositorio que no corresponden al formato realmente entregado, y una comparación del coste por tarea anunciada por el proveedor de alojamiento del modelo ganador sin publicar el método. Por otro, un corpus de voz en el que cada marca de tiempo pasa por una cadena de auditoría y donde el equipo separa explícitamente 22 horas verificadas de otras 100 que no lo están. En un repositorio público donde cualquiera puede publicar, el rigor de la verificación se convierte en la única señal aprovechable, y producirla cuesta más que un título llamativo.

La retrospectiva sobre los entornos RL y el ritmo de integración de Genspark describen el mismo desplazamiento, a dos escalas. La primera explica por qué una idea de 2016 funciona hoy: no faltaban los algoritmos, sino la infraestructura que los rodea, desde el modelo inicial hasta los sandboxes desechables. La segunda muestra en qué se convierte esta infraestructura una vez disponible, cuando una plataforma conecta cuatro modelos de cuatro proveedores en seis días. En ambos casos, el valor migra del modelo a la capa que lo rodea, y esa capa se estandariza, con OpenEnv por un lado y los orquestadores multimodelo por otro.

Queda lo que no forma parte de la carrera de modelos. El ensayo con Cathay Pacific trata de aviones y combustibles existentes: lo único añadido es una previsión entregada en el momento adecuado en la cabina, para una reducción estimada de alrededor del 40 por ciento en los vuelos afectados. El corpus Vaani abarca 58 lenguas indias, varias de las cuales carecían de recursos de voz con ruido, y la aceleradora de Asia-Pacífico de DeepMind distribuye modelos especializados a dieciséis equipos sobre el terreno. Estos tres trabajos no tienen ningún benchmark que superar. Su dificultad está en otra parte: en los datos que hay que recopilar y en lograr un despliegue exitoso, y también ahí es donde se decide la diferencia entre una demostración y un efecto medible.


Fuentes