Buscar

Meta publica seis artículos de matemáticas escritos con Muse Spark, Perplexity lanza su Decisions API, Anthropic abre la Claude Frontier Academy

ai-powered-markdown-translator

Artículo traducido del fr al es con gpt-6.1-sol.

Ver proyecto en GitHub ↗

El viernes 2 de octubre, Meta publica seis artículos de matemáticas elaborados por investigadores con su modelo Muse Spark; según Meta, cinco de ellos responden a preguntas de investigación que seguían abiertas. Anthropic destina 100 millones de dólares a formar a 10 000 ingenieros de despliegue con la Claude Frontier Academy y publica Claude Code 2.1.288, mientras que NVIDIA anuncia un DGX Spark de 64 Go a partir de 4 999 dólares. Dos anuncios de la noche anterior completan la jornada: la Decisions API de Perplexity, que responde con probabilidades mediante un modelo publicado con pesos abiertos, y el satélite de Google que lleva sus primeras TPU a la órbita.


Meta publica seis artículos de matemáticas escritos con Muse Spark, Ai2 abre AstaBrief, la IA de Google predice la gripe

2 de octubre — Meta publica en su blog de investigación seis artículos de matemáticas elaborados por investigadores con Muse Spark, su modelo propio. Según Meta, cinco de ellos responden a preguntas de investigación hasta entonces abiertas, sin que la entrada precise cuál es la excepción. Los matemáticos han trabajado estos últimos meses con Muse Spark 1.1 y 1.2 en modo Thinking, directamente en la interfaz de chat de meta.ai, sin una estructura de investigación a medida (custom research scaffold).

Following gold-medal-level performance from our AI models across five competitions in mathematics, physics, and chemistry, we asked a harder question: can AI contribute when a problem is genuinely open and without an existing solution path?

🇪🇸 Tras el rendimiento de nuestros modelos de IA al nivel de una medalla de oro en cinco competiciones de matemáticas, física y química, nos planteamos una pregunta más difícil: ¿puede la IA contribuir cuando un problema está realmente abierto y no existe ningún camino hacia su solución? — @AIatMeta en X

El protocolo presentado es estricto: un equipo de matemáticos guía la investigación, un segundo grupo revisa el trabajo y cada artículo señala los pasajes redactados principalmente por los investigadores o por la IA. La aportación del modelo varía mucho de un artículo a otro, desde cálculos auxiliares hasta la redacción de secciones enteras:

Área matemáticaResultado anunciado por MetaAportación de Muse Spark según Meta
ProbabilidadUmbral estricto para ajustar un elipsoide que pase por puntos gaussianos aleatorios en dimensiones altasEstrategias de demostración
Ecuaciones diferencialesExplosión en tiempo finito de las soluciones radiales de energía negativa de la ecuación de Schrödinger no lineal biarmónica de masa crítica, pregunta abierta desde 2015Cálculos, prueba de argumentos, revisión de la demostración
Teoría de gruposUn grupo semiabeliano no es necesariamente monomial: contraejemplo de orden 384 a una conjetura de M. Kida (2024)Programa de búsqueda escrito en GAP, que encontró el contraejemplo
OptimizaciónRegla exacta que indica cuándo una relajación por ciclos captura el problema originalReformulación probabilística, contraejemplo, estrategia de demostración
Física aritméticaLa función de dos puntos de la teoría de cuerdas p-ádica es igual a una función de altura, en una clase de curvas mucho más amplia que la curva de TateDemostraciones candidatas, tres secciones técnicas redactadas
Álgebra no asociativaContraejemplo de dimensión 3 a una conjetura sobre las álgebras de evolución resolublesContraejemplo y caracterizaciones alternativas

Meta reconoce que tres de estos problemas también se han resuelto en otros lugares: tres trabajos publicados en agosto sobre el umbral gaussiano, un contraejemplo a la conjetura de Kida comunicado el 16 de septiembre por el agente de IA Nilradical y contraejemplos sobre las álgebras de evolución de Hu y Wen. Según Meta, sus propios resultados se obtuvieron de forma independiente, mediante otros enfoques. El anuncio sigue al de OpenAI, que afirmaba el 21 de septiembre que un modelo interno había resuelto más de 100 problemas abiertos; Meta insiste en el uso de un modelo disponible para el público general, tal cual, y en la transparencia sobre la contribución de la IA, con todas las demostraciones verificadas, corregidas y reescritas por matemáticos.

🔗 Resolver juntos problemas abiertos de investigación (Meta AI Research)

AstaBrief 8B: Ai2 abre un modelo que redacta informes científicos con citas

2 de octubre — Ai2 abre AstaBrief 8B, un modelo que transforma una pregunta de investigación y extractos de la literatura en un informe científico con citas. Ahora impulsa el modo Fast de la función «Generar un informe» de Asta, la plataforma agéntica de Ai2 para la ciencia, junto al modo Thinking impulsado por Claude. La receta sigue siendo sencilla: Qwen3-8B, un ajuste supervisado (SFT) con 47 000 ejemplos producidos por el pipeline ScholarQA y, después, una optimización directa de preferencias (DPO) con unas 6 000 parejas, sin aprendizaje por refuerzo. Los pesos, bajo licencia Apache-2.0 según la ficha del modelo, y los datos de entrenamiento están publicados: un laboratorio puede ejecutarlo en su propio hardware.

El modelo escribe su informe en una sola pasada. En todo el pipeline de Asta, un informe tarda de media 51,1 segundos en modo Fast frente a 178,5 en modo Thinking, es decir, unas 3,5 veces más rápido. En un pequeño estudio con personas (14 preguntas, 3 investigadores), DR Tulu gana en preferencia global, pero dos de los tres investigadores prefieren AstaBrief por la exactitud de las citas. Ai2 advierte de que la mayor parte del entrenamiento y la evaluación data de 2025 y no se ha repetido frente a los modelos actuales.

🔗 Publicación de AstaBrief como open-source (Ai2)

Gripe: un modelo diseñado con la IA de Google ocupa el primer puesto entre 39 en la evaluación FluSight de los CDC

30 de septiembre — Google anuncia que un modelo de predicción de la gripe diseñado con su IA ha sido el mejor de la temporada 2025-2026 en FluSight, el sistema de los Centros para el Control y la Prevención de Enfermedades (CDC) de Estados Unidos que reúne cada semana, de octubre a mayo, las predicciones de ingresos hospitalarios. El informe de fin de temporada de los CDC lo confirma: de los 39 modelos seleccionados entre los 53 presentados por 34 equipos, el primero de los modelos individuales es Google_SAI-FluEns, con un WIS relativo de 0,56 (una puntuación de error: cuanto más baja, mejor es la predicción), por delante de tres modelos con 0,58, entre ellos OHT_JHU-nbxd. El conjunto FluSight, que los CDC utilizan para su comunicación pública, ocupa el 7.º puesto.

Estas predicciones se desarrollaron con Empirical Research Assistance (ERA), una herramienta de IA de Google que genera algoritmos de optimización para distintos ámbitos científicos, abierta a evaluadores de confianza. El artículo de investigación asociado describe un sistema autónomo que escribe, evalúa y mejora su propio código de predicción mediante una búsqueda en árbol guiada por un LLM; también ha producido modelos para el COVID-19 y el virus respiratorio sincitial (VRS).

🔗 Entrada de Google Research · Informe FluSight 2025-2026 de los CDC


Perplexity lanza la Decisions API y abre pplx-decider-v1-27b, llama.cpp sirve modelos de decisión

1 de octubre — Perplexity abre una nueva API, la Decisions API, y publica bajo licencia Apache 2.0 el modelo que la impulsa, pplx-decider-v1-27b. El anuncio se publicó por la noche a través de @perplexitydevs, la cuenta para desarrolladores de la empresa. En lugar de redactar una respuesta, este modelo de decisión (decision model) devuelve una distribución de probabilidades sobre un conjunto fijo de respuestas: lee texto, JSON o imágenes, pero no escribe respuestas, no genera código ni explica su razonamiento.

Se contemplan tres tipos de preguntas: noul devuelve la probabilidad de un sí, choice elige entre 1 y 255 opciones con una probabilidad para cada una y un índice de confianza, y score sitúa el contenido en una escala de hasta 10 niveles. Una solicitud puede plantear hasta 128 preguntas sobre un mismo contenido y debe mantenerse, incluidas las preguntas, por debajo de 262 144 tokens de entrada. La tarifa es de 0,04 dólares por millón de tokens de entrada, la salida es gratuita y no se cobra ninguna tarifa por solicitud; cada organización puede enviar 10 solicitudes por segundo, independientemente de su plan. Perplexity apunta a la clasificación, el enrutamiento y la puntuación según una rúbrica: su ejemplo de referencia (cookbook) clasifica tickets de soporte, con la Decisions API encargándose de la primera decisión y la Agent API de los casos escalados.

El modelo se ha ajustado a partir de Qwen3.8-27B; sus pesos, disponibles en Hugging Face, requieren una GPU CUDA capaz de alojar unos 49 Gio, además de la memoria de trabajo. Su ficha lo compara con Jev, otro modelo de decisión, y con su modelo base en once benchmarks; los resultados de pplx-decider-v1-27b se miden mediante la API de Perplexity:

Benchmark (precisión)Puntuación de JevPuntuación de Qwen3.8-27B (modelo base)Puntuación de pplx-decider-v1-27b
WinoGrande90,70 %73,10 %83,30 %
FinancialPhraseBank76,98 %75,68 %84,18 %
RAGTruth77,27 %61,53 %88,80 %
JudgeBench78,57 %68,86 %78,29 %
BBH94,27 %72,80 %82,80 %
JevBench public hard73,27 %72,28 %70,30 %
TabFact89,80 %78,60 %90,60 %
ContractNLI77,45 %80,78 %80,78 %
Circa84,60 %87,00 %89,20 %
Belebele95,00 %93,20 %94,00 %
TruthfulQA binary92,00 %82,80 %85,40 %
Global (según la ficha)84,51 %74,76 %85,71 %

En la fila Global, destacada en el anuncio, pplx-decider-v1-27b supera a Jev, con un 85,71 % frente a un 84,51 %, pero la ficha no precisa cómo se calcula esta fila. Según la tabla publicada, Jev sigue por delante en seis de los once benchmarks, incluidos BBH y WinoGrande, y en JevBench public hard el modelo de Perplexity queda incluso por detrás de su modelo base.

🔗 Anuncio de @perplexitydevs · Documentación de la Decisions API · pplx-decider-v1-27b en Hugging Face

llama.cpp sirve modelos de decisión con la API /v1/systemone, compatible con Jev

2 de octubre — El servidor de llama.cpp ya puede servir modelos de decisión mediante un nuevo endpoint, /v1/systemone, incorporado con la PR n.º 29818, fusionada el 2 de octubre. La entrada de ggml-org, firmada por Xuan-Son Nguyen y Victor Mustar, describe el principio: se envían un estado (texto, JSON, captura de pantalla) y preguntas tipadas, choice, score (de 2 a 10 niveles) o noul (sí o no), y el modelo devuelve una probabilidad por opción en una sola pasada. La API adopta el formato System One introducido por Jev, el modelo de TypeSafe: un cliente existente solo tiene que cambiar su URL base. Un modo de enrutamiento carga varios modelos bajo demanda en el mismo servidor.

Modelo de decisión compatibleTamaño del modeloModelo baseMediana de tiempo por pregunta
Julia-1 (más de 50 idiomas)144MmmBERT-small3 ms
Laya421MModernBERT-large5 ms
Kev-4B4BQwen3.5-4B-Base12 ms
lev4BQwen3.5-4B36 ms
OpenJev (también lee imágenes)27BQwen3.8-27B43 ms

Los tiempos se miden en una NVIDIA RTX PRO 6000. Próximo modelo anunciado: Clef, que Cloudflare presentó el 1 de octubre con una API compatible con la de Jev; ggml-org creó el 2 de octubre los repositorios GGUF de Clef y Clef-flash en Hugging Face.

🔗 Novedad en llama.cpp: modelos de decisión


Anthropic lanza la Claude Frontier Academy y compromete 100 millones de dólares para formar a 10 000 ingenieros

2 de octubre — Anthropic lanza la Claude Frontier Academy, un programa de formación respaldado por un compromiso de 100 millones de dólares. El objetivo es formar a 10 000 ingenieros de despliegue de vanguardia (Frontier Deployed Engineers, FDE) de aquí a finales de 2027. Las primeras cohortes reúnen a ingenieros de Accenture, Bain, Capgemini, Commonwealth Bank of Australia, Deloitte, McKinsey, Morgan Stanley y Novo Nordisk.

El primer programa, la Frontier Deployed Engineer Residency, sigue el modelo de la formación médica. Según la página del programa, comienza con un módulo intensivo de cuatro días: tres días presenciales construyendo un sistema Claude para una empresa simulada, seguidos de una prueba evaluada que otorga la insignia Claude Resident Engineer. A continuación vienen doce semanas de residencia para llevar a cabo un despliegue de Claude en la propia organización, y después una evaluación final para obtener la insignia Claude Frontier Deployed Engineer; se espera que las primeras se otorguen a principios de 2027.

El acceso sigue cerrado: participación por nominación, acceso anticipado reservado a clientes y socios seleccionados, y cohortes en San Francisco, Nueva York y Londres. La Academy amplía el Claude Partner Network (46 000 empresas, más de 175 000 certificaciones), lanzado en marzo con 100 millones de dólares; la publicación no aclara si la nueva asignación se suma a esa cantidad.

🔗 Anuncio de Anthropic · Página del programa


Agentes: Claude Code 2.1.288, GLM 5.3 en Cursor, Replit, DeepSeek Harness y el banco de pruebas SWE-sweep

Claude Code 2.1.288 elimina el límite de los comandos en segundo plano en sesiones interactivas

2 de octubre — Claude Code 2.1.288 llega con 89 entradas, entre ellas 64 correcciones. El cambio más visible afecta a los comandos ejecutados en segundo plano: el límite de tiempo introducido por la 2.1.285 (30 minutos por defecto, 2 horas como máximo) solo se aplica ahora a las sesiones sin supervisión (-p, Agent SDK, CI, cloud). En el terminal, la aplicación de escritorio y VS Code, un comando en segundo plano puede volver a ejecutarse sin límite.

Un prompt borrado por error con Ctrl+C se recupera con la flecha hacia arriba, /code-review acepta --max-findings para mostrar más o menos problemas, claude project purge pasa a ser claude purge, y los mods, lanzados el día anterior, reciben $.ui.selection(), que devuelve el último texto seleccionado en pantalla completa. Cuando se agota el tiempo de espera de la API en plena respuesta, las sesiones no interactivas y los subagentes retoman la respuesta parcial en lugar de fallar. En cuanto a seguridad, un rm peligroso introducido en un script bash -c ya no pasa sin confirmación en modo bypassPermissions, y un hook PreToolUse o PermissionRequest cuya coincidencia falla bloquea ahora la llamada en lugar de ser ignorado. Por último, el clasificador del modo auto del lado del cliente ignora ahora una variable ANTHROPIC_DEFAULT_SONNET_MODEL que indica Sonnet 5.5 u Opus 5.5, y utiliza Claude Sonnet 5 en su lugar.

Seis minutos después de la release, @ClaudeDevs destacó You should know, un mod integrado que lanza un agente secundario encargado de mostrar encima del prompt la información que conviene tener presente. Ya figuraba entre los seis mods integrados presentados el 1 de octubre y sigue desactivado por defecto.

We’re adding a new plugin to Claude Code: You should Know. It scans Claude’s output for important information you might miss to help keep you in the loop. Enable it with: /plugin enable cc-plugin-you-should-know@builtin

🇪🇸 Añadimos un nuevo plugin a Claude Code: You should Know. Analiza la salida de Claude en busca de información importante que podría pasarte desapercibida, para mantenerte al tanto. Actívalo con: /plugin enable cc-plugin-you-should-know@builtin — @ClaudeDevs en X

🔗 Notas de la versión de Claude Code 2.1.288

GLM 5.3 y GLM 5.3 Flash llegan a Cursor

1 de octubre — Cursor añade GLM 5.3 y GLM 5.3 Flash, los modelos abiertos de Z.ai, a su selector de modelos, y afirma que GLM 5.3 Max ocupa el primer puesto entre los modelos abiertos en su propio banco de pruebas.

GLM 5.3 and GLM 5.3 Flash are now available in Cursor! GLM 5.3 Max is the best-scoring open-weight model on CursorBench 4.0.

🇪🇸 ¡GLM 5.3 y GLM 5.3 Flash ya están disponibles en Cursor! GLM 5.3 Max es el modelo de pesos abiertos mejor puntuado en CursorBench 4.0. — @cursor_ai en X

El gráfico adjunto sitúa los modelos según su puntuación en CursorBench 4.0 y su coste medio por tarea, pero solo etiqueta un punto: el de GLM 5.3 marcado como «(max)», con un 42,6 % por 5,05 dólares por tarea. Según este gráfico, GLM 5.3 sigue por debajo de Claude Opus 5.5, Claude Sonnet 5.5, Fable 5.1 y Grok 4.7; no figura ningún otro modelo abierto y GLM 5.3 Flash tampoco aparece. Cursor no ha publicado precios, una entrada ni una metodología que respalde su clasificación.

Replit incorpora GPT-6.1 Sol y Claude Sonnet 5.5 a Agent, y Jev a sus AI Integrations

2 de octubre — El changelog de Replit añade dos modelos recientes a las opciones de Replit Agent: Claude Sonnet 5.5 en modo Power y GPT-6.1 Sol en modo Max. La misma entrada incorpora Jev, el modelo de decisión ya citado frente a pplx-decider-v1-27b, a las Replit AI Integrations: una aplicación puede clasificar contenido, enrutar solicitudes o puntuar clientes potenciales mediante decisiones rápidas y estructuradas, sin gestionar una clave API. La documentación precisa que Jev se ofrece bajo el identificador jev-latest a través de OpenRouter. Los ajustes se abren ahora en una página completa, y las cuentas Enterprise pueden fijar reglas para toda la empresa, con excepciones por equipo (Workspace). La entrada no indica precios.

🔗 Changelog de Replit del 2 de octubre

DeepSeek Harness se instala en macOS y Windows

30 de septiembre — La cuenta @DeepSeekHarness anuncia una versión de escritorio de DeepSeek Harness, el arnés de agentes open source de DeepSeek, para macOS y Windows. El 2 de octubre, la cuenta principal @deepseek_ai difunde el anuncio y precisa que los usuarios de Linux deben recurrir al paquete npm @deepseek-ai/dsh. Los instaladores se descargan desde el sitio de DeepSeek, para macOS con chip ARM y para Windows x64.

La página oficial, marcada como PREVIEW, presenta Harness como una versión preliminar pública abierta en todo el mundo y open source. Se basa en la arquitectura «todo es un plugin» (everything is a plugin) del framework Cordis y abarca el trabajo de oficina (archivos, datos, documentos, presentaciones), el código, la investigación con citas de fuentes y las tareas en segundo plano, con un modo Creator que permite crear nuevos plugins mediante la conversación. La novedad está en la distribución: la versión preliminar del 29 de septiembre ya integraba el comando dsh en la aplicación de escritorio, y todavía no se ha publicado ninguna versión estable en GitHub.

🔗 Anuncio de @deepseek_ai · Página de DeepSeek Harness

SWE-sweep: un banco de pruebas en el que los agentes deben encontrar por sí solos los bugs que corregir

1 de octubre — Investigadores de Meta Superintelligence Labs, junto con Harvard, la Universidad de Washington y Stanford, abren SWE-sweep, un banco de pruebas que pide a los agentes de código que descubran por sí mismos los bugs de un repositorio real y corrijan tantos como sea posible, sin pistas sobre su naturaleza ni su ubicación. El conjunto abarca 100 repositorios y 4 068 bugs; el código, bajo licencia MIT, se basa en el framework Harbor, y Ofir Press y John Yang figuran entre los autores. Todavía no hay ningún anuncio que acompañe al repositorio, creado el 1 de octubre.

La clasificación, actualizada el 24 de septiembre y medida con el agente mini-SWE-agent, muestra la magnitud de la tarea:

Posición en la clasificaciónModelo evaluadoBugs resueltosCoste total
1Sol 5.6 (xhigh), OpenAI4,7 %7 230 dollars
2Luna 5.6 (xhigh), OpenAI2,5 %224 dollars
3Terra 5.6 (xhigh), OpenAI1,5 %357 dollars
4Luna 5.6 (high), OpenAI1,4 %28 dollars
5Opus 5 (xhigh), Anthropic1,3 %5 363 dollars

🔗 SWE-sweep


Cómputo y hardware: primeras TPU en órbita, DGX Spark 64 Go, DeepGEMM y DeepEP en Ascend 950

Project Suncatcher: el satélite prototipo de Google lleva sus primeras TPU a órbita

1 de octubre — Una semana después de anunciar su primera prueba en órbita, Google ha lanzado el satélite prototipo de Project Suncatcher, un proyecto de investigación a largo plazo (moonshot) que busca determinar si el espacio podría algún día albergar una infraestructura de aprendizaje automático a gran escala. Construido con Planet, el satélite llegó a órbita a bordo de Transporter-18, una misión de lanzamiento compartido de SpaceX; según Travis Beals, de Google, el equipo ha establecido contacto y el satélite funciona según lo previsto.

Durante las próximas semanas, Google medirá cómo sus TPU soportan las exigencias del vuelo espacial y los niveles extremos de radiación y temperatura; en tierra, las TPU Trillium ya habían soportado una dosis de radiación superior a la de una misión de cinco años. El artículo revisado por pares que detalla la investigación se publica en la revista Joule. Al difundir el lanzamiento el 2 de octubre, @GoogleAI recuerda el argumento del proyecto: en órbita baja, la luz del sol es casi constante y los satélites pueden producir hasta 8 veces más energía solar que en la Tierra. La siguiente etapa anunciada: dos satélites en 2027 para probar enlaces láser.

🔗 El prototipo de Project Suncatcher está en órbita · El artículo publicado en Joule · La publicación de @GoogleAI

DGX Spark 64 Go: NVIDIA añade una configuración a la venta desde el 23 de octubre

2 de octubre — NVIDIA añade a su DGX Spark una configuración con 64 Go de memoria unificada, junto al modelo de 128 Go. Se venderá únicamente a través de seis fabricantes socios, Acer, ASUS, Dell, Gigabyte, HP y MSI, a partir del viernes 23 de octubre, con un precio inicial de 4 999 dólares; la publicación no indica el precio actual del modelo de 128 Go. La base sigue siendo la misma: chip GB10 Grace Blackwell, DGX OS y pila de software NVIDIA AI, para modelos de hasta 100 mil millones de parámetros ejecutados en la máquina.

El argumento principal es la configuración en clúster: dos unidades conectadas mediante un cable QSFP a sus tarjetas de red ConnectX-7 comparten su memoria.

Característica técnicaUn DGX Spark 64 GoDos DGX Spark 64 Go en clúster
Memoria unificada64 Go128 Go compartidos
Tamaño de modelo anunciadoHasta 100 mil millones de parámetrosHasta 200 mil millones de parámetros
Rendimiento en Qwen 3.8 27B (prueba de NVIDIA)ReferenciaHasta 1,7 veces

La aplicación NVIDIA Sync se encarga de ello mediante Cluster Assistant, que detecta las unidades y configura la red. NVIDIA Sync Model Launcher, anunciado para finales de mes, descargará y ejecutará Qwen3.8 27B en una máquina o un clúster, y configurará OpenCode para utilizarlo.

🔗 Publicación de NVIDIA sobre DGX Spark 64 Go

DeepSeek porta DeepGEMM y DeepEP a las NPU Ascend 950 de Huawei

29 y 30 de septiembre — DeepSeek ha publicado en GitHub, sin anuncio, dos adaptaciones de sus bibliotecas de cómputo a las NPU Ascend de Huawei. DeepGEMM-Ascend, cuyo README fecha la primera versión el 30 de septiembre, reproduce sin cambios la API de DeepGEMM: multiplicaciones de matrices en BF16, FP8 y FP4, logits MQA y MegaMoE, bajo licencia MIT, para la serie Ascend 950. DeepEP-Ascend adapta la biblioteca de comunicación del paralelismo de expertos (expert parallelism) de los modelos MoE, con las operaciones all-to-all de distribución (dispatch) y recombinación (combine).

En Ascend 950DT, DeepEP-Ascend mide una distribución de 373 a 375 Go/s con 8 rangos y de 313 a 320 Go/s con 128 rangos; hasta 32 rangos, alcanza aproximadamente entre el 90 y el 95 % del límite físico del ancho de banda. Estas cifras se obtuvieron con un kit de hardware (HDK) de prueba de concepto proporcionado a DeepSeek y una configuración manual, que no se distribuyen públicamente; el README remite a la versión comercial, cuya disponibilidad Huawei prevé alrededor del 15 de octubre.

🔗 DeepGEMM-Ascend en GitHub · DeepEP-Ascend en GitHub


Voz y audio: Suno Speech en beta, ElevenLabs obtiene la certificación FedRAMP 20x Class A

Suno Speech genera voz hablada y música de fondo en una misma pista

1 de octubre — Suno abre en beta Speech, una función que crea audio hablado sobre música de fondo original, directamente en Suno: se introduce una idea, un poema o un texto y después se describen la voz y el estilo musical deseados. Suno presenta Speech como el primer modelo de audio que genera la voz y la música juntas, en una única pista coherente. Tras probarse durante un mes con un pequeño grupo de usuarios, la función está ahora abierta a todos, después de actualizar la aplicación.

La publicación, firmada por el director de producto Jack Brody, cita sobre todo usos personales: mensajes de amigos transformados en lecturas dramáticas, notas de voz con música, meditaciones o cuentos para dormir. Suno advierte de que la beta sigue siendo imperfecta: un acento británico puede derivar hacia el australiano, y las pausas dramáticas pueden ser muy marcadas. No se especifican precios, planes ni idiomas compatibles.

🔗 Presentación de Speech (Suno)

ElevenLabs obtiene la certificación FedRAMP 20x Class A para ElevenAgents y sus API de voz

1 de octubre — ElevenLabs obtiene la certificación FedRAMP 20x Class A, el marco mediante el cual las agencias federales estadounidenses deciden si un producto cloud puede utilizarse de forma segura con datos gubernamentales. Cubre ElevenAgents y las API Text to Speech y Speech to Text, siempre que funcionen en Zero Retention Mode con residencia de los datos en Estados Unidos. Amplía la oferta ElevenLabs for Government, y la empresa figura ahora en el FedRAMP Marketplace. Según FedRAMP, citado por ElevenLabs, el nivel Class A es suficiente para la mayoría de los usos no sensibles de las agencias; ElevenLabs cita las solicitudes de prestaciones, los permisos, los impuestos o la transcripción de audiencias.

ElevenLabs respalda el anuncio con despliegues públicos existentes:

Despliegue público citadoCifra anunciada por ElevenLabs
Línea nacional de empleo (Ucrania)25 % gestionados por agentes conversacionales
Líneas de prestaciones y empleo (Chequia)85 % de unas 5 000 llamadas al día resueltas
Ciudad de Midland7 000 llamadas perdidas menos al mes (proyección)

🔗 Publicación de ElevenLabs


ChatGPT abre Finances a los usuarios de Free y Go en Estados Unidos

2 de octubre — Finances, el espacio de ChatGPT dedicado a las finanzas personales, se amplía a los planes Free y Go en Estados Unidos, en la web, iOS y Android. La función ya estaba disponible para los suscriptores de Plus y Pro: lanzada como versión preliminar solo para los suscriptores de Pro en mayo, incorporó el 21 de septiembre el seguimiento de la puntuación crediticia de Experian para los suscriptores de Plus y Pro. Ahora abarca los planes Free, Go, Plus y Pro, todavía solo en Estados Unidos.

El funcionamiento no cambia: se conectan las cuentas bancarias y de inversión a través de Plaid, y el informe crediticio a través de Experian, dos conexiones que pueden utilizarse juntas o por separado. La página de Finances reúne gastos, facturas, suscripciones, patrimonio neto, inversiones y puntuación crediticia. En la conversación, ChatGPT clasifica los gastos, identifica las suscripciones, compara el mes con las tendencias recientes y, para los impuestos, organiza la información y señala posibilidades que conviene examinar, como las deducciones.

🔗 Notas de versión de ChatGPT · Finances en ChatGPT


SpaceXAI publica su SDK oficial de TypeScript en versión experimental

2 de octubre — SpaceXAI ha publicado sin anunciarlo la primera versión pública de su SDK oficial de TypeScript. La 0.1.0 salió a las 16 h 57 UTC, seguida a las 18 h 25 UTC de una 0.2.0 que cambia el nombre de la clase cliente xAI a SpaceXAI: un cambio incompatible que adapta el código al nuevo nombre de la empresa. El SDK ya abarca la Responses API (streaming, compaction y conversaciones de varios turnos), las herramientas integradas de la plataforma (búsqueda web y búsqueda en X, ejecución de código, servidores MCP remotos), la generación y edición de imágenes y vídeos, así como las API Files, Batch y Voice.

Elemento del SDKDetalle observado
Paquete npm@xai-official/sdk
LicenciaApache-2.0
RequisitosNode.js 22.13 o posterior, proyecto ESM, sin dependencias de ejecución
EstadoExperimental, interfaces sujetas a cambios hasta la 1.0

Por defecto, el SDK impide su ejecución en un navegador o un Worker para evitar exponer la clave secreta en el cliente. Los desarrolladores de TypeScript disponen así de un equivalente al SDK oficial de Python, cuya versión 1.20.0 salió el 24 de septiembre.

🔗 CHANGELOG del SDK de TypeScript de SpaceXAI · El paquete @xai-official/sdk en npm


Breves

  • GPT-6.1 Sol en v0 — El 29 de septiembre, día del lanzamiento del modelo, v0, el generador de aplicaciones de Vercel, habilitó GPT-6.1 Sol, unas horas después de permitir la conexión con una suscripción a ChatGPT; el anuncio no ofrece precios ni mediciones específicas de v0. 🔗 fuente
  • Nuevo panel de agentes en Grok Build — Anunciado el 1 de octubre, muestra todos los agentes en una sola pantalla con /dashboard, inicia tareas en paralelo y sitúa un agente en su propio worktree git con Ctrl+W; Grok Build había incorporado un primer panel el 15 de junio. 🔗 fuente
  • Nightly de Gemini CLI — La v0.64.0-nightly del 2 de octubre solo contiene ocho correcciones: Ctrl+C vuelve a cancelar una operación en curso, y el estado ~/.gemini/state.json se escribe de forma atómica, con una copia de seguridad .bak que se restaura en caso de corrupción; las versiones estable y preliminar no cambian. 🔗 fuente
  • Modelos retirados de GitHub Copilot — Como se anunció el 3 de septiembre, Gemini 3.5 Flash, Gemini 3.6 Flash, Kimi K2.7 Code y Claude Opus 4.7 dejan de estar disponibles en todas las experiencias de Copilot; GitHub sugiere Gemini 3.8 Flash, Kimi K3 y ahora Claude Opus 5.5, en lugar de Claude Opus 5. 🔗 fuente
  • Probar un SKILL.md — En una publicación de la comunidad, Golda Manuel propone un método, sin mediciones publicadas, para comprobar que los agentes de código encuentran, cargan y aprovechan una habilidad: ubicación esperada por Claude Code o Codex, activación con tres niveles de solicitud y comparación con y sin la habilidad mediante ocho métricas. 🔗 fuente
  • Manus detalla Video Editor y Game Dev — Dos publicaciones del 1 de octubre profundizan en Manus 2.0: Video Editor, en Manus Studio, sitúa cada elemento de un vídeo en su propia pista (125 clips montados en una película de 10 min 50 s con 195 cortes), y Game Dev ajusta un juego en directo; sin precio ni fecha. 🔗 Video Editor · 🔗 Game Dev
  • AutoSynthData de ServiceNow — El equipo CoreAI de ServiceNow genera tareas de entrenamiento verificadas a partir de los fallos de un modelo: en EnterpriseOps Gym, Gemma-4-26B-A4B-it gana 7,2 puntos de Pass@1 en el dominio Hybrid y pasa del 18,77 % al 27,18 % en ITSM; no se han publicado ni código ni datos. 🔗 fuente
  • POCKET-Darwin-180B — VIDRAFT publica una versión GGUF de 4 bits y 111 Go (frente a 360 Go) de Darwin-180B-RSI, un MoE de 180 mil millones de parámetros: de 18,4 a 21 tokens por segundo solo con el procesador, 4,17 en un portátil con una RTX 5060 de 8 Go, y un 87,65 % en MMLU-Pro, igual que el original, según los autores. 🔗 fuente
  • Guía de los modelos GPT-6 — OpenAI publica una guía para startups: GPT-6 Astra para los razonamientos más difíciles, GPT-6.1 Sol para el código complejo, la investigación y el uso del ordenador, GPT-6 Luna para tareas específicas a gran escala; los tokens en caché cuestan hasta un 95 % menos según el modelo. 🔗 fuente
  • ChatGPT escanea varias páginas en un solo PDF desde la cámara en iOS — en despliegue, 1 de octubre.
  • Chatham Financial y Codex — La consultora de mercados de capitales ha construido con Codex una aplicación de validación de transacciones: según las primeras mediciones, la verificación pasa de unos 30 minutos a menos de 4; su plataforma Onyx combina GPT-5.6 Sol y Terra, GPT-5.4 y GPT-4.1. 🔗 fuente
  • The Den y ChatGPT Work — Según un estudio de caso de OpenAI fechado el 1 de octubre, el equipo directivo de este club de Denver para padres ahorra entre 10 y 15 horas por semana con ChatGPT Work, conectado a Gmail, Slack y Google Drive; una solicitud de subvención lleva 2 horas en lugar de 3 días. 🔗 fuente
  • GPT-6 Astra Ultrafast en Blackwell — NVIDIA precisa el 1 de octubre que el nivel Ultrafast de GPT-6 Astra, lanzado por OpenAI el 29 de septiembre, funciona en sus GPU Blackwell, hasta 8 veces más rápido que el modo Astra Standard, y que OpenAI optimiza su software de inferencia con sus propios modelos; sin cifras nuevas. 🔗 fuente
  • RL Rollouts en CoreWeave — Presentado el 30 de septiembre junto con CoreWeave Forge y difundido por NVIDIA el 2 de octubre, este servicio basado en NVIDIA Dynamo carga en caliente los nuevos puntos de control durante un postentrenamiento por refuerzo; en Nemotron 3.5 Lightning, la latencia de recarga del modelo mejora 15 veces. 🔗 fuente
  • Eleven v4 en ElevenReader — El modelo de voz más expresivo de ElevenLabs, lanzado el 28 de septiembre, llega a su aplicación de lectura: artículos, libros electrónicos y PDF con la voz elegida, en más de 90 idiomas, en iOS, Android y la web. 🔗 fuente
  • Changelog alpha de Midjourney — Fechado el 1 de octubre, reúne principalmente correcciones, entre ellas los parámetros de prompt guardados por carpeta y las referencias de estilo agrupadas en una etiqueta, antes de las nuevas herramientas colaborativas anunciadas para la semana siguiente. 🔗 fuente
  • Grok 4.7 a mitad de precio en Ramp Router — Hasta el 6 de octubre, la pasarela LLM Ramp Router ofrece Grok 4.7 con un 50 % de descuento, una oferta difundida por SpaceXAI; el modelo se factura a 2 dólares de entrada y 6 dólares de salida por millón de tokens en la API de SpaceXAI. 🔗 fuente
  • Comentarios confidenciales en los avisos de seguridad — GitHub permite comentar un aviso de seguridad de un repositorio sin que lo vea quien lo notificó: solo las personas con acceso de escritura pueden leer estos comentarios, cuyas consultas quedan registradas; una API REST de comentarios pasa a versión preliminar pública. 🔗 fuente · 🔗 API REST
  • API GraphQL de la GitHub Advisory Database — El objeto SecurityAdvisory incorpora cinco campos, entre ellos el identificador CVE y la fecha de publicación por la NVD, y la consulta securityAdvisories añade dos filtros, por gravedad y por estado de retirada: ya no es necesario recurrir de nuevo a la API REST. 🔗 fuente
  • Fin de la imagen de macOS 14 en GitHub Actions — Anunciada el 1 de octubre, la retirada tendrá lugar el 2 de noviembre, precedida de ocho interrupciones programadas en octubre, de 14 h a medianoche UTC; los workflows deben pasar a macos-15 o a macos-latest, que apunta a macos-26. 🔗 fuente
  • Madurez de la IA en las empresas — Perplexity publica una guía que describe cuatro etapas de madurez, resume los marcos de Gartner, Deloitte y Google Cloud y propone una matriz de autoevaluación; según la encuesta de McKinsey de 2026 que cita, el 80 % de los encuestados observa mejoras en la productividad personal, pero solo el 37 % una contribución al EBIT. 🔗 fuente

Qué significa esto

La IA aplicada a la ciencia se evalúa cada vez más con criterios ajenos a quienes la anuncian. Meta no se limita a enumerar resultados: cada artículo indica qué pasajes ha redactado la IA, un segundo grupo de matemáticos los revisa, y la publicación reconoce que tres de los problemas también se han resuelto en otros lugares. El modelo de predicción de la gripe diseñado con la IA de Google obtiene su valor de una evaluación realizada por los CDC durante una temporada completa, frente a otros 38 modelos. Ai2 publica los pesos y los datos de AstaBrief, pero advierte de que sus comparaciones datan de 2025: un modelo abierto se puede verificar, una evaluación envejece.

Los modelos de decisión se convierten en pocos días en una categoría por derecho propio. Después de Jev, d1 de Liquid AI y Clef de Cloudflare, Perplexity ofrece tanto una API facturada por token de entrada como los pesos de su modelo; llama.cpp sirve estos modelos en local con el mismo formato System One, y Replit incorpora Jev a sus integraciones sin clave de API. Para un desarrollador, el interés es concreto: una probabilidad por opción, obtenida en una sola pasada, en lugar de una respuesta de texto que después hay que analizar. Las comparaciones requieren prudencia: la fila Overall de la ficha sitúa a pplx-decider-v1-27b por delante de Jev, pero el desglose publicado da ventaja a Jev en seis de los once benchmarks.

Los agentes de código avanzan más rápido que su autonomía real. Cuando se deja solo ante un repositorio en SWE-sweep, el mejor modelo solo encuentra y corrige el 4,7 % de los bugs, por más de 7 000 dólares. Claude Code 2.1.288 dedica la mayor parte de sus 89 entradas a correcciones, entre ellas la reanudación tras un tiempo de espera de la API y varias reglas de permisos más estrictas, y destaca un mod que supervisa el trabajo del agente principal. Anthropic aborda el otro cuello de botella, las competencias humanas, con 100 millones de dólares para formar a ingenieros capaces de llevar un despliegue hasta producción. Los modelos abiertos, por su parte, ganan espacio en las herramientas, con GLM 5.3 en Cursor y DeepSeek Harness en el escritorio.

El hardware de computación, por último, se diversifica en tres direcciones. Google prueba en órbita TPU que algún día podrían aprovechar hasta 8 veces más energía solar que en la Tierra, NVIDIA añade a su DGX Spark una configuración de 64 Go que permite conectar dos unidades para alcanzar 200 mil millones de parámetros, y DeepSeek hace que sus bibliotecas de bajo nivel puedan utilizarse, con la misma API, en los chips Ascend de Huawei. Cada uno, a su manera, amplía los lugares y el hardware en los que pueden ejecutarse los modelos.


Fuentes