ai-powered-markdown-translatorArtículo traducido del fr al es con gpt-5.6-sol.
No hay ningún modelo nuevo este domingo, pero sí dos novedades concretas para los desarrolladores. DeepSeek V4.1 Flash, lanzado el 10 de septiembre, llega a Together AI al precio de las horas punta de DeepSeek, y Together afirma que cuesta tres veces menos por tarea que GPT-5.6 Sol, una afirmación que debe leerse con sus matices; por su parte, Perplexity permite registrar de una vez por todas un servidor MCP en su Agent API. Sakana AI retoma un número especial de la Royal Society, y tres colaboradores del blog comunitario de Hugging Face se interesan, cada uno a su manera, por la verificación de los resultados.
Together AI ofrece DeepSeek V4.1 Flash y afirma que cuesta tres veces menos por tarea que GPT-5.6 Sol
13 de septiembre — DeepSeek V4.1 Flash llega a Together AI, tanto en modalidad serverless como en despliegue dedicado, a 0,30 dólares por millón de tokens de entrada y 1,20 dólares de salida: exactamente los precios de la API de DeepSeek en horas punta, que DeepSeek reduce a la mitad en horas valle.
Together afirma, basándose en mediciones de Artificial Analysis, que el modelo supera a GPT-5.6 Sol en los benchmarks agénticos por un tercio del coste por tarea:
| Medida comparada | DeepSeek V4.1 Flash | GPT-5.6 Sol (high) |
|---|---|---|
| AutomationBench-AA | 69 % | 55 % |
| Terminal-Bench v4.0 | 27 % | 21 % |
| GDPval-AA v2 | 1632 | 1524 |
| Coste medio por tarea (Intelligence Index) | 0,27 dólares | 0,81 dólares |
Dos matices: la propia ficha de Together sitúa a V4.1 Flash por detrás de GPT-5.6 Sol en razonamiento (90,9 frente a 94,1 % en GPQA Diamond, 36,8 frente a 47 % en HLE) y, en Terminal-Bench v4.0, la ventaja medida por Artificial Analysis se invierte en la tabla publicada por DeepSeek el 10 de septiembre, que otorgaba 31,2 a V4.1 Flash frente a 39,9 a GPT-5.6 Sol.
Perplexity abre su Agent API a conectores personalizados: un servidor MCP registrado de una vez por todas
13 de septiembre — Perplexity añade a su Agent API los conectores personalizados (custom connectors). Un administrador registra una sola vez un servidor MCP remoto en los conectores de su proyecto (Project): nombre, URL, autenticación mediante clave API o ninguna, transporte Streamable HTTP o SSE. Perplexity conserva la clave de acceso del servidor, y las solicitudes de cualquier clave API del proyecto se limitan a citar el identificador del conector mediante type: "connector".
Con un servidor MCP incluido en la solicitud (type: "mcp"), su URL y sus credenciales acompañan, en cambio, a cada llamada, únicamente mediante Streamable HTTP. Estos conectores amplían los conectores gestionados (managed connectors) que llegaron el 27 de agosto para GitHub, Slack, Google Drive y Datadog, ahora seis con Linear y Notion. El descubrimiento de herramientas, diferido de forma predeterminada, hace que el modelo busque antes de cargar los esquemas necesarios, por lo que conviene establecer un max_steps suficientemente alto. No se indica ninguna tarifa específica.
🔗 Documentación de los conectores de Perplexity 🔗 Registro de cambios de la API de Perplexity
Breves
- Sakana AI retoma un número especial dedicado a los modelos del mundo (world models) — entrada en japonés del 12 de septiembre sobre el número de Philosophical Transactions of the Royal Society A publicado el 14 de mayo de 2026, cuya introducción firma David Ha, director ejecutivo de Sakana AI, junto con otros trece coautores. La actualidad reside en la entrada, no en la publicación del número. 🔗 fuente
- REINFORCE escapa de una trampa en la que el ascenso exacto por gradiente permanece bloqueado — contribución individual al blog comunitario de Hugging Face, y no una publicación de laboratorio: tras cuarenta y dos rondas de verificación por parte de un mismo lector, RDTvlokip muestra que, después de 20 000 pasos, el ascenso exacto no obtiene un código inequívoco (una biyección) en ninguno de los 12 ensayos, frente a 11 de 12 con REINFORCE. Sin embargo, todas estas cifras dependen del optimizador Adam. 🔗 fuente
- Phionyx propone un contrato de prueba para las auditorías de IA — otra contribución individual: Ali Toygar Abak quiere impedir que un panel o un informe amplíe silenciosamente lo que demuestra una prueba; por ejemplo, que una llamada de herramienta rechazada termine presentándose como un incidente detenido por el mecanismo de protección. Su propuesta, ocho grupos de metadatos asociados a cada afirmación, sigue siendo un plan de ingeniería y pruebas, sin resultados experimentales. 🔗 fuente
- darkc0de propone evaluar los modelos de agentes por el tiempo necesario para obtener un resultado validado — tercera contribución individual: Sonny DeSorbo sostiene que un modelo más débil pero más rápido puede corregirse varias veces antes de que un modelo lento haya terminado su primer intento, y esboza un benchmark, Persistent Challenge Completion, que mide el trabajo validado por segundo. Una reflexión sin experimentación que el autor invita a no tomarse demasiado en serio. 🔗 fuente
Qué significa
El primer hilo trata sobre las herramientas de los agentes. Con los conectores personalizados, un servidor MCP se convierte en un recurso del proyecto en lugar de ser un parámetro repetido en cada solicitud: un administrador lo registra una vez, Perplexity conserva su clave de acceso y el código que llama a la Agent API ya no tiene que transportarla. De este modo, Perplexity extiende a los servidores MCP de cada usuario, protegidos por una clave API o sin autenticación, la lógica de los conectores gestionados que llegaron a finales de agosto, y admite además el transporte SSE junto con Streamable HTTP. La contrapartida es el descubrimiento diferido de herramientas, que obliga a dejar al modelo suficientes pasos para buscar antes de actuar. Conectar una herramienta se convierte en una operación administrativa realizada una vez para todo un proyecto, más que en un ajuste que deba reproducirse en cada llamada.
El segundo hilo se refiere al precio y a la medición. Together AI cobra por un modelo abierto, publicado bajo licencia MIT, exactamente el precio de DeepSeek en horas punta: para quienes puedan concentrar sus llamadas en horas valle, la API de DeepSeek sigue siendo dos veces más barata. El coste por tarea destacado debe interpretarse teniendo en cuenta sus diferencias. La afirmación de Together se refiere a los benchmarks agénticos, no al razonamiento, donde V4.1 Flash sigue por detrás de GPT-5.6 Sol; e incluso en una prueba agéntica como Terminal-Bench v4.0, la clasificación depende de la fuente: V4.1 Flash supera a GPT-5.6 Sol según Artificial Analysis (27 frente a 21 %), pero queda por detrás en la tabla de DeepSeek (31,2 frente a 39,9). Las tres entradas comunitarias del día vuelven, cada una, a esta exigencia de verificación: RDTvlokip sometió sus resultados a cuarenta y dos rondas de revisión por parte de un mismo lector, Phionyx quiere impedir que un informe amplíe silenciosamente lo que demuestra una prueba y darkc0de propone medir el trabajo validado por segundo en lugar del éxito en el primer intento. Ya se trate de una puntuación, un coste o una conclusión de auditoría, la cuestión sigue siendo saber en qué condiciones se obtuvo la cifra.
Fuentes
- Together AI en X, DeepSeek V4.1 Flash
- Together AI, ficha del modelo DeepSeek V4.1 Flash
- DeepSeek, página Models & Pricing de la API
- DeepSeek, registro de cambios de la API
- Perplexity, documentación de los conectores de la Agent API
- Perplexity, registro de cambios de la API
- Sakana AI, entrada sobre el número especial de la Royal Society
- Hugging Face, Forty-two more rounds with the same reader
- Hugging Face, Access Is Not Yet Verifiability
- Hugging Face, I love speed. We all love speed