Buscar

Grok Bot se conecta a X, GitHub anuncia cinco novedades para Issues, un modelo post-transformer entrenado en un MacBook lee 10 millones de tokens

Artículo generado por inteligencia artificial
Grok Bot se conecta a X, GitHub anuncia cinco novedades para Issues, un modelo post-transformer entrenado en un MacBook lee 10 millones de tokens

ai-powered-markdown-translator

Artículo traducido del fr al es con gpt-5.6-sol.

Ver proyecto en GitHub ↗

Solo doce anuncios, en cinco ámbitos, durante el fin de semana del 29 y 30 de agosto, frente a veintidós el día anterior y cuarenta y dos el 28. Se acumulan dos causas, y ninguna merece ser ocultada. El 29 es sábado y el 30, domingo: casi ningún blog oficial publicó nada. Además, X dejó de funcionar durante la recopilación, ya que la interfaz que sirve los hilos de los perfiles dejó de responder; veintitrés cuentas monitorizadas —las de generación de imágenes y vídeo y las de herramientas de desarrollo— permanecieron inaccesibles. Por tanto, algún anuncio difundido únicamente mediante un tuit pudo escapar al rastreo.

Queda una jornada con dos vertientes. En cuanto a producto, xAI conecta Grok Bot a la red X y GitHub detalla cinco mejoras para Issues. En cuanto a investigación, toda la cosecha procede del blog de Hugging Face y de colaboradores individuales: una sonda lineal que se transfiere de un modelo de visión al de un competidor, un modelo post-transformer preentrenado en un solo MacBook, una red de Leech que hace caber Qwen3-4B en 2,60 GB de VRAM y un método para interrumpir un agente durante la generación. Son trabajos, no lanzamientos.


Grok Bot se conecta a X

29 de agosto — xAI publicó en su hilo de noticias una actualización de Grok Bot, su oferta de agentes autónomos: el producto se integra ahora más estrechamente con X.

El mecanismo se basa en conectar una cuenta. El usuario vincula su cuenta de X desde Grok Bot y xAI le crea automáticamente una cuenta de desarrollador si aún no tiene una, el paso que permite el acceso programático a la red. Además, los suscriptores de pago de Grok Bot reciben créditos gratuitos de la API de X para empezar, aunque xAI no especifica su cantidad ni su periodo de validez.

Una vez activado el conector, un Bot puede buscar publicaciones, leer el hilo de noticias de su propietario, consultar sus menciones y recopilar un resumen de lo que circula por la red. Para ponerlo en marcha, basta con abrir Grok Bot y utilizar el conector de X.

xAI califica explícitamente esta entrega como la primera versión de la integración y anuncia que pretende seguir facilitando el trabajo de Grok Bot en X.

🔗 Grok Bot ahora funciona con X


GitHub Issues: cinco novedades, incluida una API REST de dependencias sensible al ámbito

29 de agosto — GitHub detalló cinco mejoras de GitHub Issues, anunciadas directamente en X sin una entrada de changelog asociada: el propio mensaje es la fuente primaria.

Cuatro de ellas se centran en la comodidad de navegación. Las vistas pueden fijarse en la barra lateral, lo que evita tener que reconstruir un filtro en cada sesión. Las reacciones muestran ahora los avatares de perfil donde antes solo aparecía el recuento. La densidad del panel de control pasa a ser ajustable, algo útil en los repositorios que muestran muchas filas. Las sub-issues cerradas pueden ocultarse, lo que aligera las issues principales utilizadas para hacer el seguimiento de un proyecto.

La quinta es la más importante para la automatización: la API REST de dependencias de issues pasa a ser sensible al ámbito (scope-aware). Las dependencias entre issues, que describen el orden en el que deben procesarse las tareas, pueden consultarse teniendo en cuenta el ámbito, algo que interesa directamente a los agentes y scripts que elaboran un plan de trabajo a partir del seguimiento de un repositorio. GitHub no precisó el régimen de disponibilidad de estos cinco cambios.

Novedad anunciadaAlcance del cambio
Vistas fijadas en la barra lateralNavegación por Issues
Avatares de perfil en las reaccionesVisualización de las reacciones
Densidad ajustable del panel de controlPanel de control
Ocultación de las sub-issues cerradasIssues principales y sub-issues
API REST de dependencias sensible al ámbitoAPI REST, dependencias entre issues

🔗 Mensaje de @github


Gala, un modelo post-transformer preentrenado en un solo MacBook, lee 10 millones de tokens a velocidad constante

29 de agosto — Una familia de pequeños modelos de lenguaje, con el nombre provisional Gala, fue preentrenada desde cero con MLX puro en un único MacBook —M3 Max, GPU de 40 núcleos y 128 GB de memoria unificada— en cinco días.

El experimento parte de un cambio de perspectiva. El Transformer está diseñado para un hardware en el que abundan los productos matriciales densos y escasea la memoria de gran ancho de banda; un Mac es la máquina inversa. Por ello, la arquitectura elegida acumula parámetros y estado, y raciona los FLOPs por token.

La prueba final consiste en procesar 10,5 millones de tokens de texto real de FineWeb, en lotes de 1, en el portátil. Nada aumenta: el estado recurrente permanece fijo en 3,07 MB en todo el intervalo y la velocidad de decodificación no se deteriora. La pérdida en los 2.000 tokens siguientes tampoco aumenta. El Transformer de referencia entrenado con los mismos datos decodifica a 134 tokens/s desde un contexto de 32k y necesitaría unos 33 GB de caché KV con un millón de tokens.

Contexto alcanzadoVelocidad de decodificaciónPérdida en los 2.000 tokens siguientesEstado recurrente
32 768382,3 tokens/s3,6303,07 MB
1 048 576388,1 tokens/s3,5343,07 MB
5 242 880386,2 tokens/s3,5903,07 MB
10 485 760385,8 tokens/s3,2963,07 MB

La ingesta sigue siendo lineal, a unos 28.000 tokens/s, es decir, cerca de seis minutos para los diez millones. El modelo se publica junto con sus registros de ejecución, y el artículo dedica una sección a lo que no sabe hacer.

A post-transformer language model, pretrained from scratch on one MacBook in pure MLX, that reads 10M tokens of context at constant speed. Five days, every number measured, everything released.

🇪🇸 Un modelo de lenguaje post-transformer, preentrenado desde cero en un solo MacBook con MLX puro, que lee 10 millones de tokens de contexto a velocidad constante. Cinco días, cada cifra medida, todo está publicado.Arjun Reddy, en el blog de Hugging Face

🔗 Artículo en Hugging Face


Una red de Leech en un kernel CUDA hace caber Qwen3-4B en 2,60 GB de VRAM

29 de agosto — El número de bits por peso es la única palanca que cambia la clase de máquina capaz de alojar un modelo: con 2 bits, un modelo de 70.000 millones de parámetros pasa de 140 GB a unos 18 GB y cabe en una tarjeta de 24 GB. Pero la calidad también debe acompañar, y la mejor calidad registrada con este nivel de compresión procede de la cuantificación vectorial por bloques de 24 en la red de Leech, un trabajo de Qualcomm AI Research.

El obstáculo estaba en el software. El kernel CUDA publicado con este artículo solo decodifica una capa de la red, en aras de la simplicidad, y sigue siendo más lento que los métodos de la competencia. Sin embargo, el diccionario realmente necesario con 2 bits es una unión de capas: 301 clases de equivalencia y un índice de 47 bits que designa un punto entre 1,1 × 10¹⁴. El autor no encontró en ninguna parte un decodificador para este índice.

Así que lo escribió. El núcleo matemático del proyecto —red, búsqueda exacta del vecino más próximo, indexación biyectiva de 48 bits, GPTQ esférico— está implementado en Rust sin ninguna dependencia externa y viene acompañado del decodificador CUDA fusionado que faltaba.

Elemento medidoValor registrado
Modelo cuantificadoQwen3-4B
Huella de VRAM2,60 GB
Rendimiento de generación87 tokens/s
Clases de equivalencia con 2 bits301
Tamaño del índice47 bits, entre 1,1 × 10¹⁴ puntos
Modelo de 70.000 millones a 2 bitsDe 140 GB a unos 18 GB

El modelo cuantificado produce los mismos tokens que el modelo denso en decodificación greedy, salvo por un desempate. Dos salvedades, planteadas por el propio autor: su decodificador sigue siendo más lento que el kernel competidor QTIP, que lee 2,40 veces menos bytes y funciona 2,27 veces más rápido; y la prepublicación fue depositada por el propio autor y no ha sido revisada por pares. El código y los datos son públicos.

🔗 Artículo en Hugging Face


Una sonda lineal entrenada en un modelo de visión funciona en el de un competidor

30 de agosto — Cuatro modelos multimodales de cuatro empresas diferentes codifican las mismas imágenes. Todos están congelados, ninguno se ha ajustado y sus estados ocultos ni siquiera tienen la misma anchura: 5.376, 5.120, 2.560 y 2.048 dimensiones. Nada debería permitir que una sonda aprendida en uno funcionara en otro. Pero funciona.

El protocolo es mínimo. Una sonda lineal —una única matriz de pesos— aprende a predecir etiquetas de imágenes a partir de los estados de un modelo y luego funciona sin reentrenamiento sobre los estados de otro, mediante una transformación estimada por regresión ridge únicamente con las filas de entrenamiento utilizadas como puente entre ambos espacios.

Ámbito evaluadoAUROC nativaAUROC transferidaCoste de transferencia
Imágenes por satélite, uso del suelo con 17 clases0,95070,94840,0024
Radiografías ChestX-ray14, 3 modelos de 40,74400,7511negativo

En las radiografías de tórax —lista oficial de prueba, 25.596 imágenes de pacientes nunca vistos durante el entrenamiento— la puntuación transferida supera la puntuación nativa, y cuatro de las seis direcciones cruzadas superan a la sonda propia del modelo de destino. El rigor de la medición explica por qué el resultado merece tomarse en serio: el coseno bruto entre elementos no relacionados alcanza 0,998 antes de la corrección, el centrado reduce los cuatro proveedores a 0,005 o menos, y cada afirmación se publica con su valor basal aleatorio: 0,5014 con etiquetas mezcladas en el conjunto de prueba de imágenes por satélite.

🔗 Artículo en Hugging Face


Together AI sitúa a GLM-5.3 por delante de dos modelos cerrados en tasa de alucinaciones, sin nombrar ningún benchmark

30 de agosto — Together AI presenta la baja tasa de alucinaciones de GLM-5.3 como un aspecto infravalorado del modelo y la compara con la de dos modelos cerrados de primer nivel.

Modelo comparadoTasa de alucinaciones relativa a GLM-5.3
GLM-5.3referencia
Claude Fable 5más de 2 veces superior
GPT-5.6 Lunamás de 3 veces superior

La medición debe interpretarse por lo que es. Together AI aloja GLM-5.3 y vende su inferencia: la fuente no es neutral. El mensaje no cita ni el benchmark utilizado, ni los valores absolutos, ni el método para contar las alucinaciones, solo proporciones. Una breve grabación acompaña a la publicación, pero el texto publicado no incluye ninguna cifra bruta. Por tanto, debe entenderse como una clasificación relativa, no como una evaluación independiente.

El enfoque sigue siendo destacable porque completa el retrato trazado en días anteriores: las comparaciones de DeepSWE publicadas el 29 medían la capacidad de programación y el coste, no la fiabilidad factual en producción.

an underrated part of glm-5.3 is its low hallucination rate

claude fable 5 is over 2x higher, while gpt-5.6 luna is over 3x higher

🇪🇸 Un aspecto infravalorado de glm-5.3 es su baja tasa de alucinaciones. La de claude fable 5 es más de 2 veces superior, mientras que la de gpt-5.6 luna es más de 3 veces superior.@togethercompute en X

🔗 Mensaje de @togethercompute


Breves

  • Reflexive Role Routing, un método para interrumpir un agente durante la generación — Una sonda de una única capa lineal lee durante la generación dos valores —la desviación entre el objetivo del prompt y la trayectoria actual, y la probabilidad estimada de que la salida supere la revisión— que un controlador congelado utiliza para decidir si debe interrumpirla. El proceso se formaliza como una decisión semi-markoviana para no descartar el contexto ya generado. Prepublicación depositada con el DOI 10.5281/zenodo.22171581. 🔗 Artículo en Hugging Face
  • Una evaluación de riesgos desechable, generada por un modelo de frontera — Un único prompt hace que un modelo potente cree un benchmark nuevo cuya rúbrica de evaluación permanece privada dentro de la conversación; los modelos evaluados realizan la prueba, sus respuestas vuelven a ella para ser puntuadas y después se desecha el benchmark. El autor no lo considera una solución contra la contaminación, sino únicamente una forma de reducir la dependencia de las mismas preguntas públicas. El interés reside sobre todo en la distinción impuesta a los resultados entre voluntad (willingness), capacidad (capability) y facilitación (enablement). 🔗 Artículo en Hugging Face
  • El modo de fallo predeterminado de CUDA es el silencio — Nota de aprendizaje de la primera semana de programación de GPU, escrita a partir del programa más sencillo posible: la suma de dos listas de mil números. Lo que sorprendió al autor no fue el funcionamiento de la GPU, sino la discreción con la que falla. Ningún anuncio ni lanzamiento de modelo. 🔗 Artículo en Hugging Face
  • GitHub vuelve a destacar la agrupación de las actualizaciones de Dependabot — En GCToolkit, un proyecto de Microsoft, aproximadamente uno de cada seis commits correspondía a la actualización de una única dependencia; bastaron tres cambios en el archivo dependabot.yml para corregir el ruido agrupando las actualizaciones y reduciendo su frecuencia, sin retrasar los parches de seguridad. El artículo en cuestión data del 29 de julio de 2026: solo se compartió el 30 de agosto. 🔗 Mensaje de @github
  • WebMCP Challenge: fecha límite el 3 de septiembre y sesión de preguntas y respuestas el 31 de agosto — OpenAI Developers recuerda que los proyectos del hackathon WebMCP pueden presentarse hasta el 3 de septiembre y anuncia en el mismo hilo una sesión de preguntas y respuestas (office hours) en Discord prevista para el lunes 31 de agosto a las 11 am PT, con los socios del concurso: Chrome, Cloudflare, Shopify, Vercel, Render y Netlify. El propio hackathon se había presentado el 25 de agosto. 🔗 Mensaje de @OpenAIDevs
  • Cohere publica tres fotos de Waterloo sin ningún anuncio asociado — La cuenta oficial prolonga el posicionamiento canadiense de la empresa, sin lanzamiento, cifras ni enlaces. Ningún contenido factual: se menciona para completar la cobertura del periodo. 🔗 Mensaje de @cohere

Qué significa esto

El hardware de consumo vuelve a ser una restricción de diseño, no un límite que haya que soportar. Dos de los trabajos del fin de semana parten de la misma premisa: la máquina disponible determina la arquitectura, y no al contrario. Gala está pensado para un Mac —memoria abundante, FLOPs escasos— y, por tanto, acumula parámetros y estado en lugar de cómputo por token; el resultado es una decodificación que no se ralentiza entre 32 768 y 10,5 millones de tokens de contexto. La cuantificación mediante red de Leech apunta al otro extremo de la cadena: reducir un modelo de 70 mil millones de parámetros de 140 GB a unos 18 GB, es decir, hacer que quepa en una tarjeta que poseen usuarios particulares. Ninguno de los dos pretende competir con un modelo de frontera, y esa no es la cuestión: ambos desplazan la pregunta del tamaño del modelo hacia la clase de máquina capaz de alojarlo.

Una sonda aprendida sobre un modelo puede interpretarse en el modelo vecino. El resultado más sorprendente del día es también el más discreto. Si cuatro modelos congelados de cuatro empresas codifican las imágenes de forma lo bastante similar como para que una sola matriz de pesos pueda transferirse de uno a otro con un coste de 0,0024 de AUROC —o incluso con un coste negativo—, entonces las herramientas construidas sobre esas representaciones dejan de estar cautivas del proveedor con el que se calibraron. El propio artículo ofrece esta interpretación práctica, pero señala de inmediato la limitación que impide que ya sea un método: las aplicaciones de transporte se ajustan por pares y nada indica que una sola de ellas funcionaría en un modelo excluido de ese ajuste. El rigor de la medición no se relaja en ningún momento: anisotropía corregida antes de cualquier comparación y nivel de azar publicado junto a cada puntuación.

Las afirmaciones de fiabilidad llegan sin metrología. Together AI sitúa a GLM-5.3 por delante de dos modelos cerrados en cuanto a la tasa de alucinaciones, pero no menciona ningún benchmark, no publica ningún valor absoluto ni describe su método de recuento, al tiempo que vende la inferencia del modelo que clasifica en primer lugar. El contraste con las publicaciones de investigación del mismo fin de semana es claro: estas publican sus niveles de azar junto a los resultados y detallan sus protocolos. Un informe sin referencia no es una medición, sino un argumento comercial, y merece ser clasificado como tal.

En cuanto al producto, el fin de semana solo trajo infraestructura básica, y ahí es donde se juega el futuro de los agentes. xAI no lanza ningún modelo: conecta Grok Bot con X, crea la cuenta de desarrollador en nombre del usuario y distribuye créditos de API para reducir la fricción de entrada. GitHub no anuncia ninguna funcionalidad espectacular: hace que su API REST de dependencias de issues tenga en cuenta el ámbito. En ambos casos, lo que cambia es el derecho de acceso y la superficie consultable, no la capacidad del modelo. Es el trabajo menos visible y más determinante para quienes construyen agentes destinados a leer una red social o un sistema de seguimiento de tickets.


Fuentes