ai-powered-markdown-translatorgpt-5.6-sol을 사용하여 프랑스어에서 한국어로 번역된 기사.
8월 29일과 30일 주말에는 5개 분야에서 단 12건의 발표만 나왔다. 전날의 22건, 28일의 42건과 대조적이다. 두 가지 원인이 겹쳤으며, 어느 쪽도 감출 이유가 없다. 29일은 토요일, 30일은 일요일이어서 거의 모든 공식 블로그가 아무것도 게시하지 않았다. 게다가 수집 도중 X에 장애가 발생해 프로필 피드를 제공하는 인터페이스가 응답을 멈췄다. 이에 따라 이미지·동영상 생성 및 개발 도구 관련 계정 등 추적하던 계정 23개에 접근할 수 없었다. 따라서 트윗으로만 공개된 발표는 스캔에서 빠졌을 수 있다.
그럼에도 이날의 소식은 두 갈래로 나뉜다. 제품 측면에서는 xAI가 Grok Bot을 X 네트워크에 연결했고 GitHub가 Issues의 발전 사항 다섯 가지를 상세히 소개했다. 연구 측면의 소식은 전부 Hugging Face 블로그와 개인 기고자에게서 나왔다. 한 비전 모델에서 훈련해 경쟁사의 모델에도 적용할 수 있는 선형 프로브, 단 한 대의 MacBook에서 사전 훈련된 포스트 Transformer 모델, Qwen3-4B를 2.60GB의 VRAM에 담는 Leech 격자, 생성 중인 에이전트를 중단하는 방법이다. 이는 연구 결과이지 제품 출시는 아니다.
Grok Bot이 X에 연결되다
8월 29일 — xAI는 자율 에이전트 제품인 Grok Bot의 업데이트를 뉴스 피드에 게시했다. 이제 이 제품은 X와 더 긴밀하게 통합된다.
메커니즘은 계정 연결 하나로 이루어진다. 사용자가 Grok Bot에서 X 계정을 연결하면, 개발자 계정이 없는 경우 xAI가 자동으로 계정을 생성해 준다. 이는 네트워크에 프로그래밍 방식으로 접근하기 위한 필수 단계다. 또한 Grok Bot 유료 구독자는 시작에 사용할 수 있는 무료 X API 크레딧을 받지만, xAI는 그 규모나 유효기간을 명시하지 않았다.
커넥터를 활성화하면 Bot은 게시물을 검색하고, 소유자의 뉴스 피드를 읽고, 멘션을 확인하며, 네트워크에서 오가는 내용을 종합해 요약할 수 있다. 시작하려면 Grok Bot을 열고 X 커넥터를 이용하기만 하면 된다.
xAI는 이번 배포를 통합의 첫 번째 버전이라고 명시했으며, 앞으로도 Grok Bot이 X에서 더 쉽게 작업할 수 있도록 개선하겠다고 밝혔다.
GitHub Issues: 범위 인식형 종속성 REST API를 포함한 새로운 기능 다섯 가지
8월 29일 — GitHub는 별도의 변경 로그 항목 없이 X에서 직접 GitHub Issues의 발전 사항 다섯 가지를 공개했다. 해당 게시물 자체가 1차 출처다.
그중 네 가지는 탐색 편의성에 관한 것이다. 이제 보기를 사이드바에 고정할 수 있어 세션마다 필터를 다시 만들 필요가 없다. 이전에는 개수만 표시되던 반응에 이제 프로필 아바타가 나타난다. 대시보드 밀도를 조절할 수 있어 행이 많은 저장소에서 유용하다. 종료된 하위 이슈를 숨길 수 있어 프로젝트 추적에 사용되는 상위 이슈가 한결 간결해진다.
다섯 번째는 자동화에 가장 큰 구조적 영향을 미친다. 이슈 종속성 REST API가 범위 인식형(scope-aware)으로 바뀐다. 작업 처리 순서를 나타내는 이슈 간 종속성을 이제 범위를 고려해 조회할 수 있다. 이는 저장소 추적 정보를 바탕으로 작업 계획을 구성하는 에이전트와 스크립트에 직접적인 의미가 있다. GitHub는 이 다섯 가지 변경 사항의 제공 범위를 명시하지 않았다.
| 발표된 새로운 기능 | 변경 범위 |
|---|---|
| 사이드바에 보기 고정 | Issues 탐색 |
| 반응에 프로필 아바타 표시 | 반응 표시 |
| 대시보드 밀도 조절 | 대시보드 |
| 종료된 하위 이슈 숨기기 | 상위 이슈 및 하위 이슈 |
| 범위 인식형 종속성 REST API | REST API, 이슈 간 종속성 |
단 한 대의 MacBook에서 사전 훈련된 포스트 Transformer 모델 Gala, 일정한 속도로 1,000만 개의 토큰을 읽다
8월 29일 — 가칭 Gala라는 소형 언어 모델 제품군이 단 한 대의 MacBook에서 순수 MLX로 5일 동안 처음부터 사전 훈련됐다. 사용된 기기는 M3 Max, 40코어 GPU, 128GB 통합 메모리 사양이다.
이 실험은 관점의 전환에서 출발한다. Transformer는 조밀한 행렬 곱셈 자원은 풍부하지만 고대역폭 메모리는 부족한 하드웨어를 위해 설계됐다. Mac은 그 반대에 해당하는 기기다. 따라서 채택된 아키텍처는 매개변수와 상태를 축적하면서 토큰당 FLOPs를 제한한다.
최종 테스트에서는 노트북에서 배치 크기 1로 실제 FineWeb 텍스트 1,050만 개의 토큰을 처리했다. 증가하는 것은 아무것도 없었다. 전체 구간에서 순환 상태는 3.07MB로 고정됐으며 디코딩 속도도 저하되지 않았다. 이어지는 2,000개 토큰의 손실 역시 증가하지 않았다. 동일한 데이터로 훈련한 기준 Transformer는 컨텍스트가 32k에 이르는 순간부터 134 tokens/s로 디코딩하며, 토큰 100만 개에서는 약 33GB의 KV cache가 필요하다.
| 도달한 컨텍스트 | 디코딩 속도 | 이어지는 2,000개 토큰의 손실 | 순환 상태 |
|---|---|---|---|
| 32 768 | 382,3 tokens/s | 3,630 | 3,07 Mo |
| 1 048 576 | 388,1 tokens/s | 3,534 | 3,07 Mo |
| 5 242 880 | 386,2 tokens/s | 3,590 | 3,07 Mo |
| 10 485 760 | 385,8 tokens/s | 3,296 | 3,07 Mo |
입력 처리 속도는 약 28,000 tokens/s로 선형을 유지해 1,000만 개를 처리하는 데 약 6분이 걸린다. 모델은 실행 로그와 함께 공개됐으며, 글에는 모델이 할 수 없는 일을 설명하는 별도 섹션도 마련돼 있다.
A post-transformer language model, pretrained from scratch on one MacBook in pure MLX, that reads 10M tokens of context at constant speed. Five days, every number measured, everything released.
🇰🇷 순수 MLX를 사용해 단 한 대의 MacBook에서 처음부터 사전 훈련됐으며, 일정한 속도로 1,000만 개의 컨텍스트 토큰을 읽는 포스트 Transformer 언어 모델이다. 5일간 모든 수치를 측정했으며, 전부 공개했다. — Hugging Face 블로그의 Arjun Reddy
CUDA kernel의 Leech 격자로 Qwen3-4B를 2.60GB의 VRAM에 담다
8월 29일 — 가중치당 비트 수는 모델을 구동할 수 있는 기기의 등급을 바꾸는 유일한 요소다. 2 bits에서는 매개변수 700억 개 규모의 모델이 140GB에서 약 18GB로 줄어 24GB 카드에 들어간다. 다만 품질도 따라줘야 한다. 이 압축 수준에서 보고된 최고 품질은 Qualcomm AI Research가 연구한 Leech 격자의 24개 단위 블록 벡터 양자화에서 나왔다.
문제는 소프트웨어였다. 이 논문과 함께 공개된 CUDA kernel은 단순화를 위해 격자의 단일 계층만 디코딩하며, 경쟁 방식보다 느리다. 하지만 2 bits에서 실제로 필요한 코드북은 여러 계층의 합집합이다. 이는 301개의 동치류와 1.1 × 10¹⁴개 점 가운데 하나를 지정하는 47 bits 인덱스로 이루어진다. 저자는 이 인덱스를 위한 디코더를 어디에서도 찾지 못했다.
그래서 직접 만들었다. 프로젝트의 수학적 핵심인 격자, 정확한 최근접 이웃 검색, 48 bits 전단사 인덱싱, 구면 GPTQ는 외부 종속성 없이 Rust로 구현됐으며, 그동안 빠져 있던 융합 CUDA 디코더도 함께 제공된다.
| 측정 요소 | 측정값 |
|---|---|
| 양자화된 모델 | Qwen3-4B |
| VRAM 사용량 | 2,60 Go |
| 생성 처리량 | 87 tokens/s |
| 2 bits 동치류 | 301 |
| 인덱스 크기 | 47 bits, 1,1 × 10¹⁴개 점 중 하나 |
| 2 bits의 700억 매개변수 모델 | 140 Go에서 약 18 Go로 |
양자화된 모델은 동률 판정에서 발생하는 차이 하나를 제외하면 탐욕 디코딩에서 조밀 모델과 동일한 토큰을 생성한다. 저자 스스로 두 가지 한계를 밝혔다. 이 디코더는 경쟁 kernel인 QTIP보다 여전히 느리다. QTIP은 읽는 바이트가 2.40배 적고 속도는 2.27배 빠르다. 또한 이 사전 논문은 저자가 직접 등록했으며 동료 심사를 거치지 않았다. 코드와 데이터는 공개돼 있다.
한 비전 모델에서 훈련된 선형 프로브가 경쟁사의 모델에서도 작동하다
8월 30일 — 서로 다른 네 기업의 멀티모달 모델 네 개가 동일한 이미지를 인코딩한다. 모두 동결됐고 어느 것도 미세 조정되지 않았으며, 은닉 상태의 너비조차 각각 5,376, 5,120, 2,560, 2,048차원으로 다르다. 한 모델에서 학습된 프로브가 다른 모델에서 작동할 이유가 전혀 없어 보인다. 하지만 작동한다.
프로토콜은 최소한으로 구성됐다. 단 하나의 가중치 행렬로 이루어진 선형 프로브가 한 모델의 상태를 바탕으로 이미지 레이블을 예측하도록 학습한다. 이후 두 공간을 잇는 연결 고리로 훈련 행만 사용해 ridge regression으로 추정한 변환을 적용하고, 재학습 없이 다른 모델의 상태에서 프로브를 실행한다.
| 평가 영역 | 기본 AUROC | 전이 AUROC | 전이 비용 |
|---|---|---|---|
| 위성 영상, 17개 클래스 토지 이용 | 0,9507 | 0,9484 | 0,0024 |
| ChestX-ray14 방사선 영상, 모델 4개 중 3개 | 0,7440 | 0,7511 | 음수 |
흉부 방사선 영상에서는 훈련 중 한 번도 보지 못한 환자의 영상 25,596장으로 구성된 공식 테스트 목록에서 전이 점수가 기본 점수를 넘어섰으며, 여섯 가지 교차 방향 가운데 네 가지가 대상 모델 자체의 프로브보다 높은 성능을 냈다. 측정 규율 덕분에 이 결과는 진지하게 살펴볼 가치가 있다. 보정 전에는 서로 관련 없는 요소 간의 원시 cosine이 최대 0.998까지 올랐지만, 중심화 후에는 네 공급자 모두 0.005 이하로 내려갔다. 또한 각 주장은 우연 수준의 하한과 함께 공개됐다. 위성 테스트 세트에서 레이블을 섞었을 때의 값은 0.5014였다.
Together AI, benchmark를 밝히지 않은 채 환각률에서 GLM-5.3이 두 비공개 모델보다 앞선다고 제시하다
8월 30일 — Together AI는 GLM-5.3의 낮은 환각률을 과소평가된 특성으로 소개하며, 이를 선도적인 비공개 모델 두 개와 비교했다.
| 비교 모델 | GLM-5.3 대비 상대 환각률 |
|---|---|
| GLM-5.3 | 기준 |
| Claude Fable 5 | 2배 이상 높음 |
| GPT-5.6 Luna | 3배 이상 높음 |
이 측정은 있는 그대로 해석해야 한다. Together AI는 GLM-5.3을 호스팅하고 추론 서비스를 판매하므로 중립적인 출처가 아니다. 게시물에는 사용한 benchmark, 절댓값, 환각 집계 방법이 전혀 제시되지 않았고 비율만 공개됐다. 짧은 동영상이 게시물에 첨부됐지만 공개된 글에는 원시 수치가 하나도 없다. 따라서 독립적인 평가가 아니라 상대적인 순위로 받아들여야 한다.
그럼에도 이 관점은 주목할 만하다. 며칠 전 제시된 모델의 모습에 새로운 측면을 보태기 때문이다. 29일 공개된 DeepSWE 비교는 코딩 능력과 비용을 측정했을 뿐, 프로덕션 환경의 사실적 신뢰성은 평가하지 않았다.
an underrated part of glm-5.3 is its low hallucination rate
claude fable 5 is over 2x higher, while gpt-5.6 luna is over 3x higher
🇰🇷 glm-5.3에서 과소평가된 측면은 낮은 환각률이다. claude fable 5는 2배 이상 높고, gpt-5.6 luna는 3배 이상 높다. — X의 @togethercompute
단신
- Reflexive Role Routing, 생성 중인 에이전트를 중단하는 방법 — 단일 선형 계층 프로브가 생성 도중 두 값을 읽는다. 하나는 프롬프트의 목표와 현재 궤적 사이의 이탈 정도이고, 다른 하나는 출력이 검토를 통과할 것으로 추정되는 확률이다. 동결된 컨트롤러는 이를 바탕으로 중단 여부를 결정한다. 이미 생성된 컨텍스트를 버리지 않도록 이 과정은 준 Markov 의사결정으로 정식화됐다. 사전 논문은 DOI 10.5281/zenodo.22171581로 등록됐다. 🔗 Hugging Face 게시글
- 최전선 모델이 생성한 일회용 위험 평가 — 단일 프롬프트로 강력한 모델이 새로운 benchmark를 만들며, 채점 기준표는 대화 안에서 비공개로 유지된다. 평가 대상 모델들이 테스트를 치르면 그 응답을 다시 보내 채점한 뒤 benchmark를 폐기한다. 저자는 이것이 오염을 막는 방안이라고 보지 않으며, 단지 반복해서 사용되는 동일한 공개 질문에 대한 의존도를 낮춘다고 설명한다. 특히 결과에서 의향(willingness), 능력(capability), 조력(enablement)을 구분하도록 한 점이 흥미롭다. 🔗 Hugging Face 게시글
- CUDA의 기본 장애 방식은 침묵이다 — GPU 프로그래밍 첫 주에 작성한 학습 기록으로, 가능한 가장 단순한 프로그램인 숫자 1,000개로 구성된 두 목록의 덧셈에서 출발한다. 저자에게 인상적이었던 것은 GPU의 작동 방식이 아니라 장애가 발생할 때 드러나는 고요함이었다. 발표나 모델 출시는 없다. 🔗 Hugging Face 게시글
- GitHub, Dependabot 업데이트 묶음을 다시 조명하다 — Microsoft 프로젝트인 GCToolkit에서는 커밋 약 6개 중 하나가 단일 종속성의 버전 업데이트였다.
dependabot.yml파일을 세 번 수정하는 것만으로 업데이트를 묶고 주기를 늦춰 소음을 줄였으며, 보안 수정은 지연되지 않았다. 소개된 글은 2026년 7월 29일에 작성됐고, 공유만 8월 30일에 이뤄졌다. 🔗 @github의 게시물 - WebMCP Challenge: 9월 3일 마감 및 8월 31일 질의응답 세션 — OpenAI Developers는 WebMCP hackathon 프로젝트를 9월 3일까지 제출할 수 있다고 알리고, 같은 스레드에서 대회 파트너인 Chrome, Cloudflare, Shopify, Vercel, Render, Netlify와 함께하는 질의응답 세션(office hours)을 8월 31일 월요일 오전 11시 PT에 Discord에서 진행한다고 발표했다. hackathon 자체는 8월 25일에 소개됐다. 🔗 @OpenAIDevs의 게시물
- Cohere, 관련 발표 없이 Waterloo 사진 세 장을 게시하다 — 공식 계정은 출시 소식, 수치, 링크 없이 기업의 캐나다 정체성을 계속 강조했다. 사실로 다룰 내용은 없으며, 수집 기간의 완전성을 위해 기록한다. 🔗 @cohere의 게시물
이것이 의미하는 것
소비자용 하드웨어는 감수해야 할 한계가 아니라 다시 설계 제약 조건이 되고 있다. 주말에 공개된 연구 두 건은 같은 전제에서 출발한다. 사용할 수 있는 기계가 아키텍처를 결정하며, 그 반대가 아니라는 것이다. Gala는 풍부한 메모리와 부족한 FLOPs라는 Mac의 특성에 맞춰 설계되었기 때문에 토큰당 연산량 대신 매개변수와 상태를 축적한다. 그 결과 문맥이 32,768토큰에서 1,050만 토큰으로 늘어나도 디코딩 속도가 느려지지 않는다. Leech 격자 양자화는 사슬의 반대쪽 끝을 겨냥한다. 매개변수 700억 개짜리 모델을 140GB에서 약 18GB로 줄인다는 것은 개인이 보유할 수 있는 그래픽 카드에 모델을 넣는다는 뜻이다. 어느 쪽도 프런티어 모델과 경쟁한다고 주장하지 않으며, 그것이 핵심도 아니다. 두 연구 모두 모델 크기에 관한 질문을 해당 모델을 구동할 수 있는 기계의 등급에 관한 질문으로 바꾼다.
한 모델에서 학습한 프로브를 이웃 모델에서도 사용할 수 있다. 이날 가장 놀라운 결과는 가장 눈에 띄지 않는 결과이기도 하다. 서로 다른 네 기업의 동결된 모델 네 개가 이미지를 충분히 비슷하게 인코딩해 하나의 가중치 행렬을 한 모델에서 다른 모델로 옮길 때 AUROC 손실이 0.0024에 불과하고 심지어 성능이 향상되기도 한다면, 이러한 표현 위에 구축된 도구는 더 이상 보정에 사용한 공급자에게 종속되지 않는다. 논문 자체도 이러한 실용적 해석을 제시하지만, 이것이 아직 하나의 방법론이 되지 못하게 하는 한계도 곧바로 밝힌다. 전송 매핑은 모델 쌍마다 따로 조정되며, 그중 하나가 이러한 조정에서 제외된 모델에서도 작동하리라는 보장은 없다. 측정의 엄밀함은 어느 대목에서도 흐트러지지 않는다. 모든 비교 전에 이방성을 보정하고 각 점수 옆에 무작위 기준선을 함께 공개한다.
신뢰성에 관한 주장은 계측 없이 제시된다. Together AI는 환각률에서 GLM-5.3이 두 비공개 모델보다 앞선다고 평가하지만, 어떤 벤치마크도 명시하지 않고 절대값도 공개하지 않으며 집계 방법도 설명하지 않는다. 그러면서 자신이 1위로 평가한 모델의 추론 서비스를 판매한다. 같은 주말에 공개된 연구 글들과는 뚜렷이 대조된다. 이 연구들은 결과 옆에 무작위 기준선을 공개하고 프로토콜을 상세히 설명한다. 기준 체계가 없는 보고서는 측정이 아니라 마케팅 논거이며, 그에 맞게 분류해야 한다.
제품 측면에서 이번 주말에 나온 것은 배관 작업뿐이었지만, 에이전트의 성패는 바로 여기서 갈린다. xAI는 모델을 출시한 것이 아니다. Grok Bot을 X에 연결하고, 사용자를 대신해 개발자 계정을 만들며, 진입 장벽을 낮추기 위해 API 크레딧을 제공한다. GitHub도 화려한 기능을 발표한 것이 아니다. 이슈 종속성 REST API가 범위를 인식하도록 만들었다. 두 경우 모두 바뀐 것은 모델의 역량이 아니라 접근 권한과 질의할 수 있는 영역이다. 소셜 네트워크나 티켓 추적 시스템을 읽어야 하는 에이전트를 만드는 사람에게는 이것이 가장 눈에 띄지 않으면서도 가장 결정적인 작업이다.
출처
- xAI — 이제 Grok Bot을 X와 함께 사용할 수 있음
- GitHub — GitHub Issues의 새로운 기능 다섯 가지
- MacBook에서 훈련한 포스트 Transformer 모델 Gala
- Leech 격자 양자화 및 융합 CUDA 디코더
- 동결된 비전 모델 간에 전송된 선형 프로브
- Together AI — GLM-5.3의 환각률
- Reflexive Role Routing
- 프런티어 모델이 생성한 일회용 위험 평가
- CUDA의 조용한 실패에 관한 학습 노트
- GitHub — Dependabot 업데이트 그룹화
- OpenAI Developers — WebMCP Challenge 및 질의응답 세션
- Cohere — Waterloo 사진