검색

ESPnet, YODAS v3로 공개 음성 코퍼스를 세 배 확장… Mistral API에서 GLM 5.3 제공, JEV-27B와 OpenDecider는 Jev와 대등한 성능 주장

인공지능으로 생성된 기사
ESPnet, YODAS v3로 공개 음성 코퍼스를 세 배 확장… Mistral API에서 GLM 5.3 제공, JEV-27B와 OpenDecider는 Jev와 대등한 성능 주장

ai-powered-markdown-translator

gpt-6-sol로 프랑스어에서 한국어로 번역한 기사.

GitHub에서 프로젝트 보기 ↗

ESPnet이 100개 이상의 언어로 이루어진 110만 시간 분량의 공개 음성 데이터셋 YODAS v3를 발표했다. 첫 버전보다 규모가 세 배 크고 전체 오디오는 48 kHz다. Mistral은 이제 자사 API에서 Z.ai의 공개 가중치 모델 GLM 5.3을 100만 토큰의 컨텍스트와 99.5% SLA로 제공한다. 두 공개 의사결정 모델 JEV-27B와 OpenDecider는 개발자가 직접 측정한 벤치마크에서 Jev와 대등한 성능을 주장한다. MiniMax는 벤치마크나 API 요금 없이 M3.1-Flash-Preview를 출시했다. 단신에서는 Claude Code 규칙을 읽는 Copilot CLI 프리뷰와 OpenRouter의 무료 비공개 모델 Space Bunny Alpha도 다룬다.


ESPnet, 48 kHz 공개 음성 110만 시간 분량의 YODAS v3 발표

9월 27일 — ESPnet 팀의 William Chen과 Shinji Watanabe가 첫 버전보다 규모가 세 배 큰 110만 시간 분량의 다국어 음성 데이터셋 YODAS v3를 발표했다. 모든 오디오는 48 kHz로 배포하며, 웹 오디오에는 업샘플링된 자료가 많아 메타데이터에 실제 유효 주파수를 기록했다.

YODAS v3의 특징발표된 내용
지원 언어100개 이상, 그중 34개 언어는 각각 1,000시간 이상
다중 채널 오디오70% 이상이 서로 다른 채널을 최소 두 개 포함
주석 데이터단어별 타임스탬프가 있는 전사, 다국어 자료의 절반 이상에 영어 번역 제공
크기와 라이선스OPUS 형식 60 To, CC BY 3.0

저자들에 따르면 이 정도 규모면 Whisper 수준의 모델을 처음부터 학습할 수 있다. 250만 회 이상 다운로드된 첫 버전은 IBM Granite, NVIDIA Canary와 Parakeet, Ai2의 OLMoASR 학습에 사용됐다. 관련 논문은 Interspeech 2026 학술대회 논문집에 실렸다.

🔗 Hugging Face 블로그의 YODAS v3


Mistral API에서 Z.ai의 GLM 5.3 제공: 1M 컨텍스트와 99.5% SLA

9월 26일 — Z.ai는 8월 14일 GLM 5.3을 출시하고 28일 가중치를 공개했다. 이번 새 소식은 @MistralDevs 계정이 발표한 Mistral API 제공이다. 공개 프리뷰에서 식별자 zai-glm-5-3으로 제공되는 이 모델은 수정 없이 Mistral 인프라에서 서비스된다. 컨텍스트는 100만 토큰, 최대 출력은 128k 토큰, 처리 속도는 초당 100토큰 이상이며, 우선 등급(priority tier)의 SLA는 99.5%다.

토큰 100만 개당 요금Mistral APITogether AI (8월 29일)
입력1.40달러1.40달러
캐시된 입력0.14달러0.26달러
출력4.40달러4.40달러

Mistral은 8월 11일 GLM 5.2를 시작으로 자사 플랫폼을 타사 모델에 개방한다고 발표했다. GLM 5.3은 9월 21일 Vibe Code에 추가되어 웹 앱의 기본 모델이 됐다.

🔗 @MistralDevs의 발표 · 모델 정보


공개 의사결정 모델: AutoTrust AI의 JEV-27B와 OpenDecider, Jev와 비교

9월 27일 게시된 커뮤니티 글 두 편이 Apache-2.0 라이선스의 공개 의사결정 모델을 소개했다. 이 모델들은 에이전트가 던지는 참·거짓, 여러 선택지 중 고르기, 점수 매기기 같은 짧은 정형 질문에 각 답의 확률과 함께 빠르게 응답한다. Together AI의 Tev1-4B-experimental이 나온 지 나흘 만에 등장한 두 모델은 모두 TypeSafe AI가 호스팅하는 비공개 모델 Jev 1.13과 비교됐다. 아래 점수는 각 모델 저자들이 직접 측정한 결과다.

AutoTrust AI의 JEV-27B: 저자들에 따르면 평균적으로 Jev 1.13과 대등

9월 27일 — TypeSafe AI와 관계가 없다고 밝힌 AutoTrust AI가 공개 코퍼스로 Jev 1.13의 지식을 증류한 JEV-27B를 발표했다. 학습 방식은 Qwen3.8-27B를 동결한 채 분리 가능한 1억 890만 매개변수 블록을 추가해 B200에서 약 9.2시간 학습하는 것이다. 기본 모델은 변경되지 않았으며 HumanEval 점수는 78.0%다. 저자들이 9월 26일 측정한 점수는 다음과 같다.

의사결정 벤치마크JEV-27BJev 1.13 (API)
JevBench (공개 데이터셋)88,7087,18
Kev83,7585,52
OpenJev text73,8972,96
Nimble92,9191,84
VitaminC77,4678,46
MASSIVE-en87,7187,14
6개 평균84,0783,85

B200에서 의사결정 한 건의 지연 시간 중앙값은 137 ms다. 저자들은 대등한 성능이 평균에 한정되며, 증류 모델이 Jev의 취약점도 물려받는다고 인정한다. 독립 순위표에 결과를 제출할 예정이라고 밝혔다.

🔗 AutoTrust AI의 글

OpenDecider: typed-decisions에서 Laya와 Jev를 앞선 4억 매개변수 nano 모델

9월 27일 — Manjunath Janardhan이 의사결정 모델군 OpenDecider를 발표했다. Ettin 인코더 기반의 약 4억 매개변수 nano 모델, Qwen3-4B 기반의 40억 매개변수 small 모델, Mac용 MLX 버전으로 구성된다. 두 공개 교사 모델 Qwen3-235B와 DeepSeek V4.1 Flash에서 증류했으며 GPU 비용은 30달러 미만이었다.

평가 모델typed-decisions (2 000)새로운 일반 의사결정 (200)보정 오차
OpenDecider-nano0,7960,6800,092
OpenDecider-small0,6720,7350,087
Laya (특화 체크포인트)0,7660,5700,162
Jev 1.13 (API)0,7540,7300,164

저자의 측정에 따르면 small 모델은 처음 접하는 의사결정에서 Jev와 대등하면서 보정 오차는 거의 절반이다. Laya의 애플리케이션 평가 세트에서는 Jev가 0.774로 앞섰으며, 특히 피싱 항목에서는 0.90 대 0.63이었다. 예측 결과와 재현 가능한 벤치마크가 공개됐지만, 결과는 단일 시드에서 얻었다.

🔗 OpenDecider 소개 글


MiniMax, 벤치마크와 API 요금 공개 없이 MiniMax Code와 Token Plan에 M3.1-Flash-Preview 출시

9월 27일 — MiniMax가 최신 텍스트 모델 M3.1-Flash-Preview를 프리뷰로 선보였다. 오전에는 자체 코딩 에이전트 MiniMax Code에 처음 적용했고, 저녁에는 MiniMax 플랫폼의 구독 상품 Token Plan에도 추가했다.

MiniMax-M3.1 Flash Preview is now live on the Token Plan! Faster, lighter, and built for teams running high-volume, latency-sensitive workloads, now available under your existing Token Plan subscription, no extra setup required.

🇰🇷 MiniMax-M3.1 Flash Preview를 이제 Token Plan에서 사용할 수 있습니다! 더 빠르고 가벼우며 처리량이 많고 지연 시간에 민감한 작업을 운영하는 팀을 위해 설계된 이 모델은 추가 설정 없이 기존 Token Plan 구독에서 바로 이용할 수 있습니다. — X의 @MiniMax_AI

MiniMax는 벤치마크, API 요금, 모델 크기, 컨텍스트 창, 가중치 중 어느 것도 공개하지 않았다. 모델 릴리스 노트도 아직 7월 31일에서 멈춰 있다.

🔗 X에 게시된 MiniMax Code 출시 소식


단신

  • Copilot CLI, Claude Code 규칙 읽기 지원 — 9월 27일 공개된 프리뷰 1.0.89-5에서 Copilot CLI는 .claude/rules에 저장된 Claude Code 규칙 파일을 사용자 지정 지침으로 받아들인다. 아직 안정 버전 1.0.89는 출시되지 않았다. 릴리스 노트에는 인식하는 형식이나 우선순위가 명시되지 않았다. 🔗 출처
  • mistral CLI 0.7.0 — 9월 26일 별도 발표 없이 공개된 Mistral 명령줄 도구의 이번 버전에는 앱을 플랫폼에 배포해 프로덕션까지 올리는 mistral apps deploy, 앱을 Vibe 카탈로그에 게시하는 mistral apps publish, 오프라인 평가용 mistral evals가 추가됐다. 🔗 출처
  • Perplexity Agent API, GPT-6로 전환 — 9월 25일 소식이다. low와 medium 프리셋은 openai/gpt-5.6-luna에서 openai/gpt-6-luna으로, high 프리셋은 openai/gpt-5.6-sol에서 openai/gpt-6-sol으로 바뀌었다. 프롬프트, 추론 노력, 도구, 토큰 예산, 단계 제한은 그대로다. 🔗 출처
  • OpenRouter의 Space Bunny Alpha — 9월 23일 소식이다. OpenRouter가 개발사를 밝히지 않은 무료 비공개(stealth) 모델을 등록했다. 컨텍스트는 100만 토큰이며 텍스트, 이미지, 동영상을 입력받는다. 운영을 맡은 제3자 제공업체는 프롬프트와 응답을 보관할 수 있지만 학습에는 사용하지 않는다. 공식 벤치마크는 없다. 🔗 출처
  • 금융 수치를 평가하는 4B 판정 모델 — Tony Esposito가 은행 지표 열 가지에 대해 코드로 계산한 레이블을 담은 합성 데이터셋 FinCalc-NLI와 수치 주장을 검증하는 판정 모델 openjev-fincalc-4b를 공개했다. 판정 모델은 A100에서 40분간 파인튜닝했으며, 4 000건 중 94.4%를 맞혀 시험한 최고의 공개 판정 모델이 기록한 63.2%를 앞섰다. 🔗 출처
  • 16 Go Mac에서 모델 파인튜닝 — Harshit Kumar Gupta가 LoRA 파인튜닝 10회에서 PyTorch MPS가 Apple MLX보다 2.2~5.7배 빠르다고 측정했다. 다만 PyTorch MPS는 약 15억 매개변수에서 한계에 이른 반면, 4비트 MLX는 30억 매개변수 모델을 메모리에 올렸다. 두 환경의 LoRA 랭크와 옵티마이저는 서로 달랐다. 🔗 출처

이것이 의미하는 바

공개 데이터는 공개 모델을 떠받치는 기반으로 남아 있다. 저자들에 따르면 YODAS 첫 버전은 IBM, NVIDIA, Ai2 모델의 학습에 쓰였다. v3는 데이터 규모를 세 배로 늘리고 48 kHz와 다중 채널을 지원하면서 CC BY 3.0 라이선스를 유지한다. 저자들은 이 데이터로 Whisper 수준의 모델을 처음부터 학습할 수 있다고 본다. 오늘 소개한 의사결정 모델도 같은 흐름에 있다. JEV-27B는 공개 코퍼스로 학습했고, OpenDecider는 30달러 미만의 비용으로 공개 교사 모델 두 개를 증류했으며, 둘 다 Apache-2.0으로 배포된다.

공개 가중치 모델은 카탈로그의 한 항목처럼 판매되고, 호스팅 업체는 서비스 조건으로 차별화한다. 캐시를 제외한 GLM 5.3의 요금은 Mistral과 Together AI가 같다. 토큰 100만 개당 입력 1.40달러, 출력 4.40달러다. Mistral은 Together AI의 0.26달러보다 낮은 캐시 입력 요금 0.14달러, 초당 100토큰 이상의 처리 속도, 99.5% SLA를 내세운다. GLM 5.2부터 타사 모델을 받아들인 Mistral은 이로써 모델 개발사이자 호스팅 업체로 자리 잡는다. Perplexity에서도 내부 모델이 바뀌었다. Agent API 프리셋을 통과하는 요청은 이제 개발자가 모델을 직접 선택하지 않아도 GPT-6에서 실행된다.

남은 문제는 누가 성능을 측정하느냐다. JEV-27B와 OpenDecider는 저자들이 직접 실행한 벤치마크에서 Jev와 대등하다고 주장한다. 적어도 한계와 예측 결과 또는 재현 가능한 벤치마크를 공개했으며, 자체 표에서도 VitaminC부터 피싱까지 여러 시험에서는 Jev가 앞선다. 반면 MiniMax는 검증 가능한 수치를 전혀 제시하지 않은 채 모델을 출시했다. 벤치마크, API 요금, 컨텍스트 창도 없다. 두 경우 모두 독립적인 측정이 필요하며, AutoTrust AI는 독립 순위표에 결과를 제출하겠다고 밝혔다.

Mistral과 MiniMax 모두 새 모델을 먼저 자체 코딩 에이전트에 투입했다. GLM 5.3은 9월 21일 웹 버전 Vibe Code의 기본 모델이 된 뒤 Mistral API에 도입됐고, M3.1-Flash-Preview는 MiniMax Code에서 첫선을 보인 뒤 Token Plan에 추가됐다. 지침도 에이전트 사이를 오가기 시작했다. Copilot CLI 프리뷰 1.0.89-5는 Claude Code용으로 작성된 .claude/rules 파일을 읽는다. 따라서 적어도 이 프리뷰에서는 하나의 저장소가 동일한 규칙으로 두 에이전트를 안내할 수 있다.


출처