검색

OpenAI, 유럽연합에서 ChatGPT와 Codex 텍스트에 워터마크 도입 예정, Devin은 세션 간 기억 유지, GitHub는 ReviewBench 출시

ai-powered-markdown-translator

gpt-6.1-sol을 사용해 프랑스어에서 한국어로 번역한 기사.

GitHub에서 프로젝트 보기 ↗

OpenAI는 생성된 텍스트를 기계가 식별할 수 있도록 해야 한다는 AI Act의 요구에 대응해, 앞으로 몇 주 안에 유럽연합 사용자의 ChatGPT와 Codex 텍스트에 보이지 않는 워터마크를 추가한다. 전 세계 API 고객에게는 오늘부터 이 워터마크를 선택적으로 사용할 수 있도록 제공한다. 에이전트 분야에서는 기억 기능이 자리 잡고 있다. Cognition은 Devin에 세션 간 기억 기능을 추가하고 그 형식을 공개 표준으로 발표했으며, Cohere는 세션이 바뀌어도 맥락을 유지하는 기억 기능을 갖춘 North 2를 출시했다. GitHub는 인공지능 코드 검토를 위한 공개 벤치마크인 ReviewBench를 공개했다. 공개 모델 분야에서는 Reflection AI가 매개변수 5,010억 개의 Beam을 소개했으며, 가중치는 10월 중 추후 공개할 예정이다.


OpenAI의 보이지 않는 워터마크: 유럽연합에서는 ChatGPT와 Codex 텍스트에 표시, API에서는 전 세계에 선택 기능 제공

10월 5일 — OpenAI가 텍스트 출처에 관한 유럽 규정에 대한 대응 방안을 공개했다. AI Act는 생성형 인공지능 제공업체가 생성한 텍스트를 기계가 읽고 식별할 수 있도록 요구한다. OpenAI는 단계적으로 대응하면서, 현재 텍스트 워터마크 기술에는 상당한 한계(중대한 제약)가 있음을 처음부터 명시했다.

대상변경 사항발표된 일정
유럽연합의 ChatGPT 및 Codex 사용자, 모든 요금제적용 가능한 텍스트에 보이지 않는 워터마크 추가앞으로 몇 주 안에
전 세계 API 고객이름이 공개되지 않은 일부 모델에서 워터마크를 선택적으로 활성화(사용자 동의), 기본값은 비활성화10월 5일부터
승인을 받은 연구자 및 전문 기관신청 후 개별 심사를 거쳐 탐지기 접근 권한 부여10월 5일 신청 시작

OpenAI는 이를 전 세계에 기본 설정으로 적용하지 않으며, 클라우드 파트너와 협력해 앞으로 몇 주 안에 파트너가 제공하는 OpenAI 모델에도 같은 워터마크를 적용할 계획이다. textGrain 기술은 눈에 보이는 표시나 특수 문자 없이 모델의 단어 선택에 보이지 않는 통계적 신호를 추가한다. OpenAI에 따르면 이 기술은 텍스트용 SynthID를 포함해 시험한 다른 접근법과 동등하거나 더 나은 성능을 보인다. 기술 보고서가 공개됐으며, OpenAI는 코드를 공개할 계획이다. 탐지기는 워터마크를 놓치거나 오탐이 발생할 위험 때문에 출시 시점에는 공개되지 않는다. 접근 권한은 유럽연합 집행위원회의 실천 규범(실천 강령)에 따라 부여된다.

공개된 수치는 특히 탐지의 한계를 보여 준다.

측정 조건공개된 탐지율
200 tokens 길이의 문단, 심리학 관련 내용, 목표 오탐률 1 %약 80 %
400 tokens 길이의 문단, 심리학 관련 내용, 목표 오탐률 1 %약 95 %
수학 관련 내용, 동일한 1 % 기준훨씬 낮음 (수치는 그래프에만 제시됨)
수정하지 않은 400 tokens 길이의 영어 문단 (ELI5 데이터셋)약 92 %
같은 문단에서 단어의 10 %를 동의어로 교체66 %
같은 문단에서 단어의 25 %를 교체17 %

Watermarks have limits. They’re often undetectable, especially in short passages. Rewriting or translating text can completely remove the watermark.

🇰🇷 워터마크에는 한계가 있습니다. 특히 짧은 문단에서는 탐지되지 않는 경우가 많습니다. 텍스트를 다시 쓰거나 번역하면 워터마크가 완전히 사라질 수 있습니다. — X의 @OpenAI

품질 측면에서 OpenAI는 GPT-6 Astra의 벤치마크 8개에서 워터마크 적용 전후에 유의미한 차이가 없다고 측정했다(GPQA Diamond에서 94,44 % 대비 93,94 %, Terminal-Bench 4.0에서 53,90 % 대비 56,06 %). 게시물은 워터마크로 알 수 없는 사항도 명시한다. 사람이 얼마나 기여했는지, 텍스트의 소유권이나 책임이 누구에게 있는지, 사용자 신원이 무엇인지, 내용이 정확한지는 알 수 없으며, 워터마크가 없다고 해서 사람이 쓴 텍스트라는 증거가 되지도 않는다. 이미지와 오디오는 달라지는 것이 없다. openai.com/verify와 Content Provenance API는 기관에 계속 제공되며, 5월 19일부터 생성된 이미지의 C2PA 메타데이터에 SynthID도 추가되고 있다.

🔗 유럽연합의 텍스트 출처에 관한 OpenAI 게시물


코드 에이전트: Devin의 세션 간 기억, Cursor, Qwen Code, Together Link와 IBM Bob

10월 5일 — Cognition이 Devin에 서로 연결된 두 기능을 도입했다. 세션이 바뀌어도 유지되는 기억 기능인 Memory와, 매일 이 기억을 재정리하는 ‘꿈’인 Dreaming이다. Memory는 에이전트가 각 사용자와 작업하면서 배운 선호 사항, 수정 사항, 프로젝트나 작업 흐름에서 얻은 교훈을 보관한다. 세션 요약이 아니라 짧은 메모이며, 각 메모는 해당 교훈을 배운 세션에 연결된다. 이 기억은 개인별로 유지되며, 조직 전체가 공유하는 지침으로 바뀌지 않는다.

메모는 저장소, 프로젝트 또는 주제별로 분류된 Markdown 파일을 담은 영구 Git 저장소인 Memory Drive에 저장된다. 의도적으로 짧게 작성한 MEMORY.md 파일에는 전반적인 선호 사항과 나머지 내용의 색인이 들어 있다. Devin은 각 세션이 시작될 때 이 파일을 받은 뒤, 전체 기록을 프롬프트에 불러오지 않고 코드를 탐색할 때 쓰는 도구로 필요한 메모를 찾는다. 각 세션은 자체 Git 복사본에서 작업한다. Devin은 다른 세션의 업데이트를 병합하고, 리비전 검사로 오래된 상태를 바탕으로 한 쓰기를 거부하며, 충돌은 알림 없이 덮어쓰는 대신 표시한다.

Dreaming은 매일 실행되는 백그라운드 세션이다(Cognition의 게시물에서는 야간에 실행된다고 명시한다). Devin은 기억을 바탕으로 과거 대화를 다시 읽고, 겹치는 메모를 통합하며, 일시적인 세부 사항을 제거하고, 기록하지 못했던 교훈을 찾아내며, 어떤 세션에서도 사용하지 않은 기억을 삭제한다. devin.ai의 Customize → Memory 메뉴에서 이용할 수 있다. 게시물은 Devin Desktop이나 Devin CLI를 언급하지 않으며, 요금도 발표하지 않았다.

Cognition은 이 형식을 Agent Memory Repo라는 공개 표준으로 MIT 라이선스에 따라 공개했다. 기여를 받는 이 명세는 각 세션의 반복 절차(기억 복제, 검색, 사람의 개입 없이 업데이트, 수정할 때마다 푸시)와 하나의 세션에서 여러 기억을 함께 사용하는 방법을 설명한다. 각 기억은 자체 권한과 이력을 갖춘 별도 저장소에 저장된다. 소개된 활용 사례에는 팀 기억과 에이전트 군집(에이전트 무리)이 포함된다.

In early experimentation we saw a swarm of Devins using the memory as a way to coordinate at large scale without us prompting them to (we promise they didn’t hack anyone)

🇰🇷 초기 실험에서 Devin 군집이 저희가 요청하지 않았는데도 기억을 활용해 대규모로 협력하는 모습을 보았습니다(정말로, 누구도 해킹하지 않았습니다). — X의 @cognition

에이전트의 기억을 재정리하는 ‘꿈’은 이미 Anthropic(5월의 Claude Managed Agents)과 OpenAI(6월의 ChatGPT 기억 기능)에 존재했다. 이번에 달라진 점은 기억을 Git으로 버전 관리하는 파일에 저장하고, 다른 에이전트도 채택할 수 있는 명세로 공개했다는 것이다.

🔗 기억과 꿈에 관한 Cognition 게시물 🔗 Agent Memory Repo 명세

Cursor: 실행 중인 SDK 에이전트에 방향 제시

10월 5일 — Cursor가 TypeScript 또는 Python 코드에서 에이전트를 실행하는 SDK를 확장했다. run.steer() 메서드는 에이전트가 현재 진행 중인 턴에 메시지를 끼워 넣는다. 그 시점에 하위 에이전트가 작업 중이라면 백그라운드로 전환해 계속 작업한다. 백그라운드 하위 에이전트도 결과를 보고한다. 상위 에이전트의 턴이 끝났을 때 결과가 사라지는 대신, 같은 실행의 추가 턴으로 상위 에이전트에 전달된다.

SDK의 새 기능변경 기록에 명시된 적용 범위
run.steer(), 실행 중 제어TypeScript의 로컬 에이전트, 클라우드 에이전트에서는 메시지가 일반적인 후속 요청으로 전송됨
백그라운드 하위 에이전트의 결과 반환TypeScript와 Python의 로컬 에이전트
사용자 정의 도구의 MCP 주석 (readOnlyHint, destructiveHint…)TypeScript, SDK가 강제하지 않는 단순한 지침
시스템 프롬프트 교체 가능, 규칙과 스킬은 계속 로드됨TypeScript의 로컬 에이전트, 계정별로 접근 권한 활성화

이러한 변경 사항에 따른 요금은 발표되지 않았다.

🔗 Cursor의 X 게시물 🔗 Cursor SDK 변경 기록

Qwen Code v0.25.0: 작업 공간 에이전트, 이메일 채널과 Mem0 기억

10월 5일 — Qwen이 명령줄 프로그래밍 에이전트인 Qwen Code의 v0.25.0을 공개했다. 9월 29일의 v0.24.7 이후 첫 안정 버전으로, Managed Agent용 23개를 포함한 기능 42개와 수정 사항 79개가 추가됐으며, 알려진 호환성 파괴 변경은 없다. 모두 명시적으로 활성화해야 하는 세 가지 추가 기능이 눈에 띈다. 이제 작업 공간 에이전트가 로컬에서 협업한다. 데몬이 에이전트의 턴을 시작하고 재개하며, Web Shell에서는 에이전트와 작업을 관리하고 대화에서 @agent으로 에이전트를 호출할 수 있다. 이 지속형 에이전트는 만료와 취소가 가능한 공유를 통해 A2A 1.0 프로토콜도 지원한다. 마지막으로 Mem0 기억 기능을 CLI에 직접 연결할 수 있다. 엔드포인트와 키만 지정하면 Qwen Code가 해당 MCP 서버를 직접 등록한다. 이메일 채널은 IMAP과 SMTP를 사용하는 에이전트 전용 메일함도 제공하며, Code Mode는 모델이 묶은 Bash 호출을 병렬로 실행한다. 같은 날 아침 TypeScript SDK v0.1.18과 Desktop 애플리케이션 v0.25.0도 뒤이어 공개됐지만, Qwen의 트윗은 없었다.

🔗 Qwen Code v0.25.0 릴리스 노트

10월 5일 — Together AI가 이미 설치된 코드 에이전트를 플랫폼이 호스팅하는 공개 모델에서 실행할 수 있게 하는 Together Link를 베타로 출시했다. 설치 명령 하나(macOS 또는 Linux)로 계정 키를 사용해 Claude Code, Claude Desktop, Codex, OpenCode와 Pi를 자사 API에 연결한다. 문서는 ChatGPT Desktop도 지원 목록에 추가하며, 명령, 라우팅과 모델 목록은 아직 변경될 수 있다고 안내한다. Auto 모드 외에 네 가지 모델이 제공되며, 모두 1M tokens의 컨텍스트를 지원한다.

제공 모델Claude Code의 /model 메뉴에서 대응하는 항목
Kimi K3Opus
GLM 5.3Fable
GLM 5.3 FlashSonnet
DeepSeek V4.1 FlashHaiku

기본으로 선택되는 Auto 모드는 사용자가 Anthropic 키를 제공하면 어려운 작업을 Opus 5.5에 맡길 수 있다. 다만 게시물과 문서는 이 라우팅을 서로 다르게 설명한다. 게시물에 따르면 프롬프트 캐시를 유지하기 위해 세션당 한 번만 선택하지만, 문서에 따르면 Claude Code와 Claude Desktop에서만 요청별로 분류한다. Together AI는 산정 방식을 공개하지 않은 채 지출이 50 % 넘게 줄어든다고 발표했으며, 각 세션이 끝나면 실제 비용과 Opus 5.5에서 실행했을 경우의 비용을 나란히 표시한다.

🔗 Together AI 게시물 🔗 Together Link 문서

자체 호스팅 IBM Bob, NVIDIA의 Nemotron 3 Ultra 기반으로 작동

10월 5일 — IBM이 에이전트형 개발 도우미 Bob의 자체 호스팅(자체 인프라에서 운영) 버전이 Poolside Laguna S 2.1과 함께 NVIDIA의 Nemotron 3 Ultra를 기반으로 작동하는 이유를 설명했다. 지난주 정식 출시된 이 옵션은 외부 네트워크와 격리된(망이 분리된) 환경까지 포함해 고객 인프라에서 도우미를 실행한다. 팀은 네 가지 기준(하드웨어 자원 사용량, 코드 정확도, 지연 시간, 가중치 공개 여부)으로 모델을 평가했다. Bob의 에이전트 실행 프레임워크에서 모델을 시험했으며, Anthropic, OpenAI와 Google의 비공개 모델을 비교 기준으로 삼았다. 처음에는 지나치게 장황했던 Nemotron은 NVIDIA와 함께 조정했다. 프롬프트, 샘플링 매개변수, 추론 설정과 실행 프레임워크 수정이 포함됐다. IBM 내부 시험에 따르면 Blackwell GPU에서 실행되는 Nemotron 3 Ultra의 지연 시간은 네트워크를 통해 호출하는 최첨단 SaaS 모델의 약 4분의 1 수준까지 낮아지며, 도구 스키마를 엄격하게 준수한다. Laguna S 2.1은 성능 대비 자원 사용량이 우수해 선택됐다. 게시물은 정확도 점수를 공개하지 않았다.

🔗 자체 호스팅 Bob에 관한 IBM 게시물


ReviewBench : GitHub가 AI 코드 검토용 공개 벤치마크를 출시하다

10월 5일 — GitHub가 AI 코드 검토 에이전트를 위한 공개 벤치마크 ReviewBench를 연구용 사전 공개(연구 미리 보기) 단계로 출시했다. 전용 사이트에는 전체 데이터셋, 순위표, 방법론, 프롬프트와 평가 모델의 설정, 직접 실행할 수 있는 실행기가 공개되어 있다. 게시글은 미셸 저우와 알레한드로 카르데레라 데 디에고가 작성했으며, 감사의 글에서 GitHub와 Microsoft를 프로젝트 참여자로 언급한다.

데이터셋은 19개 언어로 작성된 187개 공개 오픈 소스 저장소의 풀 리퀘스트 219개로 구성된다. 언어와 저장소 크기의 분포는 풀 리퀘스트 1억 390만 개를 바탕으로 산출한 GitHub의 분포를 재현하되, 중간 규모와 대규모 변경에 의도적으로 더 높은 가중치를 부여했다. 정답 기준(기준 정답 집합)은 사람 검토자, 후속 커밋에서 추론한 문제, 결정론적 분석 도구, 여러 최첨단 LLM을 교차 활용해 구성한다. 지적 사항은 LLM 평가 모델로 검증하며, 게시글에 따르면 Claude Sonnet 5를 사용한다. 데이터셋 구축에 참여하지 않은 선임 엔지니어들이 모든 지적 사항에 다시 라벨을 붙였고, 이들의 판정은 96,6 %의 사례에서 ReviewBench와 일치했다. 정답 기준만을 대상으로 측정하는 ‘근거 기반’(정답 근거 기반) 재현율이 주요 비교 지표로 사용된다.

GitHub의 초기 순위표에 따르면 Copilot code review가 선두다.

평가 에이전트(설정)근거 기반 F1근거 기반 정밀도근거 기반 재현율실행 날짜
Copilot Code Review (Balanced)40,1 %87,8 %26,0 %2026년 10월 1일
Devin AI37,0 %84,0 %23,8 %2026년 9월 28일
Qodo35,1 %85,3 %22,1 %2026년 9월 28일
Codex (GPT-5.6 Sol · Ultra)32,3 %87,0 %19,9 %2026년 7월 19일
Cubic27,3 %85,5 %16,3 %2026년 6월 29일
Greptile27,2 %86,1 %16,2 %2026년 6월 16일
Cursor17,3 %87,7 %9,6 %2026년 9월 27일

사이트는 이 초기 결과들이 ReviewBench 팀이 명시된 날짜에 각 업체의 공개 제품을 실행해 얻은 것이며, 업체들이 직접 실행하거나 검증한 결과는 아니라고 설명한다. 이제 누구나 자신의 에이전트를 제출할 수 있다. 제출자가 컨테이너 이미지와 모델 키를 제공하고 GitHub가 평가 모델을 제공하며, 풀 리퀘스트 25개로 시험한 뒤 전체 평가를 세 차례 실행한다. 점수는 관리자의 검증을 거친 뒤, 해당 에이전트의 이전 점수보다 높거나 첫 등록인 경우에만 공개된다.

GitHub는 이를 Copilot code review 개선에도 활용한다. A/B 테스트에서 여러 독립 실행을 결합한 Lite 등급의 다중 모델 검토는 검토당 비용이 8,0 % 줄면서 재현율이 13,6 % 향상됐으며, 이는 오프라인 평가에서 예상한 방향과 일치한다. 게시글의 댓글 수 수치는 서로 모순된다. 본문에서는 +61 %, 그래프에서는 +25,0 %라고 한다.

🔗 ReviewBench에 관한 GitHub 게시글 🔗 ReviewBench 사이트와 순위표


Cohere가 North 2를 출시하고 PwC와 세계적 제휴를 맺다

10월 5일 — Cohere가 기업용 AI 에이전트 플랫폼 North의 새 버전인 North 2를 출시했다. 9월 9일에는 “곧 출시”한다고 발표했고, 이후 10월 출시를 예고한 버전이다. 출시 게시물 묶음은 15개 이상의 새로운 기능(15+ 신규 기능)을 내세우지만, 게시글에는 이 수치가 언급되지 않는다. 이번 버전의 핵심은 여러 단계로 구성된 자동화와 에이전트를 위해 재설계한 새로운 에이전트 실행 체계(에이전트 하네스)다. 플랫폼은 여전히 특정 모델에 종속되지 않아 Cohere 모델이나 고객의 모델을 사용할 수 있다.

기능 영역Cohere가 언급한 새로운 기능
에이전트프롬프트로 생성해 조직 내에서 공유하는 재사용 가능한 에이전트와 자동화; 다중 에이전트 오케스트레이션; 세션이 바뀌어도 맥락을 유지하는 메모리
생산성스킬(Skills), 라이브러리(Libraries) 및 프레젠테이션, 대시보드, 문서를 생성하는 애플리케이션; 7월 말에 출시된 Automations, 바로 사용할 수 있는 템플릿과 시각적 편집기 제공
커넥터Slack, SharePoint, OneDrive, Outlook, Exchange, Jira, Linear, Notion 및 GitHub; 금융 데이터 제공업체(PitchBook, FactSet 등)는 계획 단계
배포 및 보안자체 호스팅, VPC, 하이브리드, 온프레미스 또는 완전히 단절된 환경; SOC 2 Type 2, ISO 27001 및 ISO 42001; 중요한 의사결정에 대한 사람의 검증을 포함하는 자율성 정책
거버넌스North Admin 콘솔, 사용자 또는 그룹별 요청 및 토큰 사용량 단계, 한도 도달 전 알림

Cohere는 한국의 LG CNS와 캐나다의 Bell Cyber를 고객 사례로 제시하며, NVIDIA의 생성형 AI 책임자 카리 브리스키의 발언을 인용해 NVIDIA Blackwell 및 Hopper GPU에서 자사 모델의 처리량이 개선됐다고 강조한다. 구체적인 수치는 제시하지 않았다. 가격이나 배포 일정도 공개하지 않았으며, 게시글은 영업팀에 시연을 예약하도록 안내한다.

🔗 North 2 출시 게시글 🔗 X의 North 2 출시 게시물 묶음

캐나다에서 시작하는 PwC와의 세계적 제휴

10월 5일 — 같은 날 PwC와 Cohere는 캐나다에서 시작하는 세계적 제휴(글로벌 제휴)를 발표했다. 토론토발로 작성된 PwC Canada의 보도자료를 Cohere의 짧은 게시글이 소개했다. 역할 분담은 명확하다. Cohere는 North, 기업용 모델, 정보 검색 도구를 제공하고, PwC는 업종, 규제, 위험 관리, 전환에 관한 전문성을 제공하며 사용 사례 선정부터 AI를 기업 데이터와 시스템에 통합하는 단계까지 지원한다. 발표된 활용 분야는 기업 검색, 지식 접근, 심층 연구, 의사결정 지원, 작업 자동화다. 프라이빗 클라우드, 온프레미스 또는 단절된 환경에서 활용하며, 규제 산업을 우선 대상으로 삼는다. 보도자료는 PwC Canada의 도미닉 마리노와 아니 베예, Cohere의 에이든 고메즈를 인용하지만, 금액이나 고객, 캐나다 이외 지역의 일정은 제시하지 않는다. Cohere는 이미 9월 16일 OpenText와 제휴를 맺었다.

🔗 PwC와의 제휴에 관한 Cohere 게시글 🔗 PwC Canada 보도자료


공개 모델 : Beam, MetaEncoder-30B, 식물 유전체학에 활용되는 Gemma 4

공개 모델 세 가지가 서로 다른 세 단계에서 이날 소식을 전했다. 하나는 공개가 예고됐고, 하나는 발표 없이 업로드됐으며, 마지막 하나는 공개된 지 한 달 뒤에 소개됐다.

Beam : Reflection AI의 매개변수 5,010억 개 공개 모델

10월 5일 — Reflection AI가 첫 가중치 공개 모델인 Beam을 소개했다. 총 5,010억 개의 매개변수 중 230억 개가 활성화되는 희소 MoE로, 코드 작성, 추론, 에이전트 작업을 위해 설계됐으며 처음부터 전체 과정을 거쳐 학습됐다. 사전 학습에는 토큰 23조 8,000억 개를 사용했다. 강화 학습 단계에서는 NVIDIA GB300 GPU 10,500개를 4주 동안 사용해 1억 개가 넘는 실행 궤적(롤아웃)을 생성했다.

Reflection AI의 표에 따르면 다음과 같다.

평가 벤치마크BeamNemotron 3 UltraGLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
SWE-bench Verified80,970,7————
SWE Bench Pro v165,546,4——67,7—
Terminal Bench v2.180,156,488,288,386,690,6
DeepSWE v1.144,4—61,068,051,074,2

대시는 게시글에 점수가 보고되지 않았음을 나타낸다. Reflection AI는 추론 연산량을 3~4배 적게 사용하면서 GLM-5.2와 비슷한 추론 점수를 낸다고 주장하며, 순수 역량에서는 Kimi K3가 여전히 앞선다는 점을 인정한다. 아직 다운로드할 수 있는 것은 없다. Beam은 최종 평가와 적대적 테스트(레드팀 테스트)를 진행 중이며, 조기 이용을 위해서는 신청해야 한다. 가중치, 기술 보고서, 모델 설명서, 개발자 도구는 10월 중 추후 공개할 예정이다.

🔗 Beam에 관한 Reflection AI 게시글

MetaEncoder-30B, Meta가 발표 없이 업로드한 의사결정 인코더

10월 5일 — Meta가 Hugging Face의 facebook 조직 계정에 MetaEncoder-30B를 업로드했으며, 관련 발표는 확인되지 않았다. 저장소는 9월 30일에 생성되고 10월 5일에 수정됐으며, 우리가 집계한 시점에는 다운로드가 단 두 건이었다. 모델 설명서는 이를 Jev의 의사결정 모델 형식을 따른 “System One” 멀티모달 인코더로 소개한다. 자연어로 된 작업(질문, 지시, 상태 설명, 기준)과 이미지·동영상을 보조 자료로 포함한 텍스트 후보 목록을 입력하면 각 후보에 점수를 매긴다. 작업과 후보를 별도로 인코딩하므로 비교 연산이 내적으로 단순화되며, 최근접 이웃 인덱스를 사용하면 모델을 다시 실행하지 않고도 수백만 개의 후보를 다룰 수 있다. MetaEncoder는 Meta가 8월에 출시한 가중치 공개 에이전트 모델 Muse Glimmer 30B를 대조 학습 방식으로 미세 조정한 모델이며, Apache 2.0 라이선스를 그대로 적용한다. 다운로드하려면 약관에 동의해야 하며, vLLM으로 텍스트와 이미지에 대해 모델을 서빙할 수 있다.

평가 벤치마크모델 설명서의 점수사용 지표
JEVBench (원본 / 쉬움 / 어려움)0,9444 / 1,0000 / 0,7387정확도
ImaJEV-Bench0,8958정확도
NanoBEIR0,6632NDCG_linear@10
MMEB-V3 (이미지 / 동영상 / 시각 문서)0,7897 / 0,6046 / 0,8138Hit@1 / Hit@1 / NDCG@5

🔗 Hugging Face의 MetaEncoder-30B 모델 설명서

Living Models가 Gemma 4와 BOTANIC-1을 결합해 식물 DNA를 해독하다

10월 5일 — Google이 @GoogleAI의 X Article과 Gemmaverse 소개 페이지에서 파리에 기반을 둔 AI 생물학 연구소 Living Models의 작업을 소개했다. Gemma 4 E4B가 터미널 처리 파이프라인, 데이터 필터링, 도구 호출 등 분석 과정을 조율하며, 단일 NVIDIA L4 GPU에서 Ollama를 통해 로컬로 실행된다. 한편 320종의 식물로 사전 학습된 유전체 기반 모델 BOTANIC-1은 변이의 영향을 평가하며, 독자 보유 유전체 데이터는 온프레미스에 남는다. 사례 연구는 아드난 부알렘이 INRAE에서 수행한 발견을 재현한다. 멜론의 CmEIN3 유전자에서 염기 하나가 바뀌면 꽃이 암꽃에서 양성화로 변한다. X Article에 따르면 단일 염기 변이 후보 2,494개 중 검증된 변이가 4분도 안 돼 동점 없이 단독 1위로 나왔다.

테스트 구성(20회 실행)Recall@1
가이드 없음0,00
전문가 가이드0,15
BOTANIC-1 점수 사용0,90

Botanic1 모델(매개변수 3억~20억 개)과 bioRxiv 사전 공개 논문은 9월 초에 나왔다. 이번에 새로운 점은 Google의 소개와 결과의 상세 내용이다.

🔗 Google AI의 X Article 🔗 Google DeepMind의 Gemmaverse 페이지


ChatGPT 광고 : 시각적 형식 테스트와 측정 확대

10월 5일 — OpenAI가 ChatGPT용 시각적 광고 형식을 준비하고 있다. 제품과 관련된 영감, 사용 방식 또는 제품이 가능하게 하는 경험을 이미지로 보여준다. 첫 테스트는 이미지 생성 중에 진행되며, 광고를 명확히 표시하고 생성 중인 이미지와 분리한다. 이달 중 미국에서 첫 광고주 그룹을 대상으로 시작할 예정이다. OpenAI는 광고가 ChatGPT의 답변에 영향을 주지 않는다고 다시 강조하며, 회사에 따르면 ChatGPT는 매주 12억 명에게 도달한다.

발표 내용의 대부분은 측정 기능에 관한 것이다. Hightouch, Tealium, LiveRamp를 통한 전환 데이터 전송, 이름이 공개된 10개 어트리뷰션 파트너(AppsFlyer, Adjust, Triple Whale 등), Haus, Measured, WorkMagic과 진행하는 지역별 증분 효과 실험, 보고서의 광고 노출 후 1일 전환 추적 기간, 신호 품질 지표(Event Quality Score)가 포함된다. 브랜드 안전성 측면에서는 자격 요건을 충족하는 광고주가 표현을 제외할 수 있으며(Negative Phrases), DoubleVerify 및 Integral Ad Science와 평가 시범 운영도 준비 중이다. 픽셀과 Conversions API는 이미 5월 5일부터 제공되고 있다.

OpenAI가 공개한 결과공개 수치측정 수행 기관
WeightWatchers의 유료 검색 광고 기준 대비 고객 획득 비용−15,3 %DV Rockerbox
신규 고객이 발생시킨 Dose 브랜드의 증분 구매67 %WorkMagic
ChatGPT Ads를 통해 유입된 Portland Leather 방문자 중 해당 브랜드의 신규 방문자93 %Triple Whale

🔗 새로운 광고 형식에 관한 OpenAI 게시글 🔗 측정에 관한 Ads 블로그 게시글


Perplexity 10월 5일 변경 내역: Computer용 브라우저 확장 기능, Wiley와 Stripe Projects

10월 5일 — Perplexity가 18개 항목으로 구성된 제품 변경 내역을 공개했다. 확인 시점에는 X에 관련 게시물이 올라오지 않았다. 8개 항목은 이미 다룬 발표를 다시 소개하며(Automations, Claude Opus 5.5, 영상 생성, American Express Skills, AMD 기반 Portable Computer, Fast Search, Agent API의 Profiles, Claude Fable 5.1), 아홉 번째 항목은 10월 1일 발표한 그래프에 인터랙티브 3D 설명을 추가한다. 처음 소개된 새로운 기능은 다음 9가지다.

처음 소개된 새로운 기능플랫폼 또는 버전대상 사용자
Computer가 브라우저를 사용할 수 있게 하는 Chrome, Edge 또는 Brave 확장 기능(기본 브라우저는 Comet)Mac용 Perplexity 26.38.0 이상명시되지 않음
별도의 탭과 창에서 실행하는 Computer 작업Mac용 Perplexity 26.37.1 이상명시되지 않음
모바일의 작업 강도 모드(Light, Standard, High, Ultra)iOS 26.38.0 및 Android 2.100.0 이상Pro, Max, Enterprise Pro, Enterprise Max
별도의 Wiley 구독 없이 이용하는 Wiley 학술지와 도서Perplexity 및 Computer모든 요금제, 프리미엄 이용 한도는 상이함
GPT-6.1 Sol, Computer의 Light 작업 강도에서도 GPT-6 Sol을 대체Perplexity 및 Computer이용 자격을 갖춘 유료 구독자
첫 Computer 작업을 시작하도록 안내하는 대화웹신규 무료 계정
입력 영역에서 앱 연결(앱 연결)웹의 Computer명시되지 않음
투자 자료실(거래 자료실)용 DocSend 커넥터Computer이용 자격을 갖춘 DocSend 계정
Stripe Projects: Stripe CLI에서 Perplexity API 키 생성Stripe CLIPerplexity API 개발자

Stripe Projects에서는 명령어 하나로 프로젝트를 생성하거나 연결하고, 키를 생성해 .env 파일에 저장한다. Perplexity는 이 설정 작업을 Claude Code, Cursor 또는 Codex에 맡길 것을 제안한다.

🔗 Perplexity 10월 5일 변경 내역


생성형 창작: Suno Albums와 HeyGen의 HyperFrames Studio

Suno, 앨범 기능 추가

10월 5일 — Suno가 지금까지 플랫폼에 없었던 앨범 기능을 추가했다. 발표와 함께 공개한 글에 따르면, 이 기능은 가장 좋은 곡들을 완성된 프로젝트(정규 프로젝트)로 만들며, 앨범처럼 사용하던 재생 목록(재생 목록)을 이제 Album으로 변환할 수 있다. Suno는 첫 앨범 5개의 아티스트를 소개했다. naenia(Oakwood///diskrot), Old Soul(아이제이아 월리스), phenomenal(KakerMix///diskrot), Lost In a Dream(Dream Relic), VOID(ECHLO)다. Suno는 대상 요금제, 앨범당 곡 수, 정확한 서비스 개시일을 밝히지 않았다. 지난 6월에도 Suno는 커뮤니티에 재생 목록, 앨범, 라디오를 통한 청취 경험을 물었다.

🔗 Suno의 X 발표 🔗 놓치면 안 될 앨범 5선, Suno 블로그

HyperFrames Studio, 에이전트를 위해 설계한 HeyGen의 영상 편집기

10월 5일 — HTML 코드를 영상으로 변환하는 HeyGen의 오픈 소스 프레임워크 HyperFrames가 데스크톱 앱으로 출시된다. HyperFrames Studio는 에이전트를 위해 처음부터 설계한 영상 편집기를 표방한다. 원하는 영상을 설명하면 에이전트(Claude Code, Codex 또는 자체 에이전트)가 첫 편집본을 만들고, 이후 사람과 에이전트가 같은 타임라인(타임라인)에서 작업한다. 편집 방향은 프롬프트보다 직접 조작으로 정한다. 화면의 요소에 동그라미를 치거나, 특정 단어에 댓글을 고정하거나, 직접 잘라내는 방식이다. 앱은 4K로 내보내기를 지원하고, 수백 가지의 영감 자료와 템플릿을 제공한다고 밝힌다. HyperFrames의 X 계정에 따르면 무료이며, 다운로드는 macOS 버전만 제공된다. 이는 코드로 생성한 영상을 시각적으로 편집할 수 있었던 7월의 Studio Preview를 확장한 것이다.

🔗 HyperFrames Studio 발표 🔗 HeyGen의 관련 게시물


단신

  • Warp Factories, 정식 출시로 전환 — Warp는 가을 워크숍에 관한 10월 3일 게시물에서 자사의 에이전트 인프라 Warp Factories가 얼리 액세스에서 정식 출시로 전환 중이라고 밝혔다. 날짜와 가격은 공개하지 않았다. 팀은 이를 활용해 지난 한 달 동안 PR당 비용을 70 % 줄였다고 설명했다. 🔗 출처
  • Devin 10월 2일 릴리스 노트 — Microsoft Teams의 접근 설정이 이제 적용된다. 클릭 한 번으로 동일한 심각도의 보안 발견 사항을 모두 선택할 수 있으며(API v3 포함), 제공되는 플러그인은 설치 전에 스킬, MCP, 훅, 규칙을 보여준다. 대규모 Perforce 저장소의 환경 빌드는 10분 뒤 실패하는 대신 최대 3시간 동안 실행할 수 있다. 🔗 출처
  • Replit의 TikTok Ads MCP — Replit이 450개가 넘는 통합 기능 목록에 TikTok Ads를 추가했다. 계정을 연결하면 Agent가 작업 공간에서 TikTok 광고를 생성하고 관리하며, 잠재 고객에게 도달하고 성과를 측정할 수 있다. 연결에는 크레딧이 소모되지 않는다. 🔗 출처
  • Replit의 Cockle Finance — Replit이 Cockle Finance에 관한 영상을 고정 게시했다. 이 도구는 댄과 그의 아버지 스티브가 고객 유입을 추적하기 위해 Replit에서 만들었다. Replit에 따르면 댄은 3개월 동안 사업을 15 % 성장시켰지만, 측정 기준은 밝히지 않았다. 🔗 출처
  • Copilot CLI 1.0.92 안정 버전 — 이 버전은 사전 출시 버전 1.0.92-0부터 -5까지의 새 기능을 모았다. 유일한 신규 기능으로, Microsoft Entra에 로그인한 뒤 사용자가 사용할 계정을 선택할 수 있다. /logout은 해당 OAuth 세션을 종료하며, Entra로 보호되는 MCP 서버는 사용자 개입 없이 인증 정보를 갱신한다. 🔗 출처
  • Codex CLI 0.160.1 — 0.160.0의 이번 수정 버전에는 백포트 하나만 포함된다. 원격 환경이 명시적으로 설정된 원격 MCP stdio 서버를 시작할 때 Windows의 SYSTEMROOT, TEMP, TMP 환경 변수를 유지한다. 0.161.0 안정 버전은 아직 출시되지 않았으므로 이것이 최신 안정 버전이다. 🔗 출처
  • Gemini CLI 10월 5일 야간 빌드 — 변경 사항은 없다. 10월 3일 버전과 같은 커밋으로 빌드되어 버전 번호만 다르며, 안정 채널(v0.62.0)과 사전 출시 채널(v0.63.0-preview.0)은 그대로다. 🔗 출처
  • SpaceXAI TypeScript SDK 0.2.1 — 10월 2일 공개된 이 버전은 Standard Schema 검증기(Zod, Valibot 또는 ArkType)로 구조화된 출력을 검증하는 toJson(schema)과, 출력이 발생하기 전에 실패한 스트리밍(스트리밍) 요청을 재시도하는 retryBeforeOutput 옵션을 추가했다. Retry-After 헤더가 없는 429 응답의 대기 시간은 이제 250밀리초 대신 1초부터 시작해 최대 30초까지 늘어난다. 🔗 출처
  • Claude Agent SDK 기반 Cresta Conductor — Claude로 제품을 만드는 스타트업을 소개하는 Anthropic 시리즈에서 Cresta는 Claude Agent SDK를 기반으로 자연어를 사용해 고객 응대 에이전트를 만드는 도구 Conductor를 소개했다. Cresta에 따르면 초기 사용 사례에서 최초 배포 시간을 약 절반으로 줄였으며, 출시일과 가격은 공개하지 않았다. 🔗 출처
  • npm: 신뢰 기반 게시 설정의 만료 — 10월 2일부터 한 번도 게시에 사용하지 않은 신뢰 기반 게시(신뢰 기반 게시) 설정은 생성 후 48시간이 지나면 만료된다. npm은 pull_request_target과 마찬가지로 GitHub Actions의 issue_comment 이벤트에서 발급된 토큰도 거부한다. 🔗 출처
  • npm: 게시 대기로 새 패키지 생성 — 10월 2일부터 npm stage publish은 로컬 세션이나 세분화된 권한의 토큰으로 아직 존재하지 않는 패키지를 생성할 수 있다. 대기 등록만 허용하는 토큰(stage-only)도 사용할 수 있다. 첫 버전은 관리자가 승격해야 설치할 수 있다. 🔗 출처
  • Fast Search를 사용하는 Perplexity Agent API — Agent API의 low, medium, high 사전 설정은 이제 web_search 도구에 Fast Search를 사용한다. 호출 1 000회당 비용은 2,50달러에서 1달러로 줄고, 속도는 약 800 ms 빨라졌다. xhigh 사전 설정은 표준 검색을 유지한다. 🔗 출처
  • Perplexity RAG 가이드 — Perplexity가 검색 증강 생성(검색 증강 생성, RAG) 사례 9개와 아키텍처 7개를 담은 가이드를 공개했다. Zendesk나 GitHub Copilot 같은 외부 사례와 함께 자사의 웹 인덱스와 Instant Buy 기능을 소개한다. 새로운 제품 기능은 없다. 🔗 출처
  • Cohere 직원 수 — Cohere는 채용 게시물에서 자사 직원 수가 2026년 초 약 400명에서 현재 800명 이상으로 늘었다고 밝혔다. 🔗 출처
  • Meta의 IsoVGRBench와 Logbook — 별도 발표 없이 facebookresearch가 IsoVGRBench와 Logbook의 코드를 공개했다. IsoVGRBench는 한 가지 측면만 다른 16 000개 쌍으로 영상 보상 모델을 평가한다(같은 클립의 프레임 순서를 섞어 비교하면 이 모델들은 거의 무작위에 가까운 결과를 내놓는다). Logbook은 매우 긴 오디오 녹음의 이벤트를 다룬다. 🔗 출처
  • FiftyOne, LeRobot v3 데이터셋 읽기 지원 — 하르프리트 사호타의 커뮤니티 게시물에 따르면, 오픈 소스 도구 모음 FiftyOne이 이제 변환기나 영상 복사 없이 LeRobot v3 형식을 기본 지원한다. 시연에는 LeRobot 커뮤니티 데이터셋의 로봇 50종에서 추출한 497개 에피소드가 사용됐다. 🔗 출처
  • Ai2의 FetchMan-data — 10월 1일 별도 발표 없이 공개된 이 데이터셋은 MolmoSpaces에서 생성한 Unitree G1 휴머노이드의 물체 잡기 시뮬레이션 에피소드 352 696개(5 200만 프레임, 902개 지시)를 담고 있다. 형식은 LeRobot v3이며, 라이선스는 ODC-BY다. 🔗 출처
  • Hugging Face 프로필의 P(doom) — Hub 사용자는 인공지능이 인류의 존립을 위협하는 재앙을 일으킬 확률에 대한 자신의 추정치인 P(doom)을 프로필에 표시할 수 있다. 응답은 조사에 활용되며, 2주 뒤 집계하고 익명화한 결과만 공개된다. 🔗 출처
  • hf-image 확장 기능 — Hugging Face가 별도 발표 없이 자사의 레지스트리 cr.hf.co에서 컨테이너 이미지를 빌드, 푸시, 풀, 실행하는 CLI 확장 기능을 공개했다. 압축하지 않은 레이어는 Xet로 중복 제거되므로, README에 따르면 2 GB 레이어에서 100 MB를 수정하면 약 100 MB만 전송한다. 🔗 출처
  • 밀로시 코틀라르의 실험 3가지 — 밀로시 코틀라르는 커뮤니티 게시물 3개에서 다음 토큰에 대한 일치율 97,85 %를 유지하며 작은 트랜스포머의 KV 캐시를 2,71배 압축하고, MoE 라우팅에서 전문가가 할당되지 않은 토큰의 비율을 13,84 %에서 8,09 %로 줄였다고 밝혔다. 속도 향상은 없었다. 🔗 출처
  • 스티븐 유의 LLM 심사 모델 감사 — 스티븐 유는 38 400개 표본으로, 자신의 12B 재작성 모델의 GRPO 보상에서 사실 충실도를 평가하는 GLM-5.3 심사 모델을 감사했다. 사실이 바뀌었는지 탐지하는 데는 신뢰할 만했지만, 그 심각도를 판단하는 데는 잡음이 있었다. 오류가 있는 출력을 세자 첫 집계에서는 드러나지 않았던 39 %의 감소가 확인됐다. 🔗 출처
  • 도쿄 Sakana AI 심포지엄 — Sakana AI가 10월 26일 도쿄 히토쓰바시 홀에서 열리는 무료 심포지엄의 참가 신청을 받는다. 행사는 영어로 진행되며, 위르겐 슈미트후버의 강연과 Sakana AI 최고경영자 데이비드 하와의 대담이 예정되어 있다. 🔗 출처
  • NVIDIA Inception 스타트업과 유방암 — NVIDIA가 진료 과정에 인공지능을 적용하는 Inception 프로그램 소속 스타트업 4곳을 소개했다. FDA 허가를 받은 3D 초음파 장비 ATUSA를 개발한 iSono Health(수동 검사에서는 최대 45분이 걸리는 데 비해 유방 하나당 약 2분), Whiterabbit.ai, Ataraxis AI, SimBioSys다. 이 기술 중 일부는 FDA 승인을 받지 않았다. 🔗 출처

이것이 의미하는 것

텍스트의 출처 확인이 규제상 의무가 되고 있다. 지금까지 생성 콘텐츠의 추적 가능성은 주로 이미지와 오디오에 집중되어 있었으며, 워터마크와 검증 가능한 메타데이터를 활용했다. AI Act는 이 요건을 텍스트로 확대하며, OpenAI는 단계적으로 대응하고 있다. 유럽연합에서는 ChatGPT와 Codex의 텍스트에 워터마크를 기본 적용하고, API에서는 선택 기능으로 제공하며, 탐지기는 승인된 기관에만 제공한다. 공개된 수치는 이러한 신중함의 이유를 보여준다. 오탐률 목표가 1 %인 조건에서 심리학 분야 콘텐츠의 400토큰 구간은 약 95 %가 탐지된다. 하지만 영어로 된 400토큰 구간에서 단어의 10 %를 동의어로 바꾸면 탐지율은 약 92 %에서 66 %로 떨어지며, 재작성이나 번역으로 워터마크가 지워질 수 있다. 워터마크는 출처를 추정하는 단서이지 증거는 아니며, 워터마크가 없다는 사실만으로 작성자에 관해 알 수 있는 것은 없다.

에이전트 메모리가 자리 잡으며 표준화되기 시작했다. Devin은 배운 내용을 Markdown 파일로 구성된 Git 저장소에 보관하고, Dreaming이 이를 매일 재정리한다. Cognition은 다른 에이전트도 채택할 수 있도록 이 형식을 MIT 라이선스로 공개했다. North 2는 세션 간 맥락을 유지하며, Qwen Code는 Mem0를 CLI에 직접 연결한다. 사람이 읽을 수 있고 버전 관리되는 파일, 외부 메모리 서비스, 플랫폼에 통합된 기능 등 접근 방식은 다르지만, 모두 에이전트가 매 세션을 처음부터 시작하지 않게 하려는 같은 필요에 대응한다. Cognition의 선택에는 실용적인 장점이 있다. 각 메모는 해당 내용을 배운 세션으로 연결되고, 인터페이스에서 열람할 수 있으며, Git 기록을 유지한다. 이를 통해 에이전트가 기억한 내용을 읽고 수정할 수 있다.

개방형 모델이 여러 경로로 코딩 도구에 들어오고 있다. Together Link는 Claude Code와 Codex를 포함한 기존 에이전트에 이 모델들을 연결하며, 지출이 절반 이상 줄어든다고 밝힌다. IBM은 자체 인프라에서 개발을 진행하는 기업을 위해 Bob의 자체 호스팅 버전을 Nemotron 3 Ultra로 구동하며, 외부망과 단절된 환경까지 지원한다. Reflection AI는 Beam을 코딩과 에이전트 작업에 특화된 개방형 모델로 소개하며, 자체 표에서 SWE-bench Verified 점수 80,9를 제시한다. 공통된 주장은 점수 자체보다는 비용, 지연 시간, 데이터 통제에 무게를 둔다. Reflection AI도 점수에서는 Kimi K3가 여전히 앞선다고 인정한다.

오늘 소개된 수치 중 상당수는 발표 당사자가 제공했다. GitHub는 ReviewBench를 설계하고, 다른 개발사들의 실행이나 검증 없이 Copilot code review가 1위를 차지한 초기 순위를 작성했다. Nemotron 3 Ultra의 지연 시간은 IBM의 내부 테스트에서 나온 수치이며, Together Link의 비용 절감과 ChatGPT의 광고 성과는 Together AI와 OpenAI가 발표한 수치다. 다만 GitHub는 데이터셋, 심사 모델, 방법론을 공개하고 결과 제출을 받는다. 각 개발사는 자체 에이전트로 측정을 다시 수행할 수 있다. 이를 통해 초기 순위가 유지되는지 판단할 수 있을 것이다.


출처