검색

OpenAI가 GPT-Red로 GPT-5.6을 강화하고, Claude Code가 아티팩트를 MCP에 연결하며, xAI가 Grok Build를 오픈 소스로 공개

OpenAI가 GPT-Red로 GPT-5.6을 강화하고, Claude Code가 아티팩트를 MCP에 연결하며, xAI가 Grok Build를 오픈 소스로 공개

ai-powered-markdown-translator

gpt-5.4-mini로 fr에서 ko로 번역된 기사.

GitHub에서 프로젝트 보기 ↗

7월 15일의 핵심 주제는 에이전트의 공격 대응 강인성이다. OpenAI는 GPT-5.6을 프롬프트 주입에 더 강하게 만드는 자동화된 레드팀 도구 GPT-Red를 공개했고, Claude Code는 CLI를 더 엄격하게 다듬었으며, Warp의 코드 리뷰 에이전트는 의도적으로 읽기 전용 접근만 허용하기로 했다. 그 밖의 하루 일정은 코딩 에이전트에 관한 발표들(Codex in Chrome, 오픈 소스로 공개된 Grok Build, Slack의 Devin, GitHub Copilot), 공개 모델들(Meta AI, Hugging Face, Ai2, Together AI), 그리고 Google, 미디어 생성, Perplexity, Cohere 측의 여러 새 기능 소식을 포함한다.


GPT-Red: OpenAI가 프롬프트 주입에 대한 GPT-5.6의 강인성을 강화

7월 15일 — OpenAI는 내부에서 학습된 자동화 레드팀 모델 GPT-Red를 공개했다. 이 모델은 문서, 웹 페이지 또는 도구 출력 안에 악의적인 지시를 숨겨 에이전트를 원래 작업에서 벗어나게 하는 공격인 프롬프트 주입(prompt injection)에 맞서 자사 모델의 저항력을 강화하도록 설계됐다. OpenAI는 공격을 상상하기 위해 인간 팀에만 의존하는 대신, 이 탐색을 전담 특화 모델에 맡겨 지속적으로, 그리고 대규모로 수행할 수 있게 했다.

이 모델은 강화 학습을 활용한 자기 대결(self-play) 방식으로 훈련된다. 공격자는 바람직하지 않은 행동을 유발하는 데 성공할 때 보상을 받고, 방어 모델 집단은 본래 과제를 해치지 않으면서 저항하는 법을 배운다. 이 제로섬 게임은 내부 모델과 공개 모델을 포함해 테스트된 거의 모든 모델을 무너뜨릴 수 있는 공격자를 만들어냈고, 그 범위는 GPT-5.6에 이르기까지였다.

GPT-Red를 GPT-5.6 학습에 통합한 결과, 가장 어려운 직접 주입 공격에 대한 실패율이 4개월 전의 최상위 생산 모델과 비교해 6배 감소했다. 학술 기준 시나리오(Dziemian et al., 2025)에서는 같은 사례들에 대해 인간 레드팀 요원의 13%에 비해 84%의 성공률을 기록했다.

OpenAI는 두 가지 실제 사례로 실용적 가치를 보여준다. 사내 자판기를 관리하는 에이전트(Andon Labs가 개발했으며, « Project Vend » 프로젝트의 계보를 잇는 사례)에서 GPT-Red는 비싼 상품의 가격을 0.50달러까지 낮추고, 100달러가 넘는 상품을 주문해 같은 헐값에 되팔게 만들었으며, 다른 고객의 주문까지 취소시켰다. 데이터 유출 시나리오 10개에 직면한 Codex CLI 에이전트에서는 단순 프롬프트를 사용하는 기준선보다 더 효율적이면서 토큰도 더 적게 사용했다. 이 모델은 악용 가능성이 나쁜 손에 들어가지 않도록 공개 배포된 적이 없는 엄격한 내부용이며, 방법을 설명하는 프리프린트는 이번 주 안에 공개될 예정이다.

측정 지표측정 값
GPT-Red 대 인간 레드팀 요원 성공률(학술 시나리오)84% 대 13%
직접 주입 공격에 대한 실패율 감소(GPT-5.6 대 이전 모델)실패 6배 감소
GPT-Red의 직접 주입 공격에 대한 GPT-5.6의 잔여 실패율0.05%

“Introducing GPT-Red. An internal automated red teamer on a mission to find our models’ prompt injection vulnerabilities at scale, helping us build stronger defenses before wider deployment.”

🇰🇷 GPT-Red 소개. 프롬프트 주입에 대한 우리 모델의 취약점을 대규모로 찾아내어, 더 넓은 배포 전에 더 강력한 방어를 구축하는 데 도움이 되도록 설계된 내부 자동화 레드팀 도구입니다.@OpenAI X에서

🔗 공식 발표


Claude Code: MCP에 연결된 아티팩트와 CLI v2.1.207부터 v2.1.210까지

이제 아티팩트가 MCP 커넥터를 호출합니다

7월 15일 — Claude Code의 아티팩트(Artifacts)가 이제 MCP(Model Context Protocol) 커넥터를 호출할 수 있게 되어, 각 방문자에게 필요한 정보를 가져오고 요청에 따라 작업을 실행하는 대시보드와 애플리케이션을 만들 수 있다. 아티팩트는 한 번만 만들어지고, 조회할 때마다 실시간 데이터를 가져오며, 생성자가 아닌 현재 방문자의 MCP 커넥터를 사용한다. 생성자 기준이 아니라 방문자 기준으로 권한을 나누는 이 모델은 기업용 사용에서 명백한 보안 우려를 해소한다. 각 사용자는 자신이 접근 권한을 가진 데이터만 보게 되기 때문이다.

이 기능은 Pro, Max, Team, Enterprise 요금제에서 사용할 수 있지만, 공개 공유된 아티팩트에는 적용되지 않는다. 데이터 접근이 각 방문자의 커넥터에 따라 달라지기 때문이다.

🔗 X의 발표

CLI v2.1.207부터 v2.1.210까지: 스크린 리더, 가벼워진 전사본, 강화된 보안

7월 15일 — Anthropic은 지난 보도 이후 Claude Code CLI의 네 가지 버전을 공개했다. 가장 큰 변화가 있는 v2.1.208은 스크린 리더 모드(--ax-screen-reader)를 추가하고, 긴 세션에서 최대 64MB에 이르는 메모리 누수를 수정했으며, 편집 활동이 많은 세션에서 세션 전사본 크기를 최대 79배까지 줄였다. 보안도 강화되어, 역따옴표(backticks)가 포함된 재난급 삭제 명령은 이제 자동 모드와 --dangerously-skip-permissions 사용 중이라도 확인 절차를 거치게 된다.

v2.1.207은 옵트인 없이 자동 모드를 Bedrock, Vertex AI, Foundry까지 확장하고, 이 플랫폼들의 기본값을 Claude Opus 4.8로 전환한다. v2.1.210은 긴 도구 호출에 실시간 시간 카운터를 추가하고, 하위 에이전트가 읽은 콘텐츠를 통해 간접적으로 들어오는 프롬프트 주입에 맞서 Agent 도구의 보안을 더 강화한다.

🔗 전체 CHANGELOG


코딩 에이전트: Codex, Grok Build, Warp, Devin 그리고 GitHub Copilot

Chrome의 Codex가 자동화된 출시 계획을 보여준다

7월 15일 — OpenAI Developers는 Chrome에서 Codex를 사용해 단순 요청을 출시 계획으로 바꾸는 데모를 공유했다. 폼 입력을 바탕으로 에이전트가 체크리스트를 만들고, Google Drive, Slack, 로컬 파일에서 맥락을 가져오며, 사람의 확인이 필요한 지점을 표시하고, 대상 포털을 업데이트한 뒤 응답까지 작성한다. 최종 결정은 각 단계마다 사용자에게 남는다. 이 데모는 Codex가 주도하는 웹 탐색을 강조하는데, 이 기능은 이미 제품 변경 기록에서 « Browser use »라는 이름으로 문서화되어 있다.

🔗 X의 데모

xAI가 Grok Build의 소스 코드를 공개하다

7월 15일 — xAI는 5월 말 초기 베타로 출시한 명령줄 코딩 에이전트 Grok Build의 소스 코드를 공개했다. 이번 공개에는 에이전트 루프, 도구들(읽기, 수정, 코드 검색, 명령 실행), 터미널 인터페이스, 확장 시스템(skills, 플러그인, 훅, MCP 서버, 서브에이전트) 등 네 가지 구성 요소가 포함된다. 개발자에게 특히 중요한 점은 Grok Build가 이제 자체 추론 엔진에 연결되어 있으며 config.toml 파일을 통해 제어되는 완전한 로컬 우선(local-first) 방식으로 동작할 수 있다는 것이다.

한편 xAI는 7월 12일부터 모든 사용자에 대해 기본 데이터 보존을 비활성화했으며, 이전에 보관하던 코드 데이터도 삭제하고 있다.

“In response to user questions about privacy: Since launch, Grok Build has fully respected zero data retention (ZDR). All users have always had the ability to disable data upload in the CLI. […] We disabled default retention for all Grok Build users starting on July 12th. Additionally, we are deleting all coding data that was previously retained, ensuring every user’s preferences are respected.”

🇰🇷 사용자들의 개인정보 보호 관련 질문에 답변드립니다. 출시 이후 Grok Build는 항상 데이터 보존 0(ZDR)을 준수해 왔습니다. 모든 사용자는 CLI에서 데이터 전송을 비활성화할 수 있었습니다. […] 우리는 7월 12일부터 모든 Grok Build 사용자에 대해 기본 보존을 비활성화했습니다. 또한 각 사용자의 선호를 보장하기 위해 이전에 보관된 모든 코드 데이터를 삭제하고 있습니다.@SpaceXAI X에서

🔗 공식 발표

Warp가 자기 개선형 코드 리뷰 에이전트를 만든다

7월 15일 — Warp의 CEO Zach Lloyd는 « cloud software factory » 시리즈의 세 번째 글을 공개했다. 이전의 티켓 분류 에이전트와 명세서 작성 에이전트에 이어, 이번에는 자동으로 개선되는 코드 리뷰 에이전트를 다룬다. 이 아키텍처는 풀 리퀘스트, diff, 명세서를 분석하는 리뷰 스킬, 그 출력을 댓글로 바꾸는 GitHub 액션, 그리고 하루에 한 번 인간의 피드백을 관찰해 스스로 리뷰 스킬 업데이트를 제안하는 두 번째 « 외부 루프 » 에이전트로 구성된다. 눈에 띄는 설계 선택은, 댓글 게시를 GitHub 액션 코드가 처리하도록 하여 에이전트에는 풀 리퀘스트에 대한 읽기 전용 접근만 허용했다는 점이다. 이는 프롬프트 주입 위험을 줄이기 위한 것이다.

🔗 warp.dev의 전체 글

Devin이 Slack에 들어간다

7월 15일 — Cognition은 Slack과의 협업을 통해 Devin을 Slack 안에 직접 통합해, 팀이 대화 채널을 벗어나지 않고도 문제를 조사하고, 코드베이스에 대해 질문하고, 개발 작업을 시작할 수 있게 했다. 이 통합은 이미 제공 중인 Devin의 진입점(CLI, Windsurf를 통한 IDE, GitHub)에 더해지는 것으로, 많은 엔지니어링 요청이 공식 티켓이 되기 훨씬 전부터 Slack 메시지에서 시작된다는 점을 반영한다.

🔗 X의 발표

GitHub Copilot: Visual Studio 업데이트와 JetBrains용 BYOK 확장

7월 14일 — GitHub는 Visual Studio의 Copilot에 대한 6월 요약을 공개했다. 사용량 창과 초과 직전의 사전 경고, MCP 서버에 대한 신뢰 검증(알려진 기준과 비교하는 시작 시점 검사, 기본 활성화), C++ 현대화 에이전트의 일반 공급 전환이 포함된다. 그 밖의 추가 사항으로는 원거리 편집 제안, Copilot Chat에 풀 리퀘스트를 맥락으로 추가하는 기능, IDE에 통합된 풀 리퀘스트 리뷰가 있으며, 이 모든 기능은 Free부터 Enterprise까지 사용할 수 있다.

JetBrains 측에서는 Copilot이 OpenAI 호환 사용자 지정 엔드포인트에 대한 BYOK(Bring Your Own Key) 지원을 확대하고, 에이전트와 스킬을 설정할 수 있는 Claude 에이전트 공급자를 추가하며(공개 프리뷰, Pro 이상), Copilot CLI를 위한 로컬 샌드박스와 내장 디버깅 스킬을 도입했다.

🔗 Visual Studio 업데이트 · 🔗 JetBrains용 BYOK 확장


공개 모델: Meta AI, Hugging Face, Ai2 그리고 Together AI

Meta AI, 아시아 물리 올림피아드에서 만점을 획득하다

7월 14일 — Meta AI는 대회 위원회의 허가를 받아 아시아 물리 올림피아드(APhO 2026) 이론 시험에 모델을 제출했다. 결과는 30점 만점에 30점으로, 인간 상위 세 명의 후보와 동률이었다. Meta AI는 그것이 자신의 최신 대형 출고판인 7월 9일의 Muse Spark 1.1인지, 아니면 공개되지 않은 다른 내부 모델인지는 밝히지 않았다.

🔗 X의 발표

Hugging Face가 새로운 오픈 웨이트 모델을 예고하다

7월 15일 — Hugging Face는 이날 늦게 간단히 제목만 붙인 영어 라이브스트림 « 새 오픈 웨이트 모델 »을 공개했지만, 글로는 모델 이름을 밝히지 않았다. 트윗, 방송 제목, 공식 블로그 어디에도 명시되지 않았다. 트윗의 여러 답글은 정확히 어떤 모델인지와 표준 벤치마크와 어떻게 비교되는지 묻고 있지만, 작성 시점에는 서면 답변이 전혀 없었다. 서면 정보가 공개되는 대로 확인해야 한다.

🔗 X의 라이브스트림

Ai2, 1,700명의 사용자 이후 SciArena를 종료하다

7월 15일 — Ai2는 과학 문헌 질문에 답하는 모델 능력을 평가하는 공개 평가 플랫폼 SciArena를 종료했다. 평가는 자동 모델이 아니라 연구자들이 채점했다. 종료 시점의 집계는 약 1,700명의 사용자와 약 3,900개의 투표였다. 전체 방법론과 결과는 arXiv에 제출된 논문에 자세히 설명돼 있다.

🔗 X의 요약

Together AI, 첫날부터 Inkling을 제공하고 TogetherLink를 출시하다

7월 15일 — Together AI는 Thinking Machines Lab의 새 모델 Inkling을 출시와 동시에 바로 제공했다. Inkling은 총 9,750억 개 매개변수의 멀티모달 MoE(Mixture of Experts) 모델로, 토큰당 400억 개가 활성화되며, 100만 토큰의 컨텍스트 창을 갖고 텍스트, 이미지, 오디오를 처리할 수 있다. Together AI는 이 아키텍처에 맞게 FlashAttention-4 핵심을 최적화했으며, 요청 조건부 상대적 주의와 짧은 인과적 합성곱을 결합한다.

같은 날 Together AI는 가장 널리 쓰이는 개발 환경에서 어떤 공개 모델이든 실행할 수 있는 오픈 소스 CLI인 TogetherLink도 출시했다. 데모에서는 GLM 5.2가 Codex와 Claude Code에서 직접 실행되는 모습을 보여준다.

측정 지표측정 값
총 매개변수(Inkling)9750억
토큰당 활성 매개변수400억
컨텍스트 창100만 토큰

🔗 Inkling day-0 지원 · 🔗 X의 TogetherLink


Google DeepMind와 Gemini Spark

DeepMind가 AI 에이전트의 과학적 검증 병목을 짚어보다

7월 15일 — Google DeepMind는 AI 에이전트가 과학 연구를 어떻게 바꾸는지에 대한 공공정책 에세이 « Conjecture Machines »를 발표했다. 서두의 사례는 인상적이다. 임페리얼 칼리지 런던의 미생물학자 José Penadés는 팀이 거의 10년간 작업해 온 문제를 Co-Scientist에 제출했다. 에이전트는 이틀 만에 다섯 개의 가설을 우선순위대로 돌려줬고, 그중 첫 번째는 팀이 수년이 걸려 입증한 것이었다.

에세이는 두 가지 양상을 구분한다. 에이전트를 통해 빠르게 진전하는 구상(아이디어 도출) 단계(Co-Scientist나 AlphaEvolve를 통해)와, 여전히 느리고 비용이 많이 드는 검증 단계다. 다만 수학과 컴퓨터 과학에서는 검증이 형식적일 수 있다. 2월의 « First Proof challenge »에서 도구 Aletheia는 10문제 중 6개를 해결했다. 의사결정자에게는 네 가지 우선순위가 제안된다. 에이전트에 대한 폭넓은 접근, 국가 데이터의 활용, 검증 인프라에 대한 투자, 그리고 동료 검토의 진화다.

🔗 X 스레드 · 🔗 DeepMind의 전체 에세이

Gemini Spark, 지리적 범위를 확장하고 네 가지 개선 사항을 제공

7월 15일 — Google은 Google AI Ultra 구독자를 대상으로, 사용자 대신 백그라운드에서 작동하는 개인 에이전트 Gemini Spark의 배포를 더 많은 국가와 언어로 확대합니다. 같은 날 네 가지 개선 사항이 배포되기 시작합니다:

개선 사항설명
Google Docs 편집Spark가 문서를 직접 열고 수정할 수 있음
더 깊어진 Workspace 통합Google Sheets와 Slides의 댓글 읽기
속도오래 걸리는 작업이 더 빠르게 실행됨
향상된 다중 소스 수집복잡한 작업에서 여러 소스를 병렬로 가져오고 검토함

🔗 X에서 전체 스레드


미디어 생성: Suno와 Synthesia

Suno가 iMessage 키보드에 합류

7월 15일 — Suno는 iMessage용 키보드 확장 기능을 출시해, 앱을 전환하지 않고도 iOS의 Messages 앱에서 바로 음악 트랙을 생성하고 전송할 수 있게 했습니다. 이를 사용하려면 Suno 앱을 최신 버전으로 업데이트해야 합니다.

🔗 X에서 발표

Synthesia, Dubbing 2.0 출시

7월 15일 — Synthesia는 비디오 AI 더빙 시스템의 전면 개편 버전인 Dubbing 2.0을 발표했습니다. 이는 완전히 새로운 인프라를 기반으로 하며, 복잡한 장면에서도 훨씬 개선된 립싱크, 더 표현력 있는 음성, 원본 비디오의 리듬을 더 잘 반영하는 번역, 그리고 완전한 재렌더링 없이도 트랜스크립트를 즉시 편집할 수 있는 기능을 제공합니다. 모든 사용자는 이 기능을 시험해 볼 수 있도록 최대 450분의 무료 시간을 받습니다.

🔗 전체 발표


Perplexity와 Cohere: 인프라와 커뮤니티 연구

Perplexity, Perplexity Computer의 샌드박스 플랫폼 SPACE 공개

7월 15일 — Perplexity는 Perplexity Computer를 구동하는 보안 실행 계층인 SPACE를 공개했습니다. 이 계층은 코드, 파일, 장기 실행 에이전트 세션을 위한 격리된 환경으로, 각 환경은 자체 게스트 커널을 가진 가상 머신으로 구현됩니다. 인증 정보는 절대 샌드박스 안으로 들어가지 않으며, 중앙 네트워크 게이트웨이가 출력 정책을 강제합니다. btrfs(쓰기 시 복사) 파일 시스템 덕분에 SPACE는 6월부터 Perplexity Computer의 프로덕션 트래픽 100%를 처리하고 있으며, Perplexity는 이를 Linux microVM, Windows 게스트, 사용자 로컬 머신으로 확장할 계획입니다.

측정 지표SPACE 이전SPACE 적용
샌드박스 생성 중앙값 지연 시간185 ms60 ms (3,1x)
생성 P90 지연 시간447 ms89 ms (5,0x)

🔗 X에서 발표

Cohere, Expedition Tiny Aya 결과 공개

7월 15일 — Cohere Labs는 Tiny Aya를 중심으로 한 멘토링 기반 연구 프로그램인 Expedition Tiny Aya의 결과를 공개했습니다. Tiny Aya는 70개 이상의 언어에서 뛰어난 성능을 보이며, 휴대폰을 포함해 로컬에서 실행할 수 있는 개방형 경량 모델입니다. 커뮤니티 프로젝트는 교육(어린이를 위한 오프라인 음성 동반자와 새로운 안전 벤치마크), 다국어 안전성(한 언어에서 학습된 정렬 실패가 다른 언어로 전이될 수 있음), 로컬 배포(언어를 인식하는 압축, 4비트 양자화된 어시스턴트)를 다룹니다. 이 연구들은 COLM 2026 컨퍼런스에 채택되었습니다.

“Tiny Aya is Cohere Labs’ answer to a familiar problem: most AI is built for a handful of languages and needs serious hardware to run. Tiny Aya is open-weight, strong across 70+ languages, and light enough to run locally, even on a phone.”

🇰🇷 Tiny Aya는 Cohere Labs가 익숙한 문제에 내놓은 해답입니다. 대부분의 AI는 소수의 언어만을 위해 설계되고 강력한 하드웨어를 필요로 합니다. Tiny Aya는 개방형이며, 70개가 넘는 언어에서 뛰어난 성능을 보이고, 휴대폰에서도 로컬로 실행될 만큼 충분히 가볍습니다.Cohere Blog

🔗 X에서 전체 스레드


간단 소식

  • Together AI, GPU Clusters의 신뢰성 향상 — 프로덕션 GPU 클러스터를 위한 수동 상태 점검, 안내형 노드 복구, 재구성된 Slurm 스택, 외부 OIDC 지원. 🔗 출처
  • HeyGen, HyperFrames 프롬프트 작성을 위한 ‘여섯 가지 결정’ 방법 공개 — 비디오 생성 CLI 에이전트에 관한 일일 시리즈의 열 번째 에피소드. 🔗 출처
  • Kling AI, 인터랙티브 시리즈 ‘Choose a door’의 새 에피소드 공개 — 커뮤니티가 댓글로 투표해 공포 단편 영화 ‘You Can Never Leave’의 다음 전개를 정합니다. 🔗 출처
  • Pika MCP, 실험 단계 종료 — Pika와 타사 에이전트(Claude, Codex, OpenClaw, HermesAgent)의 연결이 이제 공개적으로 제공됩니다. 🔗 출처
  • OpenAI Developers, kbd-1.0-codex-micro 출시 — @work_louder와 함께 설계한 조이스틱 탑재 매크로패드로, Codex 단축키 제어용 한정판 제품입니다. 🔗 출처
  • Cohere, 기업 AI 총소유비용 분석 공개 — Gartner, IDC, McKinsey에 따르면 생성형 또는 에이전틱 AI를 배포하는 조직의 92~96%가 예상보다 높은 비용을 마주하고 있습니다. 🔗 출처

의미하는 바

에이전트의 보안은 이제 사후 검토가 아니라 독립적인 공학 과제가 되고 있습니다. GPT-Red는 자기 대결 방식의 self-play로 red teaming을 자동화하고, 자동판매기와 Codex CLI 에이전트라는 실제 사례에 이를 적용합니다. Claude Code v2.1.208 CLI는 자체적인 파괴적 명령과 Agent 도구를 통한 간접 프롬프트 주입에 대비해 방어를 강화했고, Warp의 코드 리뷰 에이전트는 같은 계열의 공격을 줄이기 위해 명시적으로 읽기 전용 접근만 허용합니다. 서로 독립적인 세 가지 이니셔티브가 하나의 생각으로 수렴합니다. 에이전트가 실제 시스템에서 독립적으로 더 많이 행동할수록, 프롬프트 주입 방어는 일회성 체크리스트가 아니라 지속적이고 자동화된 규율이 되어야 합니다.

코딩 에이전트 생태계는 모든 전선에서 동시에 더 촘촘해지고 있습니다. xAI는 Grok Build의 소스 코드를 공개하고 완전한 로컬 사용을 허용하며, Devin은 Slack에 들어와 티켓이 되기 전의 요청까지 포착하고, Codex는 Chrome에 배포되어 종단 간 작업을 조종하며, GitHub Copilot은 BYOK 제공과 현대화 에이전트를 함께 확장합니다. 코드 공개, 커뮤니케이션 도구 통합, 자율 웹 탐색, 모델 공급자 유연성 같은 이러한 다양한 전략은 하나의 지배적인 단일 모델로 수렴하기보다, 각 주체가 개발자의 일상 업무 흐름에 접근하는 서로 다른 방식을 찾고 있음을 보여줍니다.

개방형 모델과 이를 뒷받침하는 인프라는 함께 진전하고 있습니다. Together AI는 Inkling을 첫날부터 지원하고, 동시에 어떤 개방형 모델이든 IDE에서 실행할 수 있게 하는 TogetherLink를 공개하면서 이 흐름의 두 얼굴을 보여줍니다. 한편 Ai2는 AI가 생성한 과학적 답변의 신뢰성에 대해 연구자 약 3,900명의 투표를 수집한 뒤 SciArena를 종료했습니다. 그 배경에는 Google DeepMind의 과학 검증 병목에 대한 논문과 Perplexity의 샌드박스 플랫폼 SPACE가 있습니다. 이 둘은 서로 다른 각도에서 같은 질문을 던집니다. 점점 더 자율적인 에이전트가 만들어내는 결과를 대규모로, 그리고 안전하게 어떻게 검증할 것인가?

보다 대중적인 용도 측면에서, 생성형 AI는 계속해서 점점 더 일상적인 진입점에 스며들고 있습니다. Suno의 iMessage 키보드, Gemini Spark의 Workspace 문서 편집, Synthesia의 비디오 더빙이 그 예입니다. 이러한 확산에는 기업 측의 더 냉정한 경고도 뒤따릅니다. Cohere의 AI 총소유비용 분석은 조직의 92~96%가 예상보다 더 많은 비용을 지출하고 있음을 강조하며, 에이전트의 보편화가 그 기반 인프라에 대한 엄격한 경제적 관리까지 대신해 주지는 않는다는 점을 상기시킵니다.


출처