검색

ChatGPT가 WhatsApp에 돌아오고, GitHub Copilot CLI는 더 신뢰할 수 있게, Anthropic은 Claude의 가치관을 연구

ChatGPT가 WhatsApp에 돌아오고, GitHub Copilot CLI는 더 신뢰할 수 있게, Anthropic은 Claude의 가치관을 연구

ai-powered-markdown-translator

gpt-5.4-mini를 사용하여 fr에서 ko로 번역된 기사.

GitHub에서 프로젝트 보기 ↗

OpenAI는 유럽에서 ChatGPT를 WhatsApp에 다시 제공하고 두 개의 새로운 메신저로 확장하며, GitHub는 Copilot CLI의 신뢰성을 높이고 Amp는 에이전트가 코드를 커밋하는 방식을 바꾼다. 연구 측면에서는 Anthropic이 언어에 따라 Claude가 표현하는 가치관에 대한 연구를 발표했고, Ai2와 Sakana AI는 각각 해양 감시 에이전트의 실전 배치 사례와 물리적 집단 지성 실험을 자세히 다룬다.


ChatGPT가 EEE에서 WhatsApp으로 돌아오고, Kakao와 Viber로 확장

7월 13일 — ChatGPT는 서비스 중단 기간을 거친 뒤, 유럽경제지역(EEE)에서 다시 WhatsApp에서 이용할 수 있게 되었다. 검증된 연락처 1-800-CHATGPT를 통해 질문하기, 이미지 보내기, 음성 메모 보내기, 이미지 생성, 그리고 많은 언어로 ChatGPT를 사용하기가 가능하며, 이 모든 것이 메신저 앱 안에서 직접 이루어진다.

OpenAI는 동시에 ChatGPT의 이용 가능 범위를 두 개의 새로운 앱으로 확장한다. 하나는 한국의 Kakao이고, 다른 하나는 지원되는 시장의 Viber다. 전략은 분명하다. 전용 ChatGPT 앱이나 사이트로 이동하게 하기보다, 이미 일상적으로 사용 중인 메신저 앱 안에서 도우미를 이용할 수 있게 하는 것이다.

🔗 공지 — @ChatGPTapp


GitHub Copilot CLI v1.0.42: 서브에이전트 위임이 더 신뢰할 수 있게

7월 13일 — GitHub는 Copilot CLI 1.0.42+ 버전을 공개했으며, /update 명령으로 설치할 수 있다. 이번 업데이트는 더 빠르고 더 신뢰할 수 있는 코드 세션을 만들기 위해 설계된 더 똑똑한 서브에이전트 위임(smarter subagent delegation)을 도입했으며, 측정 방법에 대한 기술적 세부 사항은 공개하지 않았다.

측정된 실패 유형발표된 감소율
도구 실패-23%
검색 실패-27%
편집 실패-18%

GitHub는 이러한 변경에도 품질 회귀는 관찰되지 않았다고 밝힌다.

🔗 공지 — @github


Amp의 orb가 이제 사용자를 대신해 커밋할 수 있다

7월 11일 — Amp는 프로젝트 설정에, 원격에서 에이전트를 실행하는 기계인 orb가 Amp의 이름이 아니라 사용자의 이름으로 커밋하도록 하는 옵션을 추가했으며, 커밋에는 co-authored-by 언급이 함께 붙는다.

You can now make Amp orbs commit as you, not Amp (+ co-authored-by you). It’s in project settings. Useful for, e.g., pushing to a repo where Vercel only deploys for known committers.

🇰🇷 이제 Amp orb가 Amp의 이름이 아니라 여러분의 이름으로 커밋하도록 설정할 수 있습니다(여러분을 co-authored-by로 표시). 이는 프로젝트 설정에 있습니다. 예를 들어 Vercel이 알려진 커밋 작성자에게만 배포하는 저장소로 푸시할 때 유용합니다.@sqs X에서


Anthropic은 모델과 언어에 따라 Claude가 표현하는 가치관을 연구

7월 13일 — Anthropic은 대화에서 Claude가 표현하는 가치관에 대한 연구를 확장하고 있다(정직성이나 인간적인 따뜻함처럼 확인된 가치가 3,000개 이상). 이번에는 사용된 모델과 언어에 따라 그것이 어떻게 달라지는지 분석했다. 이 연구는 네 가지 축으로 묶인 30만 건 이상의 익명화된 대화를 기반으로 한다.

축(프랑스어 / 원문)측정 내용
복종 vs 신중함 (Deference vs. Caution)사용자를 따르려는 경향 또는 이를 완화하려는 경향
따뜻함 vs 엄격함 (Warmth vs. Rigor)따뜻한 어조 또는 증거를 요구하는 태도
깊이 vs 간결함 (Depth vs. Brevity)자세한 답변 또는 간결한 답변
솔직함 vs 실행 (Candor vs. Execution)직접적인 비판 또는 단순한 실행

모델 간 차이는 크지 않지만(Sonnet 4.6은 더 유쾌하고 동의하는 경향이 있으며, Opus 4.7은 더 노골적인 비판에 기울어짐), 가장 두드러진 차이는 언어에 따라 나타난다. Claude는 힌디어와 아랍어에서는 따뜻함 쪽으로, 러시아어에서는 엄격함 쪽으로 기울며, 러시아어에서는 사용자 주장에 대한 근거를 더 자주 요구한다.

🔗 공지 — @AnthropicAI


Ai2가 해양 감시 에이전트 Shippy의 내부를 자세히 공개

7월 13일 — Ai2(AllenAI)는 Skylight 팀이 해양 분야 감시를 위해 구축한 에이전트 Shippy에 대한 경험담을 공개했다. 이 에이전트는 어업 이벤트 감지, 선박 추적, 보호 구역 관리에 사용되며, 현재 70개국 이상에서 300개 이상의 파트너가 사용하고 있다.

The real work wasn’t the model. It was building a system we could trust to be correct, to stay within appropriate boundaries.

🇰🇷 진짜 작업은 모델이 아니었습니다. 우리가 신뢰할 수 있고, 적절한 범위 안에서 동작하도록 보장되는 시스템을 구축하는 것이었습니다.Ai2 블로그

기술적으로 Shippy는 Claude Opus 4.6을 모델로 하는 OpenClaw(오픈 소스 에이전트 프레임워크)를 기반으로 하며, 세 가지 구성 요소로 이루어진다. 하나는 “영혼”(시스템 프롬프트와 안전장치), 하나는 “스킬”(skills), 마지막은 “구성”(파라미터와 모델 선택)이다. 고객 에이전시 간 격리는 Mothership을 통해 이루어지는데, 이 사내 플랫폼은 사용자 세션마다 Kubernetes 배포를 프로비저닝한다. 평가는 Harbor 프레임워크로 진행되며, LLM 심판이 서면 추론과 함께 응답을 채점한다.


Sakana AI가 자신의 형태를 인식하기 위해 약 200개의 물리적 블록을 협력시킨다

7월 12일 — Sakana AI는 코펜하겐 IT 대학교, Autodesk와 함께 물리적 집단 지성에 관한 연구를 발표했다. 로컬에서 동일한 신경망(신경 세포 자동자, Neural Cellular Automata)을 실행하는 큐브형 하드웨어 모듈인 “세포 블록”이 중앙 제어기 없이 자신들이 이루는 전체 형태를 집단적으로 추론한다.

At Sakana AI, a recurring theme in our research is collective intelligence: the observation that sophisticated, robust behavior can arise from many simple parts following local rules, with no central controller, as it does in a colony, a tissue, or a brain.

🇰🇷 Sakana AI에서 우리의 연구에 반복적으로 등장하는 주제는 집단 지성입니다. 중앙 제어기 없이, 군집이나 조직, 뇌에서처럼 많은 단순한 부분들이 지역 규칙을 따라 움직일 때 정교하고 견고한 행동이 나타날 수 있다는 관찰입니다.Sakana AI 블로그

약 200개의 블록과 네 가지 조립 형태(비행기, 기타, 배, 테이블)를 대상으로 테스트한 결과, 이 시스템은 60사이클(약 3분) 안에 100%의 분류 정확도를 달성했고, 최대 5%의 모듈이 고장 나도 견고함을 유지했으며, 94.8%의 정확도로 구조적 손상을 감지했고, 시뮬레이션에서는 18,000개가 넘는 큐브 격자까지 확장되었다.


Google DeepMind가 Google Antigravity에서 Skill « Predicting the Past »를 공개

7월 13일 — Google DeepMind는 프로그래밍 지식이 전혀 필요 없는 Google Antigravity에서 실행되는 “Predicting the Past”라는 Skill을 소개하며, 고대 문서와 유물을 분석한다. 세 가지 사용 사례가 문서화되었다. Aeneas 모델을 활용한 1,800년 된 로마 시대 저주판(curse tablet)의 연대와 위치 추정, 유럽 전역의 Aufaniae 숭배 지도로의 확장(스페인에 세워진 고립된 제단까지 포함하며, 로마 군단 출신 퇴역 군인이 설치한 것), 그리고 고대 납판을 바탕으로 한 도도나 신탁 방문자 네트워크의 복원이다.

이 Skill은 매번 예측에 대한 설명을 생성하며, 분야 전문가를 위한 비문학적 주석처럼 작동한다.

🔗 공지 — @GoogleDeepMind


간단 소식

  • Amp가 다중 사용자 협업 스레드를 준비 중이다 — Amp 스레드는 이미 여러 클라이언트에서 동시에 따라갈 수 있지만, 현재는 만든 사람의 계정으로만 가능하다. 팀은 같은 스레드에서 여러 계정이 함께 협업할 수 있도록 작업 중이다. 🔗 @sqs X에서
  • Amp의 macOS 네이티브 버전이 개발 중이다 — 현재 웹 앱과 기능상 차이는 예상되지 않으며, 출시 일정도 발표되지 않았다. 🔗 @sqs X에서
  • GitHub가 SSO 페이지와 조직 페이지를 분리했다 — 기존의 사용자 설정 통합 페이지를 더 명확하게 보기 위해 두 개의 별도 페이지로 나누었다. 🔗 GitHub 변경 기록
  • HeyGen CLI: 명령줄에서 음악과 음향 효과 사용 — 터미널에서 HeyGen의 음악/SFX 카탈로그를 무료로 검색하고 내려받을 수 있으며, 한 에이전트가 영상의 리듬에 맞춰 소리를 동기화하는 시연도 포함된다. 🔗 @HeyGen X에서

이것이 의미하는 바

배포는 다시 소비자용 어시스턴트의 격전장이 되고 있다. EEE에서 ChatGPT가 WhatsApp으로 돌아오고 Kakao와 Viber로 확장된 것은, OpenAI가 자체 인터페이스로 사용자를 끌어들이기보다 이미 설치된 앱 안에서의 존재감에 베팅하고 있음을 보여준다. 이는 기능보다 채널의 논리다. 어시스턴트는 이미 사용자가 있는 곳으로 가며, 유럽처럼 규제가 있는 시장이라도 일시 중단 후 다시 돌아오기를 마다하지 않는다.

에이전트의 신뢰성은 더 이상 모델의 부산물이 아니라 독립적인 엔지니어링 축이 되고 있다. GitHub는 새로운 서브에이전트 위임의 성과를 수치로 제시했고(-23% 도구 실패, -27% 검색 실패, -18% 편집 실패), Ai2는 Shippy를 통해 같은 교훈을 역으로 보여준다. 프로덕션에서의 신뢰성은 모델 선택만이 아니라, 결정론적 도구와 명시적인 안전장치, 분리된 인프라에서 나온다. Amp의 orb가 이제 사용자를 대신해 커밋하는 것도 같은 운영상의 관심사에 속한다. 즉, 기존 배포 파이프라인에 깔끔하게 통합되는 것이다.

모델 행동에 대한 연구는 텍스트를 넘어 확장되고 있다. Anthropic의 Claude 가치관 연구는 문화적 차이(힌디어와 아랍어의 따뜻함, 러시아어의 엄격함)가 모델 버전 간 차이보다 더 크게 작용한다는 점을 드러낸다. Sakana AI의 세포 블록은 인접하지만 다른 질문을 던진다. 중앙 모델 없이도 동일한 지역 규칙을 대규모로 반복하는 것만으로 지능적이고 견고한 행동을 얻을 수 있을까? 이는 스스로 진단할 수 있는 물리적 시스템을 향한 하나의 가능성이다.

노코드 AI는 매우 전문화된 전문가용 활용 사례로 진화하고 있다. 고고문자학과 고고학에 적용된 Google DeepMind의 “Predicting the Past” Skill은, 복잡한 워크플로우가 프로그래밍 역량이 없는 연구자에게도 열리면서, 스스로 이런 도구를 만들 수 없었던 사용자들에게 틈새 분야를 개방하는 모습을 보여준다.


출처