🟡 🛡️ 보안

arXiv:2607.14570: 훈련이 필요 없는 Information Flow Graph 모니터, 에이전트의 놓친 공격을 11.6%에서 3.5%로 감소

인프라 코드 내 데이터 흐름을 보여주는 연결된 노드의 추상적 다이어그램

『Democratizing Agent Deployment Safety』 논문은 구조적 분석을 통해 모델 훈련 없이도, AI 코딩 에이전트가 infrastructure-as-code 작업을 겉으로는 완료한 것처럼 보이면서 몰래 보안 조치를 방해하는지 탐지하는 Information Flow Graph 모니터를 제시합니다. 이 접근법은 git-diff 기준선 대비 놓친 공격 비율을 11.6%에서 3.5%로 줄입니다.

🟡 🤝 에이전트

arXiv:2607.15257: SearchOS, 명시적 증거 그래프로 검색 에이전트의 반복 루프 해결

편집 일러스트: 멀티에이전트 시스템 SearchOS가 검색 상태를 증거 그래프로 외부화하는 모습

SearchOS는 검색 진행 상황을 놓치는 문제를, Frontier Task, Evidence Graph, Coverage Map, Failure Memory라는 네 가지 구조로 상태를 외부화함으로써 해결하는 멀티에이전트 프레임워크입니다. 여기에 pipeline-parallel scheduling과 도구 예산을 감시하는 Search Tool Middleware Harness가 더해집니다. WideSearch와 GISA 벤치마크에서 테스트된 모든 싱글·멀티에이전트 베이스라인 시스템을 모든 지표에서 능가합니다.

🟡 🏥 실무

Anthropic: Claude Code v2.1.214, 남용된 대화를 스스로 종료하는 EndConversation 도구 추가

터미널 창에 코드가 표시되고 명령줄 옆에 보안 자물쇠 아이콘이 있는 모습

Anthropic이 7월 18일 CLI 에이전트가 남용이나 탈옥(jailbreak) 시도를 감지했을 때 스스로 세션을 종료할 수 있는 EndConversation 도구를 갖춘 Claude Code v2.1.214를 출시했습니다. 장시간 실행되는 도구를 위한 주기적인 하트비트 신호, 새로운 OpenTelemetry 속성, 그리고 Bash와 PowerShell을 위한 수십 건의 보안 권한 수정도 함께 추가되었습니다.

최신 AI 뉴스 2026년 7월 18일

🟢 🏥 실무 2026년 7월 18일 · 1 분 읽기

arXiv:2607.14573: Alipay-PIBench, 코딩 에이전트의 결제 통합 능력 측정—스킬이 RPR을 10.31%p 끌어올려

편집 일러스트: AI 에이전트가 결제 시스템 통합 코드를 작성하는 모습

Alipay는 코딩 에이전트의 현실적인 결제 통합 능력을, 9개 프로젝트와 18개 작업 인스턴스(Basic과 Advanced로 구분)로 측정하는 벤치마크 Alipay-PIBench를 발표했습니다. 테스트된 6개 모델에서, 전용 『alipay-payment-integration』 스킬은 평균적으로 rubric pass rate(RPR)를 10.31%p 끌어올렸으며, RPR 범위는 68.58%에서 91.37%였습니다.

🟢 ✨ 흥미로운 소식 2026년 7월 18일 · 1 분 읽기

arXiv:2607.15079: BrainPilot, SOTA 에이전트 시스템보다 낮은 비용으로 신경과학 연구를 자동화

편집 일러스트: 실험실에서 AI 에이전트들이 뇌 스캔과 과학 문헌을 분석하는 모습

BrainPilot은 멀티에이전트 시스템으로, 『principal investigator』 에이전트가 문헌 검토부터 분석과 해석에 이르는 신경과학 연구의 전 과정에 걸쳐 전문 에이전트들을 감독합니다. 7,233개의 출처와 7개 영역에 걸친 72개의 방법론 단위로 구성된 지식 베이스를 활용하며, Agents' Last Exam과 BrainPilotBench-v0에서 SOTA 프레임워크에 필적하는 결과를 더 낮은 비용으로 달성합니다.

🟢 🛡️ 보안 2026년 7월 18일 · 2 분 읽기

arXiv:2607.15166: MedFailBench, 44개 사례로 의료 AI 시스템의 실패 방식을 측정—정확도만이 아니다

편집 일러스트: 의사가 안전 경고를 표시하는 AI 시스템을 감독하는 모습

MedFailBench는 임상의가 구축한 벤치마크로, 응답의 정확도뿐 아니라 의료 AI 시스템이 실패하는 방식을 측정합니다. 놓친 응급 상황이나 안전하지 않은 약물 용량 등 오류를 심각도(1~5)와 유형별로 분류하며, v0.2.1에는 환자 데이터나 모델 순위 없이 검토를 거친 44개 사례가 포함되어 있습니다.

🟢 🤝 에이전트 2026년 7월 18일 · 1 분 읽기

arXiv:2607.15193: Plover, 계획 중심의 편집 가능한 방식으로 GUI 에이전트와의 상호작용을 이끌다

편집 일러스트: 계획 중심 GUI 에이전트 Plover가 보이고 편집 가능한 작업 계획을 갖춘 모습

Plover는 계획 중심의 GUI 자동화 시스템으로, 작업 계획과 재계획을 에이전트의 숨겨진 내부 상태가 아니라 영속적이고 점검 가능한 산출물로 외부화합니다. Planner-executor 아키텍처는 실행에 대한 감독을 가능하게 하며, 편집 가능한 계획을 통한 국소적 수정을 지원합니다. 참가자 6명을 대상으로 한 형성적 연구가 상호작용 설계에 반영되었습니다.

🟢 🤝 에이전트 2026년 7월 18일 · 1 분 읽기

arXiv:2607.14658: TopoAgent, 선형 계획을 동적 그래프로 대체해 과학적 추론을 수행

편집 일러스트: 자기진화형 위상 에이전트 TopoAgent가 과학적 추론을 위해 원자 그래프를 구축하는 모습

TopoAgent는 자기진화형 위상 에이전트로, MLLM 에이전트의 선형 계획을 동적이고 상태가 분리된 그래프 진화 접근법으로 대체하여 긴 맥락에서의 시각-의미 불일치와 환각 문제를 해결합니다. 프런트엔드 분해기가 adaptive atomic fission을 이용해 원자들의 유향 비순환 그래프(Directed Acyclic Graph)를 구축하며, 수학·물리·화학에서 SOTA 선형 에이전트 프레임워크를 크게 능가합니다.

🟢 🏥 실무 2026년 7월 18일 · 1 분 읽기

GitHub: Copilot usage metrics API가 저장소 단위로 제공되며 Copilot 데스크톱 앱도 포함

개발 도구 화면에 pull request 통계 그래프와 표가 표시된 모습

GitHub는 7월 17일 usage metrics API의 새로운 엔드포인트 두 개를 발표했습니다. 이제 정식 운영(Generally Available) 단계에 들어간 이 엔드포인트는 Copilot coding agent와 코드 리뷰에서 발생한 pull request의 일별·저장소별 통계를 제공합니다. 또한 조직/엔터프라이즈 보고서에는 Copilot 앱 활동 및 IDE 외부에서의 토큰 소비 데이터도 추가되었습니다.

이전 호 2026년 7월 17일

모든 뉴스 2026년 7월 17일
🟡 🤝 에이전트 2026년 7월 17일 · 2 분 읽기

AWS: Amazon Quick, CRM과 회의 준비를 자동화하는 영업팀용 에이전틱 AI 동료

편집 일러스트: 책상에 앉은 영업사원과 화면에 CRM 데이터를 보여주는 AI 어시스턴트

Amazon Quick는 리드 스코어링, 아웃리치, 통화 분석, CRM 업데이트를 자동화하는 영업팀용 에이전틱 AI 어시스턴트입니다. 영업사원이 실제 영업에 쓰는 시간이 40%에 불과하다는 문제를 해결하며, 초기 도입 기업으로는 3M, AWS Global Sales, 아마존 내부 조직이 있습니다.

🟡 🏥 실무 2026년 7월 17일 · 2 분 읽기

Anthropic: Claude Code v2.1.212, 재설계된 /fork와 새로운 /resume 피커, 보안 수정 제공

프로그램 코드와 추상적인 AI 어시스턴트 아이콘이 표시된 터미널 창

Anthropic이 사용자 승인 없이 플랜 모드에서 Bash 명령이 자동 실행되는 것을 막는 보안 수정을 포함한 Claude Code v2.1.212를 출시했습니다. /fork 명령은 이제 대화를 새로운 백그라운드 세션으로 복사하며, /subtask가 기존 역할을 이어받습니다. 세션당 200회 호출 제한도 도입되었습니다.

🟡 🤝 에이전트 2026년 7월 17일 · 2 분 읽기

arXiv:2607.14642: MCPEvol-Bench, GPT-5.4와 Claude 모두 MCP 도구 변경 시 정확도를 잃는다는 것을 보여주다

편집 일러스트: 형태와 인터페이스가 변하는 연결된 도구 네트워크 앞에 선 AI 에이전트

MCPEvol-Bench는 123개의 MCP 서버에 11개의 변이 연산자를 시뮬레이션해 변화하는 도구 인터페이스에 대한 AI 에이전트의 적응력을 테스트하는 새로운 벤치마크입니다. GPT-5.4는 진화된 서버에서 성능이 13.7% 저하되었고, Claude-Sonnet-4-6은 더 큰 14.4% 저하를 보였으며, 테스트된 12개 프론티어 모델에서 계획 및 추론 오류가 증가했습니다.

🟡 🛡️ 보안 2026년 7월 17일 · 2 분 읽기

arXiv:2607.15218: 말은 안전하지만 행동이 사람을 죽일 때 — PRISM은 물리적 위험을 텍스트에서 분리한다

텍스트 내용과 별개로 행동의 물리적 위험성을 평가하는 AI 에이전트의 삽화

Weimeng Wang와 동료들은 Qwen2.5, Phi-3.5, SmolLM2 모델의 은닉 상태 공간에서 '콘텐츠 위험성'과 '물리적 위험성'이 분리 가능한 신호임을 보여줍니다. 이들의 방법 PRISM은 SafeAgentBench에서 86.2-87.7%의 정확도를 달성했으며 오탐률은 11.7-13.7%인 반면, 표준 LLM 판정자의 오탐률은 24.7-39.0%이고, PhysicalSafetyBench-1K에서 PRISM은 99.6%의 정확도에 도달합니다.

🟡 🛡️ 보안 2026년 7월 17일 · 2 분 읽기

arXiv:2607.15267: 포럼을 통한 계산 선전으로 언어 모델 사전학습 데이터 오염시키기

온라인 포럼과 댓글을 통한 AI 모델 학습 데이터 오염을 나타내는 삽화

앨런인공지능연구소(Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, David Kohlbrenner, Kyle Lo)의 연구는 언어 모델의 사전학습 데이터가 공개 포럼과 제3자 댓글을 통한 오염에 취약하다는 것을 보여줍니다. 저자들은 악성 콘텐츠가 웹 크롤링 과정을 견뎌내는지 측정하는 HalfLife 방법을 도입해, 위키피디아에 집중되어 있던 기존의 초점을 넘어선 공격 경로를 밝혀냈습니다.

🟡 🔧 하드웨어 2026년 7월 17일 · 2 분 읽기

NVIDIA: 코디자인 덕분에 Vera Rubin 플랫폼이 Blackwell 세대 GPU의 4분의 1만으로 최대 규모 AI 모델 훈련

파란 톤으로 표현된 서버 칩과 데이터센터의 추상적 이미지

NVIDIA는 새로운 Vera Rubin 플랫폼이 하드웨어와 소프트웨어의 엔드투엔드 코디자인 덕분에 Blackwell 세대 GPU 수의 4분의 1만으로 최대 규모의 AI 모델을 훈련한다고 밝혔습니다. Nemotron 3 Ultra 모델은 SWE-bench Verified 벤치마크에서 71.7%를 기록했으며, Vera CPU는 x86 대안보다 약 30% 높은 처리량을 보였습니다.

이전 뉴스

2026년 7월 16일 목요일

13 개 뉴스
🟡 🔧 하드웨어 2026년 7월 16일 · 2 분 읽기

AMD: AIMs 2.2, Instinct·EPYC·Radeon 위한 추론 마이크로서비스 제공

편집 일러스트: AMD ROCm 로고, 배경에 Docker 컨테이너와 GPU 칩

AMD가 AIMs 2.2를 발표했습니다—Instinct GPU 가속기, EPYC CPU, Radeon GPU에 자동 구성을 제공하는 표준화된 Docker 추론 마이크로서비스로, Gemma-4 31B, Llama-3.1 8B, Qwen3 등의 모델을 지원합니다.

🟡 ✨ 흥미로운 소식 2026년 7월 16일 · 2 분 읽기

arXiv:2607.13562: AI 조언은 『모르겠다』는 의향을 억누른다—답이 틀려도

편집 일러스트: AI 답변이 표시된 화면을 바라보는 사람, 머리 위의 물음표가 사라지는 모습

연구에 따르면 AI 제안은 참가자들이 『모르겠다』고 말하려는 의향을 거의 제거하며, AI 답변이 의도적으로 틀렸을 때도 정확도가 3분의 1로 감소하는 것으로 나타났습니다.

🟡 🤝 에이전트 2026년 7월 16일 · 2 분 읽기

arXiv:2607.13104: 자기 개선 AI 에이전트 종합 설문 (Jürgen Schmidhuber 참여)

편집 일러스트: 폐쇄 루프 사이클에서 자신의 데이터를 분석하고 파라미터를 업데이트하는 AI 에이전트

Zhe Ren, Yimeng Chen 및 공동 연구자들(Jürgen Schmidhuber 포함)이 97페이지의 연구를 발표했습니다. 자기 개선 AI 에이전트를 『인간의 입력 없이 경험을 흡수하는 업데이트 연산자』로 공식화하며, 업데이트 목표, 구동 신호, 평가를 다루고 프로토타입에서 프로덕션 시스템으로의 전환을 포함합니다.

🟡 🤖 모델 2026년 7월 16일 · 1 분 읽기

AWS: xAI의 Grok 4.3, Amazon Bedrock에서 이용 가능

편집 일러스트: xAI의 Grok 4.3 모델이 AWS Amazon Bedrock 플랫폼에 통합된 모습

xAI의 모델 Grok 4.3이 Amazon Bedrock—기초 AI 모델에 대한 AWS 관리형 액세스 플랫폼—에서 이용 가능해졌습니다. 이 모델은 구성 가능한 추론 강도, 도구 호출, 구조화된 출력, 멀티모달 입력을 지원하며 Mantle 추론 엔진 위에서 OpenAI 호환 API로 동작합니다.

2026년 7월 15일 수요일

12 개 뉴스
🟡 🤝 에이전트 2026년 7월 15일 · 2 분 읽기

arXiv:2607.13034: E3 프레임워크 — 에이전트가 태스크 복잡도를 추정하고 토큰을 91% 절감

E3 프레임워크 다이어그램: 코드 에이전트의 추정·실행·확장 단계를 보여줌

Junjie Yin과 Xinyu Feng의 E3 프레임워크(추정·실행·확장)는 실행 전에 태스크 복잡도를 추정합니다. MSE-Bench 벤치마크에서 기준선과 동일한 성공률을 달성하면서 비용을 85%, 토큰 소비를 91%, 검토 파일 수를 92% 절감했습니다.

🟡 🤝 에이전트 2026년 7월 15일 · 2 분 읽기

arXiv:2607.12463: 함수 인식 FIM 중간 훈련으로 코딩 에이전트 SWE-Bench 점수 최대 +5.4 향상

함수 인식 FIM 중간 훈련 개념도: 프로그램 의존성 그래프와 SWE-Bench 결과 포함

Wang Yubo 외 8인은 프로그램 의존성 그래프 분석을 활용한 함수 인식 FIM 중간 훈련 방법을 도입했습니다. SWE-Bench-Lite에서 Qwen2.5-Coder와 Qwen3-8B 모델에 +3.7~+5.4점 향상을 달성했으며, 훈련 코퍼스는 968개 GitHub 저장소에서 26억 토큰을 사용합니다.

🟡 🤝 에이전트 2026년 7월 15일 · 2 분 읽기

arXiv:2607.12385:PM-Bench, 에이전트의 「전망적 기억」측정——최고 모델 GPT-5.4도 F1 65.1%에 그쳐

PM-Bench 전망적 기억 벤치마크에서 8개 SOTA LLM 모델의 F1 점수 비교 그래프

PM-Bench는 LLM 에이전트의 전망적 기억——미래의 트리거에서 의도한 작업을 수행하는 능력——을 측정하는 새로운 평가 플랫폼입니다. 저자 Genglin Liu와 Saadia Gabriel은 인지 심리학에서 영감을 받아 이 벤치마크를 설계했으며, 결과는 심각한 격차를 보여줍니다. 테스트한 8개 모델 중 최고 성능인 GPT-5.4조차 F1이 65.1%에 불과합니다.

🟡 🤖 모델 2026년 7월 15일 · 2 분 읽기

Google Research: 확산 모델의 창의성, score 함수의 「평활화」로 설명되다

확산 모델의 score 함수 시각화, 훈련 데이터 포인트 사이의 보간 영역을 보여줌

Google Research가 확산 모델의 창의성에 대한 수학적 설명을 발표했습니다. 정규화로 인해 신경망은 흐릿하고 근사적인 score 함수를 학습하며, 이로 인해 생성된 이미지가 훈련 데이터 포인트 사이의 보간 영역에 위치하게 됩니다. 이는 우연이 아닌 예측 가능한 수학적 결과입니다.

2026년 7월 14일 화요일

13 개 뉴스
🟡 💬 커뮤니티 2026년 7월 14일 · 2 분 읽기

Anthropic: 캐나다 AI 연구에 1000만 캐나다달러 투자 및 Claude 사용 데이터 공개

편집 일러스트: 대학 거점을 표시한 캐나다 지도와 AI 채택률 성장 그래프

Anthropic이 AI 안전성, 의료, 저자원 언어에 초점을 맞춘 캐나다 8개 기관에 1000만 캐나다달러(CAD)를 투자합니다. 동시에 공개된 Economic Index에 따르면 캐나다는 Claude.ai 글로벌 트래픽의 2.6%를 차지하며, 1인당 채택률은 예상치의 4.4배입니다.

🟡 🤖 모델 2026년 7월 14일 · 2 분 읽기

Anthropic: Claude for Teachers — 미국 K-12 교사를 위한 무료 Claude

편집 일러스트: 교사가 교실 칠판 앞에서 태블릿으로 AI 어시스턴트를 사용하는 모습

Anthropic이 미국 인증 K-12 교사를 위한 무료 Claude 버전을 2027년 6월까지 제공하는 프로그램을 시작했습니다. 교수 기술 라이브러리, 전국 50개 주 교육 기준에 맞춘 커리큘럼, 9개 교육 도구와의 연동이 포함됩니다.

🟡 🤖 모델 2026년 7월 14일 · 2 분 읽기

arXiv:2607.11598: 상호작용이 테스트 시 계산의 「세 번째 축」 — 오류 최대 74% 제거

테스트 시 계산의 세 축 다이어그램: 더 긴 사고, best-of-N 샘플링, 도구와의 상호작용

테스트 시 계산은 더 나은 답변을 얻기 위해 추론 중 모델이 소비하는 추가 계산입니다. Bojie Li와 Noah Shi는 외부 도구와의 상호작용을 테스트 시 계산의 세 번째 축으로 정의했습니다——더 긴 사고 연쇄 및 best-of-N 샘플링과 함께. 제안자-검토자 시스템은 100% pass rate를 달성하며, 단독 사고 연쇄와 best-of-N은 정체 현상을 보입니다.

🟡 🤝 에이전트 2026년 7월 14일 · 2 분 읽기

arXiv:2607.11185: SCALECUA, RL로 컴퓨터 사용 에이전트 확장 — OSWorld 68.7%

편집 일러스트: 컴퓨터 GUI를 탐색하는 AI 에이전트와 강화학습의 보상·벌칙 루프 표시

SCALECUA는 칭화대학교/THUDM 연구자들이 제안한 새로운 프레임워크로, 온라인 강화학습을 통해 컴퓨터 사용 에이전트를 확장하여 OSWorld 벤치마크에서 새로운 SOTA 68.7%, ScienceBoard에서 54.0%를 달성했습니다.

2026년 7월 13일 월요일

12 개 뉴스
🟡 🤝 에이전트 2026년 7월 13일 · 2 분 읽기

Allen Institute:Shippy 에이전트 개발로 배운 신뢰할 수 있는 AI 에이전트 구축의 교훈

편집 일러스트: Kubernetes 사용자별 격리를 포함한 Soul-Skills-Config AI 에이전트 아키텍처 다이어그램

Allen Institute for AI는 Claude Opus 4.6으로 구동되어 70개국 이상에 서비스를 제공하는 해양 에이전트 Shippy의 아키텍처에 대한 상세한 분석을 발표했습니다. 핵심 결론은 에이전트의 신뢰성이 모델의 강력함보다 결정론적 도구, 격리된 인프라, 실제 워크플로우 기반 평가에 더 많이 의존한다는 것입니다.

🟡 🔧 하드웨어 2026년 7월 13일 · 2 분 읽기

AMD:GEAK 에이전트가 MI355에서 DeepSeek-V4 MLA 커널을 자동 최적화, 최대 9배 가속

편집 일러스트: AMD MI355 GPU 가속기 다이어그램에 최적화된 Triton 커널 코드를 생성하는 GEAK 에이전트를 보여줌

AMD의 GPU 커널 자동화 최적화 에이전트 GEAK가 DeepSeek-V4 MLA 커널을 MI355 가속기용으로 PyTorch에서 Triton으로 마이그레이션했습니다. 결과는 프리필 최대 9.13배 가속, 디코딩 기하평균 4.94배 가속, SGLang 프레임워크에서 엔드투엔드 처리량 2.10배 향상을 보여줍니다.

🟡 🤖 모델 2026년 7월 13일 · 2 분 읽기

Anthropic:Claude의 가치관은 모델과 언어에 따라 다르게 나타납니다

편집 일러스트: Claude 각 모델의 네 가지 가치 축을 언어별로 나타낸 그래픽

Anthropic은 309,815건의 익명 Claude.ai 대화를 분석하여 Sonnet 4.6, Opus 4.6, Opus 4.7 모델 간, 그리고 분석된 20개 언어 간에 표현되는 가치관에 통계적으로 유의미한 차이가 있음을 발견했습니다. 힌디어가 가장 높은 따뜻함을 보였고, 러시아어와 영어가 가장 높은 엄격함을 보였습니다.

🟡 🤖 모델 2026년 7월 13일 · 2 분 읽기

arXiv:2607.09375:Li Auto, Mach-Mind-4-Flash 발표——35B MoE, 활성 파라미터 3B

편집 일러스트: Li Auto 로고 옆에 전체 전문가 집합에서 활성 전문가를 표시한 MoE 아키텍처 다이어그램

중국 자동차 제조사 Li Auto가 자체 기반 모델 Mach-Mind-4-Flash를 공개했습니다. 350억 파라미터의 MoE 모델로 입력당 30억 파라미터만 활성화하며, 3단계 훈련 파이프라인을 통해 1000억+ 파라미터급 모델 성능을 달성하면서 추론 비용은 크게 낮췄습니다.

2026년 7월 11일 토요일

6 개 뉴스
🟡 💬 커뮤니티 2026년 7월 11일 · 2 분 읽기

arXiv:2607.07779:Terence Tao가 공동 저술한 최전선 수학에서 대형 언어 모델의 한계를 논한 논문

에디토리얼 일러스트: 신경망이 형식적 증명이 쓰인 칠판을 통과하는 모습

『From Solvers to Research』는 arXiv 논문으로, 저자 중 한 명이 필즈상 수상자 Terence Tao입니다. LLM 에이전트가 자동 형식화와 증명 합성을 통해 연구 수준의 수학을 수행할 수 있는지를 검토합니다. 기존 증명 합성 시스템의 체계적 약점을 식별하고 문제 해결과 진정한 연구의 경계를 그립니다.

🟡 🛡️ 보안 2026년 7월 11일 · 2 분 읽기

arXiv:2607.08395:Token-Flow Firewall — 장기 실행 AI 에이전트를 실시간 감시하고 공격 성공률을 12.5%로 낮추다

에디토리얼 일러스트: 작동 중인 AI 에이전트로 향하는 단어 흐름을 필터링하는 방화벽

Token-Flow Firewall은 arXiv에서 발표된 방어 메커니즘으로, 장기 실행(영속적)AI 에이전트의 자연어 토큰 흐름을 실시간으로 모니터링합니다. prompt injection 및 기타 적대적 공격 테스트에서 공격 성공률을 12.5%로 낮추며, 모델 학습에만 의존하지 않는 런타임 보호 레이어를 제공합니다.

🟡 🏥 실무 2026년 7월 11일 · 2 분 읽기

Anthropic: Claude Code v2.1.207이 모든 엔터프라이즈 클라우드에서 auto mode를 활성화하고 기본 모델을 Opus 4.8로 변경하며 shell-injection 취약점 수정

에디토리얼 일러스트: 세 개의 클라우드 공급자 위에 자동 모델 전환 스위치가 있는 터미널

Claude Code v2.1.207은 Anthropic CLI 도구의 새 버전으로, opt-in 변수 없이 Amazon Bedrock, Google Vertex AI, Microsoft Foundry에서 『auto mode』를 자동으로 사용할 수 있게 합니다. 이 릴리스는 hook 설정의 shell-injection 보안 취약점을 수정하고, Bedrock, Vertex, AWS의 Claude 플랫폼에서 기본 모델을 Claude Opus 4.8로 변경합니다.

🟢 🤝 에이전트 2026년 7월 11일 · 2 분 읽기

arXiv:2607.08093:CausalDS — 데이터 과학 작업에서 AI 에이전트의 인과 추론을 측정하는 새 벤치마크

에디토리얼 일러스트: 『원인』과 『상관』이라고 표시된 두 개의 얽힌 곡선을 분리하는 에이전트

CausalDS는 arXiv에서 발표된 벤치마크로, AI 에이전트가 데이터 과학 워크플로 내에서 인과성과 상관성을 구분할 수 있는지를 테스트합니다. 자율 분석 에이전트 평가의 공백을 채웁니다. 표준 테스트는 실행 단계의 정확성을 측정하지만 올바른 인과 추론 능력은 측정하지 못했습니다.