🤝 에이전트

274 개 뉴스

🟡 🤝 에이전트 2026년 7월 18일 · 2 분 읽기

arXiv:2607.15257: SearchOS, 명시적 증거 그래프로 검색 에이전트의 반복 루프 해결

편집 일러스트: 멀티에이전트 시스템 SearchOS가 검색 상태를 증거 그래프로 외부화하는 모습

SearchOS는 검색 진행 상황을 놓치는 문제를, Frontier Task, Evidence Graph, Coverage Map, Failure Memory라는 네 가지 구조로 상태를 외부화함으로써 해결하는 멀티에이전트 프레임워크입니다. 여기에 pipeline-parallel scheduling과 도구 예산을 감시하는 Search Tool Middleware Harness가 더해집니다. WideSearch와 GISA 벤치마크에서 테스트된 모든 싱글·멀티에이전트 베이스라인 시스템을 모든 지표에서 능가합니다.

🟢 🤝 에이전트 2026년 7월 18일 · 1 분 읽기

arXiv:2607.15193: Plover, 계획 중심의 편집 가능한 방식으로 GUI 에이전트와의 상호작용을 이끌다

편집 일러스트: 계획 중심 GUI 에이전트 Plover가 보이고 편집 가능한 작업 계획을 갖춘 모습

Plover는 계획 중심의 GUI 자동화 시스템으로, 작업 계획과 재계획을 에이전트의 숨겨진 내부 상태가 아니라 영속적이고 점검 가능한 산출물로 외부화합니다. Planner-executor 아키텍처는 실행에 대한 감독을 가능하게 하며, 편집 가능한 계획을 통한 국소적 수정을 지원합니다. 참가자 6명을 대상으로 한 형성적 연구가 상호작용 설계에 반영되었습니다.

🟢 🤝 에이전트 2026년 7월 18일 · 1 분 읽기

arXiv:2607.14658: TopoAgent, 선형 계획을 동적 그래프로 대체해 과학적 추론을 수행

편집 일러스트: 자기진화형 위상 에이전트 TopoAgent가 과학적 추론을 위해 원자 그래프를 구축하는 모습

TopoAgent는 자기진화형 위상 에이전트로, MLLM 에이전트의 선형 계획을 동적이고 상태가 분리된 그래프 진화 접근법으로 대체하여 긴 맥락에서의 시각-의미 불일치와 환각 문제를 해결합니다. 프런트엔드 분해기가 adaptive atomic fission을 이용해 원자들의 유향 비순환 그래프(Directed Acyclic Graph)를 구축하며, 수학·물리·화학에서 SOTA 선형 에이전트 프레임워크를 크게 능가합니다.

🟡 🤝 에이전트 2026년 7월 17일 · 2 분 읽기

AWS: Amazon Quick, CRM과 회의 준비를 자동화하는 영업팀용 에이전틱 AI 동료

편집 일러스트: 책상에 앉은 영업사원과 화면에 CRM 데이터를 보여주는 AI 어시스턴트

Amazon Quick는 리드 스코어링, 아웃리치, 통화 분석, CRM 업데이트를 자동화하는 영업팀용 에이전틱 AI 어시스턴트입니다. 영업사원이 실제 영업에 쓰는 시간이 40%에 불과하다는 문제를 해결하며, 초기 도입 기업으로는 3M, AWS Global Sales, 아마존 내부 조직이 있습니다.

🟡 🤝 에이전트 2026년 7월 17일 · 2 분 읽기

arXiv:2607.14642: MCPEvol-Bench, GPT-5.4와 Claude 모두 MCP 도구 변경 시 정확도를 잃는다는 것을 보여주다

편집 일러스트: 형태와 인터페이스가 변하는 연결된 도구 네트워크 앞에 선 AI 에이전트

MCPEvol-Bench는 123개의 MCP 서버에 11개의 변이 연산자를 시뮬레이션해 변화하는 도구 인터페이스에 대한 AI 에이전트의 적응력을 테스트하는 새로운 벤치마크입니다. GPT-5.4는 진화된 서버에서 성능이 13.7% 저하되었고, Claude-Sonnet-4-6은 더 큰 14.4% 저하를 보였으며, 테스트된 12개 프론티어 모델에서 계획 및 추론 오류가 증가했습니다.

🟡 🤝 에이전트 2026년 7월 17일 · 2 분 읽기

AWS: Smartsheet, Bedrock와 Neptune 지식 그래프 기반 원격 MCP 서버 구축으로 30억 토큰 절약

편집 일러스트: AWS 클라우드 및 노드 지식 그래프와 연결된 Smartsheet 로고

Smartsheet가 AWS Fargate 위에 Bedrock, Kinesis, Flink, Neptune 지식 그래프를 결합한 원격 MCP 서버를 구축해 AI 에이전트에게 구조화된 데이터 접근을 제공했습니다. 자체 직렬화 형식으로 토큰을 35-47% 줄였고, 사용자 수는 첫 4주간 주간 87% 증가했습니다.

🟢 🤝 에이전트 2026년 7월 17일 · 2 분 읽기

GitHub: Copilot 코드 리뷰에 방화벽과 커스텀 러너 추가, 모바일에는 클라우드 에이전트 댓글 수정 기능 도입

편집 일러스트: GitHub Copilot 아이콘이 표시된 휴대폰과 코드 리뷰 설정 패널

GitHub이 같은 날 두 개의 변경 로그를 발표했습니다. Copilot 코드 리뷰는 이제 방화벽 규칙, 커스텀 설정 단계, 독립 러너를 지원하며, GitHub Mobile은 댓글에서 바로 클라우드 에이전트를 실행해 수정하는 'Fix with Copilot' 버튼을 얻었습니다.

🟡 🤝 에이전트 2026년 7월 16일 · 2 분 읽기

arXiv:2607.13104: 자기 개선 AI 에이전트 종합 설문 (Jürgen Schmidhuber 참여)

편집 일러스트: 폐쇄 루프 사이클에서 자신의 데이터를 분석하고 파라미터를 업데이트하는 AI 에이전트

Zhe Ren, Yimeng Chen 및 공동 연구자들(Jürgen Schmidhuber 포함)이 97페이지의 연구를 발표했습니다. 자기 개선 AI 에이전트를 『인간의 입력 없이 경험을 흡수하는 업데이트 연산자』로 공식화하며, 업데이트 목표, 구동 신호, 평가를 다루고 프로토타입에서 프로덕션 시스템으로의 전환을 포함합니다.

🟢 🤝 에이전트 2026년 7월 16일 · 2 분 읽기

arXiv:2607.14049: 『Deep Interaction』—추론 체인 수정이 교정 성공률 +25%, 토큰 40% 절약

Deep Interaction 방법 시각화: 사용자가 추론 체인의 잘못된 단계를 편집하고 모델이 수정된 경로를 따라 계속 생성

Hefeng Zhou, Jinxuan Zhang, Jiong Lou 및 공동 저자들이 Deep Interaction을 발표했습니다—사용자가 질문을 다시 하는 대신 추론 체인을 직접 편집할 수 있는 LLM 상호 작용 방법. STEM 과제에서 기준선 대비 교정 성공률 +25%, 토큰 사용량 40% 절약을 달성합니다.

🟡 🤝 에이전트 2026년 7월 15일 · 2 분 읽기

arXiv:2607.13034: E3 프레임워크 — 에이전트가 태스크 복잡도를 추정하고 토큰을 91% 절감

E3 프레임워크 다이어그램: 코드 에이전트의 추정·실행·확장 단계를 보여줌

Junjie Yin과 Xinyu Feng의 E3 프레임워크(추정·실행·확장)는 실행 전에 태스크 복잡도를 추정합니다. MSE-Bench 벤치마크에서 기준선과 동일한 성공률을 달성하면서 비용을 85%, 토큰 소비를 91%, 검토 파일 수를 92% 절감했습니다.

🟡 🤝 에이전트 2026년 7월 15일 · 2 분 읽기

arXiv:2607.12463: 함수 인식 FIM 중간 훈련으로 코딩 에이전트 SWE-Bench 점수 최대 +5.4 향상

함수 인식 FIM 중간 훈련 개념도: 프로그램 의존성 그래프와 SWE-Bench 결과 포함

Wang Yubo 외 8인은 프로그램 의존성 그래프 분석을 활용한 함수 인식 FIM 중간 훈련 방법을 도입했습니다. SWE-Bench-Lite에서 Qwen2.5-Coder와 Qwen3-8B 모델에 +3.7~+5.4점 향상을 달성했으며, 훈련 코퍼스는 968개 GitHub 저장소에서 26억 토큰을 사용합니다.

🟡 🤝 에이전트 2026년 7월 15일 · 2 분 읽기

arXiv:2607.12385:PM-Bench, 에이전트의 「전망적 기억」측정——최고 모델 GPT-5.4도 F1 65.1%에 그쳐

PM-Bench 전망적 기억 벤치마크에서 8개 SOTA LLM 모델의 F1 점수 비교 그래프

PM-Bench는 LLM 에이전트의 전망적 기억——미래의 트리거에서 의도한 작업을 수행하는 능력——을 측정하는 새로운 평가 플랫폼입니다. 저자 Genglin Liu와 Saadia Gabriel은 인지 심리학에서 영감을 받아 이 벤치마크를 설계했으며, 결과는 심각한 격차를 보여줍니다. 테스트한 8개 모델 중 최고 성능인 GPT-5.4조차 F1이 65.1%에 불과합니다.

🟡 🤝 에이전트 2026년 7월 14일 · 2 분 읽기

arXiv:2607.11185: SCALECUA, RL로 컴퓨터 사용 에이전트 확장 — OSWorld 68.7%

편집 일러스트: 컴퓨터 GUI를 탐색하는 AI 에이전트와 강화학습의 보상·벌칙 루프 표시

SCALECUA는 칭화대학교/THUDM 연구자들이 제안한 새로운 프레임워크로, 온라인 강화학습을 통해 컴퓨터 사용 에이전트를 확장하여 OSWorld 벤치마크에서 새로운 SOTA 68.7%, ScienceBoard에서 54.0%를 달성했습니다.

🟢 🤝 에이전트 2026년 7월 14일 · 2 분 읽기

arXiv:2607.10891: SETA — 4,500개 이상의 강화학습 환경으로 터미널 에이전트 성능 향상

터미널 에이전트 훈련을 위한 SETA-Synth와 SETA-Evol 구성 요소를 포함한 SETA 강화학습 환경 생성 시스템 다이어그램

터미널 에이전트는 터미널 또는 셸 명령으로 작업을 해결하는 AI 에이전트입니다. SETA(선 등, 옥스퍼드대학교, KAUST)는 터미널 에이전트 훈련을 위해 4,500개 이상의 검증 가능한 강화학습 환경을 생성합니다. DeepSeek-V4-Flash는 Terminal-Bench 2.0에서 pass@1을 40%→43%, pass@5를 54%→58%로 개선했습니다.

🟢 🤝 에이전트 2026년 7월 14일 · 2 분 읽기

AWS: Strands Agents와 Bedrock으로 멀티 에이전트 B2B 고객 탐색

Amazon Bedrock 기반 B2B 고객 탐색의 Swarm과 Graph 오케스트레이션 패턴 다이어그램

멀티 에이전트 오케스트레이션은 여러 전문 AI 에이전트가 공동 작업을 수행하는 조정입니다. Thrad.ai는 Amazon Bedrock과 Strands Agents SDK를 사용하여 6개 소스를 통해 B2B 고객을 탐색하는 시스템을 구현했습니다. Swarm 패턴은 이메일 품질 8.2/10을 달성하고, Graph 패턴은 비용 25% 절감, 속도 28% 향상입니다.

🟡 🤝 에이전트 2026년 7월 13일 · 2 분 읽기

Allen Institute:Shippy 에이전트 개발로 배운 신뢰할 수 있는 AI 에이전트 구축의 교훈

편집 일러스트: Kubernetes 사용자별 격리를 포함한 Soul-Skills-Config AI 에이전트 아키텍처 다이어그램

Allen Institute for AI는 Claude Opus 4.6으로 구동되어 70개국 이상에 서비스를 제공하는 해양 에이전트 Shippy의 아키텍처에 대한 상세한 분석을 발표했습니다. 핵심 결론은 에이전트의 신뢰성이 모델의 강력함보다 결정론적 도구, 격리된 인프라, 실제 워크플로우 기반 평가에 더 많이 의존한다는 것입니다.

🟡 🤝 에이전트 2026년 7월 13일 · 2 분 읽기

arXiv:2607.09493:에이전트를 위한 공유 선택적 영속 메모리——성공률 96%, 토큰 비용 97배 절감

편집 일러스트: 선택적 메모리 도입으로 에이전트 성공률이 상승하고, 전체 기록에서는 하락하는 추세를 보여주는 그래프

에이전틱 LLM 시스템을 위한 새로운 아키텍처 프레임워크는 재사용 가능한 4가지 카테고리의 컨텍스트를 보존하면서 일시적인 추론 흔적을 버리는 선택적 영속 메모리를 도입합니다. 결과는 작업 완료 성공률 96%, 호출당 토큰 비용 97배 절감입니다.

🟢 🤝 에이전트 2026년 7월 11일 · 2 분 읽기

arXiv:2607.08093:CausalDS — 데이터 과학 작업에서 AI 에이전트의 인과 추론을 측정하는 새 벤치마크

에디토리얼 일러스트: 『원인』과 『상관』이라고 표시된 두 개의 얽힌 곡선을 분리하는 에이전트

CausalDS는 arXiv에서 발표된 벤치마크로, AI 에이전트가 데이터 과학 워크플로 내에서 인과성과 상관성을 구분할 수 있는지를 테스트합니다. 자율 분석 에이전트 평가의 공백을 채웁니다. 표준 테스트는 실행 단계의 정확성을 측정하지만 올바른 인과 추론 능력은 측정하지 못했습니다.

🟢 🤝 에이전트 2026년 7월 11일 · 2 분 읽기

arXiv:2607.08681:SolarChain-Eval — 분산형 에너지 시장의 AI 에이전트를 위한 물리 제약 벤치마크

에디토리얼 일러스트: AI 에이전트가 에너지를 거래하는 네트워크로 연결된 태양광 패널

SolarChain-Eval은 arXiv에서 발표된 벤치마크로, 실제 시스템의 물리적 제약을 포함한 분산형 에너지 시장의 경제적 AI 에이전트를 평가합니다. 에이전트의 위험한 행동을 탐지하는 언어 모델 기반 감사 레이어를 포함하며, AI 에이전트를 사이버물리 에너지 인프라와 연결합니다.

🟡 🤝 에이전트 2026년 7월 10일 · 2 분 읽기

LangChain: OpenWiki Brains가 에이전트에 능동적 메모리 부여 — Gmail·Notion·Git에서 자동으로 컨텍스트를 수집해 Markdown으로 저장

에디토리얼 일러스트: 이메일·노트·리포지터리에서 Markdown 시트로 위키를 조립하는 로봇

OpenWiki Brains는 LangChain의 오픈소스 프레임워크로, AI 에이전트에 능동적 메모리를 부여합니다. 외부 소스에서 컨텍스트를 자동으로 수집해 디스크의 Markdown 파일로 저장합니다. 첫 버전은 Gmail·Notion·Git·Twitter/X·Hacker News·웹 검색 6개 커넥터를 지원하며, 클라우드가 아닌 로컬에서 예약 작업으로 실행됩니다.

🟢 🤝 에이전트 2026년 7월 10일 · 2 분 읽기

arXiv:2607.08403: 게임 이론으로 환각 방지 — 멀티 에이전트 프레임워크가 모델을 전략적 플레이어로 모델링해 허위 정보 생성 감소

편집 일러스트: 체스판에서 진실을 향해 수를 맞춰가는 여러 AI 플레이어들

이 연구는 대형 언어 모델의 환각을 줄이기 위해 게임 이론을 활용한 멀티 에이전트 프레임워크를 제안합니다. 모델 간 상호작용을 전략적 플레이어들의 게임으로 모델링하며, 균형(equilibrium)이 일관되고 환각이 없는 답변에 대응하도록 설계되어 기존 RLHF 및 RAG와는 다른 접근법을 제시합니다.

🟡 🤝 에이전트 2026년 7월 9일 · 2 분 읽기

arXiv:2607.06906: 「Harness Effect」——오케스트레이션 설계가 AI 에이전트 비용을 41% 절감, 모델 교체보다 효과적

편집 일러스트: 지휘봉이 모델과 도구 사이의 토큰 흐름을 지휘하는 모습

Harness Effect는 32명의 저자가 참여한 실증 연구의 발견으로, 오케스트레이션 층의 설계가 AI 에이전트 비용에 미치는 영향이 모델 선택보다 크다는 것을 보여줍니다. 22개 과제와 6개 모델에서 최적화된 오케스트레이션은 과제당 비용을 41%(0.21달러에서 0.12달러로), 토큰을 38%, 실행 시간을 44% 줄이면서 품질은 향상시켰습니다.

🟡 🤝 에이전트 2026년 7월 9일 · 2 분 읽기

IBM: Bob, 멀티 에이전트 플랫폼으로 진화——COBOL 현대화 9개월 프로젝트를 3일 만에 완료

편집 일러스트: 메인프레임 캐비닛에서 작은 에이전트 무리가 코드를 현대적인 서버로 이전하는 모습

IBM Bob은 소프트웨어 개발용 에이전트 플랫폼으로, 새 버전에서 전체 개발 주기를 아우르는 멀티 에이전트 아키텍처, Bobalytics 분석, COBOL 및 PL/I 메인프레임 현대화를 위한 Premium 패키지를 갖추게 됩니다. IBM은 고객 Blue Pearl이 Bob으로 9개월 현대화 프로젝트를 3일 만에 완료했다고 보고합니다.

🟡 🤝 에이전트 2026년 7월 9일 · 2 분 읽기

OpenAI: ChatGPT, 실제 업무 에이전트로 진화——앱 전반에 걸쳐 작업하고 수 시간 동안 자율적으로 일해 결과물 완성

편집 일러스트: 자동화된 작업 흐름이 여러 화면을 넘나드는 업무 책상

ChatGPT Work는 OpenAI의 에이전트 업무 방식으로의 큰 도약입니다. ChatGPT는 이제 앱과 파일을 넘나들며 작업을 수행하고 프로젝트를 수 시간 동안 자율적으로 처리해 목표를 완성된 결과물로 만들어냅니다. OpenAI는 이를 가장 야심찬 과제의 파트너로 포지셔닝하며, Anthropic과 GitHub의 에이전트 제품과 직접 경쟁합니다.

🟡 🤝 에이전트 2026년 7월 8일 · 4 분 읽기

프로브 캐스케이드, 첫 단계에서 AI 에이전트 실패를 은닉 활성화로 예측하고 토큰 최대 47% 절약

에디토리얼 일러스트: 신경망의 은닉 상태로부터 실패 예정 에이전트 에피소드를 예측하고 조기 중단하는 개념

연구진이 LLM 에이전트의 은닉 활성화에 경량 프로브를 적용해 첫 번째 상호작용 단계에서 실패 에피소드를 감지하는 시스템을 개발했다. Qwen-2.5-7B에서 토큰 소비를 47.1%, Llama-3.2-3B에서 37.2% 절감하면서 90% 리콜을 보장한다.

🟡 🤝 에이전트 2026년 7월 8일 · 4 분 읽기

공식 이론, LLM의 반복적 반성이 기하급수적 개선을 가져오는 시점을 정확히 정의하다

에디토리얼 일러스트: 자기 분석과 컨텍스트 내 탐색이 AI 시스템의 추론을 향상시키는 시점에 관한 이론

Wolf, Wies, Shashua 연구진이 언어 모델의 자기 개선은 반성이 오류를 안정적으로 국소화할 때만 기하급수적 이득을 제공한다는 것을 증명하는 베이즈 이론적 프레임워크를 개발했다. 그렇지 않을 경우 순차적 시도는 병렬 샘플링에 비해 점근적 우위를 제공하지 않는다.

🟡 🤝 에이전트 2026년 7월 8일 · 3 분 읽기

LangChain과 NVIDIA, NemoClaw 출시: 오픈 에이전트 스택, 경쟁사 대비 10배 낮은 비용 달성

에디토리얼 일러스트: Nemotron 3 Ultra 아키텍처를 갖춘 LangChain과 NVIDIA NemoClaw 오픈 에이전트 스택

LangChain과 NVIDIA가 공동으로 NemoClaw를 발표했습니다. Nemotron 3 Ultra 모델, LangChain Deep Agents Code 하네스, OpenShell 런타임을 결합한 오픈 블루프린트입니다. 이 조합은 평가당 $4.48의 비용으로 종합 점수 0.86을 달성하며, 다음으로 우수한 경쟁사의 $43.48과 비교됩니다. 완전한 자체 호스팅 데이터 제어 기능도 포함합니다.

🟡 🤝 에이전트 2026년 7월 7일 · 3 분 읽기

LLM-as-a-Verifier: 검증, 언어 모델 스케일링의 새 네 번째 축

편집 일러스트: LLM을 검증자로, 검증을 AI 모델 스케일링의 새 차원으로

Stanford와 UC Berkeley 연구자들이 검증 — 솔루션의 정확성을 평가하는 능력 — 을 LLM의 새로운 스케일링 축으로 식별했으며, 기존 패러다임과 직교합니다. 이 프레임워크는 연속적인 검증 점수를 생성하며 네 개의 벤치마크에서 SOTA를 달성합니다: Terminal-Bench V2(86.5%), SWE-Bench Verified(78.2%), RoboRewardBench(87.4%), MedAgentBench(73.3%).

🟡 🤝 에이전트 2026년 7월 7일 · 3 분 읽기

Google, 프로덕션 환경을 위한 Gemini API Managed Agents 확장

편집 일러스트: 개발자를 위해 관리형 에이전트를 확장하는 Google Gemini API

Google이 Gemini API에 백그라운드 실행, 원격 MCP 통합, 커스텀 함수 호출, 자격증명 갱신 등 네 가지 기능을 추가했습니다. 이를 통해 개발자들은 프로토타입 환경을 벗어나 실제 프로덕션 환경에 에이전트를 배포할 수 있습니다.

🟡 🤝 에이전트 2026년 7월 7일 · 4 분 읽기

LangChain: 에이전트 개선은 데이터 마이닝 문제다

편집 일러스트: LangChain 에이전트와 더 나은 관찰 가능성을 위한 실행 트레이스 데이터 마이닝

LangChain의 Vivek Trivedy는 AI 에이전트를 체계적으로 개선하는 것은 근본적으로 대규모 실행 트레이스 마이닝 문제라고 주장합니다. 권장 순서: 하네스 엔지니어링, 그 다음 파인튜닝, 그 다음 추가 하네스 최적화. 핵심 조언: 데이터 수집 루프를 시작하기 위해 에이전트를 일찍 배포하세요.

🟢 🤝 에이전트 2026년 7월 7일 · 3 분 읽기

Claude Code v2.1.203 — 세션 만료 경고, 더 작은 바이너리, 빠른 시작

편집 일러스트: 로그인 만료 수정과 세션 복구가 포함된 Claude Code v2.1.203

Anthropic이 7월 7일 Claude Code v2.1.203을 출시했습니다. 로그인 토큰 만료 경고, 정지된 백그라운드 세션 자동 복구, 약 7MB 바이너리 크기 감소가 포함됩니다. macOS 속도 저하와 서브 에이전트 동작을 방해하는 여러 버그도 수정되었습니다.

🟢 🤝 에이전트 2026년 7월 7일 · 3 분 읽기

AgentGym2: 새 벤치마크, 비이상화된 조건에서 LLM 에이전트를 테스트

편집 일러스트: 비이상화된 실제 작업을 위한 AI 웹 에이전트 AgentGym2 벤치마크

연구자들이 불완전한 정보와 미지의 도구를 사용한 실제 조건에서 15개 LLM 에이전트를 테스트하는 평가 프레임워크 AgentGym2를 발표했습니다. GPT-5와 Gemini를 포함한 모든 모델이 크게 부진하여, 현재 기술 상태와 프로덕션 배포 요구 사항 사이의 큰 격차를 드러냈습니다. 논문은 ACL 2026에서 채택되었습니다.

🟡 🤝 에이전트 2026년 7월 3일 · 3 분 읽기

Claude Code v2.1.200: 기본 권한 모드가 Manual로 변경

에디토리얼 일러스트레이션: 새로운 보안 수정 및 수동 권한이 적용된 Claude Code CLI 에이전트

Anthropic은 2026년 7월 3일 Claude Code v2.1.200을 출시했습니다. 모든 인터페이스에서 기본 권한 모드가 Manual로 변경되었고, 명시적 설정 없이는 AskUserQuestion 다이얼로그가 자동으로 진행되지 않습니다. 데몬 탈취 보안 취약점이 패치되었으며, 백그라운드 세션 및 하위 에이전트 속도 제한 처리가 개선되고 tmux 3.4+에서의 렌더링 깜빡임도 해결되었습니다.

🟡 🤝 에이전트 2026년 7월 2일 · 2 분 읽기

ICML 2026 연구: SFT 및 RL 에이전트, 통제된 벤치마크 외부에서 성능 급락

에디토리얼 일러스트레이션: 도구 사용 AI 에이전트의 분포 변화에 따른 취약성과 일반화 강건성

ICML 2026에 채택된 논문이 네 가지 수준 — 지각, 상호작용, 추론, 내재화 — 에 걸친 환경 변화 하에서 도구 사용 LLM 에이전트를 체계적으로 테스트한다. 주요 발견: SFT와 RL 훈련 모두 약간의 분포 변화에도 심각한 성능 저하를 보이며, 통제된 벤치마크 정확도가 실제 강건성을 예측하지 못한다. PAFT(교란 증강 파인튜닝)가 완화 방법으로 제안된다.

🟡 🤝 에이전트 2026년 7월 2일 · 2 분 읽기

SEA: 실시간 공식 안전 보장을 갖춘 자기 수정 에이전트

에디토리얼 일러스트레이션: 공식 안전 인증서와 행동 검증을 갖춘 자기 진화 AI 에이전트

SEA(Anytime-Valid Certificates를 갖춘 자기 진화 에이전트) 아키텍처는 에이전트가 공식 학습 이론적 보장을 유지하면서 자체 매개변수를 업데이트할 수 있게 한다. 5가지 검증 메커니즘과 감사 가능한 인증서가 각 자기 수정을 실시간으로 승인하거나 차단하며, SWE-bench Verified 테스트에서 강력한 기반 모델 대비 +4~+5 추가 인스턴스 해결 성과를 달성했다.

🟡 🤝 에이전트 2026년 7월 2일 · 3 분 읽기

GitHub Copilot 에이전트, 퍼블릭 프리뷰에서 세션 스트리밍 지원 시작

에디토리얼 일러스트레이션: 퍼블릭 프리뷰에서 라이브 스트리밍을 지원하는 GitHub Copilot 에이전트 세션

GitHub이 Copilot 에이전트의 세션 스트리밍 퍼블릭 프리뷰를 시작하며 엔터프라이즈 조직이 모든 Copilot 클라이언트에서 에이전트가 수행하는 프롬프트, 응답, 도구 호출을 직접 확인할 수 있게 됐다.

🟢 🤝 에이전트 2026년 7월 2일 · 3 분 읽기

AutoMem: 메모리 관리를 아키텍처적 선택이 아닌 학습 가능한 기술로

에디토리얼 일러스트레이션: 학습 가능한 인지 기술로서의 메모리 — 에이전트 학습 및 기억을 위한 그래프 엔진

스탠퍼드 연구자들이 인간의 주석 없이 메모리 구성 및 사용 방법을 자동으로 학습하는 두 개의 최적화 루프를 가진 시스템 AutoMem을 개발했다. 기준선 대비 2~4배 성능 향상을 달성했다.

🟡 🤝 에이전트 2026년 7월 1일 · 3 분 읽기

Claude Code v2.1.198: 백그라운드 에이전트가 스스로 PR을 열고, /dataviz 스킬 추가

편집 일러스트레이션: Claude Code 에이전트 뷰가 풀 리퀘스트와 백그라운드 에이전트를 자동화

Anthropic이 Claude Code v2.1.198을 출시했습니다. 주요 변경사항으로는 worktree에서 작업하는 백그라운드 에이전트가 자동으로 커밋·푸시·드래프트 풀 리퀘스트를 생성하고, Claude in Chrome이 GA에 도달했으며, 그래프 디자인을 위한 새 /dataviz 스킬과 AWS 게이트웨이 공급자가 추가되었습니다.

🟡 🤝 에이전트 2026년 7월 1일 · 3 분 읽기

AWS, 190개 포인트-투-포인트 연결을 중앙 레지스트리 하나로 대체하는 서버리스 A2A 게이트웨이 발표

편집 일러스트레이션: 에이전트-투-에이전트 통신 및 라우트 탐색을 위한 AWS 서버리스 게이트웨이

Amazon Web Services가 AI 에이전트 간의 탐색·라우팅·접근 제어를 중앙화하는 서버리스 A2A 게이트웨이 참조 아키텍처를 발표했습니다. 20개의 에이전트가 조율 없이 운영되면 최대 190개의 상호 연결이 생기는데, 게이트웨이는 이를 단일 진입점으로 줄입니다.

🟡 🤝 에이전트 2026년 7월 1일 · 3 분 읽기

AWS AgentCore Memory에 메타데이터 필터링 추가 — 정확도 40%에서 64%로 상승

편집 일러스트레이션: AI 에이전트를 위한 메타데이터 필터링이 적용된 AWS AgentCore 메모리 네임스페이스

Amazon Bedrock AgentCore Memory가 시맨틱 검색 이전에 적용되는 속성 메타데이터 필터링을 도입했습니다. 151개 질문 벤치마크에서 전체 정확도가 40%에서 64%로, 컨텍스트 의존형 쿼리는 16%에서 69%로 향상되었습니다.

🟡 🤝 에이전트 2026년 7월 1일 · 3 분 읽기

LangChain이 RLM 에이전트 도입: 재귀적 모델이 긴 컨텍스트에서 79% 향상된 성능 달성

편집 일러스트레이션: LangChain 딥 에이전트와 QuickJS 오케스트레이터로 긴 컨텍스트를 처리

LangChain이 DeepAgents 프레임워크를 통해 재귀 언어 모델(RLM)을 도입했습니다. 모델이 전체 컨텍스트를 하나의 창에 밀어 넣는 대신 입력 조각 위에서 스스로를 재귀적으로 호출하는 방식입니다. 128k 토큰 OOLONG 벤치마크에서 RLM 에이전트는 0.44였던 표준 에이전트 대비 0.79를 기록해 79% 향상되었습니다.

🟡 🤝 에이전트 2026년 6월 30일 · 3 분 읽기

Claude Sonnet 5, GitHub Copilot 탑재 및 JetBrains 에이전트 모드: 개발팀을 위한 이중 공세

에디토리얼 일러스트레이션: GitHub Copilot이 JetBrains IDE에 Claude Sonnet 5와 에이전트 모드를 도입

Anthropic이 Claude Sonnet 5를 출시한 같은 날, GitHub Copilot이 모든 플랫폼에서 해당 모델을 일반 공급 상태로 도입하고, Copilot 에이전트 모드가 VS Code에서 JetBrains 개발 환경(IntelliJ, PyCharm, GoLand, WebStorm)으로 확장됩니다.

🟡 🤝 에이전트 2026년 6월 30일 · 3 분 읽기

SkillOpt: Microsoft Research가 에이전트 명령 파일을 훈련 가능한 파라미터로 처리합니다

에디토리얼 일러스트레이션: Microsoft SkillOpt가 최적화를 위해 에이전트 스킬을 훈련 가능한 파라미터로 처리

Microsoft Research가 SkillOpt를 발표했습니다 — 모델 가중치를 건드리지 않고 반복적인 순방향-역방향 사이클로 에이전트 스킬 파일을 최적화하는 시스템. 52개 평가 셀에서 최고 또는 동점 결과를 달성했으며, 최적화된 스킬을 갖춘 GPT-5.5는 평균 정확도가 58.8%에서 82.3%로 향상되었습니다.

🟢 🤝 에이전트 2026년 6월 30일 · 3 분 읽기

TRIAGE: 에이전트 강화학습에서 올바른 토큰에 공로를 귀속시키는 방법

에디토리얼 일러스트레이션: TRIAGE 방법으로 에이전트 강화학습에서 역할별 공로 귀속

연구진이 TRIAGE를 제안합니다 — 궤적 세그먼트를 네 가지 의미론적 역할로 분류하고 각각에 다른 보상 신호를 할당하는 프레임워크로, 모든 토큰을 동일하게 처리하는 GRPO와 달리. ALFWorld, Search-QA 및 WebShop 벤치마크에서 TRIAGE는 환경에 대한 행동 수를 10.4~14.8% 줄입니다.

🔴 🤝 에이전트 2026년 6월 29일 · 3 분 읽기

Microsoft Research: Memora — 토큰 최대 98% 감소와 장문 대화 SOTA를 달성하는 AI 에이전트 메모리

에디토리얼 일러스트: Memora — 토큰 최대 98% 감소와 장문 대화 SOTA를 달성하는 AI 에이전트 메모리, 텍스트 및 얼굴 없음

Memora는 장기 지평선 AI 에이전트를 위한 Microsoft Research의 확장 가능한 메모리 프레임워크입니다. 무엇을 저장할지와 어떻게 검색할지를 분리하는 조화로운 아키텍처, 큐 앵커, 정책 기반 검색기를 도입합니다. 전체 컨텍스트 접근 방식 대비 토큰 소비를 최대 98% 줄이면서 LoCoMo와 LongMemEval 벤치마크에서 SOTA를 달성합니다.

🟡 🤝 에이전트 2026년 6월 29일 · 2 분 읽기

arXiv:2606.27483: Internalizing the Future — LLM 에이전트 세계 모델 계획을 위한 통합 에이전트 학습 패러다임

에디토리얼 일러스트: 2606.27483: Internalizing the Future — LLM 에이전트 세계 모델 계획을 위한 통합 패러다임, 텍스트 및 얼굴 없음

『Internalizing the Future』는 Tencent의 Xuan Zhang과 8명의 공저자가 2026년 6월 25일 arXiv에 제출한 프리프린트입니다. 3단계 학습(WM-AMT, FE-SFT, FC-RL)을 제안하며, 이를 통해 LLM 에이전트는 세계 모델을 개발합니다 — 단순히 반응적으로 행동하는 대신 미래 상태 예측과 계획 성공 평가 능력을 갖추게 됩니다.

🟡 🤝 에이전트 2026년 6월 29일 · 2 분 읽기

LangChain: Deep Agents의 Dynamic Subagents — 에이전트가 수백 개의 하위 에이전트를 병렬로 디스패치하는 코드 작성

에디토리얼 일러스트: Deep Agents의 Dynamic Subagents — 에이전트가 수백 개의 하위 에이전트를 병렬로 디스패치하는 코드 작성, 텍스트 및 얼굴 없음

Dynamic Subagents는 LangChain Deep Agents 프레임워크 내의 오케스트레이션 아키텍처로, 모델이 수백 개의 하위 에이전트를 병렬로 디스패치하는 JavaScript 스크립트를 작성할 수 있게 합니다. QuickJS 인터프리터가 스크립트를 결정론적으로 실행하여 300개 이상의 순차적 도구 호출을 제거합니다. 시스템은 classify-and-act부터 loop-until-done까지 6개의 오케스트레이션 패턴을 정의합니다.

🟢 🤝 에이전트 2026년 6월 29일 · 2 분 읽기

Microsoft: 2026 Agent Confidence Index — 300명의 개발자, AI 에이전트에 대한 평균 신뢰도 64/100

에디토리얼 일러스트: 2026 Agent Confidence Index — 300명의 개발자, AI 에이전트에 대한 평균 신뢰도 64/100, 텍스트 및 얼굴 없음

2026 Agent Confidence Index는 Microsoft가 MIT Technology Review Insights와 함께 12개 산업의 300명의 기술 전문가를 대상으로 101개 작업에서 AI 에이전트에 대한 신뢰도를 조사한 연구입니다. 평균 점수는 64/100이며, 30개의 작업만이 70점 임계값을 초과합니다. 전문가의 59%는 인간 감독 루프 유지를 주요 우려 사항으로 꼽습니다.

🟢 🤝 에이전트 2026년 6월 28일 · 1 분 읽기

arXiv:2606.26806: EVAF, 컨텍스트 삭제 후에도 목표를 유지하는 에이전트 파라메트릭 메모리 통합

에디토리얼 일러스트: 삭제 후에도 망상 구조에 새겨져 남아 있는 흔적, 텍스트 및 얼굴 없음

arXiv:2606.26806의 Haoliang Han 연구는 장기 실행 언어 에이전트가 작업 컨텍스트 삭제 후에도 목표를 유지할 수 있도록 하는 gated LoRA 통합 메커니즘인 EVAF를 제안합니다. EVAF는 200개 이벤트당 2–3개의 파라메트릭 쓰기만 필요하며, 목표 지속성(0.812–0.904)에서 탁월하고, 검색은 사실적 회상(0.956–0.973)에서 우위를 보입니다.

🟡 🤝 에이전트 2026년 6월 27일 · 2 분 읽기

arXiv:2606.26758: EGG — 다중 에이전트 프레임워크, PyTorch보다 2.13배 빠른 GPU 커널 생성

Editorial illustration: 데이터 흐름과 블로킹 행렬이 있는 GPU 다이어그램을 최적화하는 다중 에이전트 시스템, 얼굴 없음

EGG는 LLM 추론을 위해 최적화된 GPU 커널을 자동 생성하는 다중 에이전트 프레임워크입니다. 알고리즘 구조 후 하드웨어 튜닝의 2단계 접근 방식으로 KernelBench에서 PyTorch 기준선 대비 평균 2.13배 가속을 달성하며 에이전트 기반 및 RL 기반 접근 방식 모두를 능가합니다.

전체 아카이브 보기 →