🤖 모델

189 개 뉴스

🟡 🤖 모델 2026년 7월 10일 · 2 분 읽기

arXiv:2607.08733: 『슈퍼 가중치』가 선택적 파인튜닝이 실패하는 이유를 설명한다 — COLM 2026 채택 논문

에디토리얼 일러스트: 몇 개의 빛나는 노드가 전체 구조를 지탱하는 파라미터 네트워크

COLM 2026에 채택된 논문 『Super Weights in LLMs』는 언어 모델 행동을 불균형적으로 변화시키는 소수의 파라미터인 『슈퍼 가중치』를 식별합니다. 이 논문은 바로 이 가중치들이 일부 레이어만 선택적으로 파인튜닝하는 방식이 자주 실패하는 이유를 설명하며, PEFT 및 LoRA 접근 방식에 직접적인 시사점을 제공합니다.

🔴 🤖 모델 2026년 7월 9일 · 2 분 읽기

Google: SensorFM——1조 분 이상 웨어러블 데이터로 학습한 기반 모델, 35개 건강 과제 중 34개 승리

편집 일러스트: 스마트워치에서 생체 신호 파형이 신경망으로 흘러들어가는 모습

SensorFM은 100개 이상의 국가 500만 명 사용자의 Fitbit 및 Pixel Watch에서 수집한 1조 분 이상의 신호로 학습한 Google의 웨어러블 건강 데이터 기반 모델입니다. 35개 과제 중 34개에서 전문화 모델을 능가하며, 분류 AUC +9%, 회귀 상관관계 +21%를 달성했습니다.

🔴 🤖 모델 2026년 7월 9일 · 2 분 읽기

Microsoft: 오픈소스 모델 Aurora 1.5, 88.9% 변수에서 ECMWF 앙상블 초과——AI 기상 예보의 새 기준

편집 일러스트: 소용돌이치는 기상 전선과 데이터 네트워크로 뒤덮인 지구

Aurora 1.5는 Microsoft의 오픈소스 지구 시스템 기반 모델로, 평가된 변수와 예보 시간대의 88.9%에서 ECMWF 앙상블 예보를 능가합니다. 새 버전은 22개의 기상 변수, 시간 단위 해상도, 확률적 앙상블 예보를 추가했으며, 허리케인 Helene의 경로 오차를 초대 Aurora 대비 약 33% 줄였습니다.

🔴 🤖 모델 2026년 7월 9일 · 2 분 읽기

OpenAI: GPT-5.6, Sol·Terra·Luna 세 가지 변형으로 출시——멀티 에이전트 오케스트레이션과 GitHub Copilot 당일 지원

편집 일러스트: 데이터 흐름으로 연결된 세 행성(Sol, Terra, Luna)

GPT-5.6은 OpenAI의 새로운 모델 패밀리로 Sol(플래그십 추론), Terra(균형형), Luna(고용량·비용 효율형) 세 가지 변형을 제공합니다. 프로그래밍 방식 도구 호출, 명시적 프롬프트 캐싱 제어, 지속적 추론, 멀티 에이전트 오케스트레이션 베타가 추가되었으며, 출시 당일 GitHub Copilot에서도 이용 가능합니다.

🟡 🤖 모델 2026년 7월 9일 · 2 분 읽기

Meta: Muse Spark 1.1, 100만 토큰 컨텍스트 멀티모달 추론과 Model API를 통한 서브 에이전트 조정 제공

편집 일러스트: 중앙의 불꽃이 여러 서브 에이전트와 앱 흐름으로 가지를 뻗는 모습

Muse Spark 1.1은 Meta Superintelligence Labs의 에이전트 과제용 멀티모달 추론 모델로, 100만 토큰 컨텍스트 창을 갖추고 있습니다. 서브 에이전트를 조정하고, 여러 앱 전반의 워크플로를 탐색하며, 이미지·영상·PDF를 입력으로 받습니다. Meta Model API 공개 프리뷰 및 Meta AI 앱의 Thinking 모드에서 이용 가능합니다.

🟡 🤖 모델 2026년 7월 9일 · 2 분 읽기

xAI: Grok 4.5——코딩 및 에이전트 작업을 위한 새 플래그십, 백만 입력 토큰당 단 2달러

편집 일러스트: 어두운 콘솔 화면의 코드에서 로봇 팔이 도구를 들고 나오는 모습

Grok 4.5는 xAI의 코딩 및 에이전트 작업용 새 플래그십 모델로, 백만 입력 토큰당 2달러, 출력 6달러의 가격을 제공합니다. 설정 가능한 추론 강도(low/medium/high)를 지원하며 Perplexity의 Agent API에서도 즉시 이용 가능하고, 유사한 프론티어 모델들을 대폭 밑도는 공격적인 가격을 책정했습니다.

🔴 🤖 모델 2026년 7월 8일 · 4 분 읽기

Mistral Robostral Navigate: RGB 카메라만으로 탐색하는 로봇 AI

에디토리얼 일러스트: RGB 비전만을 기반으로 한 내비게이션을 위한 Mistral Robostral 구현 로봇 모델

Mistral이 80억 파라미터를 갖춘 최초의 구현 로봇 내비게이션 모델 Robostral Navigate를 공개했습니다. LiDAR나 깊이 센서 없이 단일 RGB 카메라만으로 미지의 환경에 대한 R2R-CE 벤치마크에서 76.6%의 성공률을 달성하며, 다중 센서 경쟁자를 4.5 퍼센트포인트 앞질렀습니다.

🔴 🤖 모델 2026년 7월 8일 · 3 분 읽기

OpenAI, 실시간 AI 대화를 위한 음성 모델 GPT-Live 출시

에디토리얼 일러스트: ChatGPT Voice 인터페이스에 통합된 OpenAI GPT-Live 음성 모델

OpenAI가 자연스럽고 생동감 있는 대화형 AI 상호작용을 위한 새로운 음성 모델 GPT-Live를 공개했습니다. 출시 첫날부터 ChatGPT Voice에 통합된 이 모델은, GPT-Realtime-2.1이 나온 지 불과 이틀 만에 등장하며 음성 모델의 가속화된 개발 흐름을 보여줍니다. 기술 사양과 가격은 아직 공개되지 않았습니다.

🟡 🤖 모델 2026년 7월 8일 · 3 분 읽기

Anthropic, 위험 지식의 「오프 스위치」 개발: GRAM, 이중 사용 능력을 제거 가능한 모듈에 격리

에디토리얼 일러스트: 이중 사용 AI 제어 및 제거를 위한 Anthropic GRAM 교체 가능한 지식 모듈

Anthropic과 AE Studio가 GRAM(Gradient-Routed Auxiliary Modules)을 발표했습니다. 학습 중 바이러스학, 사이버보안, 핵물리학 등의 이중 사용 지식을 제거 가능한 신경망 모듈에 격리하여, 단 한 번의 학습으로 서로 다른 능력 세트를 가진 여러 모델 변형을 생성할 수 있는 방법입니다.

🔴 🤖 모델 2026년 7월 7일 · 4 분 읽기

Meta, Muse Image와 Muse Video 출시 — 자체 오류를 수정하는 에이전트 AI

편집 일러스트: Meta Muse 이미지 및 비디오 콘텐츠 생성을 위한 생성형 AI

Meta Superintelligence Labs가 Muse Image와 Muse Video를 공개했습니다. 이 모델들은 에이전트로 작동하며 코드 실행 및 웹 검색 도구를 내부적으로 호출하고, Arena 리더보드에서 각각 2위와 3위를 차지했으며 Content Seal 워터마크가 의무적으로 적용됩니다.

🟡 🤖 모델 2026년 7월 7일 · 3 분 읽기

Direct-OPD: 약한 모델이 비싼 RL 없이 강한 모델을 훈련하는 방법

편집 일러스트: AI 시스템 수퍼얼라인먼트 접근법으로서의 약-강 RL 증류

칭화대학교와 Zhipu AI 연구자들이 Direct On-Policy Distillation(Direct-OPD)을 제안했습니다. 이 방법은 최종 정책을 모방하지 않고 약한 교사 모델에서 더 강한 학생 모델로 강화학습 성과를 전달하며, AIME 2024에서 48.3%에서 62.4%로의 향상을 달성합니다.

🔴 🤖 모델 2026년 7월 6일 · 4 분 읽기

Anthropic, Claude 내부에서 긴급 출현한 J-space 공개: 모델의 내부 작업 공간

에디토리얼 일러스트: Anthropic의 신경망 해석 가능성 및 숨겨진 행동 연구

Anthropic 연구자들은 새로운 기술인 Jacobian lens(J-lens)를 활용해 Claude 내부에 긴급 출현한 구조인 J-space를 식별했습니다. 신경과학의 전역 작업 공간 이론에서 영감을 받은 J-space는 모델 출력에 보이지 않는 조용한 내부 추론 공간으로, 데이터 날조·테스트 시나리오 인식·심어진 악의적 목표 등 숨겨진 행동을 드러낼 수 있습니다.

🟡 🤖 모델 2026년 7월 6일 · 3 분 읽기

AWS, Amazon Nova 모델에 선택적 언러닝 기술 rDPO 도입

에디토리얼 일러스트: rDPO와 LoRA 기법을 통한 AI 모델의 선택적 언러닝

Amazon Web Services가 Reverse Direct Preference Optimization(rDPO) 기반의 선택적 언러닝(unlearning) 기술을 Nova 모델에 도입했습니다. 완전한 재훈련 없이 LoRA 어댑터로 구현된 이 기술은 원치 않는 거부율을 최대 53.74 퍼센트 포인트 감소시키면서 유용성 손실은 최소화합니다.

🟡 🤖 모델 2026년 7월 6일 · 4 분 읽기

OpenAI, GPT-Realtime-2.1과 mini 모델 공개: 음성 인식과 노이즈 처리 개선

에디토리얼 일러스트: 실시간 에이전트 오디오 통신을 위한 OpenAI GPT Realtime 음성 모델

OpenAI는 2026년 7월 6일, 두 개의 새로운 실시간 음성 모델인 GPT-Realtime-2.1과 GPT-Realtime-2.1-mini를 기존 v1/realtime 엔드포인트에서 공개했습니다. 두 모델은 영숫자 문자열 인식 개선, 침묵과 노이즈 처리 향상, 대화 중단 시 동작 개선을 제공합니다.

🟢 🤖 모델 2026년 7월 6일 · 3 분 읽기

MiniMax M2, M2.1, M2.5, Amazon Bedrock에서 사용 가능

에디토리얼 일러스트: AWS Bedrock 플랫폼의 새로운 서드파티 오픈 MoE 모델

Amazon Bedrock이 세 가지 오픈 웨이트 MiniMax 모델로 제공 목록을 확장했습니다. 컨텍스트 100만 토큰의 M2, 심층 추론과 코딩에 특화된 M2.1, 에이전트 애플리케이션을 위한 2,300억 파라미터 Mixture-of-Experts 아키텍처의 M2.5입니다.

🟡 🤖 모델 2026년 7월 3일 · 3 분 읽기

ReContext, 재훈련 없이 128K 컨텍스트 창 활용도를 개선

에디토리얼 일러스트레이션: 언어 모델을 위한 128K 토큰의 긴 컨텍스트에서 증거 재현

일리노이 대학교 연구자들이 ReContext를 개발했습니다. 긴 컨텍스트 창에서 관련 증거를 재귀적으로 재현하여 세 가지 LLM 아키텍처에 걸쳐 여덟 개의 벤치마크에서 일관되게 성능을 향상시키는 추론 기법으로, 재훈련이 필요 없습니다.

🟢 🤖 모델 2026년 7월 3일 · 3 분 읽기

VRRL: 강화 학습이 시각 모델이 자기 수정 시 이미지를 실제로 활용하도록 강제

에디토리얼 일러스트레이션: 장면에 대한 자기 반성 강화 학습을 갖춘 시각-언어 모델

Liyan Tang, Fangcong Yin, Greg Durrett가 VRRL을 개발했습니다. 궤적 접두사 마스킹과 경험 리플레이를 통해 시각-언어 모델이 자기 반성을 실제 시각 입력에 근거하도록 강제하는 강화 학습 프레임워크로, 분포 외(OOD) 샘플에서 크게 향상된 성능을 달성합니다.

🟡 🤖 모델 2026년 7월 1일 · 3 분 읽기

Fable 5와 Mythos 5 재출시: Anthropic, 두 모델 접근권 복원

에디토리얼 일러스트레이션: Anthropic이 Claude Fable 5와 Mythos 5를 사용자에게 재공개

Anthropic은 미국 수출 통제로 약 3주간 중단됐던 Claude Fable 5와 Claude Mythos 5에 대한 접근을 7월 1일 재개했다. 복귀와 함께 개선된 안전 분류기 도입과 젤브레이크 심각도 평가를 위한 업계 프레임워크 제안이 발표됐다.

🟡 🤖 모델 2026년 7월 1일 · 3 분 읽기

NVIDIA Nemotron과 OpenAI GPT OSS 모델, FedRAMP High 인증과 함께 AWS GovCloud에서 가용

편집 일러스트레이션: 엄격한 보안 인증과 함께 AWS Bedrock GovCloud에서 운영되는 NVIDIA Nemotron과 OpenAI gpt-oss 모델

AWS GovCloud (US)가 Amazon Bedrock에 6개의 새 모델을 추가합니다. OpenAI의 오픈 웨이트 gpt-oss-120b와 gpt-oss-20b, 그리고 1M 토큰 컨텍스트를 갖춘 NVIDIA Nemotron 모델 4개입니다. 인프라는 운영자 제로 접근 설계와 함께 FedRAMP High, DoD IL 2/4/5, ITAR, CJIS 요건을 충족합니다.

🟡 🤖 모델 2026년 7월 1일 · 3 분 읽기

GitHub Copilot Vision과 브라우저 도구: 하루 만에 두 가지 GA 기능 출시

편집 일러스트레이션: GitHub Copilot Vision과 브라우저 도구가 일반 출시

GitHub이 두 가지 Copilot 기능의 GA를 선언했습니다. 채팅 프롬프트에 이미지와 PDF를 첨부할 수 있는 Vision, 그리고 VS Code의 에이전트에게 실제 브라우저 제어권을 부여하는 브라우저 도구입니다. 두 기능 모두 관리자 조치 없이 모든 플랜에서 사용 가능합니다.

🔴 🤖 모델 2026년 6월 30일 · 4 분 읽기

Claude Sonnet 5: Anthropic의 가장 에이전틱한 모델이 새로운 표준이 되다

에디토리얼 일러스트레이션: Anthropic이 에이전틱 작업을 위한 새로운 플래그십 Claude Sonnet 5 모델을 발표

Anthropic이 오늘 Claude Sonnet 5를 출시합니다 — 다단계 작업을 계획하고 브라우저와 터미널을 제어하며 주요 작업에서 Opus 4.8에 근접하는 성능을 보여주는 이 모델의 도입 가격은 2026년 8월 31일까지 백만 토큰당 $2/$10이며, 1M 토큰 컨텍스트 창을 제공합니다.

🟡 🤖 모델 2026년 6월 30일 · 3 분 읽기

Fable 5 귀환: 수출 규제 철폐, 7월 1일 글로벌 재배포 시작

에디토리얼 일러스트레이션: Anthropic이 미국 정부의 수출 금지 철폐 후 Fable 5를 재활성화

18일간의 글로벌 서비스 중단 끝에 Anthropic이 Fable 5의 재배포를 발표합니다: 미국 정부가 6월 30일 수출 규제를 철폐했으며, 개선된 보안 분류기가 발견된 우회 기법을 99% 이상 차단합니다.

🟡 🤖 모델 2026년 6월 30일 · 3 분 읽기

Google, 같은 날 두 모델 출시: Gemini Omni Flash와 Nano Banana 2 Lite

에디토리얼 일러스트레이션: Google이 비디오용 Gemini Omni Flash와 이미지 생성용 Nano Banana 2를 출시

Google이 2026년 6월 30일 Gemini Omni Flash(대화형 비디오 편집용)와 Nano Banana 2 Lite(빠른 이미지 합성용)를 동시에 발표했습니다. 비디오 모델은 출력 초당 0.10달러이며, 이미지 모델은 1,000장당 단 0.034달러입니다.

🟡 🤖 모델 2026년 6월 30일 · 3 분 읽기

Google Research, TabFM 발표: 표 형식 데이터를 위한 제로샷 파운데이션 모델

에디토리얼 일러스트레이션: 표 형식 데이터의 제로샷 분석을 위한 Google TabFM 파운데이션 모델

Google Research가 TabFM을 발표했습니다 — 하이퍼파라미터 튜닝과 피처 엔지니어링 없이 단일 순방향 패스로 제로샷 예측을 제공하는 표 형식 데이터용 파운데이션 모델. TabArena 벤치마크에서 최고의 Elo 점수를 달성했으며 Hugging Face와 GitHub에서 제공되고, Google BigQuery 통합이 발표되었습니다.

🔴 🤖 모델 2026년 6월 29일 · 2 분 읽기

Meta: Brain2Qwerty v2 — 수술적 임플란트 없이 61% 정확도로 생각을 텍스트로 비침습적 해독

에디토리얼 일러스트: Brain2Qwerty v2 — 수술적 임플란트 없이 61% 정확도로 생각을 텍스트로 비침습적 해독, 텍스트 및 얼굴 없음

Brain2Qwerty v2는 MEG 스캐닝을 사용하여 수술 없이 뇌 신호를 텍스트로 변환하는 Meta Research의 AI 시스템입니다. 단어 인식 평균 정확도는 61%에 달하며, 이는 다른 비침습적 방법(8%)보다 7배 높습니다. 학습 코드와 데이터셋이 오픈 소스로 공개되었습니다.

🟡 🤖 모델 2026년 6월 29일 · 2 분 읽기

GitHub: Claude Opus 4.8 fast mode가 Copilot 프리뷰에 출시; Anthropic은 Opus 4.6의 fast 모드 종료

에디토리얼 일러스트: Claude Opus 4.8 fast mode가 Copilot 프리뷰에 출시; Anthropic은 Opus 4.6의 fast 모드 종료, 텍스트 및 얼굴 없음

Claude Opus 4.8 fast mode가 이제 GitHub Copilot 사용자를 위한 프리뷰 단계에 있으며, 모델의 지능 수준을 유지하면서 출력 토큰 생성 속도를 크게 향상시킵니다. 동시에 Anthropic은 Opus 4.6의 fast mode를 종료합니다 — fast mode 기능을 유일하게 남은 모델로 통합합니다.

🟢 🤖 모델 2026년 6월 29일 · 1 분 읽기

Allen Institute: DiScoFormer — 하나의 트랜스포머로 다양한 분포의 밀도와 점수 추정

에디토리얼 일러스트: DiScoFormer — 다양한 분포에서 밀도와 점수를 추정하는 단일 트랜스포머, 텍스트 및 얼굴 없음

DiScoFormer는 Allen Institute for AI(AI2)의 트랜스포머 모델로, 하나의 순전파(forward pass)에서 밀도 함수(분포 밀도)와 점수 함수를 동시에 추정합니다. 기존에는 별도 모델이 필요했던 작업입니다. KDE를 고차원으로 일반화하며, 재학습 없이 새로운 분포에 적응합니다.

🟢 🤖 모델 2026년 6월 29일 · 2 분 읽기

arXiv:2606.28166: Tandem RL — 더 읽기 쉬운 사고 연쇄와 소형 모델 핸드오프를 갖춘 검증 가능한 보상

에디토리얼 일러스트: 2606.28166: Tandem RL — 더 읽기 쉬운 사고 연쇄와 소형 모델 핸드오프를 갖춘 검증 가능한 보상, 텍스트 및 얼굴 없음

Tandem RL은 언어 모델 학습의 새로운 방법으로, RLVR(검증 가능한 보상을 사용한 강화 학습)과 탠덤 접근 방식을 결합합니다. 더 강한 모델이 고정된 더 약한 모델과 협력하여 사고 연쇄를 생성합니다. Qwen3-4B에서 유사한 성능을 달성하면서 가독성과 소형 모델 핸드오프 견고성이 크게 향상됩니다.

🟡 🤖 모델 2026년 6월 28일 · 2 분 읽기

GitHub: MAI-Code-1-Flash, 마이크로소프트의 코딩 모델, 이제 Copilot Business 및 Enterprise 플랜에서 일반 제공

에디토리얼 일러스트: 개발 인터페이스를 통해 빠르게 흐르는 코드의 흐름, 텍스트 및 얼굴 없음

MAI-Code-1-Flash는 2026년 6월 26일 GitHub Copilot Business 및 Enterprise 플랜에서 일반 제공(GA)으로 전환된 마이크로소프트의 자체 코딩 모델입니다. 낮은 지연 시간과 고빈도 에이전트 코딩 워크플로에 최적화되어 있으며, 공급자 가격표에 따른 사용량 기반으로 요금이 청구되고, 관리자가 조직 설정에서 명시적으로 활성화해야 합니다.

🟢 🤖 모델 2026년 6월 28일 · 1 분 읽기

arXiv:2606.26935: CoT 훈련의 이득은 깊은 에이전트 추론이 아닌 행동 예측 강화로 귀결

에디토리얼 일러스트: 하나의 명확한 경로로 좁아지는 분기된 의사결정 흐름, 텍스트 및 얼굴 없음

arXiv:2606.26935의 Jingyu Liu 외 연구진 연구는 LLM 에이전트의 사고 연쇄(CoT) 훈련 이득이 더 깊은 추론이 아닌 더 강한 직접 행동 예측으로 귀결됨을 보여줍니다. 후기 체크포인트는 행동을 수정하는 빈도가 줄어들며, 행동 토큰에 대한 감독 마스킹은 도메인 외 일반화를 향상시킵니다.

🟢 🤖 모델 2026년 6월 28일 · 1 분 읽기

arXiv:2606.26502: 추론 모델은 틀린 문제에 더 많은 토큰 소비 — 포기하는 사람과 반대 패턴

에디토리얼 일러스트: 하나는 상승하고 다른 하나는 하강하는 두 개의 노력 곡선, 텍스트 및 얼굴 없음

arXiv:2606.26502의 Han-yu Wang 연구는 대형 추론 모델(LRM)이 틀리는 문제에 맞히는 문제보다 더 많은 토큰을 소비한다는 사실을 밝혔습니다. 사람은 어려운 문제에서 포기하는 반대 패턴을 보입니다. 격차는 크며(H-ARC 벤치마크에서 Cohen's d 1.47–3.13), 테스트된 5개 모델 모두 사람과 반대 패턴을 보였습니다.

🔴 🤖 모델 2026년 6월 27일 · 2 분 읽기

OpenAI: GPT-5.6 Sol 프리뷰 발표 — 코딩, 과학, 사이버보안

Editorial illustration: 코드 표시, 분자 구조, 사이버보안 방패가 있는 신경망의 추상적 표현

GPT-5.6 Sol은 OpenAI가 발표한 차세대 모델로 현재 프리뷰 상태(일반 출시 아님)이며, 코딩, 과학적 추론, 사이버보안에서 향상된 역량과 지금까지 가장 발전된 안전 스택을 갖추고 있습니다.

🟡 🤖 모델 2026년 6월 27일 · 2 분 읽기

Anthropic: API 속도 제한 상향 — Sonnet·Haiku가 Opus 수준으로, 3단계 티어 도입

Editorial illustration: 세 단계의 API 접근 수준과 위를 향한 화살표, 추상적인 클라우드와 서버 랙

Anthropic이 모든 모델의 API 속도 제한을 통일했습니다. Sonnet과 Haiku가 세 가지 사용 티어(Start, Build, Scale) 각각에서 Opus와 동일한 할당량을 공유하게 됩니다. 동시에 Claude Opus 4.7의 fast mode는 7월 24일 deprecated 예정입니다.

🟡 🤖 모델 2026년 6월 27일 · 2 분 읽기

arXiv:2606.26836: 표준 벤치마크, AI 모델 실제 능력의 82%를 놓치고 있다

Editorial illustration: bar chart showing benchmark gap between single-model evaluation and Capability Frontier measurement

연구자들이 단일 모델을 단 한 번 시도하는 표준 벤치마크가 LLM의 실제 능력을 최대 82%까지 과소평가한다는 것을 보여주었습니다. 21개 모델과 16개 벤치마크에서 파레토 최적성을 활용하는 Capability Frontier 프레임워크를 도입하여 85% 낮은 비용으로 동일한 정확도를 달성할 수 있음을 증명했습니다.

🟡 🤖 모델 2026년 6월 27일 · 2 분 읽기

Google: 고정된 멀티 토큰 예측으로 Pixel에서 Gemini Nano 50%+ 속도 향상

Editorial illustration: smartphone chip diagram showing parallel token prediction paths on Pixel device

Google이 고정된 멀티 토큰 예측 기법을 사용하여 Pixel 9와 10에서 Gemini Nano 추론을 50% 이상 가속했습니다. 이 기법은 한 번의 모델 패스에서 평균 약 2개의 토큰을 생성하며, 인스턴스당 130MB 메모리를 절약하고 출력 결과를 전혀 변경하지 않습니다.

🟢 🤖 모델 2026년 6월 27일 · 1 분 읽기

arXiv:2606.27288: LLM 앙상블이 실제로 도움이 될 때 — 67개 프론티어 모델의 공동 실패 천장

Editorial illustration: 얼굴 없는 AI 모델 그룹의 정확도 상한선 다이어그램, 추상적인 그래프

21개 제공업체의 67개 프론티어 모델에 대한 연구가 공동 실패 천장(co-failure ceiling) — 모든 모델이 동일한 쿼리에서 실패할 때 발생하는 LLM 앙상블 정확도의 상한선 — 이라는 개념을 도입합니다. 결과는 쿼리 수준 라우팅 없이는 모델 조합이 단일 최강 모델을 능가하는 경우가 드물다는 것을 보여줍니다.

🟡 🤖 모델 2026년 6월 26일 · 2 분 읽기

Google Research: 추론이 LLM의 매개변수 지식을 어떻게 활성화하는가

에디토리얼 일러스트레이션: 순차적으로 빛나는 양식화된 신경망 경로, 추상적인 뇌와 데이터 노드, 차가운 파란색 톤

Google Research가 추론 트레이스가 모델 가중치에 저장된 사실 검색을 개선하는 두 가지 메커니즘을 밝혔습니다 — computational buffer와 factual priming. Gemini 2.5와 Qwen3-32B에서 테스트되었습니다.

🟢 🤖 모델 2026년 6월 26일 · 2 분 읽기

arXiv:2606.25325: OPPO — 음성·표정·텍스트에서 동시에 감정을 읽는 RL 프레임워크

에디토리얼 일러스트레이션: 음파, 얼굴 프레임, 텍스트 말풍선이 하나의 감정 분석으로 합쳐지는 멀티모달 시스템

OPPO는 옴니모달 언어 모델이 시각·청각·텍스트 감정 단서를 동시에 이해하도록 강화학습으로 훈련하는 시스템입니다. 모달리티 간 환각을 억제하고 MER-UniBench와 MME-Emotion 두 벤치마크에서 SOTA를 달성했습니다.

🟡 🤖 모델 2026년 6월 25일 · 2 분 읽기

arXiv:2606.24510: RaDaR — 특화된 32B 추론 LLM, RCT에서 희귀 질환 진단 가속화

편집 일러스트: 의료 AI 진단, 정확도 그래프, 분자 구조, 디지털 의료 기록

RaDaR는 희귀 질환 진단을 위해 훈련된 320억 매개변수의 오픈소스 추론 LLM입니다. 무작위 임상 시험에서 인터넷 검색 대비 의사의 진단 정확도를 21.44%포인트 향상시켰으며, 61%의 사례에서 임상 문서화 이전에 진단을 식별했습니다.

🟡 🤖 모델 2026년 6월 25일 · 2 분 읽기

arXiv:2606.24014: 의료 도메인 RL 훈련, 50개 이상 OOD 벤치마크의 80% 이상에서 정렬 향상

편집 일러스트: 정렬 전이 화살표와 함께 여러 도메인으로 분기하는 신경망 연결, 추상적 과학 시각화

Google Research 연구진은 진실성, 공정성, 수정 가능성 같은 유익한 속성에 대한 RL 훈련이 훈련 도메인 외의 50개 이상 독립적 OOD 벤치마크 중 80% 이상에서 성능을 향상시킴을 보여주었습니다.

🟡 🤖 모델 2026년 6월 25일 · 2 분 읽기

Google: DiffusionGemma 26B — 확산 방식으로 4배 빠른 텍스트 생성

편집 일러스트: 확산 구름에서 형성되는 병렬 텍스트 흐름의 추상적 표현, 디지털 스타일

DiffusionGemma는 텍스트를 순차적이 아닌 병렬로 생성하는 Google의 26B MoE 모델입니다. 단일 H100 GPU에서 초당 1,000토큰 이상을 달성하며, 표준 자동 회귀 모델보다 최대 4배 빠릅니다. 품질은 Gemma 4 대비 다소 낮습니다.

🟡 🤖 모델 2026년 6월 25일 · 1 분 읽기

Google: Gemini 3.5 Live Translate — 실시간 70개 이상 언어 음성 통역

편집 일러스트: 실시간 번역 개념 — 지구 위 여러 문자권의 말풍선을 연결하는 오디오 파형

Google이 Gemini 3.5 Live Translate를 출시했습니다. 70개 이상 언어와 2,000개 이상 언어 조합을 실시간으로 지원하는 음성-음성 번역 시스템으로, 억양을 보존하고 SynthID 워터마크로 보호됩니다.

🟡 🤖 모델 2026년 6월 24일 · 2 분 읽기

arXiv:2606.23181: DART — 훈련 없이 하이브리드 추론 모델에서 적응형 사고 구현

에디토리얼 일러스트레이션: 토큰 네트워크에서 두 개의 별개 결정 경로가 있는 추상적 분기 다이어그램

DART는 AI 모델이 오래 생각해야 하는지 즉시 응답할 수 있는지를 추가 훈련 없이 결정하는 라우팅 방법으로, 사고 토큰 소비를 15~69% 줄이면서 코드 테스트에서 정확도를 최대 +22.5점 향상시킵니다.

🟡 🤖 모델 2026년 6월 24일 · 2 분 읽기

Mistral: OCR 4 — 170개 언어에서 바운딩 박스를 사용한 구조화된 문서 추출

에디토리얼 일러스트레이션: 다양한 언어로 단락과 바운딩 박스가 표시된 스캔된 종이 문서

Mistral OCR 4는 OlmOCRBench에서 85.20점으로 최고 성적을 기록하고, 170개 언어를 지원하며, 단락 수준 바운딩 박스를 제공하는 새로운 광학 문자 인식 모델입니다. 가격은 1,000페이지당 4달러입니다.

🟡 🤖 모델 2026년 6월 24일 · 2 분 읽기

PyTorch/SGLang: GB300에서 DeepSeek-V4 Pro — 동일한 인터랙티브성으로 5배 높은 처리량

에디토리얼 일러스트레이션: NVIDIA Blackwell GPU 카드가 있는 서버 랙과 5배 처리량 증가를 보여주는 그래프

PyTorch 팀과 SGLang은 2026년 4월부터 6월까지 NVIDIA GB300 아키텍처에서 DeepSeek-V4 Pro 모델의 서빙 처리량을 GPU당 약 2,200에서 11,200 토큰/초로 증가시켰습니다. 최종 사용자의 인터랙티브성 손실 없이 5배 향상입니다.

🟡 🤖 모델 2026년 6월 21일 · 2 분 읽기

arXiv:2606.20560: DiffusionGemma의 해석 가능성이 Gemma 4와 동등——28.6× 격차가 1.1×로 축소

편집 일러스트: DiffusionGemma의 해석 가능성이 Gemma 4와 동등——28.6× 격차가 1.1×로 축소

DiffusionGemma는 연속 잠재 공간에서 작동하는 구글의 확산 언어 모델입니다. Neel Nanda가 이끄는 13명의 저자 연구에 따르면 초기 불투명도가 Gemma 4보다 28.6배 높지만, 해석 가능한 토큰 병목 기법으로 그 격차를 1.1배까지 줄일 수 있습니다.

🟢 🤖 모델 2026년 6월 21일 · 2 분 읽기

arXiv:2606.20543: 공간 투기적 디코딩으로 이미지 생성 13.3배 가속

편집 일러스트: 공간 투기적 디코딩으로 이미지 생성 속도 13.3배 향상

SSD(Spatially Speculative Decoding)는 자기회귀 이미지 생성에서 픽셀의 수평 및 수직 인접 토큰을 동시에 예측하는 새로운 방법으로, DPG-Bench 및 GenEval 벤치마크에서 시각적 품질 저하 없이 최대 13.3배의 속도 향상을 달성합니다.

🟢 🤖 모델 2026년 6월 21일 · 2 분 읽기

arXiv:2606.20561: TimeProVe, 장시간 동영상 추론 비용 93% 절감

편집부 일러스트: TimeProVe가 장시간 동영상 추론 비용을 93% 절감

TimeProVe는 2단계 '제안 후 검증' 방식을 도입하여 장시간 동영상에서 VLM 추론을 가속화하는 프레임워크입니다. 고비용 모델 호출을 75% 줄이고 총 추론 비용을 93% 절감하면서, 새로운 OpenTSUBench 벤치마크에서 최강 경쟁 모델을 7.3 퍼센트 포인트 앞섭니다.

🟢 🤖 모델 2026년 6월 21일 · 2 분 읽기

arXiv:2606.20008: VIMPO — 비평가 없는 강화학습이 MATH-500과 AIME에서 GRPO를 능가하다

편집 일러스트: VIMPO — 비평가 없는 강화학습이 MATH-500과 AIME에서 GRPO를 능가하다

VIMPO는 LLM 추론을 위한 새로운 강화학습 방법으로, KL 정규화 RL에서 암묵적 가치 함수를 도출합니다. 별도의 비평가 네트워크 없이 AIME 2024, AIME 2025를 포함한 4개의 수학 벤치마크에서 GRPO를 능가하며, 노이즈가 있는 보상 조건에서도 안정적인 우위를 유지합니다.

🟡 🤖 모델 2026년 6월 20일 · 1 분 읽기

arXiv:2606.20333:SoftSkill이 스킬 문서를 32개 잠재 토큰으로 압축, LiveMath 42.1점 향상

편집 일러스트: 긴 문서가 몇 개의 빛나는 잠재 토큰으로 압축되는 장면

SoftSkill은 arXiv:2606.20333 논문에 기술된 방법으로, 스킬 문서(Markdown SKILL.md 파일 등)를 기초 모델을 변경하지 않고 모델 행동을 안내하는 소형 연속 잠재 객체로 변환합니다. 32개의 가상 토큰을 사용하여 LiveMath 작업에서 스킬 없는 프롬프팅 대비 42.1 퍼센트 포인트 향상을 달성합니다.

전체 아카이브 보기 →