📦 오픈소스

93 개 뉴스

🟡 📦 오픈소스 2026년 7월 21일 · 2 분 읽기

메타, SAM 3와 DINOv3를 Genesis Mission에 공개—분할 분석 시간 한 달에서 15분으로 단축

과학자가 AI 이미지 분할을 활용해 포도나무 줄기의 마이크로 CT 스캔을 분석하는 모습

메타가 이미지 분할용 SAM 3와 DINOv3 모델을 SYNAPS-I 프로젝트를 위해 공개했습니다. 이는 백악관의 과학 AI 이니셔티브인 Genesis Mission의 일환입니다. 미국 에너지부는 매년 수십 페타바이트의 데이터를 생성하며, 이전에는 한 달이 걸리던 분할 분석이 이제 300개의 NVIDIA A100 GPU와 5개 국립연구소 소속 연구원 60명을 통해 약 15분 만에 완료됩니다.

🟢 📦 오픈소스 2026년 7월 17일 · 1 분 읽기

vLLM: 266개의 CI 작업과 야간 벤치마킹이 오픈소스 LLM 추론 엔진의 프로덕션 품질을 지키는 방법

편집 일러스트: 릴리스 전 코드를 검사하는 테스트 서버와 그래픽 카드 네트워크

vLLM 팀은 NVIDIA H200, B200, AMD 가속기에서 매일 밤 17개의 모델-하드웨어 조합을 37개의 테스트 그룹, 266개의 작업, 58개의 러너 큐를 통해 테스트하는 내부 CI/QA 인프라를 공개했습니다. 2026년 6월에는 1,918개의 커밋이 병합되었으며, 릴리스는 2주마다 이루어집니다.

🟢 📦 오픈소스 2026년 7월 16일 · 1 분 읽기

LangChain: OpenWiki 0.2가 OKF 도입—Google Cloud의 에이전트 코드 문서 표준

OpenWiki CLI 명령과 생성된 OKF 위키 파일을 표시하는 터미널

OpenWiki 0.2는 코드 저장소의 위키 문서를 자동 생성하는 오픈소스 CLI 도구로, OKF(Open Knowledge Format)—결정론적 구조로 에이전트가 코드 검색에 소비하는 토큰을 줄이는 Google Cloud의 제안 표준—지원을 도입합니다.

🟢 📦 오픈소스 2026년 7월 16일 · 2 분 읽기

Sakana AI와 NVIDIA: Nemotron 오픈 모델을 멀티 에이전트 시스템 Fugu에 통합

편집 일러스트: Sakana와 NVIDIA 로고가 있는 상호 연결된 AI 에이전트 네트워크

Sakana AI가 NVIDIA Nemotron 오픈 모델을 Fugu에 통합했습니다—하나의 LLM이 에이전트 풀 내 다른 모델들을 동적으로 호출하는 멀티 에이전트 시스템으로, 재귀적으로 자기 자신도 포함합니다.

🟡 📦 오픈소스 2026년 7월 15일 · 2 분 읽기

PyTorch:Triton 3.7, 플러그인 확장 및 TLX 도입——AMD MI350에서 처리량 최대 +15%

편집 일러스트: H100과 AMD MI350에서의 TFLOPS 성능 비교 그래프와 PyTorch 및 Triton 로고

PyTorch-Triton 3.7은 동적 플러그인 시스템과 Meta의 TLX 패키지를 도입합니다. H100에서 cuBLAS 대비 +3.7%를 초과하며, AMD MI350에서는 rocBLAS 대비 최대 +15%의 처리량 향상을 달성합니다.

🟢 📦 오픈소스 2026년 7월 15일 · 2 분 읽기

CNCF:HAMi, Incubating 프로젝트로 승격——Kubernetes AI 워크로드를 위한 GPU 가상화

Kubernetes 클러스터에서의 HAMi GPU 가상화 아키텍처 다이어그램: Volcano 및 Koordinator 프로젝트와의 통합을 보여줌

CNCF 기술 감독 위원회가 HAMi(Heterogeneous AI accelerator Management interface)를 Incubating 프로젝트로 승인했습니다. HAMi는 Kubernetes 클러스터 내에서 물리적 GPU를 공유 가능한 논리 단위로 가상화하여 AI 워크로드의 리소스 단편화 문제를 해결합니다. 2024년 Sandbox에 합류한 이후 550개 이상의 조직과 2,687명의 GitHub 기여자를 확보했습니다.

🟢 📦 오픈소스 2026년 7월 15일 · 2 분 읽기

LF AI & Data:「컨텍스트가 새로운 병목」——오픈 인프라 Docling과 DocLang

Docling과 DocLang 컴포넌트를 포함한 컨텍스트 레이어 아키텍처 다이어그램

LF AI & Data TAC 의장 Peter Staar는 현대 AI 시스템에서 모델이 더 이상 병목이 아니며, 병목은 컨텍스트 레이어에 있다고 주장합니다. 오픈 프로젝트 Docling과 DocLang이 이 문제를 해결하는 인프라를 제공합니다.

🟢 📦 오픈소스 2026년 7월 14일 · 1 분 읽기

AMD: LogsLop — 오픈소스 도구로 거대한 로그 파일을 11%로 압축하고 토큰 78% 절약

LogsLop 도구의 터미널 화면: 로그 파일을 요약하고 줄 수가 감소하는 모습

AMD가 LogsLop을 공개했습니다. 정규화와 클러스터링으로 거대한 로그 파일을 요약하는 오픈소스 Python CLI 도구입니다. 73개의 실제 로그 파일에서 줄 수를 11%, 바이트를 7.5%로 줄이고 Llama 3.3 70B와 함께 사용 시 토큰 78%를 절약합니다.

🟢 📦 오픈소스 2026년 7월 14일 · 1 분 읽기

CNCF: Kubernetes Pod가 AI 에이전트의 올바른 배포 단위입니까?

하나의 Worker에 여러 일시 중지된 AI 에이전트를 호스팅하는 Kubernetes WorkerPool 아키텍처 다이어그램

Solo.io의 린 선이 Kubernetes Pod가 AI 에이전트를 스케줄링하는 데 적절한 추상화인지 재검토합니다. 에이전트는 일시적으로——잠깐 활성화되고 쉬며, 전용 유휴 Pod는 리소스를 낭비합니다. Actor와 WorkerPool을 사용하는 새로운 「agent-substrate」 모델을 제안합니다.

🟡 📦 오픈소스 2026년 7월 13일 · 2 분 읽기

arXiv:2607.09424:Soofi S——Deutsche Telekom 클라우드에서 훈련된 독일어·영어 주권 오픈소스 모델

편집 일러스트: Deutsche Telekom 클라우드 인프라와 EU 깃발 표시가 있는 오픈 언어 모델 Soofi S

Soofi S는 약 27조 토큰에서 사전 훈련된 30B MoE 하이브리드 Mamba-Transformer 모델로, 3B 활성 파라미터를 가지며 강화된 독일어 데이터를 포함합니다. 완전히 Deutsche Telekom의 클라우드 인프라에서 훈련되었으며, 모든 유럽 주권 대안을 능가하고 17개 오픈 모델 중 코드 벤치마크에서 1위를 차지합니다.

🟢 📦 오픈소스 2026년 7월 10일 · 2 분 읽기

PyTorch: 『무료 정규화』로 Layer Norm을 GEMM·어텐션 커널에 융합 — Meta, 대규모 모델 학습 비용 절감 목표

에디토리얼 일러스트: 중간 단계 없이 하나의 흐름으로 합쳐지는 두 GPU 커널

Meta 소속 PyTorch 팀이 정규화 연산을 GEMM 및 어텐션 커널에 직접 융합해 계산 비용을 제거하는 『무료 정규화』 기법을 발표했습니다. 코드는 커널 라이브러리를 통해 GitHub에 공개되어 있으며, Layer Norm·RMS Norm 연산이 빈번한 모델의 학습과 인퍼런스를 빠르게 하는 직접적인 효과가 있습니다.

🟡 📦 오픈소스 2026년 7월 9일 · 2 분 읽기

Ollama: 로컬 AI를 위한 8800만 달러 투자 유치——890만 개발자, Docker 창업자도 투자자로 참여

편집 일러스트: 프로세서 칩으로 구성된 라마 실루엣, 로컬 컴퓨터들에 둘러싸여 있는 모습

Ollama는 오픈 AI 모델을 로컬에서 실행하는 플랫폼으로, Benchmark, Theory Ventures, Docker 창업자 Solomon Hykes 등 투자자들로부터 8800만 달러 투자 유치를 발표했습니다. 890만 명의 개발자와 포춘 500 기업의 85%가 이용하며, 클라우드 서비스의 월 토큰 처리량은 매달 두 배씩 증가하고 있습니다.

🔴 📦 오픈소스 2026년 7월 8일 · 4 분 읽기

PyTorch 2.13: LLM 학습 GPU 메모리 최대 4배 절감, FlexAttention 12.3배 빨라져

에디토리얼 일러스트: AI 학습 및 추론의 주요 개선 사항을 담은 PyTorch 2.13 신규 릴리스

PyTorch 2.13이 526명의 기여자로부터 3,328개의 커밋과 함께 출시됩니다. 주요 신기능: nn.LinearCrossEntropyLoss로 LLM 학습 시 최대 4배 GPU 메모리 절감, Apple Silicon에서 FlexAttention 최대 12.3배 가속, 분산 학습을 현대화하는 새로운 torchcomms 백엔드.

🟡 📦 오픈소스 2026년 7월 8일 · 3 분 읽기

CNCF 백서: 데이터 스토리지가 대규모 클라우드 네이티브 AI의 주요 장벽으로 남다

에디토리얼 일러스트: 클라우드 네이티브 AI 및 Kubernetes 인프라를 위한 데이터 스토리지에 관한 CNCF 백서

CNCF TAG Infrastructure가 클라우드 네이티브 AI 환경의 데이터 스토리지 병목 현상을 매핑하고, 훈련, 추론, 에이전트 AI 단계의 요구 사항을 구분하며, Kubernetes AI/ML 배포를 위한 아키텍처 지침을 제시하는 백서를 발표했다.

🟢 📦 오픈소스 2026년 7월 8일 · 3 분 읽기

IBM과 Red Hat, Lightwell 확장 — 6,500개 이상의 검증된 오픈소스 의존성과 금융 부문 클리어링하우스

에디토리얼 일러스트: 오픈소스 소프트웨어 취약점 교정을 위한 IBM과 Red Hat의 Lightwell AI 시스템

IBM과 Red Hat이 Java 및 Python 생태계의 6,500개 이상 디지털 서명 검증 의존성 카탈로그를 갖춘 Lightwell Network를 일반 출시하고, 금융 서비스 부문의 패치 엠바고 조율을 위한 Lightwell Clearinghouse Premier를 선보였다. 이 플랫폼은 오픈소스 보안에 대한 50억 달러 투자 약정으로 뒷받침된다.

🟡 📦 오픈소스 2026년 7월 6일 · 3 분 읽기

vLLM과 Tencent Hunyuan, NVIDIA Hopper GPU를 위한 두 가지 HPC 백엔드 업스트림

에디토리얼 일러스트: 대규모 언어 모델의 고성능 서빙을 위한 vLLM FP8 및 MoE GPU 커널

Tencent Hunyuan AI Infra 팀과 vLLM 팀이 공동으로 HPC_ATTN 어텐션 백엔드와 hpc MoE 백엔드를 업스트림했습니다. 이 백엔드들은 8×NVIDIA H20 구성에서 TTFT를 24%, TPOT를 17% 감소시키며, vLLM 코드 포크 없이 사용 가능합니다.

🟡 📦 오픈소스 2026년 7월 1일 · 3 분 읽기

Kimi K2.7 Code, GitHub Copilot 최초의 오픈 웨이트 모델로 등장

편집 일러스트레이션: Moonshot의 오픈 소스 모델 Kimi K2.7이 GitHub Copilot에 통합

Moonshot AI의 Kimi K2.7 Code가 모델 피커 최초의 오픈 웨이트 모델로 GitHub Copilot에서 사용 가능합니다. Microsoft Azure에서 호스팅되며 Pro, Pro+, Max 플랜에서 사용량 기반 요금제로 제공되고, Business와 Enterprise로의 확대도 계획되어 있습니다.

🟢 📦 오픈소스 2026년 7월 1일 · 3 분 읽기

LangChain, 저장소를 AI 에이전트용으로 자동 문서화하는 오픈소스 도구 OpenWiki 출시

편집 일러스트레이션: 저장소를 위한 오픈소스 문서 에이전트 OpenWiki를 구동하는 LangSmith 엔진

LangChain이 코드 저장소를 위한 문서 위키를 자동으로 생성·업데이트하는 오픈소스 CLI 도구 OpenWiki를 출시했습니다. AGENTS.md나 CLAUDE.md 같은 인스트럭션 파일을 비대화시키지 않으면서 코드 에이전트에게 저장소에 대한 구조화된 컨텍스트를 제공하는 것이 목표입니다. DeepAgents 프레임워크 기반으로 여러 LLM 공급자를 지원합니다.

🟡 📦 오픈소스 2026년 6월 30일 · 3 분 읽기

Miles: 프론티어 규모 LLM을 위한 PyTorch 네이티브 오픈소스 RL 포스트 트레이닝 프레임워크

에디토리얼 일러스트레이션: 강화학습 포스트 트레이닝과 커널 퓨전을 위한 PyTorch 네이티브 Miles 스택

RadixArk이 Miles를 발표합니다 — SGLang, Megatron-LM, Ray, PyTorch를 Hopper 및 Blackwell GPU에서 대규모 언어 모델 포스트 트레이닝을 위한 단일 프로덕션 테스트 스택으로 통합하는 오픈소스 강화학습 프레임워크.

🟢 📦 오픈소스 2026년 6월 30일 · 3 분 읽기

CNCF Kepler, 처음부터 재설계: 커널 권한 없이 Kubernetes 파드의 정밀한 전력 측정

에디토리얼 일러스트레이션: CNCF Kepler가 Kubernetes 인프라의 정밀한 에너지 소비 측정을 위해 재설계됨

CNCF 샌드박스 프로젝트 Kepler가 완전히 재작성되었습니다: 새 아키텍처가 eBPF 접근법을 표준 /proc 및 /sys 경로 읽기로 대체하여 다킬로와트 측정 급증을 제거하고 프로세스 전력 귀속 격차를 밀리와트 수준으로 줄입니다.

🟢 📦 오픈소스 2026년 6월 30일 · 3 분 읽기

ONNX v1.22.0, LLM용 네이티브 어텐션 연산자와 WebAssembly 지원 도입

에디토리얼 일러스트레이션: ONNX 버전 1.22가 새로운 어텐션 연산자와 WebAssembly 상호운용성을 도입

LF AI & Data Foundation이 트랜스포머 아키텍처 및 LLM을 위한 네이티브 어텐션 연산자, 브라우저에서 모델 검사를 위한 WebAssembly 지원 및 SLSA Level 2 암호화 증명과 함께 ONNX v1.22.0을 발표했습니다. 27명의 기여자가 기여했으며 그 중 16명은 처음으로 참여합니다.

🟡 📦 오픈소스 2026년 6월 29일 · 2 분 읽기

NVIDIA: Palantir과 NVIDIA Nemotron이 에어갭 시스템의 미국 기관에 주권 AI 제공

에디토리얼 일러스트: Palantir과 NVIDIA Nemotron이 에어갭 시스템의 미국 기관에 주권 AI 제공, 텍스트 및 얼굴 없음

Palantir은 미국 정부 기관과 중요 인프라를 위한 Sovereign AI Operating System에 NVIDIA Nemotron 오픈 모델을 통합했습니다. 시스템은 인터넷 연결이 없는 완전히 격리된 네트워크인 에어갭 환경에서 작동하며, 국방, 에너지, 의료, 교육, 운송 분야를 다룹니다.

🟡 📦 오픈소스 2026년 6월 27일 · 2 분 읽기

GitHub: Desktop 3.6, Git 워크트리와 AI 머지 충돌 해결 기능 출시

Editorial illustration: laptop screen showing branching git tree diagram with multiple parallel workflow lanes, dark background

GitHub Desktop 3.6이 macOS와 Windows에서 출시되어 스태싱 없이 여러 브랜치에서 병렬 작업이 가능한 Git 워크트리 지원과 커밋 메시지 및 머지 충돌을 위한 더 깊은 Copilot 통합을 제공합니다.

🔴 📦 오픈소스 2026년 6월 26일 · 2 분 읽기

PyTorch: TokenSpeed-Kernel — 멀티 실리콘 LLM 추론을 위한 이식 가능한 고성능 커널

에디토리얼 일러스트레이션: 파란 배경에 GPU 실리콘의 추상적인 레이어와 추론 가속 그래프가 있는 PyTorch 로고

TokenSpeed-Kernel은 코드 재작성 없이 NVIDIA와 AMD GPU에서 LLM 추론 속도를 최대 3.6배 높이는 오픈소스 3계층 커널 서브시스템으로, 이미 vLLM 추론 프레임워크에 통합되었습니다.

🟢 📦 오픈소스 2026년 6월 26일 · 1 분 읽기

Allen Institute: 하이브리드 모델(OLMo 3)이 더 잘 예측하는 토큰은?

에디토리얼 일러스트레이션: 하이브리드 SSM-트랜스포머 아키텍처와 순수 트랜스포머 모델의 토큰 비교 다이어그램

Allen Institute(AI2)는 OLMo 3와 OLMo Hybrid 아키텍처를 분석하여 하이브리드 모델이 의미론적·문맥 의존적 토큰을 더 잘 예측하는 반면, 순수 트랜스포머는 텍스트를 그대로 복사하는 작업에서 우위를 유지한다는 사실을 밝혔습니다.

🟢 📦 오픈소스 2026년 6월 25일 · 1 분 읽기

arXiv:2606.24855: OpenThoughts-Agent — 에이전트 모델 훈련을 위한 오픈 데이터 레시피

편집 일러스트: 로봇 에이전트들이 파이프라인에서 데이터 카드를 분류하는 오픈 실험실

OpenThoughts-Agent는 에이전트 언어 모델을 위한 오픈 데이터 큐레이션 파이프라인입니다. 100회 이상의 절제 실험을 통해 10만 개 예제를 구축하고 Qwen3-32B를 파인튜닝한 결과, 7개 에이전트 벤치마크에서 44.8%를 달성해 기존 오픈소스 모델을 모두 능가했습니다.

🟢 📦 오픈소스 2026년 6월 21일 · 1 분 읽기

Anthropic(Claude Code GitHub):Claude Code v2.1.185, 스트림 중단 메시지 개선

편집 일러스트: Claude Code v2.1.185, 스트림 중단 메시지 개선

Claude Code v2.1.185는 2026년 6월 20일에 출시된 UX 패치로, API 스트림 중단 메시지를 변경하고 활성화 임계값을 10초에서 20초 무음으로 연장했습니다. 모델 또는 API 변경 사항은 없습니다.

🟡 📦 오픈소스 2026년 6월 20일 · 2 분 읽기

arXiv:2606.20517:Multi-LCB, LiveCodeBench를 12개 프로그래밍 언어로 확장하고 24개 모델의 Python 과적합 발견

편집 일러스트: 12개 프로그래밍 언어 아이콘이 중앙 성능 측정기를 둘러싼 모습

Multi-LCB는 arXiv:2606.20517 논문에 기술된 LiveCodeBench 벤치마크 확장으로 ICLR 2026에 채택되었습니다. Python에서 12개 프로그래밍 언어로 확장하여 24개의 대형 언어 모델을 테스트한 결과 유의미한 Python 과적합과 언어별 데이터 오염이 발견되어 현재 모델의 다중 언어 코드 생성 한계가 드러났습니다.

🟡 📦 오픈소스 2026년 6월 20일 · 1 분 읽기

UK AISI:Engineering Playbook으로 프런티어 모델 평가 인프라를 5개 레이어로 공개

편집 일러스트: 보안 방패 아이콘이 있는 5개의 인프라 레이어가 쌓인 모습

Engineering Playbook은 UK AI Safety Institute가 2026년 6월 18일 발표한 오픈소스 문서로, 프런티어 AI 모델 평가를 위한 내부 인프라를 공개합니다. Playbook은 Evaluate, Isolate, Connect, Run, Scale의 5개 레이어로 구성되며, 200개 이상의 기성 평가와 240명의 기여자를 보유한 Inspect AI 도구를 기반으로 합니다.

🟡 📦 오픈소스 2026년 6월 19일 · 1 분 읽기

Black Forest Labs: Robin Rombach, G7 지도자들에게 개방형 AI 개발 지지 촉구

편집 일러스트: Robin Rombach, G7 지도자들에게 개방형 AI 개발 지지 촉구

Robin Rombach——Black Forest Labs(FLUX 모델 개발자)의 공동 창업자 겸 CEO——가 G7 지도자들에게 직접 호소했습니다. 개방적이고 책임감 있는 AI 개발이 전 세계적 규범이 되어야 한다는 것입니다. Rombach는 AI 파라미터의 공개 접근성이 혁신을 촉진하고 기술의 민주화를 이끈다고 주장합니다.

🟡 📦 오픈소스 2026년 6월 18일 · 1 분 읽기

Allen Institute:오픈소스 MolmoMotion이 비디오에서 3D 움직임을 예측하고 로보틱스 분야에서 SOTA를 달성했습니다

편집 일러스트:로봇 조작을 위한 물체 3D 경로 예측

Allen Institute는 비디오와 『그릇을 돌려』 같은 자연어 지시로 물체의 3D 궤적을 예측하는 완전 오픈소스 모델 MolmoMotion을 공개했습니다. PointMotionBench에서 SOTA를 달성하여 평균 변위 0.109m로 이전 기록 0.134m를 경신했습니다. 로보틱스 pick-and-place 작업 성공률을 56%에서 76.3%로 20.3퍼센트포인트 향상시켰습니다. 3D 궤적과 동작 설명이 포함된 116만 개의 비디오로 구성된 MolmoMotion-1M 데이터셋으로 학습되었습니다.

🟡 📦 오픈소스 2026년 6월 17일 · 1 분 읽기

vLLM:Semantic Router Fusion이 모델 패널을 합쳐 심판 모델이 단일 응답 합성

편집 일러스트레이션:AI 모델 패널과 심판 모델이 단일 응답을 합성하는 장면

vLLM이 Semantic Router Fusion을 선보였습니다. 여러 모델이 패널로 병렬 실행되고 심판 모델이 합의와 차이를 분석하여 단일 응답을 합성하는 기본 단위입니다. 로컬 vLLM과 프라이빗 엔드포인트뿐만 아니라 Gemini, Kimi, DeepSeek, Claude 같은 공개 제공자도 지원합니다. OpenRouter DRACO에서의 외부 검증에서 합쳐진 패널이 69%를 기록하여 최고 단일 모델의 65.3%를 앞섰으며, 완전한 OpenAI API 호환성을 갖추고 있습니다.

🟡 📦 오픈소스 2026년 6월 16일 · 2 분 읽기

GitHub:8000만 행·4000만 저장소 오픈 다국어 저장소 데이터셋 공개

에디토리얼 일러스트: 오픈 코드 저장소의 다국어 데이터셋

GitHub이 4000만 개 이상의 저장소에 걸쳐 8000만 개 이상의 분류 행을 포함한 다국어 저장소 데이터셋을 완전 개방형 CC0-1.0 라이선스로 공개했습니다. 각 저장소에 대해 README, 댓글이 가장 많은 issue, 댓글이 가장 많은 pull request 등 세 가지 텍스트 소스를 기록하며, fastText, gcld3, lingua-py 세 가지 도구로 언어를 감지합니다. 비영어 README 파일에서는 포르투갈어가 1위, issue 토론에서는 한국어가 가장 두드러집니다.

🟢 📦 오픈소스 2026년 6월 16일 · 1 분 읽기

CNCF:Oracle의 300만 달러 OCI 크레딧 기부, 12개 이상 프로젝트의 Arm64 지원 가속화

에디토리얼 일러스트: 오픈소스 프로젝트를 위한 Arm64 클라우드 인프라

CNCF는 Oracle의 300만 달러 OCI 컴퓨트 크레딧 기부가 OpenTelemetry, containerd, Falco, Longhorn, Crossplane, Jaeger를 포함한 12개 이상의 프로젝트에서 Arm64 CI/CD 지원을 가능하게 한다고 밝힙니다. 수요는 월 5,000달러의 초기 지침을 빠르게 초과했습니다. 이 전환은 새로운 AWS 인스턴스의 50% 이상과 Azure 인스턴스의 33%가 현재 Arm64 아키텍처에서 실행된다는 데이터와 함께 이루어집니다.

🟡 📦 오픈소스 2026년 6월 12일 · 4 분 읽기

Allen Institute for AI, olmo-eval 공개 — LLM 모델 활성 개발 주기를 위한 평가 플랫폼

편집 일러스트: 오픈소스 언어 모델 개발 및 비교를 위한 AllenAI OLMo 평가 플랫폼

AI2가 OLMES 표준을 단일 벤치마킹에서 완전한 개발 루프로 확장하는 개방형 평가 플랫폼 olmo-eval을 공개했습니다. 핵심 혁신은 체크포인트 간 개별 질문 수준의 쌍 비교이며, 데이터 노이즈와 실제 개선을 구별하기 위한 통계적 측정값이 내장되어 있습니다.

🟡 📦 오픈소스 2026년 6월 12일 · 3 분 읽기

MiniMax M3, vLLM에 탑재: 백만 토큰 컨텍스트 모델의 Day-0 지원

에디토리얼 일러스트레이션: 백만 토큰 컨텍스트를 갖춘 MiniMax M3 멀티모달 MoE 모델을 위한 vLLM 서비스

vLLM 팀이 MiniMax M3에 대한 완전한 Day-0 지원을 발표했습니다. 이 모델은 백만 토큰 컨텍스트, 네이티브 멀티모달리티, Mixture-of-Experts 아키텍처를 결합합니다. 핵심 혁신은 MiniMax Sparse Attention으로, 전체 KV 캐시를 메모리에 로드하지 않고도 긴 컨텍스트를 실용적으로 서빙할 수 있게 합니다.

🟡 📦 오픈소스 2026년 6월 11일 · 3 분 읽기

Ollama, Apple Silicon 추론 속도 최대 20% 향상: MLX 엔진, NVFP4 양자화, 에이전틱 워크플로우용 스냅샷

에디토리얼 일러스트: Apple Silicon 칩에서 가속 로컬 추론을 위한 Ollama MLX NVFP4 양자화

Ollama가 Apple Silicon용 MLX 엔진을 업데이트하여 Metal 커널 융합 및 GPU 샘플링으로 토큰 생성 속도를 최대 20% 향상했습니다. 새로운 NVFP4 양자화 형식은 비양자화 BF16 대비 품질 손실을 절반으로 줄이며, 스냅샷 시스템은 분기 및 재시도 기능을 갖춘 에이전틱 워크플로우를 지원합니다.

🟢 📦 오픈소스 2026년 6월 10일 · 2 분 읽기

vLLM의 Helion: PyTorch 네이티브 DSL이 CUDA 커널을 대체하고 Qwen3 모델의 FP8 추론을 가속화

편집 일러스트: 추론 및 LLM 자동 튜닝을 위한 PyTorch Helion DSL 이식 가능한 GPU 커널

Helion은 직접적인 CUDA 코드 없이 GPU 커널을 작성하기 위한 PyTorch 네이티브 DSL입니다. Qwen3 모델의 FP8 추론을 위해 아홉 가지 Helion 커널이 vLLM에 통합되었습니다. 비-GEMM 커널은 H100에서 최대 73% 속도 향상을 기록하며, 전체 처리량은 이전 솔루션 대비 약 5~9% 향상됩니다.

🟢 📦 오픈소스 2026년 6월 9일 · 3 분 읽기

LF AI & Data: DocLang 워킹 그룹이 AI 네이티브 문서를 위한 개방형 표준 개발

편집 일러스트: LF AI와 Data가 AI 네이티브 문서를 위한 개방형 표준 도입

LF AI & Data Foundation이 IBM, Red Hat, NVIDIA를 창립 회원으로 DocLang Specification Working Group을 발족하여 AI 네이티브 문서를 위한 개방형 표준을 개발합니다. 이 형식은 의미론적 의미와 기하학적 레이아웃을 보존하고, 거버넌스 컨트롤을 내장하며, 현대 AI 토크나이저와 에이전트 워크플로우에 최적화됩니다.

🟢 📦 오픈소스 2026년 6월 9일 · 3 분 읽기

vLLM: vime — Megatron 훈련과 vLLM 추론을 단일 파이프라인으로 통합한 새로운 RL 프레임워크

편집 일러스트: GB200 GPU 인프라를 갖춘 vLLM 강화학습 프레임워크

vime는 Megatron 분산 훈련과 vLLM 추론을 단일 파이프라인으로 통합하는 언어 모델 사후 훈련을 위한 새로운 RL 프레임워크입니다. GB200 하드웨어에서 Qwen3-30B-A3B MoE 모델이 단계당 약 147초를 달성해 H200보다 1.72배 빠릅니다. R3 라우팅 리플레이가 로그 확률 차이를 0.019에서 0.013으로 줄입니다.

🟡 📦 오픈소스 2026년 6월 6일 · 2 분 읽기

arXiv:2606.08094: vla.cpp가 1.3 GiB 메모리로 Vision-Language-Action 모델을 실행한다

편집 일러스트레이션: vla.cpp가 1.3 GiB 메모리로 Vision-Language-Action 모델을 실행한다

새로운 논문이 자원이 제한된 로봇 하드웨어에서 Vision-Language-Action 정책을 실행하는 C++ 추론 엔진 vla.cpp를 제시한다. 이 엔진은 벤치마크 LIBERO-Object에서 SOTA 수준에 도달하며 단 1.3 GiB 메모리로 BitVLA를 실행한다.

🟡 📦 오픈소스 2026년 6월 5일 · 2 분 읽기

Ollama 0.30: llama.cpp 통합, GGUF 지원, 최대 20% 빠른 inference

편집 일러스트레이션: llama.cpp 통합, GGUF 지원, 최대 20% 빠른 inference

Ollama 0.30은 더 나은 성능과 GGUF 모델 호환성을 위한 llama.cpp 통합을 가져오며, NVIDIA GPU에서 최대 20% 빠른 처리량을 제공한다. AMD 및 Intel 기기에서 Vulkan으로 하드웨어 지원을 확장하고 tool-calling 지원을 추가한다. Apple 실리콘용 기존 MLX 엔진을 보완한다.

🟡 📦 오픈소스 2026년 6월 5일 · 3 분 읽기

vLLM Semantic Router v0.3 'Themis': 프로덕션용 stateful 질의 라우팅

편집 일러스트레이션: 프로덕션용 stateful 질의 라우팅

vLLM 팀이 Semantic Router의 v0.3 'Themis'를 출시했으며, 이는 모델 간 질의 라우팅을 위한 첫 프로덕션 준비 버전이다. Kubernetes 배포를 위한 정규 구성, 검사 가능한 결정 흐름, 재현 가능한 라우팅 동작을 가져온다.

🟢 📦 오픈소스 2026년 6월 3일 · 2 분 읽기

Google, 홍수 예측 서비스 Flood Hub 뒤의 수문학 프레임워크를 오픈소스로 공개하다

편집 일러스트레이션: Google, 홍수 예측 서비스 Flood Hub 뒤의 수문학 프레임워크를 오픈소스로 공개하다

Google Research는 2026년 6월 3일 GitHub에 Apache 2.0 라이선스로 글로벌 홍수 예측 서비스 Flood Hub를 구동하는 Python/PyTorch 프레임워크를 공개했다. 이 프레임워크는 오픈소스 데이터셋 Caravan 위에서 LSTM과 더 새로운 ME-LSTM 아키텍처를 사용하며, 업그레이드된 v2 모델은 계측된 유역에서 신뢰할 수 있는 예측 시계(視界)를 6일 연장한다.

🟡 📦 오픈소스 2026년 6월 2일 · 2 분 읽기

vLLM: Session-Aware Agentic Routing, 모델 전환 79% 감소

편집 일러스트레이션: Session-Aware Agentic Routing, 모델 전환 79% 감소

vLLM Semantic Router에 각 메시지를 개별적으로 다루는 대신 장기 에이전트 대화를 이해하는 메커니즘인 Session-Aware Agentic Routing(SAAR)이 추가되었다. 2만 1,600회 테스트 턴에서 SAAR은 모델 전환을 79.29% 줄이고, 안전하지 않은 전환을 완전히 제거하며, 추정 비용을 78.71% 절감했다.

🟢 📦 오픈소스 2026년 6월 2일 · 1 분 읽기

vLLM: AutoRound 양자화가 vLLM-Omni에 도입, 더 작은 멀티모달 모델로

편집 일러스트레이션: AutoRound 양자화가 vLLM-Omni에 도입, 더 작은 멀티모달 모델로

vLLM은 Intel의 AutoRound 양자화를 vLLM-Omni에 통합해 멀티모달 및 디퓨전 모델의 W4A16 압축을 가능하게 했다. 그 결과 체크포인트가 최대 62% 작아지며, 품질 저하는 미미하고 Intel XPU와 NVIDIA 그래픽 카드에서 생성 속도가 빨라진다.

🟡 📦 오픈소스 2026년 6월 1일 · 2 분 읽기

vLLM: NVIDIA DGX Spark / GB10 시스템에서 실행하기

편집 일러스트레이션: NVIDIA DGX Spark / GB10 시스템에서 실행하기

vLLM 팀이 GB10 칩 기반의 NVIDIA DGX Spark 시스템에서 vLLM을 실행하기 위한 실용 가이드를 공개했다. 가이드는 통합 메모리의 동작, NVFP4 모델 Nemotron-3-Super 서빙, Docker 배포, Prometheus 메트릭, 그리고 새로운 엣지 하드웨어에서의 로컬 평가 결과를 다룬다.

🟢 📦 오픈소스 2026년 5월 30일 · 1 분 읽기

xAI: xai-sdk-python v1.15.0, grok-build-0.1 모델과 컨텍스트 압축 추가

편집 일러스트레이션: xai-sdk-python v1.15.0, grok-build-0.1 모델과 컨텍스트 압축 추가

xAI가 xai-sdk-python v1.15.0을 공개했다. 변경 사항은 세 가지로, ChatModel 클래스에 grok-build-0.1 모델 추가, 컨텍스트 압축(context compaction) 지원, 그리고 버전을 1.14.0에서 1.15.0으로 올린 것이다. 모든 변경은 별도의 풀 리퀘스트 세 건을 통해 들어왔다.

🟡 📦 오픈소스 2026년 5월 29일 · 2 분 읽기

arXiv:2605.31463: PithTrain, 에이전트에 최적화된 컴팩트한 MoE 모델 학습 시스템

편집 일러스트레이션: 에이전트에 최적화된 컴팩트한 MoE 모델 학습 시스템 PithTrain

PithTrain은 코딩용 AI 에이전트에 최적화된 새로운 Mixture-of-Experts 모델 학습 시스템이다. 이 연구는 agent-task efficiency 지표와 이에 대응하는 ATE-Bench를 도입하며, 그 위에서 PithTrain은 비슷한 처리량을 유지하면서 에이전트 단계를 최대 62%, 활성 GPU 시간을 최대 64% 줄인다.

🟡 📦 오픈소스 2026년 5월 28일 · 2 분 읽기

vLLM: 표준화된 가중치 동기화 API로 비동기 RL을 가속하다

편집 일러스트레이션: 비동기 RL을 가속하는 표준화된 가중치 동기화 API

vLLM은 2026년 5월 28일 가중치 동기화(weight synchronization)를 위한 표준화된 API와 비동기 강화학습에 대한 개선된 지원을 도입했다. 각 RL 프레임워크가 훈련과 추론 사이의 가중치 전송을 임시방편으로 구현하던 파편화를 해결하고, 대규모 분산 배포의 안정성 문제를 개선한다.

전체 아카이브 보기 →