🔧 하드웨어

60 개 뉴스

🟡 🔧 하드웨어 2026년 7월 17일 · 2 분 읽기

NVIDIA: 코디자인 덕분에 Vera Rubin 플랫폼이 Blackwell 세대 GPU의 4분의 1만으로 최대 규모 AI 모델 훈련

파란 톤으로 표현된 서버 칩과 데이터센터의 추상적 이미지

NVIDIA는 새로운 Vera Rubin 플랫폼이 하드웨어와 소프트웨어의 엔드투엔드 코디자인 덕분에 Blackwell 세대 GPU 수의 4분의 1만으로 최대 규모의 AI 모델을 훈련한다고 밝혔습니다. Nemotron 3 Ultra 모델은 SWE-bench Verified 벤치마크에서 71.7%를 기록했으며, Vera CPU는 x86 대안보다 약 30% 높은 처리량을 보였습니다.

🟡 🔧 하드웨어 2026년 7월 16일 · 2 분 읽기

AMD: AIMs 2.2, Instinct·EPYC·Radeon 위한 추론 마이크로서비스 제공

편집 일러스트: AMD ROCm 로고, 배경에 Docker 컨테이너와 GPU 칩

AMD가 AIMs 2.2를 발표했습니다—Instinct GPU 가속기, EPYC CPU, Radeon GPU에 자동 구성을 제공하는 표준화된 Docker 추론 마이크로서비스로, Gemma-4 31B, Llama-3.1 8B, Qwen3 등의 모델을 지원합니다.

🟢 🔧 하드웨어 2026년 7월 16일 · 2 분 읽기

AMD: AI 코드 어시스턴트(Cursor + Claude Opus 4.7)가 MI250에서 GPU 커널 28.3배 가속

Cursor IDE와 Claude Opus 4.7을 사용한 AMD Instinct MI250의 HIP 커널 가속 그래프

AMD ROCm 블로그는 엔지니어들이 에이전트 모드에서 Cursor IDE와 Claude Opus 4.7을 사용하여 AMD Instinct MI250의 배정밀도 HIP 커널을 최적화한 방법을 설명합니다. 4단계 약 45회 실험을 통해 28.3배 가속을 달성했습니다—런타임이 46.7초에서 1.65초로 감소하고, 비트 동일 결과에 허용 오차 1e-12.

🟢 🔧 하드웨어 2026년 7월 15일 · 2 분 읽기

AMD:hipVS——Instinct용 GPU 벡터 검색 라이브러리, cuVS 호환 API 및 에이전트 RAG 데모 포함

AMD Instinct GPU의 4가지 알고리즘과 에이전트 RAG 시스템을 보여주는 hipVS 벡터 검색 아키텍처 다이어그램

AMD가 hipVS를 발표했습니다. hipRAFT 알고리즘을 기반으로 AMD Instinct GPU용으로 구축된 GPU 가속 벡터 검색 라이브러리입니다. 이 라이브러리는 NVIDIA cuVS 플랫폼과 API 수준에서 호환되며, 4가지 검색 알고리즘을 지원하고, 쿼리를 3~5개의 하위 쿼리로 분해하는 에이전트 RAG 시스템 데모도 제공합니다.

🟡 🔧 하드웨어 2026년 7월 14일 · 2 분 읽기

NVIDIA: 와트당 성능이 핵심 지표로 — Blackwell GB300, Hopper 대비 최대 25배 효율

편집 일러스트: NVIDIA Blackwell GB300 NVL72 칩과 이전 세대 Hopper와의 효율 비교 그래프

NVIDIA Blackwell GB300 NVL72는 DeepSeek V4 Pro 모델 기준 Hopper 대비 와트당 성능이 최대 25배에 달하며, 소프트웨어 최적화만으로 한 달 내에 최대 5배 개선을 달성했습니다.

🟡 🔧 하드웨어 2026년 7월 13일 · 2 분 읽기

AMD:GEAK 에이전트가 MI355에서 DeepSeek-V4 MLA 커널을 자동 최적화, 최대 9배 가속

편집 일러스트: AMD MI355 GPU 가속기 다이어그램에 최적화된 Triton 커널 코드를 생성하는 GEAK 에이전트를 보여줌

AMD의 GPU 커널 자동화 최적화 에이전트 GEAK가 DeepSeek-V4 MLA 커널을 MI355 가속기용으로 PyTorch에서 Triton으로 마이그레이션했습니다. 결과는 프리필 최대 9.13배 가속, 디코딩 기하평균 4.94배 가속, SGLang 프레임워크에서 엔드투엔드 처리량 2.10배 향상을 보여줍니다.

🟢 🔧 하드웨어 2026년 7월 10일 · 2 분 읽기

AMD: ROCm 기반 SGLang Diffusion이 Instinct GPU에 이미지 생성·편집 기능 제공 — LLM용 추론 프레임워크, 확산 모델로 확장

편집 일러스트: AMD GPU 칩에서 확산 레이어를 통해 생성된 이미지가 나타나는 모습

AMD가 ROCm 스택의 SGLang Diffusion을 통해 Instinct GPU에서 이미지 생성·편집을 위한 확산 모델을 실행하는 가이드를 공개했습니다. 대형 언어 모델 분야에서 인기를 끈 추론 프레임워크 SGLang이 이미지 확산까지 지원을 확대하면서, AMD는 NVIDIA 에코시스템 외부에서 AI 추론 분야 입지를 강화하고 있습니다.

🟢 🔧 하드웨어 2026년 7월 9일 · 2 분 읽기

AMD: FlyDSL——더 적은 코드로 수작업 HIP C++ GPU 커널의 성능을 약속하는 Python DSL

편집 일러스트: 파이썬 뱀이 GPU 칩을 감싸고 칩에서 최적화된 데이터 흐름이 나오는 모습

FlyDSL은 AMD의 GPU 커널 작성용 Python 도메인 특화 언어로, 새로운 ROCm 가이드에 따르면 수동으로 최적화된 HIP C++ 코드의 성능을 더 적은 코드로 달성할 수 있습니다. AMD는 기존 HIP 커널 이식을 위한 실용 가이드를 공개하며 FlyDSL을 NVIDIA CUDA 도구 체인에 대한 Python 우선 대안으로 포지셔닝하고 있습니다.

🟢 🔧 하드웨어 2026년 7월 7일 · 3 분 읽기

AMD, MI355X occupancy 수학 설명 — 높은 점유율이 최고 처리량의 조건이 아니다

편집 일러스트: AMD CDNA4 MI355X GPU occupancy 수학 및 커널 코드 최적화

AMD ROCm 팀이 CDNA4 아키텍처에 대한 GPU occupancy 수동 계산 기술 가이드를 발표했습니다. 핵심 발견: MI355X의 행렬 바운드 커널은 불과 12% occupancy에서 최고 처리량을 달성합니다 — CUDA 생태계에서 온 실무자들에게 반직관적인 결과입니다.

🟢 🔧 하드웨어 2026년 7월 7일 · 3 분 읽기

NVIDIA Vera: 에이전트 AI에 더 많은 코어가 아닌 더 빠른 코어가 필요한 이유

편집 일러스트: AI 에이전트 루프에 최적화된 Olympus 코어를 탑재한 NVIDIA Vera CPU

Olympus 코어를 탑재한 NVIDIA Vera CPU는 Grace 프로세서 대비 IPC가 50% 높고 코어-투-코어 대역폭이 3.4TB/s입니다. Perplexity는 코딩 에이전트 워크플로우에서 1.5배 빠른 작업 완료를 기록했습니다.

🟢 🔧 하드웨어 2026년 7월 6일 · 3 분 읽기

AMD Quark, Instinct MI350에서 FLUX.1-dev를 MXFP4로 양자화해 1.92배 속도 향상

에디토리얼 일러스트: AMD MI350 MXFP4 양자화로 디퓨전 모델의 이미지 생성 가속화

AMD Quark 0.12가 Diffusers와 xDiT 프레임워크를 통해 Instinct MI350 GPU에서 이미지 생성을 위한 FLUX.1-dev 모델의 MXFP4 양자화를 가능하게 합니다. torch.compile을 사용하면 MXFP4 ASM이 BF16 eager 기준 대비 1.92배 속도 향상을 달성하며, CLIP 점수는 기준과 동일합니다.

🟢 🔧 하드웨어 2026년 7월 6일 · 3 분 읽기

AMD Primus Tuning Agent, MI355X 클러스터에서 최적의 LLM 구성을 자동으로 탐색

에디토리얼 일러스트: AMD Primus가 MI355X에서 언어 모델 훈련 구성을 자동으로 최적화하는 모습

AMD ROCm Primus Tuning Agent는 결정론적 시드 플래너와 LLM 기반 탐색 루프를 결합하여 AMD Instinct GPU에서의 LLM 훈련을 위한 최적 구성을 자동으로 발견합니다. Mixtral 8×22B에서 약 30분의 탐색으로 AMD 기준 대비 +27%의 처리량을 달성했습니다.

🟢 🔧 하드웨어 2026년 7월 6일 · 3 분 읽기

양자 기술과 AI: 오늘날 현실과 미래의 가능성

에디토리얼 일러스트: 첨단 소재 연구에서 양자 기술과 AI의 상보적 관계

Multiverse Computing과 도시바 소속 산업 전문가들이 OECD.ai에서 양자 기술이 이미 AI를 변화시키는 부분과 낙관적 기대가 증거로 뒷받침되지 않는 부분을 분석합니다. 텐서 네트워크는 계산 수요를 10~100배 절감하며, 광범위한 양자 ML 적용은 향후 10년 내 현실화되기 어렵습니다.

🟡 🔧 하드웨어 2026년 7월 3일 · 3 분 읽기

AMD AgentKernelArena: GPU 커널 최적화를 위한 AI 에이전트 오픈 벤치마크

에디토리얼 일러스트레이션: 벤치마크에서 AI 에이전트의 커널 코드 최적화를 위한 AMD MI355 GPU 칩

AMD Research는 2026년 7월 3일 AI 코딩 에이전트가 실제 GPU 커널을 얼마나 잘 최적화하는지 측정하는 오픈 벤치마킹 프레임워크 AgentKernelArena를 공개했습니다. 4가지 카테고리의 214개 태스크 중, AMD 자체 에이전트 GEAKv3(Claude Opus 4.6)가 HIP 커널에서 9.04배 속도 향상으로 선두를 차지했으며, Claude Code(Opus 4.6)가 6.08배로 2위를 기록했습니다. 모든 실험은 ROCm 7.1.1 환경의 AMD Instinct MI300X에서 수행되었습니다.

🟡 🔧 하드웨어 2026년 7월 3일 · 3 분 읽기

AMD Eagle3과 Quark FP8: 투기적 디코딩으로 MI355X에서 최대 2.00배 처리량 달성

에디토리얼 일러스트레이션: 가속 추론을 위한 AMD Instinct GPU에서의 AMD Eagle3 투기적 디코딩

AMD ROCm 팀은 2026년 7월 3일 AMD 하드웨어에서의 Eagle3 투기적 디코딩 프로덕션 적용 세부 사항을 공개했습니다. Eagle3 다중 레이어 접근법, vLLM 백엔드, AMD Quark FP8 양자화의 조합은 AMD Instinct MI355X에서 Kimi-K2.5에 대해 1.69배~2.00배, MiniMax-M2.5에 대해 1.38배~1.79배 높은 처리량을 달성하며 출력 품질 손실이 없습니다.

🟢 🔧 하드웨어 2026년 7월 3일 · 3 분 읽기

AMD ROCm: GPU 레지던트 YOLO26 파이프라인, 비디오 프레임을 디코딩부터 감지까지 VRAM에 유지

에디토리얼 일러스트레이션: YOLO26 파이프라인을 이용한 AMD Radeon GPU의 비디오 객체 감지

AMD는 rocDecode, DLPack, PyTorch, MIGraphX를 활용하여 최종 감지 결과가 확정될 때까지 비디오 프레임이 VRAM을 벗어나지 않도록 하는 GPU 레지던트 객체 감지 파이프라인을 공개했습니다.

🟢 🔧 하드웨어 2026년 6월 30일 · 3 분 읽기

NVIDIA: Blackwell의 소프트웨어 스택이 한 달 만에 DeepSeek V4 토큰 비용 5배 절감

에디토리얼 일러스트레이션: NVIDIA Blackwell 소프트웨어 스택이 토큰 당 비용을 5배 절감하는 추론

NVIDIA가 Blackwell 아키텍처에서 계층화된 소프트웨어 최적화 — NVFP4 정밀도부터 투기적 디코딩까지 — 가 DeepSeek V4 모델의 처리량을 최대 20배 높이고 토큰 비용을 5배 낮추는 방법을 설명합니다.

🟡 🔧 하드웨어 2026년 6월 29일 · 2 분 읽기

AMD: ROCm 저지연 GEMM 커널로 Instinct MI355X에서 LLM 추론 최대 1.79배 가속

에디토리얼 일러스트: ROCm 저지연 GEMM 커널로 Instinct MI355X에서 LLM 추론 최대 1.79배 가속, 텍스트 및 얼굴 없음

AMD는 AITER 프레임워크(AI Tensor Engine for ROCm) 내 FlyDSL 시스템을 발표했습니다. AMD GPU의 LLM 디코딩 단계를 위한 특수 GEMM 커널을 자동 생성합니다. 결과: 256개 컴퓨트 유닛을 갖춘 Instinct MI355X에서 평균 1.64배 지연 시간 감소, M≤8 토큰의 가장 중요한 시나리오에서 1.79배 가속.

🟢 🔧 하드웨어 2026년 6월 28일 · 1 분 읽기

AMD: Resource Manager, 비활성 GPU 워크로드를 자동 선점하여 클러스터 공유 풀에 자원 반환

에디토리얼 일러스트: 데이터 센터에서 자원 흐름이 있는 GPU 가속기 행렬, 텍스트 및 얼굴 없음

AMD Resource Manager에 자동 선점(pre-emption) 기능이 추가되었습니다. 시스템은 워크로드별 GPU 사용률을 모니터링하고, 설정 가능한 임계값(예: 10%) 이하의 작업을 지정된 유휴 타이머(예: 15분) 이후 중단합니다. 비활성 개발 환경이 점유한 GPU 자원을 공유 풀로 반환하는 두 가지 정책 — GPU 부하 시에만 선점하거나 항상 선점 — 을 제공합니다.

🟡 🔧 하드웨어 2026년 6월 27일 · 1 분 읽기

AMD: MI355X에서 MXFP4/MXFP6 혼합 정밀도 양자화로 처리량 29% 향상

Editorial illustration: AMD Instinct MI355X GPU 가속기와 혼합 정밀도 양자화 다이어그램 및 처리량 그래프

AMD는 Instinct MI355X 가속기에서 W_MXFP4_A_MXFP6 혼합 정밀도 양자화를 시연하여 vLLM 프레임워크를 활용한 프로덕션 추론 환경에서 FP8 수준에 가까운 정확도를 유지하면서 처리량을 최대 29% 향상시켰습니다.

🟡 🔧 하드웨어 2026년 6월 26일 · 2 분 읽기

NVIDIA와 AWS: EC2 G7 Blackwell GPU 인스턴스, AI 추론 4.6배 향상

에디토리얼 일러스트레이션: 파란 조명 효과가 있는 AWS 데이터 센터의 NVIDIA Blackwell GPU 서버 랙

NVIDIA와 AWS가 이전 G6 세대 대비 AI 추론 성능이 4.6배 향상된 RTX PRO 4500 Blackwell GPU를 탑재한 EC2 G7 인스턴스를 발표했습니다. cuVS 라이브러리는 Amazon OpenSearch Serverless의 기본값이 되어 벡터 인덱싱 속도가 10배 빨라졌습니다.

🔴 🔧 하드웨어 2026년 6월 25일 · 2 분 읽기

OpenAI: Jalapeño — NVIDIA 의존도를 줄이는 LLM 추론용 자체 ASIC 칩

편집 일러스트: 회로 기판 위 Jalapeno라고 표시된 미래형 AI 추론 칩, 녹색 액센트 조명, 얼굴이나 텍스트 없음

OpenAI와 Broadcom이 공동으로 LLM 추론에 최적화된 커스텀 ASIC 칩 Jalapeño를 발표했습니다. OpenAI가 자체 실리콘 영역에 진입하는 전략적 행보로, Google TPU, Apple Neural Engine, AWS Trainium과 어깨를 나란히 하며 NVIDIA GPU 의존도를 낮춥니다.

🟢 🔧 하드웨어 2026년 6월 25일 · 1 분 읽기

AMD: ATOM 옵티마이저 — MI355X에서 DeepSeek-V4를 위한 DP Attention 및 Two-Batch Overlap

편집 일러스트: AMD MI355X GPU 칩과 추론 워크로드 처리량 최적화 그래프

ATOM은 MI355X GPU용 AMD 오픈소스 추론 엔진으로, DeepSeek-V4에 두 가지 최적화를 제공합니다. PrefillDelayer는 랭크 조율 시 발생하는 손실을 제거하고, Two-Batch Overlap은 네트워크 연산 중첩으로 토큰 균형 조정을 가속화합니다.

🟢 🔧 하드웨어 2026년 6월 24일 · 1 분 읽기

AMD ROCm: EAGLE3 추측 디코딩으로 MI325X에서 Kimi-K2.5 33% 가속

에디토리얼 일러스트레이션: 데이터 센터의 AMD Instinct MI325X GPU 카드와 텍스트 생성 속도 상승 그래프

AMD ROCm 팀이 8× Instinct MI325X에서 Kimi-K2.5 모델에 EAGLE3 추측 디코딩을 적용해 GSM8K 정확도 손실 없이 출력 처리량 33% 향상, 중앙값 토큰 간 지연 58% 감소를 달성했습니다.

🟡 🔧 하드웨어 2026년 6월 23일 · 2 분 읽기

NVIDIA: JUPITER — ISC 2026에서 유럽 최초 엑사스케일 슈퍼컴퓨터, 과학 신기록 수립

편집 일러스트: NVIDIA Grace Hopper 칩과 파란색 InfiniBand 케이블이 있는 유럽 데이터센터

JUPITER는 독일 Forschungszentrum Jülich에 위치한 유럽 최초의 엑사스케일 슈퍼컴퓨터입니다. NVIDIA Grace Hopper 슈퍼칩과 Quantum-X800 InfiniBand 네트워크로 구동되는 JUPITER는 860억 개의 뉴런을 매핑하고, 50 큐비트 시뮬레이션으로 양자 기록을 경신했으며, 기후 시뮬레이션에서 세계 기록을 달성했습니다.

🟡 🔧 하드웨어 2026년 6월 23일 · 2 분 읽기

NVIDIA: 로스앨러모스의 Vera CPU — 핵과학 에이전틱 AI 7배 가속 및 3개 신규 슈퍼컴퓨터

편집 일러스트: NVIDIA Vera CPU 프로세서 칩과 연구소의 슈퍼컴퓨터 개략도

Olympus 코어를 탑재한 NVIDIA Vera CPU가 로스앨러모스 국립연구소에 도입되어 기존 Crossroads x86 프로세서 대비 URSA 워크로드에서 7배, 열전달 몬테카를로 시뮬레이션에서 3배 향상된 성능을 제공합니다. 세 가지 신규 슈퍼컴퓨터 Mission·Vision·Veritas는 2027년 가동 예정입니다.

🟢 🔧 하드웨어 2026년 6월 23일 · 1 분 읽기

NVIDIA: CUDA-X 라이브러리 cuPhoton·DAQIRI·ALCHEMI, 천문학·화학·재료과학 가속

편집 일러스트: 천문학 및 분자 그래픽이 포함된 과학 데이터 시각화를 구동하는 NVIDIA GPU 슈퍼컴퓨팅 하드웨어

NVIDIA는 과학 분야 AI를 위한 세 가지 새로운 CUDA-X 소프트웨어 라이브러리를 발표했습니다. 천문학용 cuPhoton은 최대 14,900배 가속, Lila Sciences의 ALCHEMI는 재료 스크리닝 50배 가속, DAQIRI는 물리 감지기의 실시간 네트워킹을 가속합니다.

🟢 🔧 하드웨어 2026년 6월 20일 · 1 분 읽기

AMD:ROCm으로 Matrix3D 최적화, Instinct GPU에서 3D 세계 렌더링 최대 54% 가속

편집 일러스트: GPU 코어에서 절차적으로 생성된 3D 경관이 떠오르는 장면

AMD는 ROCm 블로그에서 AMD Instinct GPU 상의 탐색 가능한 3D 세계 생성 프레임워크 Matrix3D 최적화를 소개했습니다. CUDA 전용 컴포넌트를 Triton 커널로 교체하고 gsplat 라이브러리를 활용한 3DGS를 적용한 결과, MI250 GPU에서 54%, MI300에서 50% 렌더링이 가속되었으며 렌더링 커널 자체는 CUDA 버전보다 36% 빠릅니다.

🟡 🔧 하드웨어 2026년 6월 19일 · 2 분 읽기

AMD: 대규모 언어 모델 학습에서의 RoCE 네트워크 트래픽 패턴 분석

편집 일러스트: 대규모 언어 모델 학습에서의 RoCE 네트워크 트래픽 패턴 분석

AMD는 스케일아웃 GPU 클러스터에서 GPT-4, Llama 3, DeepSeek-V2, Grok 4.0 등 4개의 대규모 언어 모델을 학습할 때 발생하는 RoCE 네트워크 트래픽 패턴에 대한 비교 분석을 발표했습니다. 이는 다수의 GPU 노드로 구성된 AI 인프라 구축을 위한 실무 지침입니다.

🟢 🔧 하드웨어 2026년 6월 18일 · 1 분 읽기

AMD:오픈소스 Schola가 Unreal Engine과 강화학습을 연결하여 ROCm에서 로봇 팔을 훈련합니다

에디토리얼 일러스트:시뮬레이션 환경에서 강화학습으로 로봇 팔 훈련

AMD가 Schola를 발표했습니다. Python 프레임워크와 gRPC를 통해 Gymnasium 호환 강화학습 훈련을 가능하게 하는 Unreal Engine용 오픈소스 플러그인입니다. 예시에서는 협동 로봇 팔 xArm6를 Unreal Engine 5.7에서 MuJoCo 물리 엔진, PPO 알고리즘, PyTorch를 AMD ROCm GPU 스택으로 훈련합니다. 튜토리얼은 팔 끝을 무작위 목표 위치로 이동시키는 도달 작업을 보여줍니다.

🟡 🔧 하드웨어 2026년 6월 17일 · 1 분 읽기

AMD:Instinct MI355X가 MLPerf Training v6.0에서 NVIDIA와 5% 차이, 전세대 대비 3.5배 성능 향상

편집 일러스트:데이터센터의 AMD Instinct MI355X 가속기

AMD는 MLPerf Training v6.0에서 Instinct MI355X가 LLM 벤치마크에서 동급 NVIDIA GPU와 약 5% 성능 차이를 보였음을 공개했습니다. MI355X는 작년 MI300X보다 3.5배, 이전 라운드보다 13~19% 빠릅니다. AMD는 최초로 MXFP4(FP4) 학습 레시피와 Primus 통합 프레임워크를 도입했으며, 512개 MI300X GPU, 64개 노드의 멀티노드 제출도 완료했습니다.

🟡 🔧 하드웨어 2026년 6월 17일 · 1 분 읽기

NVIDIA Blackwell이 MLPerf Training 6.0 석권 — 7개 벤치마크 전부 1위, GB300 최대 1.6배 빠른 성능

편집 일러스트:AI 모델 학습을 위한 NVIDIA Blackwell GPU 클러스터

NVIDIA는 Blackwell 플랫폼이 MLPerf Training 6.0의 전체 7개 테스트에서 최고 성적을 달성했다고 발표했습니다. GB300 NVL72는 GB200 NVL72 대비 최대 1.6배 빠른 학습 속도를 제공하며, 최대 규모 제출에서는 8192개의 Blackwell GPU로 6710억 파라미터의 DeepSeek-V3 모델을 학습했습니다. CoreWeave는 8192개 GPU로 DeepSeek-V3 671B를 2.02분에 학습했고, Microsoft Azure는 Llama 3.1 405B를 7.07분에 완료했습니다.

🟡 🔧 하드웨어 2026년 6월 16일 · 2 분 읽기

AMD:Instinct GPU용 신규 ATOM 추론 엔진, OpenAI 호환 API와 MoE 최적화 제공

에디토리얼 일러스트: AI 모델 서빙을 위한 AMD Instinct GPU 스택

AMD가 Instinct GPU를 위한 추론 엔진 ATOM을 발표했습니다. OpenAI 호환 API를 제공하며 KV 캐시, 스케줄링, 병렬성을 조율합니다. ATOM은 ROCm 스택 최상위에 위치하며 AITER 커널과 MoRI RDMA 통신을 활용해 TP, DP, EP 병렬성을 지원하고 DeepSeek V2~V4, Mixtral, Qwen3-MoE 등 MoE 모델에 최적화되어 있습니다. FP8, MXFP4, INT8, INT4 양자화와 EAGLE 제안자를 사용한 MTP 투기적 디코딩을 제공합니다.

🟢 🔧 하드웨어 2026년 6월 12일 · 3 분 읽기

폐기된 Pixel 스마트폰이 데이터센터로: 기기 2,000대, 탄소 발자국 50% 절감

편집 일러스트레이션: Google이 2,000대의 폐기된 Pixel 스마트폰을 저탄소 데이터센터로 전환

UC 샌디에이고 대학 연구진이 Google의 지원을 받아 폐기된 Pixel 스마트폰 2,000대로 데이터센터를 구축하고 있습니다. 마더보드를 재활용하여 내재 탄소를 약 50% 절감하며, 25~50대 전화기로 구성된 클러스터가 이미 75개 병렬 컴퓨팅 강좌의 피크 부하를 처리하고 있습니다.

🟡 🔧 하드웨어 2026년 6월 4일 · 2 분 읽기

Black Forest Labs: FLUX.2 [klein], ASUS ProArt 노트북에 사전 설치되어 출시

편집 일러스트레이션: FLUX.2 [klein], ASUS ProArt 노트북에 사전 설치되어 출시

Black Forest Labs가 ASUS, NVIDIA와의 파트너십을 통해 FLUX.2 [klein]을 ASUS ProArt 소비자용 노트북에 사전 설치하여 제공한다. FLUX 모델이 소비자용 하드웨어에 사전 설치되어 출시되는 첫 사례다. 40억 파라미터 모델은 클라우드 의존 없이 로컬에서 1초 미만에 이미지 생성과 편집을 가능하게 한다.

🟡 🔧 하드웨어 2026년 6월 1일 · 2 분 읽기

OpenAI: 미시간주에 Stargate 데이터센터 발표

편집 일러스트레이션: 미시간주에 Stargate 데이터센터 발표

OpenAI는 미국 미시간주에 새로운 Stargate 데이터센터 건설을 발표했다. 이는 컴퓨팅 파워를 위한 Stargate 인프라 프로그램의 확장으로, OpenAI는 이를 이른바 Intelligence Age의 맥락 속에 위치시킨다. 이번 발표에는 용량과 투자에 대한 세부 정보가 제시되지 않아 공식 출처를 참고하도록 안내한다.

🟢 🔧 하드웨어 2026년 6월 1일 · 1 분 읽기

AMD: Alibaba의 ROLL 프레임워크, Instinct GPU에서 네이티브로 작동

편집 일러스트레이션: Alibaba의 ROLL 프레임워크, Instinct GPU에서 네이티브로 작동

AMD는 Alibaba의 오픈소스 강화학습 프레임워크 ROLL이 이제 ROCm 소프트웨어와 함께 AMD Instinct GPU에서 코드 수정, 커스텀 패치, 비표준 빌드 없이 네이티브로 작동한다고 발표했다. 이번 협력에는 vLLM 호환성, Ray 수정 사항, 대규모 언어 모델의 분산 RL 학습 지원이 포함된다.

🟢 🔧 하드웨어 2026년 5월 29일 · 1 분 읽기

AMD: MI300X의 추측 디코딩이 추론을 4.3배 가속

편집 일러스트레이션: MI300X의 추측 디코딩이 추론을 4.3배 가속

AMD는 ROCm 블로그에서 Instinct MI300X GPU 상의 추측 디코딩 구현을 소개했다. 더 작은 draft 모델이 토큰을 예측하고 더 큰 모델이 이를 검증하는 이 기법은, 기존 자기회귀 생성 대비 최대 4.3배 높은 처리량을 달성했다.

🟢 🔧 하드웨어 2026년 5월 27일 · 1 분 읽기

AMD ROCm: MI355X(CDNA 4)용 4웨이브 인터리브 FP8 GEMM 커널 최적화로 웨이브당 레지스터 예산 2배 확보

Urednička ilustracija: 4-valna interleave optimizacija FP8 GEMM kernela za Instinct MI355X (CDNA 4) udostručuje regist

AMD ROCm 블로그에서 CDNA 4 아키텍처 기반 Instinct MI355X 가속기에 대한 FP8 GEMM(혼합 정밀도 행렬 곱셈) 커널의 새로운 4웨이브 인터리브 방식을 소개합니다. 이 최적화는 8웨이브 핑퐁 방식에서 웨이브당 512개 레지스터 전체 VGPR 예산을 갖는 4웨이브 방식으로 전환하며, XOR 기반 스위즐로 LDS 메모리 충돌을 제거하고 MFMA 명령어와 데이터 로딩의 정밀한 중첩으로 메모리 레이턴시를 숨깁니다.

🟢 🔧 하드웨어 2026년 5월 27일 · 1 분 읽기

PyTorch: TokenSpeed, NVIDIA Blackwell GPU로 Qwen3.5-397B-A17B에서 580 토큰/초 신기록 달성

Urednička ilustracija: TokenSpeed postiže rekordnih 580 token/s na Qwen3.5-397B-A17B s NVIDIA Blackwell GPU-ima

MIT 라이선스의 오픈소스 LLM 추론 엔진 TokenSpeed(LightSeek Foundation)가 TP8 구성의 NVIDIA Blackwell B200 GPU 8개로 Qwen3.5-397B-A17B 모델에서 초당 580 토큰을 달성했습니다. 이 신기록은 프리픽스 캐싱과 CPU-GPU 실행 중첩을 사용하는 에이전틱 워크로드에서 달성되었으며, 1백만 토큰 컨텍스트에서도 성능 저하가 16% 미만입니다.

🟡 🔧 하드웨어 2026년 5월 25일 · 1 분 읽기

AMD: Ryzen AI Max+ 395, 통합 메모리로 최대 1,220억 매개변수 LLM 모델 구동

Urednička ilustracija: Ryzen AI Max+ 395 pokreće LLM modele do 122 milijarde parametara uz zajedničku memoriju

AMD ROCm 블로그가 UMA(통합 메모리 아키텍처)를 탑재한 Ryzen AI Max+ 395 프로세서에서의 LLM 추론 성능을 상세 분석한 글을 공개했습니다. 128GB LPDDR5X 메모리를 갖춘 이 시스템은 Qwen3.5 35B MoE 모델에서 GPU 전체 오프로딩으로 초당 42토큰을 달성하며, CPU와 GPU 메모리를 결합하면 최대 1,220억 매개변수 모델도 지원합니다.

🟢 🔧 하드웨어 2026년 5월 23일 · 3 분 읽기

AMD:Gluon 블록 수준 모델로 Instinct MI355에서 MXFP4 5.255 TFLOPS GEMM 커널 구현

편집 일러스트: 매트릭스 유닛 레이아웃과 파이프라인을 가진 GPU 가속기

AMD ROCm 팀이 MI355 GPU에서 Gluon 프로그래밍 모델로 고성능 GEMM 커널을 작성하는 튜토리얼을 공개했습니다. 최적화된 FP16 커널은 MFMA 효율 98.75%로 1.489 TFLOPS를 달성했으며, BF8(3.257 TFLOPS)과 MXFP4(5.255 TFLOPS)로의 확장은 현대 AI 워크로드에 대한 적합성을 입증합니다. 튜토리얼에는 L2 캐시 미스를 530만에서 410만으로 줄이는 워크그룹 리매핑과 swizzle 기법이 포함되어 있습니다.

🟡 🔧 하드웨어 2026년 5월 21일 · 2 분 읽기

AMD: ROCm 7.13, MI350P GPU·멀티 VF 가상화·TheRock 모듈형 패키징 도입

Editorial illustration: AMD ROCm 7.13이 MI350P GPU, 멀티 VF 가상화, TheRock 모듈형 패키징 도입

AMD는 2026년 5월 20일 ROCm 7.13을 발표했습니다. 오픈소스 AI 컴퓨팅 스택의 새 버전으로 MI350P GPU 지원, MI300X 가속기당 최대 8개의 격리된 vGPU 가상화, 투명한 성능 분석을 위한 오픈소스 ROCprof Trace 디코더, 도메인별 SDK를 갖춘 모듈형 TheRock 패키징이 도입됩니다. Ubuntu 26.04 및 RHEL 9.6에서 검증됐으며 MI350X 및 MI355X의 VMware ESXi 9.1 지원도 포함됩니다.

🟢 🔧 하드웨어 2026년 5월 16일 · 3 분 읽기

AMD ROCm: BubbleFence가 메타데이터 휴리스틱 대신 Vision Foundation 모델 임베딩으로 비디오 스트림을 분할합니다

Editorial illustration: 2D 공간에서 임베딩 버블 시각화가 있는 비디오 프레임.

BubbleFence는 AMD가 2026년 5월 15일 ROCm 블로그에서 발표한 새로운 AI 도구로, 의미적 누수 없이 비디오 스트림을 훈련/검증/테스트 세트로 의미적으로 분할하는 근본적인 ML 문제를 해결합니다. 기존의 메타데이터 기반 휴리스틱 대신, BubbleFence는 Vision Foundation 모델 임베딩(CLIP)과 LID 가중치를 사용한 적응형 버블을 사용하여 분할합니다. 자율 주행(Zenseact Open Dataset)과 Minecraft 게임플레이 시나리오에서 구성 변경 없이 시연되었습니다.

🟢 🔧 하드웨어 2026년 5월 15일 · 2 분 읽기

AMD ROCm: Quark + FlyDSL + AITER 추론 스택을 통한 MI325X에서의 Kimi-K2.5 W4A8 및 W8A8 양자화

편집 일러스트: W4A8 양자화 레이어와 추론 가속 아이콘이 있는 AMD MI325X GPU 다이어그램.

AMD ROCm Kimi-K2.5 MI325X용 양자화는 2026년 5월 14일에 공개된 새로운 추론 가속 청사진입니다. AMD Quark 양자화 툴킷을 사용하여 Kimi-K2.5 모델을 W4A8 및 W8A8 정밀도 형식으로 변환하고, FlyDSL 추론 서빙 레이어와 AITER 최적화 스택을 결합합니다. 이 접근 방식은 중국 프론티어 모델에 비 NVIDIA 추론 경로를 제공하며, MI325X를 오픈소스 LLM 서빙을 위한 H100/H200의 실행 가능한 대안으로 위치시키는 AMD의 전략을 보여줍니다.

🟡 🔧 하드웨어 2026년 5월 12일 · 2 분 읽기

AMD: Instinct MI355X가 세 가지 ComfyUI 워크플로에서 NVIDIA B200 초과——ROCm 7.2.0 PyTorch 최적화 활용

Editorial illustration: Instinct MI355X가 세 가지 ComfyUI 워크플로에서 NVIDIA B200 초과——ROCm 7.2.0 PyTorch 최적화 활용

AMD Instinct MI355X는 발표된 벤치마크에서 세 가지 ComfyUI 생성 워크플로——텍스트-투-비디오 Wan2.2(1.44×), 텍스트-투-이미지 FLUX.1-dev(1.42×), 3D Hunyuan3D v2.1(1.20×)——에서 NVIDIA B200을 초과하는 데이터센터 GPU입니다. ROCm 7.2.0의 AOTriton gfx950 커널, hipBLASLt GEMM 튜닝 등의 최적화 덕분입니다.

🟡 🔧 하드웨어 2026년 5월 12일 · 2 분 읽기

NVIDIA: Fleet Intelligence——대규모 GPU 플리트 실시간 관리 모니터링과 암호학적 무결성 검증

Editorial illustration: Fleet Intelligence——대규모 GPU 플리트 실시간 관리 모니터링과 암호학적 무결성 검증

NVIDIA Fleet Intelligence는 대규모 NVIDIA 데이터센터 GPU 플리트를 실시간으로 모니터링하는 관리형 서비스로——전력, 온도, 성능, ECC 오류를 감시하고——NVIDIA Remote Attestation Service를 통한 GPU의 암호학적 진위 확인을 제공합니다. Vera Rubin, Blackwell, Hopper GPU 소유자에게 무료로 제공됩니다.

🟡 🔧 하드웨어 2026년 5월 11일 · 1 분 읽기

vLLM: TurboQuant 연구에서 FP8이 KV-cache에서 여전히 우월——3bit-nc 정확도 약 20포인트 하락

Editorial illustration: TurboQuant 연구에서 FP8이 KV-cache에서 여전히 우월——3bit-nc 정확도 약 20포인트 하락

Red Hat AI 팀은 TurboQuant의 공격적인 KV-cache 양자화(3~4비트)를 FP8 표준과 체계적으로 비교했습니다. 결과에 따르면 FP8은 처리량과 정확도를 유지하는 반면 3bit-nc 변종은 AIME25 등 고난도 추론 벤치마크에서 약 20포인트의 정확도를 잃습니다.

🔴 🔧 하드웨어 2026년 5월 7일 · 2 분 읽기

NVIDIA: Spectrum-X 다중 경로 신뢰 연결이 기가급 AI 네트워크를 위한 OCP 개방 표준으로 채택

Editorial illustration: paralelne svjetlovodne staze između AI rack-ova s natpisom MRC, Spectrum-X i OCP open standard

NVIDIA Spectrum-X 다중 경로 신뢰 연결(MRC)은 단일 연결의 트래픽을 여러 네트워크 경로에 분산하는 RDMA 전송 프로토콜로, 오픈 컴퓨트 프로젝트(OCP)를 통해 개방 규격으로 공개되었습니다. MRC는 OpenAI, Microsoft Fairwater 데이터센터, Oracle Abilene 데이터센터에서 이미 운영 중이며 AMD, Broadcom, Intel, Microsoft와 공동 개발되었습니다.

🟡 🔧 하드웨어 2026년 5월 6일 · 1 분 읽기

AMD: FarSkip-Collective, AMD GPU에서 MoE 추론 속도 18~34% 향상

편집 일러스트: MoE 추론 중 유휴 블록 없이 AMD GPU 간을 흐르는 병렬 데이터 스트림

AMD ROCm 팀이 전문가 병렬 통신 중 GPU 유휴 시간을 제거하는 개선된 MoE 아키텍처인 FarSkip-Collective를 발표했습니다. 결과: Llama-4 Scout의 TTFT 18% 감소, DeepSeek-V3 최대 1.34배 가속, Moonlight 사전 훈련 단계 11% 향상.

전체 아카이브 보기 →