惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

P
Proofpoint News Feed
V
V2EX
WordPress大学
WordPress大学
Google DeepMind News
Google DeepMind News
Martin Fowler
Martin Fowler
小众软件
小众软件
Blog — PlanetScale
Blog — PlanetScale
月光博客
月光博客
The Cloudflare Blog
T
Tailwind CSS Blog
H
Help Net Security
腾讯CDC
爱范儿
爱范儿
人人都是产品经理
人人都是产品经理
H
Hackread – Cybersecurity News, Data Breaches, AI and More
The GitHub Blog
The GitHub Blog
Microsoft Security Blog
Microsoft Security Blog
Stack Overflow Blog
Stack Overflow Blog
D
DataBreaches.Net
C
Check Point Blog
量子位
酷 壳 – CoolShell
酷 壳 – CoolShell
美团技术团队
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com

ZDNet Korea

여기어때, 해양 관광 레저·티켓 할인 쿠폰 쏜다 11번가, 5월 바다여행지 숙박·체험 상품 할인 패스트파이브, 작년 매출 1500억원·영업익 60억원 혼다코리아, '뉴 파일럿 블랙 에디션' 사전 계약…7880만원 카카오엔터 추천 4월 화제의 신작 웹툰 4선 휴먼컨설팅그룹, 연구개발 허브 ‘양재센터’ 신설 더벤처스, K뷰티 '클레버스텝스' 시드 투자 민주당 "지방선거 이후 디지털자산기본법 논의 본격화" KFC, 가맹점주 대상 프랜차이즈 컨벤션 개최 스타벅스, 장애인의 날 맞아 공모전 수상작 굿즈 출시 "URL 포함된 고유가 지원금 알림 문자는 사기" 2025년 원화 결제 수출 비중 3.4%…역대 최고 삼양사, 국제베이커리페어 첫 참가…냉동생지 ‘프레팡’ 공개 문체부 콘텐츠 R&D 확대, 현장 체감은 엔비디아, '빌드 어 클로' 한국 첫 공개…"AI 에이전트 직접 구축" LS일렉트릭, 북미 데이터센터에 1700억 규모 전력 설비 공급 스타스테크, 콜라겐 스킨케어 ‘라보페’ 리브랜딩...국내외 유통망 확장 네이버 사우디 직원들 다시 사무실로…중동 사업 재궤도 올해는 결론 나오나…배달앱 사회적 대화기구 재출범부터 ‘균열’ [이종천] 2026년 통신시장, 아직 단통법 시절 ‘금난전권’ 그림자에 갇혀 있는가 KOSA, 의료·바이오 AI 인재 양성…실무형 교육 강화 빅밸류, 10년 만 첫 흑자…"올해 매출 100억원 목표" 트럼프, 호르무즈 해협 봉쇄령…"이란에 통행료 낸 선박 차단" 우리 동네 교통·안전 문제, ‘도시 데이터’로 해결 환경분야 시험·검사 전문성 ↑…산업계 수요 반영, 고난도 분석기술 교육 靑 "종전선언까지 비상대응...매점매석 금지 추가검토" "D램 가격 상승률, 1분기 70%→2분기 30~50%로 둔화 전망" "판교 정보보호클러스터 확 달라져"...9년만에 시설 대폭 개선 보안 개념이 바뀐다...'미토스 보고서' 7월 발표 벤츠, 전국 어디서나 같은 가격…다이렉트 직판제 전환
엔비디아, 구글 '디퓨전젬마' 지원…"로컬 AI 추론 속도 높여"
김미정 · 2026-06-12 · via ZDNet Korea

엔비디아가 구글딥마인드 디퓨전 언어 모델을 그래픽처리장치(GPU)와 개인용 인공지능(AI) 시스템에 최적화했다. 

엔비디아는 구글딥마인드 '디퓨전젬마'를 지포스 RTX GPU와 RTX 프로 플랫폼, DGX 스파크 시스템 전반에서 더 빠르게 실행할 수 있도록 최적화했다고 12일 밝혔다.

디퓨전젬마는 텍스트를 한 단어씩 순차 생성하는 기존 자기회귀 방식과 달리 여러 단어를 병렬로 생성한다. 각 단계에서 최대 256개 토큰을 디노이징해 텍스트 블록 전체를 출력하는 구조다.

엔비디아가 구글딥마인드 디퓨전 언어 모델을 그래픽처리장치(GPU)와 개인용 인공지능(AI) 시스템에 최적화했다. (사진=엔비디아)

이 방식은 대화형 채팅과 에이전틱 루프, 온디바이스 어시스턴트처럼 응답 속도가 중요한 단일 사용자 작업에 적합하다. 개발자와 연구자, AI 사용자는 로컬 기기에서 기존보다 빠른 텍스트 생성을 활용할 수 있다.

디퓨전젬마는 젬마 4 기반으로 구축됐다. 젬마 4는 260억 개 파라미터를 갖춘 전문가 혼합 모델이며, 단계마다 38억 개 파라미터를 활성화한다.

엔비디아는 디퓨전젬마가 동급 자기회귀 모델보다 최대 4배 빠른 성능을 제공한다고 설명했다. 단일 엔비디아 H100 텐서 코어 GPU에서는 초당 1천 개 토큰, DGX 스파크에서는 초당 150개 토큰, DGX 스테이션에서는 최대 초당 2천 개 토큰 성능을 낸다.

구글딥마인드는 디퓨전젬마를 연구·실험 목적용이라고 당부했다. 속도와 병렬 생성에 초점을 맞춘 만큼 전체 출력 품질은 기존 자기회귀 기반 젬마4 모델보다 낮다고 밝혔다.

디퓨전젬마는 아파치 2.0 라이선스 기반 오픈 웨이트 모델로 제공된다. RTX와 DGX 스파크에서 완전히 실행될 수 있으며 클라우드나 토큰당 비용 없이 허깅페이스 트랜스포머, vLLM, 언슬로스에서 기본 지원된다.

관련기사

엔비디아는 DGX 스파크와 RTX 프로 6000 워크스테이션, DGX 스테이션에서 디퓨전젬마 실행을 지원한다. 지포스 RTX 그래픽처리장치에서는 향후 라마.cpp 지원도 추가될 예정이다.

개발자는 허깅페이스 트랜스포머를 통해 지포스 RTX 5090이나 DGX 스파크에서 디퓨전젬마를 테스트할 수 있다. 더 높은 처리량이 필요한 경우 vLLM을 활용할 수 있으며 언슬로스와 엔비디아 네모 프레임워크를 통해 파인튜닝도 가능하다.