- 블랙웰 울트라 512 GPU로 라마 3.1 405B 64.6정확도 유지하며 처리량·전력 효율 동시 개선

 

엔비디아, NVFP4로 AI 훈련·추론 성능과 효율성 동시 향상.jpg

 

 

 

 

엔비디아가 4비트 부동소수점 정밀도 ‘NVFP4’를 앞세워 저정밀 AI 훈련·추론 경쟁에 속도를 높였다. 최신 MLPerf 훈련 벤치마크에서 블랙웰 울트라 GPU 512개로 구성한 GB300 NVL72 시스템이 라마 3.1 405B 사전 훈련을 64.6분 만에 완료하며, FP8 기반 GB200 NVL72 대비 최대 1.9배 빠른 성능을 기록했다. 처리량과 전력 효율을 동시에 개선하면서도 정확도 요건을 충족해 저정밀 포맷의 상용 적용 범위를 넓혔다.

 

저정밀 연산 전략, 공동 설계로 성능 구조 전환

최신 AI 모델은 규모와 복잡도가 커지며 훈련과 추론에 필요한 연산 수요가 급증하고 있다. 엔비디아는 칩과 시스템 아키텍처, 소프트웨어를 통합 설계하는 공동 설계 전략으로 세대별 성능 향상 폭을 확대했다NVFP4는 블랙웰 아키텍처부터 도입한 4비트 부동소수점 정밀도 포맷이다. 포맷 설계와 실리콘 구현, 라이브러리 지원, 훈련 레시피, 추론 최적화를 하나의 스택으로 통합해 저정밀 연산의 처리량 이점을 실제 워크로드에 적용했다는 설명이다.

 

블랙웰 울트라, NVFP4 기준 최대 15페타플롭스

블랙웰 울트라 GPUNVFP4 기준 최대 15페타플롭스의 처리량을 제공하며, 동일 GPUFP8 대비 최대 3배 높은 연산 밀도를 구현한다. 엔비디아는 FP8에서 NVFP4로 전환할 경우 6,710억 매개변수 규모의 MoE 모델 딥시크-R1’ 추론에서 토큰 처리량이 향상된다고 설명했다. 훈련 영역에서도 성과를 제시했다. 512개의 블랙웰 울트라 GPU로 구성한 GB300 NVL72 시스템은 NVFP4를 적용해 라마 3.1 405B 사전 훈련을 64.6분 만에 완료했다. 이는 이전 라운드에서 FP8 정밀도로 동일 벤치마크를 수행한 512개 블랙웰 GPU 기반 GB200 NVL72 대비 최대 1.9배 빠른 결과다.

 

정확도 요건 충족LLM 전반 적용 확대

MLPerf 훈련·추론 비공개 부문은 엄격한 정확도 기준을 충족해야 유효 제출로 인정된다. 엔비디아는 NVFP4를 적용해 여러 거대 언어 모델(LLM) 테스트 항목에서 정확도 요건을 충족했다고 밝혔다. 딥시크-R1, 라마 3.1 8B·405B, 라마 2 70B 등 다양한 모델에서 결과를 제출했다.

 HGX B200에서 MTP 미적용 FP8, MTP 적용 FP8, MTP 적용 NVFP4의 처리량 대 상호작용 곡선.jpg

생태계 확장 가속글로벌 기업 참여 확대

엔비디아 모델 옵티마이저, LLM 컴프레서, torch.ao 등을 통해 고정밀 모델을 NVFP4로 양자화할 수 있으며, 텐서RT-LLM, vLLM, SGLang 등 주요 추론 프레임워크도 NVFP4 포맷을 지원한다. 허깅 페이스에서는 라마 3.3 70B, FLUX.2, 딥시크-R1-0528, Qwen3-235B-A22B, Nemotron Nano NVFP4 버전을 제공하고 있다.

 라마(Llama) 3.1 405B 사전 훈련과 라마 2 70B LoRA 파인튜닝 성능을 각각 512-GPU와 8-GPU 규모에서 평가했다.jpg

Black Forest Labs, Radical Numerics, Red Hat 등도 NVFP4 기반 훈련·추론을 확대하고 있다. 블랙 포레스트 랩스 로빈 롬바흐 CEOCUDA Graphs, torch.compile, NVFP4, TeaCache를 결합해 단일 B200에서 최대 6.3배 속도 향상을 달성했다고 밝혔다.

 

루빈 플랫폼, NVFP4 성능 추가 도약 예고

엔비디아는 차세대 루빈(Rubin) 플랫폼에서 NVFP4 기준 훈련 연산 35페타플롭스, 추론 50페타플롭스를 목표로 한다고 밝혔다. 이는 블랙웰 대비 각각 3.5, 5배 향상된 수치다. NVFP4를 훈련과 추론 전반에 확산해 처리량과 전력 효율을 동시에 개선하는 전략을 이어갈 계획이다.

 딥시크-R1 모델 평가 점수에서 NVFP4가 FP8 기준선의 정확도와 매우 유사하게 일치함을 보여준다.jpg

#엔비디아 #NVFP4 #블랙웰울트라 #GB300NVL72 #MLPerf #AI훈련 #AI추론 #저정밀연산 #루빈

 

 
?

  1. 벡터코리아, AI 요구사항 기반 테스트 자동화 ‘VectorCAST 2026’ 출시… 단위 테스트 생성·추적성 통합

    - Reqs2x 적용, 요구사항 기반 단위 테스트 자동 생성과 인증 대응 프로세스 단순화 벡터코리아가 AI 요구사항 기반 테스트 생성 기능을 적용한 임베디드 소프트웨어 테스트 자동화 플랫폼 ‘VectorCAST 2026’을 출시하고, 요구사항 기반 단위 테스트 생성과 추...
    Date2026.03.30 Bynewsit Views36
    Read More
  2. SAP코리아, 아이아이컴바인드 글로벌 HR 통합 시스템 구축… SAP 석세스팩터스 기반 인사 데이터 일원화

    - LG CNS 협력 구축, 글로벌 조직 운영 위한 HR 데이터 표준 체계 적용 SAP코리아가 아이아이컴바인드에 SAP 석세스팩터스 기반 글로벌 인사 관리 시스템을 구축했다. LG CNS와 협력해 국가별로 분산된 HR 데이터를 하나의 체계로 통합하고 글로벌 조직 운영 ...
    Date2026.03.30 Bynewsit Views40
    Read More
  3. [GTC 2026] 엔비디아, ‘코리아 AI 엑스퍼트 데이’ 개최…에이전틱·피지컬 AI 산업 적용 공유

    - GTC 발표 핵심 기술 방향 소개…국내 기업·개발자 300여 명 참석 엔비디아가 GTC 2026에서 국내 AI 산업 관계자를 대상으로 ‘코리아 AI 엑스퍼트 데이(Korea AI Expert Day)’를 개최하고 에이전틱 AI와 피지컬 AI 중심 기술 방향과 산업 적용 사례를 공유했다...
    Date2026.03.27 Bynewsit Views32
    Read More
  4. 솔트웨어, AI DLP 기반 생성형 AI 보안 ‘사피가디언’ 공개…LLM 데이터 유출 통제 지원

    - 프롬프트 입력·출력 전 구간 정책 필터링으로 생성형 AI 보안 관리 대응 솔트웨어가 ‘eGISEC 2026’에서 AI DLP(Data Loss Prevention) 기반 생성형 AI 보안 솔루션 ‘사피가디언(Sapie-Guardian)’을 공개하며 생성형 AI 활용 과정에서 증가하는 데이터 유출 ...
    Date2026.03.27 Bynewsit Views31
    Read More
  5. 티맥스소프트, 제4회 ‘상용·AI SW 마켓 페어’ 참가…인터페이스 플랫폼 4종 전시

    - 애니링크·애니API·애니EIMS·애니Sim으로 공공 AX 환경 DB-AI 연계 대응 티맥스소프트가 ‘상용·AI SW 마켓 페어’에서 인터페이스 플랫폼 4종을 전시하며 클라우드·온프레미스·AI 플랫폼이 함께 운영되는 공공 IT 환경의 시스템 연계 수요 증가에 대응한다. 공...
    Date2026.03.27 Bynewsit Views32
    Read More
  6. 딥엘, DeepL Voice 벤치마크 공개…실시간 음성 번역 정확도·자막 안정성 1위

    - 언어 전문가 96% 선택, 구글 미트·팀즈·줌 대비 번역 오류율 최대 76% 감소 딥엘이 실시간 음성 번역 솔루션 DeepL Voice 벤치마크 결과를 공개했다. 슬레이터(Slator)가 수행한 블라인드 테스트에서 번역 품질과 자막 안정성 평가 모두 주요 협업 플랫폼 대...
    Date2026.03.26 Bynewsit Views42
    Read More
  7. 헥사곤, SIMTOS 2026 참가…정밀 측정·AI 기반 제조 솔루션 공개

    - 3차원 측정기·대형 구조물 자동화 검사·AI CAM 기술 전시, 데이터 기반 제조 품질 관리 구조 제시 헥사곤이 SIMTOS 2026에서 정밀 측정 장비와 자동화 검사 시스템, AI 기반 CAM 소프트웨어를 공개한다. 측정 데이터와 제조 공정을 연결하는 제조 인텔리전스...
    Date2026.03.26 Bynewsit Views25
    Read More
  8. 세일포인트, AWS 협력 에이전틱 AI 보안 확장…통합 아이덴티티 거버넌스 레이어 구축

    - 인간·머신·AI 에이전트 통합 관리 구조 적용, 지속적 권한 제어 기반 보안 체계 확장 세일포인트가 AWS와 전략적 협력 계약(SCA)을 체결하고 에이전틱 AI 환경을 위한 통합 아이덴티티 거버넌스 레이어 구축을 추진한다. AWS 환경에서 인간과 머신, AI 에이...
    Date2026.03.26 Bynewsit Views31
    Read More
  9. 옥타브, IDC 마켓스케이프 EAM 리더 선정… AI 기반 자산 생애주기 관리 구조 평가

    - 자산 계획·정비·운영 데이터 연결하는 EAM 플랫폼 역량 반영 옥타브가 IDC가 발표한 ‘IDC 마켓스케이프: 2025-2026년 전 세계 AI 기반 자산집약 산업용 엔터프라이즈 자산 관리(EAM) 애플리케이션 제공업체 평가’에서 리더로 선정됐다. 자산 계획부터 유지보...
    Date2026.03.25 Bynewsit Views20
    Read More
  10. 한국퀀텀컴퓨팅, 에어큐브와 PQC 기반 패스워드리스 인증 PoC 추진

    - 양자내성암호와 IAM 결합해 NPE 키 관리 구조 검증 한국퀀텀컴퓨팅(KQC)이 에어큐브와 PQC(Post-Quantum Cryptography) 기반 패스워드리스 인증 모델 공동 검증에 나선다. 양자내성암호와 통합 인증·접근관리(IAM)를 결합해 비밀번호 없이 동작하는 인증 구...
    Date2026.03.25 Bynewsit Views24
    Read More
목록
Board Pagination Prev 1 2 3 4 5 6 7 8 9 10 ... 236 Next
/ 236
CLOSE