엔비디아가 오픈 모델과 소프트웨어, 개발자 도구, 하드웨어를 아우르는 로컬 AI 생태계를 확대한다. AI 개발자와 애호가들이 클라우드에 의존하지 않고 자체 환경에서 에이전틱 AI를 구축하고 맞춤화할 수 있도록 다양한 모델과 개발 도구, 가속 컴퓨팅 플랫폼을 선보인다.

대표적으로 엔비디아는 30억 개가 아닌 300억 파라미터 규모의 오픈 웨이트 전문가 혼합(MoE) 모델인 네모트론 3.5 라이트닝을 공개했다. 동급 오픈 모델보다 최대 4배 빠른 토큰 생성 속도와 최대 30% 짧은 작업 완료 시간을 제공하며, 사용자가 자체 데이터를 활용해 특정 업무나 분야에 맞게 파인튜닝할 수 있다. vLLM, 올라마, llama.cpp, LM 스튜디오 등 주요 로컬 AI 플랫폼과도 연계되며 RTX PC, DGX 스파크, 젯슨 등 다양한 엔비디아 시스템에서 실행할 수 있다.
기업의 AI 비용 부담을 줄이기 위한 네모 스위치야드도 공개됐다. 오픈소스 라우팅 라이브러리인 네모 스위치야드는 에이전트 작업의 각 단계에 적합한 모델을 자동으로 연결해 성능과 비용을 조절할 수 있도록 지원한다. 엔비디아 내부 벤치마크에서는 프론티어 수준의 작업 완료 성능을 유지하면서 비용을 크게 낮출 수 있는 것으로 나타났다.
DGX 스파크를 여러 대 연결해 하나의 클러스터로 구성할 수 있는 엔비디아 싱크 클러스터 어시스턴트도 선보인다. 개발자는 복잡한 네트워크 설정 없이 여러 시스템을 연결해 대규모 모델의 추론과 학습 성능을 확장할 수 있다. 이와 함께 실시간 CPU·GPU 사용량을 확인할 수 있는 리소스 모니터와 DGX 스파크용 네이티브 ARM64 구글 크롬 지원도 추가될 예정이다.
엔비디아는 메타의 300억 파라미터 규모 오픈 모델 뮤즈 글리머와 LTX의 오픈 비디오 생성 모델 LTX-2.5 등 다양한 로컬 AI 모델도 지원한다. 뮤즈 글리머는 코딩과 장시간 에이전트 작업에 특화됐으며 RTX 5090에서 초당 200토큰 이상의 성능을 제공한다. LTX-2.5는 영상 품질과 프롬프트 반영 성능을 개선하고 RTX GPU와 DGX 스파크 등에서 로컬 영상 생성이 가능하도록 최적화됐다.
이 밖에도 로보틱스·자율주행용 코스모스 3 엣지, 미니맥스-H3, 풀사이드 AI의 라구나 S 2.1, 딥시크 V4 플래시, 싱킹 머신스 랩의 잉클링-스몰, 알리바바의 완-애니메이트-2 등 다양한 오픈 모델이 엔비디아 GPU 생태계에 합류한다. 엔비디아는 이를 통해 개인 개발자부터 기업까지 로컬에서 AI 모델을 실행하고 파인튜닝하는 환경을 확대해 나간다는 전략이다.
|