엔비디아, 추론 성능 가속화하는 새로운 소프트웨어 텐서RT-LLM 출시 Page 1:: 보드나라

뉴스

단신뉴스

오늘의 주요뉴스

메인

전송 2023-09-12 10:45

[뉴스/보도자료]
엔비디아, 추론 성능 가속화하는 새로운 소프트웨어 텐서RT-LLM 출시

엔비디아(www.nvidia.co.kr)가 새로운 소프트웨어 엔비디아 텐서RT-LLM(NVIDIA TensorRT-LLM)을 출시했다고 밝혔다.

텐서RT-LLM은 대규모 언어 모델이 발전함에 따라 오픈 소스 모듈식 파이썬 API(Python API)를 통해 사용 편의성과 확장성을 개선하고, 쉽게 사용자 맞춤화할 수 있다. 파이썬 API는 새로운 아키텍처와 개선 사항을 정의, 최적화, 실행할 수 있다. 예를 들어, 모자이크ML은 텐서RT-LLM 위에 필요한 특정 기능을 원활하게 추가하고 추론 서비스에 통합했다.

H100은 단독으로도 A100보다 4배 빠른 속도를 보여준다. 인플라이트 배칭 등 텐서RT-LLM의 성능을 추가하면 속도가 총 8배로 증가해 최고의 처리량을 제공한다.최근 메타가 출시한 언어 모델 라마2(Llama 2)는 생성형 AI를 통합하려는 여러 조직에서 널리 사용되고 있다. 이 라마2에서 텐서RT-LLM은 A100 GPU에 비해 추론 성능을 4.6배 가속화할 수 있다.

라마2와 같은 최신 대규모 언어 모델에서는 700억 개의 파라미터를 사용하더라도 고객은 A100 기준 대비 4.6배의 성능 속도 향상을 실현한다. 이로써 총소유비용은 3배, 소비 에너지는 3.2배 절감할 수 있다.

텐서RT-LLM은 개별 가중치 행렬을 여러 디바이스에서 분할하는 모델 병렬 처리의 일종인 텐서 병렬 처리(Tensor Parallelism)를 사용한다. 이를 통해 개발자의 개입이나 모델 변경 없이도 각 모델이 NV링크(NVLink)를 통해 연결된 여러 GPU와 서버에서 병렬로 실행돼 대규모 추론을 효율적으로 수행할 수 있게 됐다.

또한 텐서RT-LLM에는 오늘날 프로덕션 환경에서 널리 사용되는 많은 대규모 언어 모델의 최적화되고 바로 실행 가능한 버전이 포함돼 있다. 여기에는 메타의 라마 2, 오픈AI(OpenAI)의 GPT-2 와 GPT-3, 팔콘(Falcon), 모자이크 MPT(Mosaic MPT), 블룸(BLOOM) 등 12가지가 포함되며, 모두 사용이 간편한 텐서RT-LLM 파이썬API로 구현할 수 있다.

이러한 기능을 통해 개발자는 사실상 모든 업계의 요구 사항을 충족하는 맞춤형 대규모 언어 보델을 더 빠르고 정확하게 만들 수 있다.

인플라이트 배칭을 사용하면 전체 요청이 완료될 때까지 기다렸다가 다음 요청 세트로 넘어가는 대신, 텐서RT-LLM 런타임이 완료된 시퀀스를 배치에서 즉시 제거한다. 그런 다음 다른 요청이 아직 전송 중인 동안 새 요청을 실행한다. 인플라이트 배칭과 추가적인 커널 수준 최적화를 통해 GPU 사용량을 개선하고 H100 텐서 코어 GPU의 실제 대규모 언어 모델 요청 벤치마크에서 처리량을 최소 두 배 이상 증가시켜 총소유비용을 최소화하고 에너지 비용을 절감한다.

텐서RT-LLM이 탑재된 엔비디아 H100 GPU(H100 GPU)를 사용하면 모델 가중치를 새로운 FP8 형식으로 쉽게 변환하고, 최적화된 FP8 커널을 자동으로 활용하도록 모델을 컴파일할 수 있다. 이는 호퍼 트랜스포머 엔진(Hopper Transformer Engine) 기술을 통해 가능하며, 별도로 모델 코드를 변경할 필요가 없다.

H100에 도입된 FP8 데이터 포맷을 통해 개발자는 모델을 정량화하고 모델 정확도를 저하시키지 않으면서 메모리 소비를 획기적으로 개선한다. FP8 양자화는 INT8 또는 INT4와 같은 다른 데이터 형식에 비해 높은 정확도를 유지하면서도 가장 빠른 성능을 달성하고 가장 간단한 구현을 제공한다.

텐서RT-LLM은 프로덕션 환경에서 추론을 위한 대규모 언어 모델을 정의, 최적화, 실행하기 위한 간단한 오픈 소스 파이썬 API에 텐서RT의 딥 러닝 컴파일러, 최적화된 커널, 사전, 사후 처리, 멀티 GPU/멀티 노드 통신으로 구성된다.

엔비디아 텐서RT-LLM은 현재 얼리 액세스 버전으로 제공된다. 아울러 보안, 안정성, 관리 용이성, 지원 등을 갖춘 엔터프라이즈급 AI 소프트웨어 플랫폼인 엔비디아 AI 엔터프라이즈(AI Enterprise)의 일부인 엔비디아 네모 프레임워크에 통합될 예정이다. 개발자와 연구자는 NGC의 네모 프레임워크 또는 깃허브(GitHub)의 소스 레포지토리를 통해 텐서RT-LLM에 액세스할 수 있다.

얼리 액세스 릴리스를 신청하려면 엔비디아 개발자 프로그램(Developer Program)에 등록돼 있어야 한다. 또한 기업용 이메일 주소로 로그인해야 한다. 지메일(Gmail), 야후(Yahoo), 큐큐(QQ) 또는 기타 개인 이메일 계정을 사용하는 계정에서는 신청을 받을 수 없다.

태그(Tag) : AI, 엔비디아

관련 기사 보기

[영상] NVIDIA RTX SPARK는 인텔과 AMD의 X86 노트북 시장을, AI를 무기로 정복할 수 있을까?
[영상] 하나도 새롭지 않은 엔비디아의 개인용 AI 노트북, RTX SPARK와 젠슨 황 Q&A까지
[영상] 정말 쉬운 엔비디아 젠슨황 키노트 해설과 중요 QnA 설명, 그리고 컴퓨텍스의 위기
[영상] 석 달째 횡보하는 PC시장 메모리 가격, 하반기 메모리 모듈 가격의 향방은?
[영상] 비싼 메모리 시대에 램버스 실패로 알아보는, AI 시대 메모리 확보 전쟁의 끝은? [PC흥망사 17-2]
[영상] 엔비디아 지싱크 펄사(Pulsar)는 어떻게 잔상을 근본적으로 없애는가?, 펄사 지원 모니터 ASUS ROG Strix Pulsar XG27AQNG
태그(Tags) : AI, 엔비디아 관련기사 더보기

		편집부 / 필명 편집부 / press@bodnara.co.kr

		기자가 쓴 다른 기사 보기

이기사와 사진은 업체에서 제공받은 보도자료와 사진으로, 보드나라의 논조와는 다르다는 점을 알려드립니다.

보드나라 많이본 기사

커스텀 스팀머신의 시대? 밸브 스팀OS에 AMD 외장 그래픽 지원 시작

Let’s 클로! MSI 클로 8 EX AI+ 얼리버드 예판 진행

엔비디아, LG그룹과 AI 팩토리 구축 협력 피지컬 AI 모빌리티 AI 인프라 혁신 가속화

지클릭커, 제주 감성 담은 풀윤활 스위치로 완성한 '파도프로젝트 PADO87' 매크로 무선 기계식 키보드 출시

작지만 탄탄한 AM5 게이밍 메인보드, 기가바이트 B850M GAMING X WIFI6E 제이씨현

최고급 성능 게이밍 CPU 라이젠 7 9800X3D, 싱글 vs 듀얼 채널 메모리 게임 성능 차이는?

크리에이터를 위한 고성능 가성비 CPU, 인텔 코어 울트라 200S Plus

정말 쉬운 엔비디아 젠슨황 키노트 해설과 중요 QnA 설명, 그리고 컴퓨텍스의 위기

이 기사의 의견 보기

닉네임

웹봇방지

2026년 07월

주간 히트 랭킹

작지만 탄탄한 AM5 게이밍 메인보드, 기가바이트 B850M G

최고급 성능 게이밍 CPU 라이젠 7 9800X3D, 싱글 vs 듀얼

크리에이터를 위한 고성능 가성비 CPU, 인텔 코어 울트라

정말 쉬운 엔비디아 젠슨황 키노트 해설과 중요 QnA 설명

붉은사막 열풍의 동반자, 인텔 코어 울트라 5 250K Plus

더운 여름 속 시원한 성능으로 달린다, 기가바이트 지포

미니멀리즘 추구한 와이파이 익스텐더, ipTIME Extender-

하나도 새롭지 않은 엔비디아의 개인용 AI 노트북, RTX S

USB-C 포트 하나로 확장성과 충전까지, ipTIME UC305HDMI

실용적인 16포트 기가비트 스위치 허브, ipTIME SG16R-mi

TCL A400M	커세어 3200D	젠하이저 모멘텀 5 와이어



다크플래쉬, 실속 더한 18,	델 네트워킹 Z9500 이더넷	BL2423PT



삼성전자 NX3000	엡손 워크포스 DS-40 모바	플렉스터 M6e M.2 SSD