기획
 






 
 
 




전송 2010-03-27 07:00
[테크닉]

드디어 출시된 엔비디아 Fermi, 지포스 GTX 400 완벽 분석

1. 처음 2. GT200보다 두 배로 늘어난 지포스 GTX 400
3. DX11에 최적화된 지포스 GTX 400 4. GPGPU에 보다 최적화된 지포스 GTX 400
5. 3D 비전 서라운드 지원하는 지포스 GTX 400 6. 지포스 GTX 400 시리즈 스펙 및 발표회 현장

     2. GT200보다 두 배로 늘어난 지포스 GTX 400


지포스 GTX 400 시리즈에 사용된 Fermi GF100 (이하, GF100)은 GT200처럼 범용컴퓨팅과 그래픽컴퓨팅용으로의 2가지 분야에 적합한 아키텍처가 적용되지만, GT200보다 레이트레이싱과 지오메트릭을 포함하고 DirectX 11의 특징인 테셀레이션 등을 경쟁사 제품보다 강화하여 GPU 컴퓨팅과 그래픽처리에도 큰 개선이 이루어졌다.

 

DX11 지원 지포스 GTX 400, 두 배로 증가된 내부 구조

[2배로 늘어난 스트림 프로세서 등을 구성]

GF100은 GT200의 14억 개 트랜지스터보다 16억 개가 증가되어 2배 이상 증가된 30억 개의 트랜지스터를 내장하는데 여기에는 2배로 늘어난 스트림 프로세서, 1.5배 늘어난 ROP, GDDR5 메모리 적용으로 2배 늘어난 데이터 전송률을 제공한다.

이러한 구성을 바탕으로 GPGPU를 위한 범용컴퓨팅과 그래픽처리를 위한 아키텍처의 두 가지를 모두 갖추고 GT200 시리즈보다 더욱 강화된 범용컴퓨팅 처리 성능을 갖췄다. 특히, GF100은 레이트레이싱과 지오메트리 연산을 위한 기능을 파이프라인에 내장하여 이전보다 사실적인 그래픽 효과를 표현할 수 있게 되었다.

 

쿼드코어화된 GF100

[모듈화된 GPC 1개가 코어 하나, 최대 4개의 GPC로 쿼드코어화]

GF100의 범용컴퓨팅에 강화된 아키텍처를 갖는 부분 외에도 쿼드코어화된 구조도 갖추고 있다. 라데온 HD 5800 시리즈는 듀얼코어화로 GPU의 발전된 모습을 보여주고 있지만, GF100은 모듈화된 GPC로 쿼드코어화를 구성해 그래픽처리와 범용컴퓨팅 처리 능력을 더욱 개선하고 있다.

GF100은 4개의 GPC (Graphics Processing Cluster)를 최대로 구성할 수 있다. GT200은 TPC (Texture/ Thread Processing Clusters)라는 개념이 사용되어 그래픽 프로세싱과 범용컴퓨팅에 사용되었는데 GF100은 GPC를 통해 더욱 이를 발전시키고 있다. GPC 모듈화 구성을 통해 범용컴퓨팅에서는 16코어, 그래픽처리에는 4코어로 활용할 수 있게 된다.

GF100은 GPC 구조와 기가스레드 (GigaThread) 엔진을 개선하여 GT200이 한 번에 하나의 커널 프로그램을 실행했다면, GF100은 다수의 커널 프로그램을 동시에 실행할 수 있는 발전된 멀티 스레드 개념을 적용하고 있다.

 

쿠다코어는 GT200 대비 4배 증가, 정수와 실수연산 개선

[GT200 대비 4배로 증가된 SM (Streaming Multiprocessor)]

3세대 SM (Streaming Multiprocessor)를 내장하고 있는 GF100은 GT200 (8개)의 4배인 32 쿠다코어 (CUDA Cores, Streaming Processor 또는 Thread Processor가 CUDA Cores로 네이밍 변경)를 제공해 총 512 쿠다코어를 구성할 수 있다.

또한, 증가된 쿠다코어 등을 바탕으로 범용컴퓨팅 분야 (HTC 어플리케이션, Linear Algebra, Mumerical Simulation, Quantum Chemistry 등)에 활발하게 사용되고 있는 더플 프리시전 (Double Precision Floating Point) 연산 성능도 GT200의 8배에 이르는 향상을 가져왔다. 이 외에도 명령어 처리를 위한 듀얼 Warp 스케쥴러와 2개의 디스패치가 포함되며, 클럭 당 32 스레드 처리가 가능하다. L1 캐쉬와 공유 메모리 파티셔닝이 가능한 64KB (16KB + 48KB)RAM도 제공된다. Atomic 메모리 오퍼레이션 성능도 GT200보다 크게 향상되어 범용컴퓨팅에 더욱 유리해졌다.

 

GF100의 CUDA 코어는 16개 그룹이 2개, SFU 4개, 로드/ 스토어 유닛 16개 그룹으로 구성되며, 32 스레드로 구성되는 1 Warp는 하나의 명령을 2 사이클에 실행할 수 있는 구조를 가진다. Warp는 32 스레드 단위로 처리되며, Warp 내의 스레드는 같은 명령을 실행하는 구조를 가진다. (SM 스케쥴 스레드는 Warp로 불리는 32개 병렬 스레드 그룹으로 구성되며, 각 SM은 2개의 Warp 스케쥴러와 2개의 명령 디스패치 유닛을 내장한다.) GPC 4개의 그룹은 Warp 스케쥴러가 병렬로 다른 명령을 실행할 수 있는 구조로 자유도를 높였다.

쿠다코어는 산술 논리 연산장치인 ALU (정수, Arithmetic Logic Unit)와 부동소수점 연산장치인 FPU (실수, Floating Point Unit)를 내장하고 있으며, IEEE 745-1985 표준을 따르던 GT200은 24bit 정수 연산을 지원하였던 것과 달리 IEEE754-2008 표준에 따른 32bit 정수 처리와 64bit 연산도 확장하여 지원된다.

또, FMA (Fused Multiply-Add)는 덧셈과 곱셈 연산을 동시 수행하는데 이를 지원해 이들 계산의 효율을 향상시키고 있다. 16개의 로드/ 스토어 유닛은 클럭 당 16개의 스레드를 처리할 수 있고 캐쉬 및 메모리 간의 데이터 교환을 통해 효율을 크게 높였다.

SFU (Special Function Unit)은 4개가 포함되며, 클럭 및 스레드 당 하나의 연산을 처리한다. SFU는 사인, 코사인, 역수, 제곱근 등을 연산하는 특수 유닛으로 그래픽 인터폴레이션 기능도 지원한다.

텍스처 유닛은 SM (Streaming Multiprocessor) 당 4개를 독립적으로 지원하며, 각 텍스처 유닛은 클럭 당 텍스처 주소 계산 및 4개의 텍스처 샘플을 불러올 수 있다. GF100은 최대 64개의 텍스처 유닛을 가지며, 지포스 GTX 470은 56/ GTX 480은 60개로 GT200의 최대 80개보다 줄어 텍스처 비중이 높은 게임 등에서는 불리할 것으로 예상된다.

GF100은 2세대 병렬 스레드 실행 ISA를 바탕으로 C++ 지원을 위한 공유 주소 공간 제공을 비롯하여 범용컴퓨팅을 위한 OpenCL과 DirectCompute에도 이전보다 최적화된 모습을 가진다. 입출력 예측성능도 개선되었다.

 

Fermi GF100은 병렬 커널 실행 지원

[기가스레드 (GigaThread) 엔진의 병렬 커널 실행]

DirectX 11의 주요한 특징 중 하나는 멀티스레드 처리 효율의 증대인데 GPC 모듈화로 쿼드코어화된 구조를 바탕으로 명령어의 병렬 처리 성능을 향상시켰다. 또, GF100은 기가스레드 (GigaThread) 엔진을 통해 시리얼 방식이던 기존 아키텍처에서 벗어나 병렬 커널을 실행할 수 있게 된다.

PhysX 프로그램 실행시 순차 실행하면 스레드 프로세서는 단지 절반만 이용되나 GF100은 다른 커널을 같은 CUDA로 동시 실행 가능하다. GPU 리소스의 최적화 지원을 통해 커널들은 서로 다른 어플리케이션 구조에 따라 순서대로 실행되며, 구조 간의 스위칭 성능 효율을 크게 개선했다. GF100은 어플리케이션 구조 스위칭을 10배 증가시키고 있다.

 

그래픽연산과 범용컴퓨팅을 고려한 캐쉬구조

지포스 GTX 480과 GTX 470의 ROP와 캐쉬, 메모리 인터페이스 구성은 블록다이어그램을 참고하여 나뉘어진 구성을 보면 위 표와 같다. 현재까지 가장 상위의 지포스 GTX 480은 8개의 ROP 그룹과 6개의 메모리 인터페이스 그룹으로 48 ROP와 768KB의 공유 L2 캐쉬, 메모리 인터페이스는 384bit를 가지며, GTX 470은 8개 ROP 그룹과 5개의 메모리 인터페이스 그룹으로 40 ROP와 공유 L2 캐쉬 640KB, 320bit 메모리 인터페이스가 적용된다. 이후 등장할 제품들은 8/4, 8/3, 8/2, 8/1 그룹으로 구성될 것으로 예상해볼 수 있다.

 

캐쉬 구조 역시 범용컴퓨팅과 그래픽연산을 위해 효율적인 구조로 교체되었으며, 메모리 접근시 발생하는 시간을 줄였다. 이는 새롭게 구성된 캐쉬 구조를 통해 버텍스 정보와 픽셀 쉐이더 처리 및 렌더 아웃풋시의 메모리 접근을 줄일 수 있기 때문이다.

GF100은 L1 캐쉬 64KB를 제공하는데 사용에 따라 16 + 48KB로 분할해 사용할 수 있으며, 공유 L2 캐쉬 768KB는 버텍스, 쉐이더, 텍스처와 ROP 데이터 공유에 주로 쓰인다. 캐쉬 효율과 공유 메모리, 공유 L2 캐쉬의 용량이 이전보다 3배 증가했다. 이를 바탕으로 전반적인 처리효율 및 성능을 개선할 수 있게 되었다.

 

GF100은 ECC를 지원하는 첫 GPU로 소개되고 있는 병렬컴퓨팅 분야를 제외한 그래픽컴퓨팅 분야에서는 필요성이 적기 때문에 지포스 GTX 400 시리즈에서는 이 기능이 사용되지 않는 것으로 알려지고 있다.

 

GDDR5 메모리 적용, 클럭 스위칭

AMD ATI의 경우 라데온 HD 4800 시리즈로 넘어오면서부터 GDDR5 메모리를 적용했지만, 엔비디아는 40nm 공정을 적용한 GT240에서 GDDR5를 처음 적용하고 GF100으로 넘어와 고클럭의 GDDR5 메모리를 적용했다.

GDDR3를 사용하던 GT200과 비교하여 메모리 인터페이스는 512bit에서 384/ 320bit로 줄어 G80 GPU와 비슷한 구성을 하고 있다. 하지만, 고클럭 GDDR5 메모리를 적용하는 만큼 전송률 향상을 바탕으로 대역폭을 증가시킬 수 있게 되었다. 또, 경쟁사처럼 GDDR5 메모리는 클럭 및 전압을 부하에 따라 스위칭하여 전력효율을 높여주고 있다.

 

32x CSAA 지원과 TMAA 품질 향상, AA 효율과 성능도 개선

[32x CSAA 지원 및 AA 효율과 성능 개선]

GF100은 최대 48 ROP를 지원하며, 지포스 GTX 470과 GTX 480은 각각 40/ 48 ROP를 지원하여 AA 효율 및 처리 성능을 개선하게 된다. ROP 유닛은 클럭 당 32bit 정수 픽셀 처리, FP16 픽셀은 2클럭, FP32 픽셀은 4클럭 처리가 이루어진다.

 

GF100의 텍스처 유닛은 Directx 11의 텍스처 압축 포맷 지원으로 HDR 렌더링을 지원할 수 있게 해준다. 또, 32x CSAA (8xMSAA (8 컬러 샘플) + 24 CSAA (Coverage Sampling Anti-Aliasing)를 지원하여 보다 자연스럽고 개선된 AA 품질을 얻으면서 성능 저하를 줄일 수 있게 만들어준다. AA 처리 성능도 GF100은 GT200대비 2배 높은 처리 성능을 제공하며, Shadow-map 처리도 3배 이상 향상된 것으로 소개되었다.

또한, TMAA (Transparency Multisample AA)를 적용해 DirectX 9에서 지원하지 못하는 Alpha to Coverage를 사용하도록 쉐이더 코드를 변환해 향상된 이미지 품질을 얻을 수 있게 해준다.

 

지포스 GTX 470과 GTX 480에 사용된 GF100은 DirectX 11 지원에 최적화된 모습을 보여주고 있으며, 확장성도 GT200 (GTX 200 시리즈에 사용되는 GPU)보다 크게 증가되고 있다. 지금까지 살펴본 GF100을 정리하면 아래와 같다.

- DirectX 11과 GPGPU에 보다 최적화된 아키텍처
- 테셀레이터 및 멀티스레딩 능력 강화 (동시실행 능력)
- GT200 대비 최대 8배 향상된 지오메트리 성능
- PhysX 최대 2.5배, AI 및 Ray-Tracing 3.5배 처리 향상
- 쿠다코어 최대 512 적용 (GTX 480 480/ GTX 470 448)
- 고클럭 GDDR5 메모리 사용 및 에러정정 기능 포함
- 텍스처 처리 유닛 최대 64개, 텍스처 처리향상 (GTX 480 60/ GTX 470 56)
- 32x CSAA 및 TMAA/ AA의 효율적인 처리 및 성능 향상
- Render Back-Ends (ROP) 유닛 최대 48 (GTX 480 48/ GTX 470 40)
- 전력관리 개선 (클럭 및 전압 스위칭, GDDR5 클럭 및 전압 감소)

지포스 GTX 200 시리즈에 대한 내용은  게임을 넘어서는 GPU, NVIDIA GeForce GTX 200 시리즈 기사를 참조하자.

HD 5800 시리즈와 HD 4800 시리즈에 대한 내용은 지난 기사인 [이론편] 공정으로 압도하는 RV770. ATI Radeon HD 4800 시리즈와 [이론편] Over the GeForce! 라데온HD5800의 모든것 기사를 참조하자.

  태그(Tag)  : 지포스 GTX 400
이전페이지 | 다음페이지.DX11에 최적화된 지포스 GTX 400
관련 기사 보기
태그가 등록되지 않아 관련 기사를 출력할 수 없습니다

  권경욱 前 기자 / 필명 바이퍼투 / 바이퍼투님에게 문의하기 press@bodnara.co.kr
남들은 스마트폰이나 타블렛 PC에 관심을 갖고 있지만, 여전히 PC가 좋다. 새로운 것, 독특한 것을 좋아하지만, 남앞에 나서거나 사진찍히는 것을 싫어해 기자에는 제일 어울리지 않는 성격. 누구보다 빠르게 PC 하드웨어 정보를 전달하기 위해 노력하고 있으며, PC 하드웨어에 대한 열정은 현재진행형이다.
기자가 쓴 다른 기사 보기

Creative Commons License 보드나라의 기사는 저작자표시-비영리-변경금지 2.0 대한민국 라이선스에 따라 이용할 수 있습니다. Copyright ⓒ 넥스젠리서치(주) 보드나라 미디어국
싸이월드 공감 기사링크 퍼가기 기사내용 퍼가기 이 기사를 하나의 페이지로 묶어 볼 수 있습니다. 출력도 가능합니다.
홈으로 탑으로
보드나라 많이본 기사
RTX 30 시리즈도 DLSS 5 구동 가능, 정상적 실행 불가 수준 성능
이엠텍, 지포스 RTX 5070 시리즈 이상 그래픽카드 또는 그래픽카드가 장착된 PC 구매 시 컨트롤 레조넌트 게임 번들 증정 프로모션 진행
DJI, IFA 2026서 Osmo 360 II·ROMO 2·Power 생태계 공개
DDR4칩을 DDR5으로 마킹, 더 정교해진 가짜 메모리 등장
메인스트림 게이머의 심리적 마지노선 가격 모델, 라데온 RX 9070 GRE vs RTX 5070 성능 비교
기가바이트 40년 상징 그래픽 카드,기가바이트 AORUS 지포스 RTX 5080 INFINITY 제이씨현
미야모토 무사시 검의 길을 밝힐 선택은?, 귀무자 검의 길 CPU 6종 벤치마크
하반기 엔비디아 지포스 그래픽카드 가격 더 오른다?, RTX 50 Super의 운명은? RTX 60 직행하나?
   이 기사의 의견 보기
트위터 베타서비스 개시! 최신 PC/IT 소식을 트위터를 통해 확인하세요 @bodnara

기자의 시각이 항상 옳은것은 아닙니다. 나머지는 여러분들이 채워 주십시요.

2014년부터 어려운 이야기를 쉽게 하는 것으로 편집방침을 바꿉니다.

주동성 bsbday님의 미디어로그 가기  / 10-03-27 8:10/ 자국/ 신고/ 이댓글에댓글달기
58XX 계열이 처음 나왔을 때 듀얼코어 어쩌고 하는거 보고 좀 놀랬었는데..
페르미는 쿼드코어 어쩌고 저쩌고.. -_-;; 놀랍기만 하네요...

공부하자 milkblue님의 미디어로그 가기  / 10-03-27 9:41/ 자국/ 신고/ 이댓글에댓글달기
어떤 기술이 적용되었는지...
보다는 성능을 보고 싶었는데, 이 기사에는 벤치마크가 없군요.
- 아래에 기사가 있었군요. ;;;;

사랑이눈신사 redsjd님의 미디어로그 가기  / 10-03-27 9:52/ 자국/ 신고/ 이댓글에댓글달기
페르미 과연 앞으로 행보가 궁금해지는군요.
기대 이상 보다는 기대 이하일 가능성이 더 커 보이니...

허접프로그래머 valkyrie님의 미디어로그 가기  / 10-03-27 10:30/ 자국/ 신고/ 이댓글에댓글달기
사실 그래픽칩셋에서 듀얼코어, 쿼드코어라는 개념은 의미가 없지요. 따지고보면 셰이더 프로세서 하나가 1개의 코어라고 봐야 하는데 그렇게 따지면 AMD는 1600코어 프로세서게요...?

물리적으로 SP를 모아둔 블록을 2개로 나누었든 4개로 나누었든 그건 별 의미가 없는 것 아닌가 생각합니다만. 뭐, 그렇게 나눔으로써 분기 처리 등의 기존의 약점을 커버할 수 있을라나요;;

어쨋든... 개발 개념은 알겠습니다만, 이론이 좋다고 성능이 좋다는 법은 없으니 앞으로 두고봐야 겠네요.
참 잘했어요 / 10-03-27 14:31/ 자국/ 신고/ 이댓글에댓글달기
가격 인하 계획 없다는 a당에게 한방 먹여주길..
a당팬이긴 하지만 한쪽이 자만심이 가득하면 절대로 안됨...
대박인생 bigfog님의 미디어로그 가기  / 10-03-27 16:58/ 자국/ 신고/ 이댓글에댓글달기
들어간 기능은 참 좋아 보이는데...
너무 많은 것을 추구한 것은 아닌지 그런 생각도 드네요.
Aria / 10-03-27 18:24/ 자국/ 신고/ 이댓글에댓글달기
저로썬 GPGPU 강화가 눈길을 끄는군요..ㅋ
lightlas / 10-03-27 21:08/ 자국/ 신고/ 이댓글에댓글달기
성능은 둘째치고 (DX11 쪽 성능은 기다린 값을 했습니다만....)
온도와 전력 소모량이 아주 안드로메다로 가셨습니다.
저 정도면 TDP를 320, 300 정도로 잡아야 되는거 아닐까요.

듀크 lordstar님의 미디어로그 가기  / 10-03-27 21:47/ 자국/ 신고/ 이댓글에댓글달기
성능도 아쉽고 전력소모도 아쉽고 여러모로 아쉬운 점만 가득한 제품이네요.

복남 ascentia님의 미디어로그 가기  / 10-03-27 21:50/ 자국/ 신고/ 이댓글에댓글달기
드디어 나오는 군요

끓여만든배 / 10-03-28 2:13/ 자국/ 신고/ 이댓글에댓글달기
아키텍쳐에 많은 변화가 있네요.
Scavenger bmw375님의 미디어로그 가기  / 10-03-28 12:43/ 자국/ 신고/ 이댓글에댓글달기
많은 발전이 이뤄진 것은 좋은데 'TDP 250W'라는 문구가 너무 거슬리는군요. 물론 고급형 제품군을 구입하는 사람들에게는 큰 단점이 되지 않겠지만 만약 10만 원대로 출시하는 제품들도 경쟁사 제품들보다 높은 소비전력을 필요로 한다면 구매력이 낮을 것 같습니다.
nift nift님의 미디어로그 가기  / 10-03-28 13:29/ 자국/ 신고/ 이댓글에댓글달기
어디까지 발전할 건지 하지만 이정도까진 되겠지 하는 수준은 아닌듯

너도모르냐 tkdchan님의 미디어로그 가기  / 10-03-28 14:32/ 자국/ 신고/ 이댓글에댓글달기
어서어서 나왔으면 하네요.. 기대가 너무 큰건지 실망감이 클진 모르겠지만 기대해 봅니다.
즐거운하루 rbear님의 미디어로그 가기  / 10-03-29 10:05/ 자국/ 신고/ 이댓글에댓글달기
새로운 기술이 가득하다는 생각보다는 너무 많이 산만하다는 느낌이 드네요. 전력소모를 줄이고 성능을 높이는 것이 요즘 대세라 생각되는데, 다소 거리가 있는 제품일듯.. 많이 개선된 제품이 발매되었으면 좋겠습니다.
햇님아빠 blasty님의 미디어로그 가기  / 10-03-29 15:10/ 자국/ 신고/ 이댓글에댓글달기
가격은 대단하겠네요, 어지간한 머신 한대를 능가할..

무무상 jackyang님의 미디어로그 가기  / 10-04-03 7:04/ 자국/ 신고/ 이댓글에댓글달기
그래도 희망은 있을것입니다. 절망의 순간에 반전의 역사가 다시 시작하는것이죠. 2900XT의 다음의 A당의 영광을 잊지 마시길.....
닉네임 웹봇방지

홈으로 탑으로
 
 
2026년 09월
주간 히트 랭킹

[결과발표] 2026년 2분기 포인트 소진 로또 13
[결과발표] 2026년 1분기 포인트 소진 로또 15
[결과발표] 2025년 4분기 포인트 소진 로또 17
[결과발표] 2025년 3분기 포인트 소진 로또 16
[결과발표] 2025년 2분기 포인트 소진 로 18

실시간 댓글
소셜 네트워크