AMD ATI Radeon HD 4800 시리즈는 HD 2900XT에서 적용된 통합쉐이딩
아키텍처와 DirectX 10.1 지원, 그리고 유연한 프로그래밍이 가능한 VLIW 아키텍처를 사용한 5-Way
Superscalar 쉐이더 프로세서, 테셀레이션 유닛을 이어받고 있어 NVIDIA가 병렬 컴퓨팅와 그래픽 프로세싱 처리
성능을 향상하기 위해 G80 아키텍처를 개선한 것처럼 완전히 새로운 아키텍처로 보기는 어렵다.
AMD ATI Radeon HD 4800 시리즈와 NVIDIA GeForce GTX 200
시리즈 모두 공정의 안정화에 따라 더 많은 쉐이더 프로세서를 넣고 텍스처 유닛 증가, AA 개선 등을 통해 이전
시리즈들보다 더 높은 성능을 이루게 된 점은 공통점으로 볼 수 있다. 그 중에서도 AMD ATI는 특히 55nm 공정의
안정화를 통해 다양한 기술들을 넣음으로써 경쟁사의 동급 제품을 압도하는 높은 성능을 얻을 수 있게 되었다고 볼 수 있다.
2세대 55nm 공정 적용으로 와트 당 성능/ 단위면적 당 성능비 증대!


AMD ATI Radeon HD 4800 시리즈들은 HD
3800 시리즈에 이어 55nm 공정을 적용하고 있다. 이는 경쟁사의 새로운 GPU가 더 많은 것들을 넣고도 여전히
65nm 공정을 적용하고 있어 발열 및 소비전력을 비롯하여 생산 부분에서의 단점들을 여전히 갖고 있는 것과는 대조적이라고
볼 수 있다.
두 번째 55nm 공정이 적용되는 HD4800 시리즈에
사용되는 GPU인 RV770은 경쟁 제품 대비 더 작은 사이즈로 생산 비용에서 유리하고 GDDR5 메모리 적용, 더 낮은
수준의 전력소비, 와트 당 성능비/ 단위면적 당 성능비가 훨씬 유리해졌다.
최근 GeForce 9800 GTX의 가격인하와 GeForce
9800 GTX+의 투입은 55nm 공정을 도입하고 있는 HD 4800 시리즈가 HD 3800 시리즈에 이어 성능 개선
뿐만 아니라 공정의 우위를 통해 가격적인 부분에서도 유리한 고지를 점령하고 있기 때문이다.
테라스케일로 업그레이드된 HD 4800 시리즈 그래픽 엔진!

현재 발표된 HD 4800 시리즈 GPU의 특징은 이 자료 하나만으로 기존 HD 3800
시리즈보다 개선된 부분을 설명할 수 있다. HD 4800 시리즈가 주안점을 둔 부분은 바로 부동소수점 연산 능력을 HD
4850은 1TeraGFLOPs, HD 4870의 경우 1.2TeraGFLOPs로 높여 테라스케일의 처리 능력을 제공하게
된 점이다.
또한, 기존 HD 3800 시리즈가 320개를 제공하던 스트림 프로세서를 800개로 480개나
더 늘려 쉐이더 처리 능력을 개선하였고 SIMD (Single Instruction Multiple Data) 코어의
개선, 텍스처 유닛 증대와 텍스처 캐쉬 최적화, GDDR5 SDRAM 메모리 적용에 따라 기존 링버스 메모리 아키텍처를
버리고 새로운 메모리 아키텍처를 도입했다. 또, HD 3800 시리즈에서 부각되었던 고해상도 및 안티앨리어싱 적용의 성능
저하를 Render back-ends (ROP)의 최적화를 통해 개선했으며, 지오메트리 및 테셀레이션 유닛의 성능 개선도
포함되고 있다.
그러면, 지금부터는 HD 4800 시리즈 GPU인 RV770에서 개선된 부분을 좀 더 자세하게
살펴보도록 하자.
800개로 늘어난 스트림 프로세싱 유닛!

[HD 4800 시리즈 블럭 다이어그램]

[R600, HD 3800 시리즈 블럭 다이어그램]
HD 4800 시리즈와 R600, HD 3800 시리즈의 블럭 다이어그램을 비교하여 보면,
전반적인 구성에서는 큰 변화가 나타난 것을 확인하기는 힘들며 이는 완전히 새로운 아키텍처를 적용한 것이 아니라 기존
R600과 HD 3800 시리즈에서 문제가 되었던 성능 저하 부분 등을 개선하기 위해 더 늘어난 스트리밍 프로세서와 텍스처
유닛, 새로운 메모리 지원에 따라 새로운 메모리 아키텍처 등을 찾아볼 수 있다.
그 외 쉐이더 처리 능력과 효율을 증대시키기 위해 도입된 Ultra-Threaded
Dispatch Processor는 그대로 유지되고 있으며, 픽셀과 버텍스, 지오메트리 쉐이더 유닛을 모두 처리할 수 있는
통합 쉐이딩 아키텍처의 구성과 DirectX 10.1 지원 구성은 변함이 없다.
DirectX 10.1에 대한 내용은 지난 기사인
드디어 등장한 DX10.1 지원 HD 3870과 3850, 달라진 점과 성능을 살펴보자!와
DX10.1에 대한 모든것, DX10에 비해 어떻게 바뀌었나?
기사를 참조하기 바라며, DirectX 10에 대한 내용은 지난
기사인
코드명 G80, DirectX 10, nVIDIA GeForce 8800 / 도대체 어떤게 바뀐거야?를
참조하자.

[부동소수점 및 정수 연산 처리 성능을 높인 5-Way Superscalar 구성]
R600부터 적용된 AMD ATI의 아키텍처는 VLIW 아키텍처와 5-Way의
Superscalar 구조의 적용으로 스트리밍 프로세서 내부에 5개의 스트리밍 프로세서 유닛이 있고 이 스트리밍 프로세서
유닛의 효율적인 분배와 관리를 해주는 Branch Execution Unit, 범용 레지스터의 구성으로 이루어진다.
HD 4800 시리즈의 스트림 프로세싱 유닛 변화는 기존보다 40% 증가된 단위면적 당 성능
향상을 들 수 있으며, 더 공격적인 클럭 적용에 의해 와트 당 성능비 증대, 부동소수점 연산의 두 배 정밀도 향상
(FP64 연산에서 HD 4870은 240GFLOPs, HD 4850은 200GFLOPs, GTX 280은
117GFLOPs로 HD 4870의 경우 2배 향상, FP64 효율은 RV770은 1/5, GTX 200 시리즈는 1/8), 정수
연산 유닛의 처리 성능 향상을 통해 전반적으로 12.5배에 이르는 향상이 이루어지고 있다고 밝히고 있다. 스트림 프로세서가
차지하는 면적 역시 기존보다 28% 작아졌다.
또, 스트림 프로세싱 유닛은 HD 3800 시리즈는 320개였으나 HD 4800 시리즈는 800개로
2.5배 더 늘어난 유닛을 제공하며, 16개 4개의 SIMD 코어에서 16개 10개의 SIMD 코어 구조를 가진다. 이에
따라 HD 3800 시리즈의 프로그래밍 가능한 쉐이더는 최상의 경우 320개의 쓰레드를 처리할 수 있지만, 최악의 경우 64개의
쓰레드만을 처리하여 성능이 저하될 수도 있다. 그러나, HD 4800 시리즈는 최상의 경우 800개의 쓰레드 처리, 최악의 경우에도 160개의
쓰레드를 처리하게 되므로 이전 HD 3800 시리즈의 2.5배에
가까운 스트림 프로세싱 유닛을 사용하게 되고 그 만큼 성능 저하를 줄일 수 있게 되는 것이다. (NVIDIA 9800
시리즈는 클럭 당 128개의 쓰레드 처리, GTX 280/ 260은 240개/ 192개의 쓰레드를 처리한다.) 쉐이더 처리
성능은 AMD ATI와 NVIDIA의 방식이 서로 다르기 때문에 어떤 것이 항상 유리하다고만 볼 수는 없으며, 프로그래밍에
따라 각각에 맞게 최적화되면 최적의 성능을 얻을 수 있게 된다.
스트림 프로세서 클럭의 경우 NVIDIA가 코어 클럭과 비동기식 설정을 통해 더 높은 클럭을
적용하여 빠른 처리를 가능하게 하고 있는 것과 달리 AMD ATI는 기존과 같이 코어 클럭과 같은 스트림 프로세서 클럭을
적용하고 있다. 하지만, 앞서 언급하였듯이 쉐이더의 처리 능력이 증대되었으므로 이전의 HD 3800 시리즈들보다 향상된
성능을 기대해볼 수 있다.


SIMD 코어는 80 Scalar 스트림 프로세싱 유닛과 16KB의 Lacal Data 공유
캐쉬를 제공하고 4개의 텍스처 유닛과 L1 캐쉬를 제공하며, SIMD 코어 간의 커뮤니케이션을 위해 16KB의 전역
Data 공유 캐쉬를 제공하는 구조를 하고 있다. 이에 따라 텍스처와 산술 연산의 비율은 4 :1이 유지된다. (SIMD
코어는 쓰레드 순서 조절을 위한 Thread Sequencer 추가와 텍스처 유닛, 16KB 전역 데이터 공유 캐쉬로
구성된다.)
HD 4800 시리즈는 HD 3800 시리즈보다 2.5배 더 늘어난 800개의 스트림 프로세서
제공을 통해 벡터 컴퓨팅 성능 향상, 로컬 및 전역 데이터 공유, 빠른 정수 연산, 빠른 메모리 입출력이 가능해지게
되었다.
HD 3800 시리즈가 4개의 SIMD 코어 (80SP) 구성 (4 x 16)이었다면, HD
4800 시리즈는 10개의 SIMD 코어 (80SP) 구성 (10 x 16)으로 이루어져 스트림 프로세싱 유닛의 수가 대폭
향상되었다.

800개의 스트림 프로세서, 스트림 프로세서와 텍스처 유닛, 공유 데이터 캐쉬로 구성되는
SIMD 코어 성능 개선 등을 비롯하여 DirectX 10부터 등장한 지오메트리 쉐이더와 HD 2900XT를 통해 다시
등장한 테셀레이션 유닛의 성능 역시 개선되었다. 지오메트리 쉐이더의 경우 이전보다 4배 이상의 쓰레드를 지원하도록 개선되고
있으며, 테셀레이션은 인스턴싱 지원 및 DirectX 10/ 10.1과 호환되어 다양한 DirectX 10/ 10.1 지원
게임들에 적용할 수 있다.
10개로 늘어난 텍스처 어드레싱 유닛으로 텍스처 처리 능력 증대!


HD 4800 시리즈는 또한 텍스처 유닛을 기존 R600, HD 3800 시리즈가 4개를 제공
(4 텍스처 어드레스로 총 16개, 16 FP32 텍스처 샘플러로 총 64개, 4 FP32 텍스처 필터 유닛으로 총
16개)하던 것과 비교하여 10개 (4 텍스처 어드레스로 총 40개, 16 FP32 텍스처 샘플러로 총 160개, 4
FP32 텍스처 필터 유닛으로 총 40개)로 늘어난 텍스처 유닛을 제공하여 텍스처 처리 능력을 증대했다. (GeForce
GTX 280의 경우 텍스처 어드레싱 유닛과 필터링 유닛을 1:1 즉, 80 : 80개를 제공하여 텍스처 처리 능력을
높이고 있다.)
또한, 기존 4개에서 10개로 늘어난 텍스처 유닛을 통해 단위면적 당 성능을 70% 가까이 높일
수 있다고 언급되며, HD 3800 시리즈와 비교하여 두 배로 늘어난 텍스처 대역폭, 2.5배로 증가된 32bit 필터
비율, 1.25배로 증가된 64bit 필테 비율, 클럭 당 160이 넘는 페치를 제공하게 된다. 또, SIMD 코어마다
L1의 데이터 저장 효율 2배 증가, 전체로는 5배가 증가되 L2와 메모리 채널의 유기적인 조합, 버텍스 캐쉬 분리,
L1의 텍스처 페치 대역폭이 480GB/s 이상으로 L1과 L2 사이의 대역폭은 384GB/s로 늘어났다.
또, 텍스처 유닛이 차지하고 있는 실리콘의 면적은 기존보다 41%가 줄어들었으며, FP16
필터링을 위한 텍스처의 비율은 줄이고 증대되는 32bit 필터링 성능을 높이는데 주안점을 두었다고 밝히고 있다.

이렇게 증가된 10개의 텍스처 유닛을 통해 HD 4870의 경우 기존 GeForce
9800GTX와 새롭게 등장한 GeForce GTX 280과 비교하여 텍스처 유닛 자체는 적으나 높은 코어 클럭과 내부
성능 개선을 통해 텍스처 유닛 성능 즉, 클럭 당 텍셀 처리 능력과 텍스처 필레이트 처리 능력과 효율은 더 좋은 것으로
나타나고 있다.
Hub 방식의 메모리 컨트롤러 아키텍처 도입과 최초로 GDDR5 메모리 사용!

[새로운 Hub 방식 메모리 컨트롤러 아키텍처 적용한 HD 4800 시리즈]

[링버스 메모리 아키텍처를 적용한 X1000 (좌), R600, HD 3800 시리즈
(우)]
AMD ATI는 X1000 시리즈를 시작으로 기존 크로바 메모리 컨트롤러를 대체할 새로운 링버스
메모리 아키텍처를 도입했다. R600 (HD 2900XT)과 HD 3800 시리즈는 X1000 시리즈의 링버스 메모리
아키텍처를 이어받고 GDDR4 SDRAM 메모리의 사용에 맞게 이를 개선하는 등의 변화가 이루어졌다.
특히, 기존 Crossbar 메모리 컨트롤러의 한계를 극복하고자 내놓은 링버스 메모리 컨트롤러는
빠른 전송 문제와 고속 메모리 사용에서 Crossbar보다 유리해졌으며, Crossba Switch와 혼합한 Hybrid
방식이 X1000 시리즈에서 사용되었고 내부 256bit 읽기와 쓰기 512bit 구성을 하고 있다.
또, HD 2900XT/ HD 3800 시리즈들은 8채널 64bit 메모리 채널 지원 및 내부
512bit 읽기와 쓰기를 통해 고속 메모리와 빠른 전송이 가능해졌고 PC-Exress Ring Stop을 통해 완전한
링버스 메모리 아키텍처가 적용되었다. HD 2900XT의 경우 64bit 8채널을 통해 512bit 메모리 인터페이스를
구성하여 최대 106GB/s의 높은 대역폭을 확보할 수 있다. HD 3800 시리즈들의 경우 256bit 메모리
인터페이스를 적용하여 HD 3870의 경우 72GB/s의 대역폭을 확보할 수 있다.
HD 4800 시리즈에서도 링버스 메모리 아키텍처에 이어 Hub 방식의 새로운 메모리 컨트롤러
아키텍처를 도입했다. HD 4800 시리즈에 도입된 Hub 방식 새로운 메모리 컨트롤러 아키텍처는 메모리 채널 당 하나의
컨트롤러가 배치되어 내부 256bit 인터페이스 4개를 가지며, UVD2, CrossFire X, PC-Express,
Display 컨트롤러 등을 하나의 Hub를 통해 관리할 수 있다. Hub에 연결된 각 부분들은 Point-to-Point
방식으로 연결되며, 레이턴시 향상 및 링 간의 충돌을 줄이고 전체 성능 향상과 저전력, 적은 케이블을 사용하여 비용을 줄일
수 있다.
또, Hub 메모리 컨트롤러 방식은 최적의 상황에서는 이전의 HD 3800 시리즈와 비교하여
90-95%에 이르는 효율을 얻을 수 있는 것으로 밝히고 있다.
Hub 방식을 도입한 이유는 두 가지로 볼 수 있으며, 새로운 GDDR5 메모리 효율적인 사용
및 앞으로 등장할 AMD ATI의 듀얼 GPU에서 링버스 메모리 아키텍처보다는 Hub 방식이 효율이나 코어 간의 공유에서도 더 유리할 것이기 때문이다.

[Hub 방식의 메모리 컨트롤러 아키텍처 적용을 메모리 대역 효율 증대]
새롭게 적용되는 Hub 메모리 컨트롤러 아키텍처와 데스크탑 최초로 사용되는 GDDR5 메모리를
통해 이전보다 더 높은 동작 클럭과 256bit 메모리 인터페이스로 115GB/s가 넘는 대역폭을 확보할 수 있다.

[데스크탑 그래픽 카드 최초로 GDDR5 SDRAM 적용!]
또한 HD 4800 시리즈 중 상위 제품인 HD 4870의 경우 데스크탑 그래픽 카드 최초로
GDDR5 SDRAM을 적용하는 그래픽 카드인데 GDDR5는 이전세대의 메모리들과 비교하여 3배 더 높은 대역폭을 확보할
수 있는 장점이 있다. 또한, GDDR5는 GDDR4보다 낮은 1.5V의 동작 클럭과 65nm 또는 55nm 공정이
적용되고 FBGA 170 타입을 사용하여 칩의 크기를 줄이면서 용량은 더 늘릴 수 있게 된다. HD 4870의 경우
GDDR5로 3.6 (1.8)GHz 적용할 경우 115GB/s의 대역폭을, 5 (2.5)GHz일 경우 160GB/s의
대역폭을 확보할 수 있게 된다.
하지만, GDDR5 SDRAM 메모리는 높은 클럭과 대역폭을 확보할 수 있는 장점이 있으나 기존
메모리와 근본적으로 다른 기술과 더 많은 로직을 필요로 한다. 클럭 데이터 복구, 이미지 신호 제거, 고클럭에서 노이즈
필터링 처리 제어, 에러 인식, 링크 트레이닝 (각 채널을 위한 RISC 마이크로프로세서로 제어), 칩을 켤 때의 속도는
문제되지 않으나 칩을 끌 때의 신호를 보존 (링크 트레이닝이 필요)해야 하는 등의 복잡함이 요구된다.
또, GDDR4 SDRAM 메모리를 사용하였던 HD 3870처럼 높은 가격을 형성할 것이고
GDDR5 SDRAM의 초기 수율이나 공급량이 원활하지 않을 것이므로 많은 제품을 기대하기는 쉽지 않을 것으로 보여진다.
링버스 메모리 아키텍처의 구조는 지난
Shader Model 3.0과 HDR 그 이상이 있다!, ATI Radeon X1000 시리즈와
R600의 모든것을 보여주마! AMD ATI Radeon HD 2900XT
기사를 참조하자.
Render Back-Ends (ROP) 성능 개선!

HD 4800 시리즈는 텍스처 유닛 증대를 통한 텍스처 처리 능력 향상 외에도 HD 3800
시리즈에서 지적되었던 안티앨리어싱을 적용하였을 때의 처리 성능도 개선하고 있다. HD 4800 시리즈는 HD 3800
시리즈와 같은 프로그래밍 가능한 16개의 Render Back-Ends 유닛을 제공하고 있지만, 단위면적 당 안티앨리어싱
성능을 개선하는데 주안점을 두고 있다. HD 2900XT/ HD 3800 시리즈/ HD 4800 시리즈는 쉐이더를 통해
AA/ AF를 처리하는 방식이 적용되는 것으로 알려지고 있었는데 HD 4800 시리즈는 800개로 더 늘어난 스트림
프로세서를 통해 HD 3800 시리즈가 가진 성능 저하 문제를 어느 정도 개선이 가능해졌다.
또한, 이전처럼 MSAA 지원과 프로그래밍 가능한 CFAA 모드를 제공하는데 32bit
컬러에서는 MSAA를 적용하지 않을 때에는 클럭 당 픽셀 처리 능력에 차이를 두지 않고 있으나 2x/ 4x MSAA
모드에서는 클럭 당 8에서 16 픽셀 처리, 8x MSAA 모드에서는 클럭 당 4에서 8 픽셀 처리 능력으로 각각 2배씩
처리 능력이 증가되었다. 또, 64bit 모드에서는 No MSAA, 2x/ 4x MSAA, 8x MSAA는 클럭 당 8에서
16, 8에서 16, 4에서 8 픽셀 처리 능력으로 각각 2배씩 처리 성능이 증가되고 있다. Deph/ Stencil
처리에서도 클럭 당 32에서 64 픽셀로 처리 성능이 2배 증가되었다.



Render Back-Ends (ROP)의 처리 성능을 HD 3800 시리즈들보다 개선함에 HD
3800 시리즈에 사용된 RV670 GPU보다 전반적으로 향상된 MSAA 성능과 Edga Dect CFAA 필터를
적용하였을 때의 전반적인 성능의 향상도 이루어졌다. 프로그래밍 가능한 CFAA의 경우 2배의 샘플 생성률 (Z-Fill
Rate)과 2.5배의 쉐이더 해결 능력 (Shading & Texture Fetch Rage per Clock),
Render Back-Ends와 쉐이더 엔진 성능 향상에 의한 빠른 처리 성능을 제공하게 된다.
전력관리 기능 강화!

HD 4800 시리즈에 사용된 RV770 GPU는 이전 HD 3800 시리즈에 사용된 RV670
GPU보다 진보된 전력관리 기능을 제공한다. 칩에 내장된 마이크로 컨트롤러의 열 센서를 통해 GPU 블럭과 PCI-Express
버스 활성화를 즉시 모니터링 가능하며, 드라이버의 오버헤드를 최소화 해준다.
또한, 이전 HD 3800 시리즈가 ATI PowerPlay를 통해 GPU의 부하에 따라
(2D/ 3D 모드) 클럭과 전압을 변화시켜 소비전력을 낮추었던 것처럼 HD 4800 시리즈 역시 코어와 메모리 클럭,
그리고 전압, 팬 컨트롤 기능까지 GPU의 부하에 따라 조절해주며 HD 3800 시리즈와 비교하여 와트 당 성능비를 2배로
개선한 만큼 ATI PowerPlay의 효율도 더 높아졌다.
이전 HD 3800 시리즈가 2D 모드에서 코어 (300MHz)와 전압을 낮췄다면, HD
4800 시리즈들에서는 코어 클럭과 메모리 클럭, 그리고 전압의 변경까지 지원하고 있다.
AMD ATI Radeon HD 4800 시리즈의 RV770 GPU에서 향상된 부분 정리

HD 4800 시리즈를 지금까지 살펴보았는데 앞서 살펴본 AMD ATI Radeon HD
4800 시리즈의 RV770 GPU에서 성능 향상을 위해 개선된 부분을
정리한 내용이다.
-
2.5배 스트림 프로세서 및 칩 당 쓰레드 처리 성능
(320개-> 800개)
-
2세대 55nm 공정으로 와트 당 (1.95배)/
단위면적 당 (2.8배) 성능 향상
-
4x AA Fillrate 2배 향상 (8-> 16)
-
부동소수점 연산에서 2배 정밀도 향상
-
4배 빨라진 지오메트리 쓰레드 성능 및 테셀레이션 성능
개선
-
새로운 Hub 메모리 컨트롤러 아키텍처 적용
-
GDDR5 SDRAM 메모리 사용으로 더 높은 클럭과
대역폭 확보
-
Z/Stencil 32에서 64로 처리 성능 2배 향상
-
텍스처 처리 유닛 10개 제공으로 텍스처 처리능력 향상
(16개->40개)
-
Render Back-Ends 유닛 처리 성능 개선
-
향상된 전원관리 (ATI PowerPlay 향상)
HD 2900 XT의 궁금한 부분은 지난 기사인
R600의 모든것을 보여주마! AMD ATI Radeon HD 2900XT
를 참조하기 바라며, HD 3800 시리즈는 지난 기사인
드디어 등장한 DX10.1 지원 HD 3870과 3850, 달라진 점과 성능을 살펴보자!
를 참조하자.
G92 기반의 8800시리즈의 궁금한 부분은 지난 기사인
그래픽시장의 세대교체를 가져올 폭풍의 눈! NVIDIA GeForce 8800GT 장착 Leadtek Winfast
8800GT Extreme 기사와
메모리에 발목잡혀 8800GT 512MB와 비교 불가! NVIDIA 8800GT 256MB
기사,
HD 3850 좋은 시절은 다 갔다! 이엠텍 GeForce
8800GS XENON 태왕 384MB HDMI VF1000
기사를 참조하고 G80 기반의 8800 시리즈에 궁금한
부분은 지난 기사인
코드명 G80, DirectX 10, nVIDIA GeForce 8800 / 도대체 어떤게 바뀐거야?를
참조하자.