3. 테셀레이션 구현이 다른 엔비디아와 AMD ATI
DirectX 11을 지원하는 그래픽카드를 발표하면서 AMD ATI와 엔비디아의 개발 방향이 서로 달라지고 있다. AMD ATI는 기존 R600의 아키텍처를 개선해 스트림 프로세서를 크게 늘리고 기존처럼 그래픽 연산에 최적화된 모습을 하고 있고 GPGPU 지원을 위한 부분은 기존보다 향상되었지만, 주는 그래픽 연산이다.
반면, 엔비디아는 범용성을 기존 세대 제품들보다 크게 늘려 GPGPU에 보다 최적화되었고 물리엔진인 PhysX 지원 개선과 병렬 처리 능력 향상, 그리고 테셀레이션 강화로 DirectX 11 세대의 처리 성능을 개선하고 있다. 이러한 변화는 그래픽 연산과 범용 연산을 모두 고려하고 있는 엔비디아의 차후 아키텍처 방향을 엿볼 수 있다.
이런 양사의 아키텍처 및 지원 방향은 DirectX 11 테셀레이션 구현 방법에서도 서로 차이를 나타내고 있다.
엔비디아, 병렬 처리 아키텍처와 다수의 테셀레이터 내장

[지포스 GTX 400, 최대 4개의 레스터 엔진과 16개 테셀레이터]
엔비디아는 폴리모프 엔진 (PlyMorph Engine)은과 래스터 엔진 (Raster Engine)을 분할한 형태로 테셀레이션 병렬 처리 및 지오메트리 성능을 기존 지포스 GTX 200보다 최대 8배를 향상시킬 수 있게 된 것으로 소개되고 있다.
GF100은 4개의 모듈화된 GPC (Graphics Processing Cluster)로 구성되고 있어 라데온 HD 5800 시리즈가 듀얼코어화된 것과 비교해 쿼드코어화된 구조로 설명될 수 있다. 이러한 구조는 기존 세대보다 병렬 처리 능력을 크게 개선한 아키텍처적인 변화를 잘 설명하고 있다.
Fermi GF100 GPU를 적용한 지포스 GTX 400 시리즈 (GTX 470/ GTX 480)는 GPC 당 최대 4개의 레스터 엔진을 통해 4개의 레스터 라이저 (Rasterizer, 버텍스 쉐이더를 통해 정점의 그룹이 입력되었을 경우 출력 좌표는 그 영역내에서 픽셀을 결정하기 위해 보간되며, 이러한 작업이 레스터라이제이션이다. 이 작업을 통해 픽셀 각각이 픽셀 쉐이더를 통과하여 화면상의 색을 계산하게 된다.)와 GPC 당 4개의 SM (Streaming Multiprocessor)이 제공되고 1개의 SM에는 32 쿠다코어 (CUDA Cores)와 폴리모프 엔진 하나가 제공된다. 폴리모프 엔진에는 1개의 테셀레이터 (Tessllator)가 내장되므로 GPC 하나에는 최대 4개의 테셀레이터가 내장된다.
따라서, GF100은 최대 16개의 테셀레이터를 제공하며, 지포스 GTX 470은 14개, GTX 480은 15개의 테셀레이터가 내장된다. 2010년 6월 초 공개될 것으로 알려진 지포스 GTX 465의 경우 11개의 테셀레이터가 내장되며, 차후 제품들 역시 경쟁사 라인업 대비 테셀레이션 성능이 유리할 것으로 예상된다.
AMD ATI, 그래픽 엔진에 하나의 테셀레이터 내장

[라데온 HD 5800, 듀얼 레스터라이저와 1개의 테셀레이터]
라데온 HD 5800 시리즈는 엔비디아가 그래픽 엔진을 병렬 처리할 수 있도록 최적화된 구조와 다수의 테셀레이터를 배치하여 테셀레이션과 지오메트리 연산, 그리고 그래픽 연산의 병렬 처리의 효율을 높이고 있는 것과 달리 그래픽 엔진 하나에 듀얼 레스터라이저와 하나의 테셀레이터를 제공해 테셀레이션과 지오메트리 연산을 진행하는 구조다.
엔비디아도 지포스 GTX 200 시리즈까지는 AMD ATI 라데온 HD 5000 시리즈와 유사한 구조로 그래픽 연산을 진행해왔으나 지오메트리 연산과 테셀레이션 연산의 향상을 위해 페르미로 넘어오면서 이런 구조가 바뀌게된다.
엔비디아와 AMD ATI의 테셀레이션 구현 차이
엔비디아가 GPC 단위로 병렬 처리할 수 있는 구조로 데이터 처리의 유연성이 높은 반면, AMD ATI는 하나의 테셀레이터를 이용한 방법이기 때문에 테셀레이션을 적극적으로 활용할 경우 데이터 처리의 유연성이 떨어져 병목현상이 발생될 가능성이 높아진다.
하지만, 엔비디아의 테셀레이션 구현 방법은 병렬 처리 구조로 이득을 볼 수 있지만, 병렬 처리를 위한 분산형 폴리모프 엔진은 테셀레이션 처리가 아닌 다른 작업에서는 오히려 비효율적으로 동작되는 약점이 나타날 수 있다.
AMD ATI는 그래픽 엔진이 엔비디아보다 복잡하지 않아 그래픽 연산의 효율성을 높일 수 있고 그래픽 엔진만 교체하면 고정유닛인 테셀레이터를 늘릴 수 있다. 엔비디아는 하나의 프로세서 클러스터 (SM 1개당 32 쿠다코어와 폴리모프 엔진 제공)마다 폴리모프 엔진이 포함된 형태이므로 고정 유닛의 교체와 보강시 클러스터가 늘어나는 방식이 되기 때문에 이로 인한 다이 크기 증가와 생산 비용 증가 이어지므로 AMD ATI보다 불리한 입장이 된다.
테셀레이션 차이 외에도 지오메트리 연산 성능을 비롯한 다양한 부분에서 크게 개선된 엔비디아 지포스 GTX 400 시리즈는 추후 최적화 여부에 따라 테셀레이션과 지오메트리 연산 성능을 이용한 성능의 향상이 예상된다.
AMD ATI는 R600부터 적용한 현재의 아키텍처로 라데온 HD 5000 시리즈를 만들었고 이를 잇는 후속 제품을 준비중이다. 그리고 내년에는 엔비디아처럼 병렬 처리가 강화된 아키텍처를 적용할 것으로 예상되는 만큼 이들을 어떻게 발전시키고 최적화가 진행될지에 따라 달라질 것으로 보여진다.
특히, 엔비디아가 차세대 그래픽 시장의 경쟁을 DirectX 11과 테셀레이션으로 내세우고 있는 만큼 라인업을 이미 완성한 라데온 HD 5000 시리즈를 이어 새로운 제품을 준비중인 AMD ATI는 이 부분을 크게 보강할 수 있는 시간적인 여유가 남아있기 때문에 지금 부족한 테셀레이션 처리를 강화할 여지가 남아있다.
또한, 현재의 DirectX 11과 테셀레이션을 지원하는 Unigine Heaven BenchMark와 같은 벤치마크 프로그램들은 테셀레이션 차이를 극명하게 보여줄 수 있다. 하지만, 초기 등장하고 있는 DirectX 11 지원 게임들은 일부 즉, 맛보기식의 테셀레이션을 지원하여 충분히 테셀레이션의 장점을 살리지 못하고 있다. 이는 추후 적극적인 테셀레이션을 게이밍 환경에 도입할 경우 양사 간의 성능 차이는 나타날 것으로 예상된다.