뉴스
 








 
 
 




전송 2007-05-15 16:05
[뉴스]

NVIDIA가 바라본 AMD R600의 스펙 평가?

AMD가 14일에 발표한 Radeon HD 2900의 사양에 대해 NVIDIA의 관점에서의 해석을 담은 기사가 Impress Watch에 등록되었다. 이는 어디까지나 NVIDIA의 견해이긴 하지만 현재로써는 DirectX 10지원을 하는 유일한 제품들이기 때문에 참고삼아 보길 바란다.

 

 

Q: Radeon HD 2900은 320개의 스트리밍 프로세서가 장착되었지만 GeForce 8800 GTX는 128개밖에 없다. 이에 대한 의견은?

 

A: AMD의 경우 표준ALU와 특수기능ALU의 개수를 합산해서 320개라고 하고 있다. GeForce 8800 GTX의 경우 128개의 표준ALU와 128개의 특수기능ALU를 장착하고 있기 때문에 AMD의 계산을 따르면 GeForce 8800 GTX의  쉐도우 개수는 256이 된다.  물론 Radeon HD 2900의 쉐도우 수가 25% 많지만 AMD에 비해 GeForce 8800 GTX의 ALU 클럭은 82%, GeForce 8800 GTS의 ALU 클럭은 62% 빠른 속도를 갖추고 있다. 이를 종합해 보면 Radeon HD 2900의 경우 GeForce 8800 GTS와 동급이며 GeForce 8800 GTX는 더욱더 빠른 속도를 제공한다.

 

 

Q: 8800은 Scalar 아키텍처를, Radeon HD 2900은 VLIW 명령을 지원하는 Super Scalar 아키텍처를 채택하고 있는데 어느쪽이 우수한가?

 

A: NVIDIA는 몇 년전 이미 GeForce 6 시리즈에 Super Scalar 아키텍쳐를 적용하였다. 또한 이전 세대인 GeForce FX에서는 VLIW(Very Long Instruction Word)아키텍처를 채용했다. 둘 사이는 각각 장단점이 있고 이러한 경험을 바탕으로 GeForce 8은 Scalar 아키텍처를 설계했다.

 

 Super Scalar 아키텍쳐의 장점은 각격의 쉐이더 프로세서에 대해 복수의 독립된 명령을 실행할 수 있다는 점을 들 수 있다. Radeon HD 2900의 경우라면 각각의 쉐이더 프로세에 대해 클럭마다 최대 5개의 독립된 산술 명령과 1개의 분기 명령을 실행할 수 있다. 만약 Radeon HD 2900이 항상 1번의 클럭당 5개의 산술명령을 실행할 수 있다면 그 성능은 대단히 높아질 것이다. 하지만 Super Scalar 아키텍처의 특성상 ALU의 수가 늘어날수록 각각에 대해 동시에 작업을 할당하는 것이 힘들어진다.

 

즉 Radeon HD 2900가 최고의 성능을 유지하기 위해서는 드라이버가 쉐이더 코드 스트리밍을 읽어들여 완벽하게 이해를 한 후 항상 5개의 독립된 명령을 실행해야만 한다. 만약 드라이버가 1클럭당 2개의 명령밖에 실행할 수 없을 경우 성능은 2/5로 줄어들 게 된다.

 

GeForce 8800의 scalar 아키텍처의 경우 쉐이더 유닛 모두를 지속적으로 활용하기 위해 드라이버는 1클럭당 2개의 명령 (표준ALU용 1개, 특수기능ALU용 1개)만을 실행하게 됨으로써 이러한 문제는 발생하지 않는다. 결과적으로 실제 효율면에서는 GeForce 8800이 앞서게 되는 것이다.

 

 

Q: 게임에서는 Scalar 코드와 Vector 코드중에서 어느쪽의 사용이 더 많은가?

 

A: 쉐이더의 경우 다른 사이즈의 Scalar 코드와 Vector 코드를 조합해 사용된다. 3D알고리즘이 복잡화됨에 따라 보다 많은 동작들이 고정되지 않은 Vector 사이즈에서 실행되게 된다. 예를 들면 텍스쳐의 좌표는 1차원, 2차원, 혹은 3차원으로 표현된다. 대부분 모든 게임에서 이용할 수 있는 쉐도우 매핑은 1개의 요소만을 갖고 있다. 이러한 형식은 고정 크기의 Super Scalar ALU에는 적합하지 않으며 Scalar 설계쪽이 좀더 높은 유연성과 고효율을 갖추고 있다.

 

 

Q: 왜 GeForce 8800의 Scalar 쉐도우는 Radeon HD 2900의 Super Scalar 쉐도우보다 효율이 높은것인가?

 

A: 예를 들어 두개의 수를 더하고 그후에 곱하는 단순한 경우를 생각해 보자.

     Sum = A + B

     Result = Sum * C

 

여기서 두 번째의 계산은 최초의 결과에 의존하게 된다. 만약 Radeon HD 2900이 전형적인 VLIW설계를 따르고 있다면 두 번째의 계산이 첫 번째 계산 결과에 의존하기 때문에 두 개의 계산은 같은 VLIW 명령 워드에 그룹화 될 수 없다. 예를 들면 Radeon HD 2900의  쉐이더프로세서는 최초의 계산은 최초의 VLIW 명령 워드에서 동시 실행된 명령내의 1개의 의해서 계산되고, 다음 VLIW 명령 워드에 있어서 MUL(곱셈) 동작은 최초의 VLIW명령에서 요청된 결과를 이용하게 된다. (1개의 ALU가 MUL을 실행하기 위해서는 복수의 클럭 사이클이 필요하다는 점도 주목해야할 것이다.)

 

이러한 의존성은 명령 스트림내에서 자주 발생하기 때문에 VLIW 컴파일러가 모든 VLIW 명령 워드 내의 모든 슬롯을 채우기 위해서 의존성이 없는 실행에 대해 그룹화를 못하기 때문에 효율성은 떨어지게 된다. 다시 말하면 5개의 ALU를 탑재한 Super Scalar VLIW 아키텍처는 연속적으로 의존적인 코드 스트림을 사용하는 프로그램을 실행할 경우 그 효율성은 20%로 낮아진다.

 

GeForce 8800의 경우에는 위와 같은 의존성이 있는 상황에서 1개의 Scalar  스트리밍 프로세서(SP)내의 ALU는 최초의 명령의 결과를 기다려야 하지만 모든 SP에 대하여 효율적인 작업을 분배할 수 있기 때문에 VLIW 아키텍처와는 다르며 명령/실행 슬롯이 낭비되는 것을 막을 수 있다.

 

 

Q: 8800의 텍스쳐 성능은 Radeon HD 2900의 2배이상을 보여준다. 최근에는 쉐이더 성능이 보다 중요시 되고 있는데 왜 텍스쳐 성능 향상에 보다 초점을 두었는지?

 

A: 쉐이더 연산은 아무 것도 없는 곳에서 그 효과를 발휘하지는 않으며 일반적으로 대단히 많은 텍스쳐, 쉐도우 매핑, 큐브 매핑등을 통해 복잡한 쉐이딩 연산을 하게 된다. 그렇기 때문에 필요한 텍스쳐가 제공되지 않으면 쉐이더 프로세서는 효과적으로 작업들을 실행할 수가 없게 된다.

 

 

Q: Radeon HD 2900이 80개의 텍스쳐 샘플러를 탑재하고 있다고 주장하고 있다. 이는 GeForce 8800보다 뛰어난 것은 아닌가?

 

A: 80개의 텍스쳐 샘플러라고 하는 것이 무엇을 표현하고 있는 것인지 분명치는 않다. 그보다도 텍스쳐 성능뿐만 아니라 다양한 텍스쳐 형석이나 필터링 방법을 적용하고 클럭당 필터링된 픽셀의 수를 비교하는 것이 더욱더 중요하다.

 

일반적인  비 HDR 텍스쳐(채널당 8bit)의 경우 GeForce 8800은 바이리니어, 트라이리니어 혹은 2:1 이방성 필터링을 사용해서 클럭당 32개의 픽셀을 출력할 수 있다. FP16 HDR 텍스쳐(채널당 16bit 부동 소수)의 경우에 GeForce 8800은 클럭당 바이리니어 필터링에서 32픽셀, 트라이리니어 및 2:1 이방성 필터링에서는 16픽셀을 출력할 수 있다.

 

물론 이에 비해 Radeon HD 2900은 FP16 HDR에서 어떤 텍스처의 필터링의 경우에라도 풀 스피드로 실행이 가능하지만 그 수는 16픽셀로 제한된다.

 

 

Q: 지오메트리 쉐이더의 테스트 결과 50배이상 빠르다고 밝히고 있는데?

 

A: 테스트에 따라 그 결과는 바뀔 수 있다. NVIDIA의 경우 'metaballs'라는 지오메트리쉐이더 테스트 프로그램을 개발해 사용하고 있다. 이 테스트에서는 GeForce 8800이 모든 부분에서 앞서고 있어 결국 이러한 지오메트리의 성능을 비교하기에 적합한 것은 실제의 게임이라고 할 수 있을 것이다.

 

 

Q: Call of Jaurez 라는 DirectX 10 데모 게임에서 GeForce 8800은 동작하지 않는지?

 

A: 배표된 것은 프리 릴리즈 판으로 MSAA 버퍼 부분에 버그가 있다. 실제 벤치마크를 위해선 정식으로 출시된 버전을 사용하길 권장한다.

 

 

Q: Vista의 NVIDIA 드라이버는 어느정도 개선이 되었는지?

 

A: 1월에 최초로 발표한 드라이버 이후 수많은 개선이 이뤄졌다. 최근에 출시된 드라이버는 200개 이상의 버그가 수정되었으며 3D 성능은 Windows XP와 동일한 수준으로 올라섰다. 5월에 발표될 드라이버에서는 더욱더 성능이 개선되고 DirectX10 에서의 SLI 도 지원될 것이다.

 

 

Q: CSAA의 차이는?

 

A: 2001년 GeForce 3을 출시하였을 때 여기에 'Quincunx'라고 불리우는 AA기업이 구현되었다. 이 모드는 AA를 계산할 때 픽셀마다 4개의 인접한 샘플을 이용하는 방식으로 결과적으로는 이미지가 흐릿해지는 문제가 지적되었다.

 

Radeon HD 2900은 'Custom Filter AA (CFAA)'을 지원하지만 그 원리는 Quincunx와 동일하다. 선택한 필터에 의해 CFAA의 경우 4개에서 8개의 인접 샘플을 사용해서 AA를 계산하는데 이 경우에도 필연적으로 희미해 진다.

 

또한 CFAA는 하드웨어를 통한 지원이 필요치 않는 점도 지적할 수 있다. 즉, 드라이버만으로도 실행이 된다는 점이다. 그 때문에 GeForce 8800의 경우도 CFAA나 어떤 종류의 사용자 필터 모드도 드라이버의 업데이트를 통해 지원할 수도 있다. 하지만 게이머들은 AA를 적용하였을 경우 화면이 흐려지는 것을 원치 않기 때문에 이러한 지원을 하지 않고 있다. 이는 NVIDIA가 Quincunx에서 샘플의 수를 늘리지 않은 이유이며 실제로 샘플을 증가시킬수록 영상은 희미해진다.

 

 그렇지만 'Coverage Sampling AA (CSAA)'의 경우에는 희미해짐 없이 진정한 16x 정밀도를 제공할 수 있다. 이것은 하드웨어적으로 가속되는 알고리즘으로 구현되며 CFAA보다도 높은 성능을 제공한다.

 

참고로 NVIDIA에서 주장하는 G80과 R600의 사양 비교는 다음과 같다.

 

 비교

GeForce 8800 GTX

GeForce 8800 GTS

Radeon HD 2900 XT

쉐이더 클럭

1,350MHz

1,200MHz

740MHz

쉐이더 프로세서

128

96

64

코어 클럭

575MHz

500MHz

742MHz

바이리니어 필터
픽셀/클럭

32

24

16

바이리니어 필레이트

18,400MP/sec

12,000MP/sec

11,872MP/sec

INT16 필터 픽셀/클럭

32

24

16

FP16 바이리니어 필터픽셀/클럭

32

24

16

FP16 트라이리니어·2:1이방성 필터 픽셀/클럭

16

12

16

FP16 바이리니어 필레이트

18,400MP/sec

12,000MP/sec

11,872MP/sec

FP16 트라이리니어·2:1이방성 필레이트

9,200MP/sec

6,000MP/sec

11,872MP/sec

FP32 필레이트

9,200MP/sec

6,000MP/sec

5,936MP/sec

ROP 픽셀/클럭

24

20

16

ROP Z/클럭

48

40

32

ROP 픽셀

13,800GPixel/sec

10,000GPixel/sec

11,872GPixel/sec

메모리 인터페이스

384bit

320bit

512bit

메모리 클럭

1,800MHz(DDR)

1,600MHz(DDR)

1,650MHz(DDR)

메모리 대역폭

86.4GB/sec

64GB/sec

105.6GB/sec

프레임버퍼 메모리

728MB

640MB/320MB

512MB

 

 

관련 기사 보기

  이성복 前 기자 / 필명 북극곰 / 북극곰님에게 문의하기 polabear@bodnara.co.kr
언제나 그렇듯이... 언제나 그랬듯이...
기자가 쓴 다른 기사 보기

Creative Commons License 보드나라의 기사는 저작자표시-비영리-변경금지 2.0 대한민국 라이선스에 따라 이용할 수 있습니다. Copyright ⓒ 넥스젠리서치(주) 보드나라 미디어국
싸이월드 공감 기사링크 퍼가기 기사내용 퍼가기 이 기사를 하나의 페이지로 묶어 볼 수 있습니다. 출력도 가능합니다.
홈으로 탑으로
보드나라 많이본 기사
삼성전자, One UI 9.0 업데이트로 갤럭시 S25 시리즈 고속 충전 너프?
이엠텍, PALIT 지포스 RTX 50 게이밍 PC 단 1시간 G마켓 라이브 특가 진행
MS 윈도우 11 26H2 버전 정식 배포 시작
MS, 윈도우 11 9월 업데이트 이슈 대응 긴급 패치 배포
메인스트림 게이머의 심리적 마지노선 가격 모델, 라데온 RX 9070 GRE vs RTX 5070 성능 비교
애플의 가변 조리개와 폴더블 스마트폰, 아이폰 18 Pro 시리즈 및 아이폰 듀오 공개
노트북의 게임-허브-로컬 AI 솔루션, 기가바이트 AORUS RTX 5060 Ti AI BOX 제이씨현
비싸진 SSD 어떻게 고를까?, 가격 상승기 SSD 선택 가이드
   이 기사의 의견 보기
트위터 베타서비스 개시! 최신 PC/IT 소식을 트위터를 통해 확인하세요 @bodnara

기자의 시각이 항상 옳은것은 아닙니다. 나머지는 여러분들이 채워 주십시요.

2014년부터 어려운 이야기를 쉽게 하는 것으로 편집방침을 바꿉니다.

끓여만든배 (kama136) / 07-05-15 16:22/ 자국/ 신고/ 이댓글에댓글달기
생소한 단어들이 많네요.
치어로 (ytp1003) / 07-05-15 16:26/ 자국/ 신고/ 이댓글에댓글달기
일반인이 보기에는 너무 어려운.. ㅠ.ㅠ

자부리 (ujine) / 07-05-15 16:29/ 자국/ 신고/ 이댓글에댓글달기
gtx랑 gts와 중간급이라고 생각하면 될듯하던데요...성능도 그렇고...가격도...흠..gts640메가짜리랑 비슷한듯..

버림받은천사 (ljhhjw) ljhhjw님의 미디어로그 가기  / 07-05-15 16:48/ 자국/ 신고/ 이댓글에댓글달기
얼른 비교리뷰가 나와야겠군요^^

Peace~! (pphpeace) pphpeace님의 미디어로그 가기  / 07-05-15 17:24/ 자국/ 신고/ 이댓글에댓글달기
어렵습니다..
무엇보다 가장 중요한 것은 게임에서의 실제 성능이죠..
Scavenger (bmw375) bmw375님의 미디어로그 가기  / 07-05-15 18:11/ 자국/ 신고/ 이댓글에댓글달기
메모리 인터페이스 부분은 2900XT가 압도적이군요. 서로 장단점이 앞으로 비교 분석될테니 보급형 제품도 보편화 되면 다시 제대로 경쟁하는 모습을 보게 되겠네요.
extria (guru) / 07-05-15 19:08/ 자국/ 신고/ 이댓글에댓글달기
역시 이런 것보단 실제 게임에서의 비교벤치가 나와야 알 수 있을 듯 싶군요. 그나저나 기사하나 읽는데 이렇게 힘들다니 ㅡㅡ;;

Meho (ho5945) ho5945님의 미디어로그 가기  / 07-05-15 20:46/ 자국/ 신고/ 이댓글에댓글달기
전문적 용어가 너무 많아서 이정도 양이 엄청나게 많게 느껴지네요..ㅠㅠ 복사해 뒀다가 나중에 봐야지~
잘빠진몸매 (kss8569) kss8569님의 미디어로그 가기  / 07-05-15 21:18/ 자국/ 신고/ 이댓글에댓글달기
용어 가 뭐가뭕...ㅜㅜ

시골 남자 (kyta123) kyta123님의 미디어로그 가기  / 07-05-15 22:43/ 자국/ 신고/ 이댓글에댓글달기
결론은 엔비디아사의 GeForce 8800 GTX
가 더 월등하다는 표현을 전문용어를 써서 이야기하고 있군요.
gbg90 (ID) / 07-05-15 23:37/ 자국/ 신고/ 이댓글에댓글달기
벤치결과로는 8800gtx 가 약간 압도적이였던것 같습니다

MC남C (skarhkdg) / 07-05-15 23:37/ 자국/ 신고/ 이댓글에댓글달기
전문가가 전문용어 사용하며 설명하니 무지 어렵군요..;;
산쵸 (jus9430) / 07-05-15 23:44/ 자국/ 신고/ 이댓글에댓글달기
뭐 대충보니 nVidia는 역시 현실적인 면, 실리적인 면을 택한거고 AMD는 명분 이런쪽을 택했나봅니다. 현 시대에는 쓸모없거나 효율이 떨어지는 기능들이 탑재되어있어서 실제 벤치나 게임에서의 차이가 거의 없다. 뭐 이런 수준으로 보이는군요.
FREEDOM X (aft1) / 07-05-16 9:17/ 자국/ 신고/ 이댓글에댓글달기
기술자가 비교글을 올리넉시기는 한데, 자사홍보하는데,꽤 시간들이내요..다른 회사시각도 참신하기는 합니다.,

양준하 (yakmo) / 07-05-16 9:57/ 자국/ 신고/ 이댓글에댓글달기
결과적으로.. ATI는 드라이버 제대로 못만들면 꽝이 된다는 얘기도 있군요;
엔비댜는 그 문제점을 피하기위한 구조를 선택해서 문제가 없다 .. 라고 주장하고...

라지만... 엔비댜도 드라이버로 골치좀 썩고 있죠; (그~ 문제는 아니라도.. )
osocomo / 07-05-16 10:37/ 자국/ 신고/ 이댓글에댓글달기
Impress Watch 웹사이트 주소가 어떻게 되지요? 출처 표시를 해주셔야 원문을 볼 수 있을텐데.

당신기억 (bluemun) bluemun님의 미디어로그 가기  / 07-05-16 11:16/ 자국/ 신고/ 이댓글에댓글달기
ATI가 성능이 밀리는 이유가 있었군요.

박오현 (ohhobod) / 07-05-16 11:44/ 자국/ 신고/ 이댓글에댓글달기
ati가 성능에서 좀 뒤쳐지더라도 빨리 나와 보급형에서 두각을 나타내어주길 바랄 뿐인데 너무 시간을 끄네요
jin2006 (ID) / 07-05-16 14:54/ 자국/ 신고/ 이댓글에댓글달기
잘 모르겠지만 이번엔 n 쪽이 잘 한듯...

Noir (iamafool) iamafool님의 미디어로그 가기  / 07-05-16 22:15/ 자국/ 신고/ 이댓글에댓글달기
이해하기 힘든 설명이 많네요
제이슨 / 07-05-17 10:54/ 자국/ 신고/ 이댓글에댓글달기
한마디로 쉽게 말하면 일을 빠르게 하는 것에는 2가지가 있다. 한가지는 몸을 빠르게 움직이는 것, 두번째는 일을 효율적으로 하는 것. 결국에는 N당은 후자를 택한 것이고, A당은 전자를 택한 것이내요. 서로 일장일단은 있겠지만 지금까지의 벤치와 같이 이번 A당은 효율성면에서는 좀 안좋네요.
qodish (ID) / 07-05-17 23:44/ 자국/ 신고/ 이댓글에댓글달기
되게 말 꼬아서 말하네....
리넙스 (rinups) rinups님의 미디어로그 가기  / 07-05-19 0:43/ 자국/ 신고/ 이댓글에댓글달기
흠...논리적으로 답변을 아주 잘하네요 ㅡ,.ㅡ

ET뽕 (yunkj) yunkj님의 미디어로그 가기  / 07-05-19 9:02/ 자국/ 신고/ 이댓글에댓글달기
GPU의 차이를 어렴풋이 느낄 수 있네요
blasty (ID) blasty님의 미디어로그 가기  / 07-05-20 8:27/ 자국/ 신고/ 이댓글에댓글달기
둘다 전기 많이 먹는 괴물인데..

전진맨 (jenjinman) jenjinman님의 미디어로그 가기  / 07-05-20 11:26/ 자국/ 신고/ 이댓글에댓글달기
조금 어렵게 느껴지네요.
쯩교 (y20303) y20303님의 미디어로그 가기  / 07-05-20 19:58/ 자국/ 신고/ 이댓글에댓글달기
뭐 시장의 평가를 지켜보면서,,

니 애미 (pmicro) pmicro님의 미디어로그 가기  / 07-05-20 21:36/ 자국/ 신고/ 이댓글에댓글달기
A당이 더 빠른 것 같더군요.

followme95 (jlee95) jlee95님의 미디어로그 가기  / 07-05-20 22:32/ 자국/ 신고/ 이댓글에댓글달기
이런 깊은 기술적인 문제까지..

공유신 (koysin) koysin님의 미디어로그 가기  / 07-05-20 22:34/ 자국/ 신고/ 이댓글에댓글달기
사용자 평가가 중요할것 같군요.

일장춘몽 (sky0734) sky0734님의 미디어로그 가기  / 07-05-20 23:21/ 자국/ 신고/ 이댓글에댓글달기
읽어보면 유익정보군요..
닉네임 웹봇방지

홈으로 탑으로
 
 
2026년 10월
주간 히트 랭킹

[결과발표] 2026년 3분기 포인트 소진 로또 5
[결과발표] 2026년 2분기 포인트 소진 로또 13
[결과발표] 2026년 1분기 포인트 소진 로또 15
[결과발표] 2025년 4분기 포인트 소진 로또 17
[결과발표] 2025년 3분기 포인트 소진 로또 16

실시간 댓글
소셜 네트워크