커뮤니티 빌런 18+엔비디아 RTX 5090, AI 추론 성능 M5 Max 앞서 … 메모리가 변수
브랜드로그

애플

브랜드로그 정보 애플 기술과 디자인의 경계를 허물어, 세상이 경험하는 혁신을 다시 쓰는 애플!
구독자 : 6
운영자 : 대장
엔비디아 RTX 5090, AI 추론 성능 M5 Max 앞서 … 메모리가 변수
쪽지 승인 : 2026-08-22 15:41:01
0
0


엔비디아 노트북용 지포스 RTX 5090이 다양한 대규모 언어모델(LLM) 테스트에서 애플 M5 Max를 앞서는 성능을 기록했다. 다만 AI 모델이 커지거나 컨텍스트(Context Length)가 길어질수록 M5 Max의 대용량 통합 메모리(Unified Memory)가 강점을 보이며 결과가 뒤집혔다.


유튜버 알렉스 지스킨드(Alex Ziskind)는 최신 레이저 블레이드 18(Razer Blade 18)과 16인치 맥북 프로(M5 Max)를 이용해 다양한 LLM 추론 성능을 비교했다. 테스트는 프롬프트 처리(Prompt Processing)와 토큰 생성(Token Generation)을 중심으로 진행됐다.


먼저 Qwen3 4B를 4비트 양자화 환경에서 컨텍스트 길이 26만2144로 실행한 결과, M5 Max가 크게 앞섰다. RTX 5090 노트북 GPU는 24GB VRAM 대부분이 사용되면서 초당 25.28토큰을 생성하는 데 그쳤다. 반면 128GB 통합 메모리를 탑재한 M5 Max는 초당 181.40토큰을 기록했다.

 


차이는 메모리로 인해 발생했다. 컨텍스트 길이가 길어질수록 KV 캐시와 모델 데이터가 VRAM을 빠르게 채우게 된다. 24GB VRAM을 사용하는 RTX 5090은 메모리 한계에 먼저 도달한 반면, M5 Max는 대용량 통합 메모리를 활용해 더 많은 데이터를 유지할 수 있다. 반대로 컨텍스트 길이를 약 6만8000 수준으로 줄이자 결과는 크게 달라졌다. VRAM 여유가 확보되면서 RTX 5090의 토큰 생성 속도는 초당 160.36토큰까지 크게 향상된 것


다만 윈도우 환경에서 LM Studio, 애플 실리콘에서는 MLX를 사용해 직접적인 성능 비교는 어렵다.


또한, 중소형 모델에서는 RTX 5090이 우세했다. Gemma 4 12B와 Qwen3.5 27B, Qwen3.6 35B A3B 등을 llama.cpp에서 실행한 결과 프롬프트 처리와 토큰 생성 모두 RTX 5090이 M5 Max보다 높은 성능을 발휘했다. GPU 연산 성능을 적극 활용할 수 있는 환경에서는 RTX 5090이 확실한 우위를 보인 것이다.


그러나 모델 규모를 키우면서 상황은 역전됐다. Qwen3.5 122B처럼 초대형 모델에서는 RTX 5090의 24GB VRAM만으로는 실행 자체가 어려웠다. 반면 M5 Max는 최대 128GB 통합 메모리를 활용해 약 94GB의 메모리를 사용하면서 프롬프트 처리 초당 139토큰, 토큰 생성 초당 47.4토큰을 기록했다.


즉, AI 추론에서 연산 성능만큼 메모리 용량이 중요해지고 있음을 시사한다.


GPU 성능이 아무리 높더라도 VRAM이 부족하면 대형 모델이나 긴 컨텍스트 환경에서는 성능이 급격히 저하될 수 있다. 반대로 통합 메모리 구조는 메모리 용량에서는 강점을 갖지만, GPU 연산 성능이 충분히 활용되는 환경에서는 RTX 5090 같은 고성능 GPU가 더 높은 처리량을 제공할 수 있다.


현장에서는 AI PC 경쟁 구도의 핵심이 메모리로 올겨갈 것이라 내다봤다. 
대형 LLM과 에이전트 AI가 보편화될수록 메모리 용량이 곧 성능을 좌우하는 핵심 요소가 될 전망이다.

 

@nvidia

@apple
 

0
0
By 콘텐츠 제보 및 정정요청 = master@villain.city
저작권자ⓒ 커뮤니티 빌런 18+ ( Villain ), 무단전재 및 재배포 Ai 학습 포함 금지
Comment
최대 128x128 권장