سال‌ها AMD از نظر عملکرد در بیشتر کاربردهای مربوط به هوش مصنوعی، از NVIDIA عقب‌تر بوده است. NVIDIA تقریباً همیشه گزینه قدرتمندتری محسوب می‌شده، حتی اگر این برتری با پرداخت هزینه بیشتر به دست می‌آمد؛ موضوعی که هنوز هم تا حدی صدق می‌کند.

خوشبختانه به نظر می‌رسد AMD تا حد زیادی خود را به NVIDIA رسانده است و بسته‌ی نرم‌افزاری Radeon Open Compute یا ROCm این شرکت نیز در Linux تجربه‌ای شگفت‌انگیز و لذت‌بخش ارائه می‌دهد. در این مقاله از اینتوتک می‌خواهیم عملکرد کارت گرافیک انویدیا و ای‌ام‌دی در پردازش مدل‌های بزرگ زبانی یا به اختصار LLM روی کامپیوتر را با نگاهی به بنچ‌مارک‌ها مقایسه کنیم و به این سوال پاسخ دهیم که اگر بودجه محدود باشد و بخواهیم کارت گرافیک‌های نسبتاً ارزان را برای هوش مصنوعی انتخاب کنیم، انویدیا گزینه‌ی بهتری است یا ای‌ام‌دی نیز عملکرد قابل قبولی دارد؟

عرضه سخت‌افزارهای جدیدتر مانند پردازنده‌های Ryzen AI به پیشرفت AMD در عرصه‌ی هوش مصنوعی کمک کرده است. برای مقایسه بین محصولات انویدیا و ای‌ام‌دی، لپ‌تاپ ROG Flow Z13 با ۳۲ گیگابایت حافظه RAMو چیپست AMD Ryzen AI Max 390 مورد بررسی قرار می‌گیرد. این ویژگی هم یک مزیت و هم یک محدودیت محسوب می‌شود، زیرا AI Max این مجموعه حافظه را بین VRAM و RAM سیستم به اشتراک می‌گذارد و همین موضوع شرایط را کمی پیچیده می‌کند.

راه‌اندازی کامل روی Arch Linux

نگاهی به سیستم مورد استفاده برای آزمایش

نصب Ollama روی Arch Linux بسیار ساده است. برای راه‌اندازی آن کافی است ترمینال باز شود و جدیدترین نسخه از AUR با استفاده از Pacman دانلود شود.

از آنجا که این سیستم کاملاً مبتنی بر AMD است، باید چند پکیج به صورت انتخابی نصب شوند. دو گزینه انتخاب‌شده، ollama-vulkan و ollama-rocm هستند و پس از آن سرویس Ollama در سراسر سیستم فعال می‌شود.

sudo pacman -S ollama ollama-vulkan ollama-rocm rocm-hip-sdk rocm-opencl-sdk

sudo systemctl enable --now ollama

امکان نصب کامل Ollama از طریق یک اسکریپت نصب تحت وب نیز وجود دارد، اما این روش عمداً انتخاب نمی‌شود. دلیل آن این است که با نصب از طریق پکیج‌ها می‌توان به‌روزرسانی‌های متمرکز سیستم را در اختیار داشت و برای دریافت به‌روزرسانی‌ها به سازوکار جداگانه Ollama وابسته نبود.

پس از راه‌اندازی Ollama، نوبت به اجرای چند مدل می‌رسد:

  • gemma2:9b
  • mistral:7b
  • phi4:14b
  • deepseek-r1:8b
  • deepseek-r1:14b
  • llava:7b
  • llava:13b

البته محدودیت‌های سخت‌افزاری نیز باید در نظر گرفته شوند. مدل مورد استفاده از Flow Z13 به چیپست ضعیف‌تر AI Max 390 مجهز است و از iGPU یا پردازنده‌ی گرافیکی مجتمع مدل Radeon 8050S بهره می‌برد که 8 واحد محاسباتی یا CU کمتر از مدل پرچم‌دار 8060S دارد.

این سیستم همچنین تنها ۳۲ گیگابایت حافظه اشتراکی بین سیستم و iGPU دارد که تعداد مدل‌هایی را که می‌توان به صورت همزمان اجرا کرد محدود می‌کند. با این حال، امکان اختصاص حداکثر ۲۴ گیگابایت VRAM از داخل BIOS وجود دارد که از این نظر می‌تواند با بیشتر GPUهای رده‌بالای مصرفی برابری کند.

اما این تنها نیمی از ماجراست؛ پهنای باند حافظه نیز باید در نظر گرفته شود که در AI Max حدود ۲۵۶ گیگابایت بر ثانیه است. برای مقایسه، RX 9070 پهنای باند ۶۴۰ گیگابایت بر ثانیه دارد و یکی از بهترین گزینه‌های AMD محسوب می‌شود. بنابراین در نگاه اول کاملاً مشخص است که عملکرد AI Max چندان چشمگیر به نظر نمی‌رسد.

اجرای بنچمارک‌ها

نتایج نسبتاً شگفت‌انگیز ROCm در مقایسه با Vulkan

برای اجرای بنچمارک‌ها از مجموعه llm-benchmark استفاده می‌شود که وابستگی‌های مورد نیاز را به صورت خودکار دریافت می‌کند.

sudo pacman -S python-pip python-pipx

pipx install llm-benchmark

llm_benchmark run

با جابه‌جایی بین بک‌اندهای Vulkan و ROCm، مجموعه‌ای از بنچمارک‌ها اجرا می‌شوند که تکمیل آن‌ها مدتی زمان می‌برد. سیستم نیز با حداکثر TDP ممکن تحت فشار قرار می‌گیرد.

مقایسه AMD و NVIDIA در پردازش مدل‌های هوش مصنوعی در لپ‌تاپ، رایزن بهتر است یا RTX 4050 Mobile؟

نتایج نشان می‌دهند که فاصله عملکرد ROCm و Vulkan بسیار کمتر از چیزی است که انتظار می‌رود. در بیشتر موارد، عملکرد هر دو تقریباً یکسان است. با این حال، خطاهای «out of memory» در ROCm به دفعات مشاهده می‌شوند. به همین دلیل در شرایط فعلی توصیه ROCm کمی دشوار است و برای تجربه‌ای پایدارتر، استفاده از Vulkan گزینه بهتری خواهد بود.

Radeon 8050S با ۳۲ واحد محاسباتی به دلیل فرم‌فکتور کوچک و TDP پایین‌تر، عملکرد قابل توجهی دارد و به RTX 4060 Mobile نزدیک می‌شود؛ در حالی که RTX 4060 Mobile یک GPU میان‌رده است که مصرف انرژی بسیار بیشتری دارد. RTX 4060 Mobile قدرت پردازشی بیشتری دارد، اما به دلیل تنها ۸ گیگابایت VRAM، ناگزیر با محدودیت حافظه مواجه خواهد شد.

مقایسه AMD و NVIDIA در پردازش مدل‌های هوش مصنوعی در لپ‌تاپ، رایزن بهتر است یا RTX 4050 Mobile؟

در مقابل، Strix Halo به کل ۳۲ گیگابایت حافظه RAM دسترسی دارد و همین موضوع آن را به گزینه‌ای واضح برای اجرای LLMهای سنگین‌تر تبدیل می‌کند. این یکی از ویژگی‌هایی است که در محصولات AMD به مرور به آن عادت خواهید کرد.

از سوی دیگر، یک RX 9070 XT دسکتاپ در مدل‌های 7B می‌تواند به حداکثر عملکرد 95 توکن بر ثانیه برسد که تقریباً دو برابر عملکرد 8050S است. این کارت همچنین از نظر ارزش خرید و پهنای باند حافظه وضعیت بسیار بهتری دارد و به همین دلیل برای بیشتر کاربران انتخاب ساده‌تری محسوب می‌شود.

مقایسه AMD و NVIDIA در پردازش مدل‌های هوش مصنوعی در لپ‌تاپ، رایزن بهتر است یا RTX 4050 Mobile؟

با این حال، وقتی تمام گزینه‌های AMD با RTX 5090 انویدیا مقایسه می‌شوند، فاصله عملکرد به شکل محسوسی افزایش پیدا می‌کند. RTX 5090 به‌سادگی کارت بسیار بهتری برای اجرای محلی مدل‌های هوش مصنوعی است، ولیکن قیمت سرسام‌آور آن نیز برای بیشتر کاربران غیرمنطقی و بسیار بالا محسوب می‌شود. در مقابل، AMD انتخاب منطقی‌تری است که بسیار ارزان‌تر است و در ازای قیمت خود عملکرد رقابتی ارائه می‌دهد.

عملکرد مناسب است، اما ارزش خرید جایی است که AMD واقعاً می‌درخشد

نمی‌توان انکار کرد که NVIDIA در حال حاضر بهترین گزینه برای اجرای LLMها را ارائه می‌دهد، اما AMD طی سال‌های اخیر عملکرد بسیار خوبی در کاهش این فاصله داشته است. هم ROCm و هم Vulkan پیشرفت‌های قابل توجهی داشته‌اند و AMD حالا به یک جایگزین شگفت‌انگیز و کاملاً رقابتی تبدیل شده است. در واقع اگر بودجه بسیار محدود باشد، ای‌ام‌دی کم و بیش برنده‌ی رقابت است.

دلیل چندانی برای پرداخت هزینه بیشتر جهت خرید کارت NVIDIA وجود ندارد؛ به‌خصوص وقتی در نظر گرفته شود که بسیاری از این کارت‌ها از نظر مقدار VRAM با محدودیت‌های قابل توجهی مواجه هستند.