سالها AMD از نظر عملکرد در بیشتر کاربردهای مربوط به هوش مصنوعی، از NVIDIA عقبتر بوده است. NVIDIA تقریباً همیشه گزینه قدرتمندتری محسوب میشده، حتی اگر این برتری با پرداخت هزینه بیشتر به دست میآمد؛ موضوعی که هنوز هم تا حدی صدق میکند.
خوشبختانه به نظر میرسد AMD تا حد زیادی خود را به NVIDIA رسانده است و بستهی نرمافزاری Radeon Open Compute یا ROCm این شرکت نیز در Linux تجربهای شگفتانگیز و لذتبخش ارائه میدهد. در این مقاله از اینتوتک میخواهیم عملکرد کارت گرافیک انویدیا و ایامدی در پردازش مدلهای بزرگ زبانی یا به اختصار LLM روی کامپیوتر را با نگاهی به بنچمارکها مقایسه کنیم و به این سوال پاسخ دهیم که اگر بودجه محدود باشد و بخواهیم کارت گرافیکهای نسبتاً ارزان را برای هوش مصنوعی انتخاب کنیم، انویدیا گزینهی بهتری است یا ایامدی نیز عملکرد قابل قبولی دارد؟
عرضه سختافزارهای جدیدتر مانند پردازندههای Ryzen AI به پیشرفت AMD در عرصهی هوش مصنوعی کمک کرده است. برای مقایسه بین محصولات انویدیا و ایامدی، لپتاپ ROG Flow Z13 با ۳۲ گیگابایت حافظه RAMو چیپست AMD Ryzen AI Max 390 مورد بررسی قرار میگیرد. این ویژگی هم یک مزیت و هم یک محدودیت محسوب میشود، زیرا AI Max این مجموعه حافظه را بین VRAM و RAM سیستم به اشتراک میگذارد و همین موضوع شرایط را کمی پیچیده میکند.
راهاندازی کامل روی Arch Linux
نگاهی به سیستم مورد استفاده برای آزمایش
نصب Ollama روی Arch Linux بسیار ساده است. برای راهاندازی آن کافی است ترمینال باز شود و جدیدترین نسخه از AUR با استفاده از Pacman دانلود شود.
از آنجا که این سیستم کاملاً مبتنی بر AMD است، باید چند پکیج به صورت انتخابی نصب شوند. دو گزینه انتخابشده، ollama-vulkan و ollama-rocm هستند و پس از آن سرویس Ollama در سراسر سیستم فعال میشود.
sudo pacman -S ollama ollama-vulkan ollama-rocm rocm-hip-sdk rocm-opencl-sdk
sudo systemctl enable --now ollama
امکان نصب کامل Ollama از طریق یک اسکریپت نصب تحت وب نیز وجود دارد، اما این روش عمداً انتخاب نمیشود. دلیل آن این است که با نصب از طریق پکیجها میتوان بهروزرسانیهای متمرکز سیستم را در اختیار داشت و برای دریافت بهروزرسانیها به سازوکار جداگانه Ollama وابسته نبود.
پس از راهاندازی Ollama، نوبت به اجرای چند مدل میرسد:
- gemma2:9b
- mistral:7b
- phi4:14b
- deepseek-r1:8b
- deepseek-r1:14b
- llava:7b
- llava:13b
البته محدودیتهای سختافزاری نیز باید در نظر گرفته شوند. مدل مورد استفاده از Flow Z13 به چیپست ضعیفتر AI Max 390 مجهز است و از iGPU یا پردازندهی گرافیکی مجتمع مدل Radeon 8050S بهره میبرد که 8 واحد محاسباتی یا CU کمتر از مدل پرچمدار 8060S دارد.
این سیستم همچنین تنها ۳۲ گیگابایت حافظه اشتراکی بین سیستم و iGPU دارد که تعداد مدلهایی را که میتوان به صورت همزمان اجرا کرد محدود میکند. با این حال، امکان اختصاص حداکثر ۲۴ گیگابایت VRAM از داخل BIOS وجود دارد که از این نظر میتواند با بیشتر GPUهای ردهبالای مصرفی برابری کند.
اما این تنها نیمی از ماجراست؛ پهنای باند حافظه نیز باید در نظر گرفته شود که در AI Max حدود ۲۵۶ گیگابایت بر ثانیه است. برای مقایسه، RX 9070 پهنای باند ۶۴۰ گیگابایت بر ثانیه دارد و یکی از بهترین گزینههای AMD محسوب میشود. بنابراین در نگاه اول کاملاً مشخص است که عملکرد AI Max چندان چشمگیر به نظر نمیرسد.
اجرای بنچمارکها
نتایج نسبتاً شگفتانگیز ROCm در مقایسه با Vulkan
برای اجرای بنچمارکها از مجموعه llm-benchmark استفاده میشود که وابستگیهای مورد نیاز را به صورت خودکار دریافت میکند.
sudo pacman -S python-pip python-pipx
pipx install llm-benchmark
llm_benchmark run
با جابهجایی بین بکاندهای Vulkan و ROCm، مجموعهای از بنچمارکها اجرا میشوند که تکمیل آنها مدتی زمان میبرد. سیستم نیز با حداکثر TDP ممکن تحت فشار قرار میگیرد.
نتایج نشان میدهند که فاصله عملکرد ROCm و Vulkan بسیار کمتر از چیزی است که انتظار میرود. در بیشتر موارد، عملکرد هر دو تقریباً یکسان است. با این حال، خطاهای «out of memory» در ROCm به دفعات مشاهده میشوند. به همین دلیل در شرایط فعلی توصیه ROCm کمی دشوار است و برای تجربهای پایدارتر، استفاده از Vulkan گزینه بهتری خواهد بود.
Radeon 8050S با ۳۲ واحد محاسباتی به دلیل فرمفکتور کوچک و TDP پایینتر، عملکرد قابل توجهی دارد و به RTX 4060 Mobile نزدیک میشود؛ در حالی که RTX 4060 Mobile یک GPU میانرده است که مصرف انرژی بسیار بیشتری دارد. RTX 4060 Mobile قدرت پردازشی بیشتری دارد، اما به دلیل تنها ۸ گیگابایت VRAM، ناگزیر با محدودیت حافظه مواجه خواهد شد.
در مقابل، Strix Halo به کل ۳۲ گیگابایت حافظه RAM دسترسی دارد و همین موضوع آن را به گزینهای واضح برای اجرای LLMهای سنگینتر تبدیل میکند. این یکی از ویژگیهایی است که در محصولات AMD به مرور به آن عادت خواهید کرد.
از سوی دیگر، یک RX 9070 XT دسکتاپ در مدلهای 7B میتواند به حداکثر عملکرد 95 توکن بر ثانیه برسد که تقریباً دو برابر عملکرد 8050S است. این کارت همچنین از نظر ارزش خرید و پهنای باند حافظه وضعیت بسیار بهتری دارد و به همین دلیل برای بیشتر کاربران انتخاب سادهتری محسوب میشود.
با این حال، وقتی تمام گزینههای AMD با RTX 5090 انویدیا مقایسه میشوند، فاصله عملکرد به شکل محسوسی افزایش پیدا میکند. RTX 5090 بهسادگی کارت بسیار بهتری برای اجرای محلی مدلهای هوش مصنوعی است، ولیکن قیمت سرسامآور آن نیز برای بیشتر کاربران غیرمنطقی و بسیار بالا محسوب میشود. در مقابل، AMD انتخاب منطقیتری است که بسیار ارزانتر است و در ازای قیمت خود عملکرد رقابتی ارائه میدهد.
عملکرد مناسب است، اما ارزش خرید جایی است که AMD واقعاً میدرخشد
نمیتوان انکار کرد که NVIDIA در حال حاضر بهترین گزینه برای اجرای LLMها را ارائه میدهد، اما AMD طی سالهای اخیر عملکرد بسیار خوبی در کاهش این فاصله داشته است. هم ROCm و هم Vulkan پیشرفتهای قابل توجهی داشتهاند و AMD حالا به یک جایگزین شگفتانگیز و کاملاً رقابتی تبدیل شده است. در واقع اگر بودجه بسیار محدود باشد، ایامدی کم و بیش برندهی رقابت است.
دلیل چندانی برای پرداخت هزینه بیشتر جهت خرید کارت NVIDIA وجود ندارد؛ بهخصوص وقتی در نظر گرفته شود که بسیاری از این کارتها از نظر مقدار VRAM با محدودیتهای قابل توجهی مواجه هستند.
اینتوتک



