اجرای مدل‌های هوش مصنوعی به‌صورت محلی معمولاً به مقدار زیادی VRAM نیاز دارد و همه کاربران نیز به کارت گرافیکی جدید و قدرتمندی با بیش از ۲۰ گیگابایت VRAM دسترسی ندارند. با این حال، چند مدل سبک و در عین حال توانمند وجود دارند که بسته به نوع استفاده می‌توانند حتی با ۸ گیگابایت VRAM یا کمتر نیز عملکرد قابل‌قبولی ارائه دهند.

این مدل‌ها برای کاربران دارای کارت‌های گرافیک NVIDIA و AMD جذاب هستند و می‌توانند امکان اجرای مدل‌های زبانی بزرگ را روی سخت‌افزارهای قدیمی‌تر فراهم کنند. با اینتوتک همراه باشید تا مدل‌های بهینه برای رم ویدیویی ۸ گیگابایت کمتر را معرفی کنیم و بنچمارکی از مدل‌های مختلف ارایه کنیم.

سیستم آزمایشی و انتظارات از عملکرد

یک سیستم تمام AMD با امکان تعیین سقف VRAM

برای ارزیابی مدل‌ها می‌توان از لپ‌تاپی مجهز به یکی از پردازنده‌های سری Ryzen AI Max استفاده کرد. این خانواده از پردازنده‌ها به GPU مجتمع قدرتمندی مجهز هستند که در برخی سناریوها می‌تواند عملکردی نزدیک به کارت‌های گرافیک موبایل میان‌رده ارائه دهد.

یکی از تفاوت‌های مهم این سیستم‌ها با کارت‌های گرافیک مجزا این است که GPU مجتمع VRAM اختصاصی ندارد و بخشی از حافظه RAM سیستم را به‌عنوان حافظه گرافیکی به کار می‌گیرد. در برخی لپ‌تاپ‌های مجهز به Ryzen AI Max می‌توان مقدار حافظه اختصاص‌یافته به GPU را از طریق BIOS تنظیم کرد.

این قابلیت امکان شبیه‌سازی شرایطی با مقدارهای مختلف رم ویدیویی را فراهم می‌کند. به عنوان مثال، با تعیین سقف ۸ گیگابایت می‌توان بررسی کرد که مدل‌های مختلف هوش مصنوعی در شرایطی مشابه یک GPU با ۸ گیگابایت VRAM چگونه عمل می‌کنند.

محدودیت رم ویدیویی در اجرای مدل‌های محلی اهمیت زیادی دارد و انتخاب مدل مناسب می‌تواند تفاوت قابل‌توجهی در سرعت و امکان اجرای آن ایجاد کند. البته این پردازنده‌ها می‌توانند در برخی پیکربندی‌ها مقدار بسیار بیشتری از حافظه سیستم را در اختیار GPU قرار دهند؛ اما در چنین آزمایشی، محدود کردن حافظه به ۸ گیگابایت باعث می‌شود مدل‌ها در شرایط سخت‌تری آزمایش شوند.

معرفی ۸ مدل هوش مصنوعی لوکال برای کارت گرافیک‌هایی با ۸ گیگابایت رم یا کمتر

Phi-3.5 Mini (3.8B)

سریع و کم‌مصرف

Phi-3.5 Mini یکی از مدل‌های سبک مایکروسافت است که برای اجرای سریع روی سخت‌افزارهای محدود طراحی شده است. اندازه نسبتاً کوچک این مدل باعث می‌شود فشار کمتری به VRAM وارد شود و در عین حال بتواند عملکرد مناسبی در بسیاری از کارهای روزمره ارائه دهد.

معرفی ۸ مدل هوش مصنوعی لوکال برای کارت گرافیک‌هایی با ۸ گیگابایت رم یا کمتر

یکی از نقاط قوت Phi-3.5 Mini سرعت بالای تولید توکن است و در سیستم‌هایی با منابع محدود می‌تواند پاسخ‌ها را با سرعت قابل‌توجهی تولید کند.

با این حال، اندازه کوچک مدل محدودیت‌هایی نیز دارد. در مسائل چندمرحله‌ای پیچیده ممکن است عملکرد آن به اندازه مدل‌های بزرگ‌تر قابل اعتماد نباشد و در برخی وظایف نیز محدودیت‌های بیشتری داشته باشد.

در نتیجه، Phi-3.5 Mini بیشتر برای کارهایی مناسب است که سرعت و مصرف پایین حافظه اهمیت بیشتری از توانایی استدلال پیچیده دارند.

Llama 3.1 (8B)

یک مدل همه‌منظوره متعادل

Llama 3.1 8B یکی از متعادل‌ترین گزینه‌ها برای اجرای محلی است. این مدل می‌تواند در طیف گسترده‌ای از وظایف عمومی و استدلالی عملکرد مناسبی ارائه دهد و به همین دلیل برای کاربرانی که تنها یک مدل محلی می‌خواهند، گزینه جذابی محسوب می‌شود.

با استفاده از کوانتیزه‌سازی ۴ بیتی، نیاز حافظه مدل به میزان قابل‌توجهی کاهش پیدا می‌کند و اجرای آن روی GPUهای دارای ۸ گیگابایت VRAM امکان‌پذیرتر می‌شود.

البته کوانتیزه‌سازی شدیدتر یک هزینه نیز دارد. کاهش دقت عددی می‌تواند کیفیت خروجی را تا حدی کاهش دهد؛ با این حال، در سیستم‌هایی که رم ویدیویی محدود دارند، استفاده از نسخه ۴ بیتی معمولاً انتخاب منطقی‌تری است، زیرا اجرای نسخه دقیق‌تر می‌تواند بخش زیادی از حافظه گرافیکی را اشغال کند.

معرفی ۸ مدل هوش مصنوعی لوکال برای کارت گرافیک‌هایی با ۸ گیگابایت رم یا کمتر

Mistral 7B (v0.3)

سریع و پایدار

Mistral 7B یکی دیگر از مدل‌های محبوب در این محدوده است و نسبت مناسبی میان سرعت و کیفیت ایجاد می‌کند. نسخه v0.3 این مدل نسبت به نسخه قبلی، واژگان گسترده‌تری دارد و برای استفاده با ابزارهای مختلف اجرای مدل طراحی شده است.

کوانتیزه‌سازی ۴ بیتی نیز می‌تواند مصرف حافظه Mistral 7B را کاهش دهد و امکان اجرای آن را روی سیستم‌های دارای VRAM محدود فراهم کند.

با وجود این، مدل‌های مختلف Mistral محدودیت‌هایی در طول زمینه یا Context دارند که بسته به نسخه و ابزار اجرای مورد استفاده باید در نظر گرفته شوند. برای کارهای فنی و پروژه‌هایی که به زمینه بسیار طولانی نیاز دارند، ممکن است مدل‌های دیگری گزینه مناسب‌تری باشند.

در مقابل، برای نویسندگی خلاقانه و بسیاری از وظایف ساده‌تر، Mistral 7B همچنان می‌تواند گزینه‌ای سریع و کاربردی باشد.

معرفی ۸ مدل هوش مصنوعی لوکال برای کارت گرافیک‌هایی با ۸ گیگابایت رم یا کمتر

Qwen 2.5 (7B)

قدرتمند اما کمی رسمی

Qwen 2.5 7B یکی از گزینه‌های مناسب برای اجرای محلی است؛ به‌خصوص برای کاربرانی که به پشتیبانی از زبان‌های مختلف اهمیت می‌دهند.

این مدل برای وظایف چندزبانه عملکرد مناسبی دارد و می‌تواند متن را در زبان‌های مختلف پردازش و تولید کند. اندازه ۷ میلیارد پارامتری آن نیز باعث می‌شود با کوانتیزه‌سازی مناسب بتوان آن را در محدوده سخت‌افزاری ۸ گیگابایت VRAM اجرا کرد.

یکی از ویژگی‌هایی که ممکن است برای بعضی کاربران مزیت و برای برخی دیگر نقطه ضعف باشد، لحن نسبتاً رسمی پاسخ‌ها است. همین ویژگی باعث می‌شود Qwen 2.5 برای وظایف فنی و متون ساختاریافته گزینه خوبی باشد؛ اما برای مکالمه‌های کاملاً خودمانی یا تولید محتوای خلاقانه شاید انتخاب اول نباشد.

معرفی ۸ مدل هوش مصنوعی لوکال برای کارت گرافیک‌هایی با ۸ گیگابایت رم یا کمتر

Gemma 2 (9B)

قدرتمندترین گزینه در این محدوده

Gemma 2 9B یکی از بزرگ‌ترین مدل‌های این فهرست است که می‌توان با ۸ گیگابایت VRAM و کوانتیزه‌سازی مناسب سراغ آن رفت.

مدل ۹ میلیارد پارامتری Gemma 2 در مقایسه با مدل‌های کوچک‌تر، توانایی بیشتری در بسیاری از وظایف پیچیده دارد. با این حال، اجرای آن روی ۸ گیگابایت VRAM به کوانتیزه‌سازی ۴ بیتی نیاز دارد و فضای بسیار کمی برای سایر مصرف‌های حافظه باقی می‌گذارد.

از سوی دیگر، سرعت آن لزوماً به اندازه مدل‌های ۷ میلیارد پارامتری یا کوچک‌تر نیست. بنابراین اگر سرعت پاسخ‌دهی اهمیت بیشتری از کیفیت خروجی داشته باشد، یک مدل کوچک‌تر می‌تواند انتخاب مناسب‌تری باشد.

معرفی ۸ مدل هوش مصنوعی لوکال برای کارت گرافیک‌هایی با ۸ گیگابایت رم یا کمتر

DeepSeek-R1-Distill-Qwen (7B)

مدل DeepSeek برای سیستم‌های دارای ۸ گیگابایت رم ویدیویی

DeepSeek-R1-Distill-Qwen 7B نسخه تقطیرشده‌ای از خانواده DeepSeek-R1 است که قابلیت‌های استدلالی این خانواده را در قالب مدلی کوچک‌تر ارائه می‌کند.

این مدل با کوانتیزه‌سازی Q4 می‌تواند روی سیستم‌های دارای VRAM محدود اجرا شود و برای وظایفی که به استدلال چندمرحله‌ای نیاز دارند، جذاب است.

معرفی ۸ مدل هوش مصنوعی لوکال برای کارت گرافیک‌هایی با ۸ گیگابایت رم یا کمتر

نقطه ضعف اصلی چنین مدل‌هایی این است که فرایند استدلال می‌تواند پاسخ‌گویی را نسبت به مدل‌های ساده‌تر کندتر کند. در نتیجه، اگر سرعت پاسخ اهمیت اصلی داشته باشد، مدل‌های کوچک‌تر و سریع‌تر گزینه مناسب‌تری هستند؛ اما برای حل مسئله و وظایف نیازمند استدلال، DeepSeek-R1-Distill-Qwen می‌تواند ارزش بررسی داشته باشد.

DeepSeek-Coder (6.7B)

DeepSeek تخصصی برای برنامه‌نویسی

همان‌طور که از نام آن مشخص است، DeepSeek-Coder برای وظایف مرتبط با برنامه‌نویسی و اشکال‌زدایی طراحی شده است.

اندازه ۶.۷ میلیارد پارامتری این مدل باعث می‌شود با کوانتیزه‌سازی ۴ بیتی بتوان آن را با محدودیت حافظه ۸ گیگابایتی اجرا کرد و همچنان فضای بیشتری برای پردازش درخواست‌های نسبتاً سنگین باقی بماند.

با این حال، تخصصی بودن مدل یک نقطه ضعف نیز محسوب می‌شود. DeepSeek-Coder برای تولید محتوای خلاقانه و وظایف عمومی الزاماً به اندازه مدل‌های همه‌منظوره مناسب نیست. بنابراین اگر هدف اصلی برنامه‌نویسی و اشکال‌زدایی باشد، این مدل انتخاب مناسبی است؛ در غیر این صورت بهتر است سراغ یک مدل عمومی‌تر رفت.

Gemma 2 (2B)

دانش عمیق از جهان نقطه ضعف آن است

Gemma 2 2B یکی از سبک‌ترین گزینه‌های این فهرست است و برای سیستم‌هایی طراحی شده که حافظه گرافیکی بسیار محدودی دارند.

اندازه کوچک این مدل باعث می‌شود سرعت اجرای آن بالا باشد و برای کارهایی که به پاسخ سریع نیاز دارند گزینه مناسبی باشد. در عوض، تنها ۲ میلیارد پارامتر دارد و نمی‌توان از آن انتظار سطح دانش و توانایی استدلال مدل‌های بزرگ‌تر را داشت.

به همین دلیل، Gemma 2 2B بیشتر برای وظایف ساده‌ای مانند ترجمه محلی، خلاصه‌سازی و پردازش‌های سریع متن مناسب است. برای پرسش‌های پیچیده یا وظایفی که به دانش گسترده و استدلال عمیق نیاز دارند، بهتر است از مدل بزرگ‌تری استفاده شود.

مقایسه عملکرد مدل‌ها

نتیجه‌گیری از آزمایش‌ها

برای مقایسه مدل‌ها می‌توان از یک اسکریپت آزمایشی در Arch Linux و ابزارهایی مانند Ollama استفاده کرد. در سیستم‌های مجهز به GPUهای AMD، نصب و استفاده از ROCm نیز اهمیت زیادی دارد و پشتیبانی Ollama از پردازنده‌های گرافیکی AMD مبتنی بر ROCm امکان اجرای مدل‌های محلی را روی طیف گسترده‌ای از سخت‌افزارهای این شرکت فراهم می‌کند.

در آزمایش‌هایی با Ryzen AI Max 390 می‌توان دو حالت مختلف حافظه گرافیکی را مقایسه کرد: حالت Auto که حافظه موردنیاز GPU را به‌صورت پویا اختصاص می‌دهد و حالت محدودشده به ۸ گیگابایت.

نتایج بنچمارک و عملکرد مدل‌های مختلف هوش مصنوعی در حالتی که رم ویدیویی محدودیت ۸ گیگابایتی دارد به صورت زیر است:

معرفی ۸ مدل هوش مصنوعی لوکال برای کارت گرافیک‌هایی با ۸ گیگابایت رم یا کمتر

در چنین مقایسه‌ای، حالت Auto معمولاً می‌تواند اندکی عملکرد بهتری ارائه دهد؛ زیرا سیستم مجبور نیست خود را به یک سقف ثابت حافظه محدود کند. با این حال، نتیجه دقیق به سخت‌افزار و شرایط اجرای مدل بستگی دارد. نمودار زیر عملکرد مدل‌های مختلف هوش مصنوعی در حالتی که سقف رم ویدیویی محدود نیست را نشان می‌دهد.

معرفی ۸ مدل هوش مصنوعی لوکال برای کارت گرافیک‌هایی با ۸ گیگابایت رم یا کمتر

همچنین عملکرد GPU مجتمع به دمای سیستم و محدودیت‌های توان وابسته است. پس از اجرای طولانی‌مدت، افزایش دما می‌تواند باعث کاهش سرعت پردازش شود. بنابراین نتایج یک آزمایش کوتاه لزوماً عملکرد مداوم یک سیستم را نشان نمی‌دهد.

انتظارات خود را از ۸ گیگابایت رم ویدیویی مدیریت کنید

۸ گیگابایت VRAM برای اجرای مدل‌های هوش مصنوعی محلی یک نقطه شروع مناسب است؛ اما محدودیت‌های آن خیلی زود مشخص می‌شوند.

هرچه مدل بزرگ‌تر باشد، حافظه بیشتری برای وزن‌های مدل نیاز دارد. علاوه بر این، بخشی از VRAM ممکن است توسط سیستم‌عامل و رابط گرافیکی مصرف شود و تمام ظرفیت اسمی کارت گرافیک در اختیار مدل قرار نگیرد.

موضوع مهم دیگر KV Cache است. این حافظه با ادامه یافتن مکالمه و افزایش تعداد توکن‌های موجود در Context بزرگ‌تر می‌شود و در نتیجه می‌تواند به‌تدریج بخش بیشتری از حافظه را اشغال کند.

به همین دلیل، ممکن است مدلی که در یک گفت‌وگوی کوتاه به‌راحتی روی ۸ گیگابایت VRAM اجرا می‌شود، هنگام پردازش مکالمه‌ای طولانی‌تر با محدودیت حافظه مواجه شود.

با وجود این محدودیت‌ها، ۸ گیگابایت رم ویدیویی به معنای غیرممکن بودن اجرای هوش مصنوعی محلی نیست. مدل‌های کوچک و کوانتیزه‌شده می‌توانند بسیاری از وظایف روزمره را به‌صورت محلی انجام دهند و نقطه شروع مناسبی برای ورود به دنیای اجرای مدل‌های هوش مصنوعی روی سخت‌افزار شخصی باشند.

نتیجه‌ی کلی بنچمارک را بررسی کنید:

معرفی ۸ مدل هوش مصنوعی لوکال برای کارت گرافیک‌هایی با ۸ گیگابایت رم یا کمتر

در واقع، انتخاب مدل مناسب اهمیت بیشتری از صرفاً انتخاب بزرگ‌ترین مدل ممکن دارد. برای ترجمه و خلاصه‌سازی سریع، یک مدل کوچک مانند Gemma 2 2B می‌تواند کافی باشد؛ برای استفاده عمومی Llama 3.1 8B یا Qwen 2.5 7B گزینه‌های متعادل‌تری هستند و برای برنامه‌نویسی یا وظایف استدلالی می‌توان سراغ مدل‌های تخصصی‌تر رفت.