اجرای مدلهای هوش مصنوعی بهصورت محلی معمولاً به مقدار زیادی VRAM نیاز دارد و همه کاربران نیز به کارت گرافیکی جدید و قدرتمندی با بیش از ۲۰ گیگابایت VRAM دسترسی ندارند. با این حال، چند مدل سبک و در عین حال توانمند وجود دارند که بسته به نوع استفاده میتوانند حتی با ۸ گیگابایت VRAM یا کمتر نیز عملکرد قابلقبولی ارائه دهند.
این مدلها برای کاربران دارای کارتهای گرافیک NVIDIA و AMD جذاب هستند و میتوانند امکان اجرای مدلهای زبانی بزرگ را روی سختافزارهای قدیمیتر فراهم کنند. با اینتوتک همراه باشید تا مدلهای بهینه برای رم ویدیویی ۸ گیگابایت کمتر را معرفی کنیم و بنچمارکی از مدلهای مختلف ارایه کنیم.
سیستم آزمایشی و انتظارات از عملکرد
یک سیستم تمام AMD با امکان تعیین سقف VRAM
برای ارزیابی مدلها میتوان از لپتاپی مجهز به یکی از پردازندههای سری Ryzen AI Max استفاده کرد. این خانواده از پردازندهها به GPU مجتمع قدرتمندی مجهز هستند که در برخی سناریوها میتواند عملکردی نزدیک به کارتهای گرافیک موبایل میانرده ارائه دهد.
یکی از تفاوتهای مهم این سیستمها با کارتهای گرافیک مجزا این است که GPU مجتمع VRAM اختصاصی ندارد و بخشی از حافظه RAM سیستم را بهعنوان حافظه گرافیکی به کار میگیرد. در برخی لپتاپهای مجهز به Ryzen AI Max میتوان مقدار حافظه اختصاصیافته به GPU را از طریق BIOS تنظیم کرد.
این قابلیت امکان شبیهسازی شرایطی با مقدارهای مختلف رم ویدیویی را فراهم میکند. به عنوان مثال، با تعیین سقف ۸ گیگابایت میتوان بررسی کرد که مدلهای مختلف هوش مصنوعی در شرایطی مشابه یک GPU با ۸ گیگابایت VRAM چگونه عمل میکنند.
محدودیت رم ویدیویی در اجرای مدلهای محلی اهمیت زیادی دارد و انتخاب مدل مناسب میتواند تفاوت قابلتوجهی در سرعت و امکان اجرای آن ایجاد کند. البته این پردازندهها میتوانند در برخی پیکربندیها مقدار بسیار بیشتری از حافظه سیستم را در اختیار GPU قرار دهند؛ اما در چنین آزمایشی، محدود کردن حافظه به ۸ گیگابایت باعث میشود مدلها در شرایط سختتری آزمایش شوند.
Phi-3.5 Mini (3.8B)
سریع و کممصرف
Phi-3.5 Mini یکی از مدلهای سبک مایکروسافت است که برای اجرای سریع روی سختافزارهای محدود طراحی شده است. اندازه نسبتاً کوچک این مدل باعث میشود فشار کمتری به VRAM وارد شود و در عین حال بتواند عملکرد مناسبی در بسیاری از کارهای روزمره ارائه دهد.
یکی از نقاط قوت Phi-3.5 Mini سرعت بالای تولید توکن است و در سیستمهایی با منابع محدود میتواند پاسخها را با سرعت قابلتوجهی تولید کند.
با این حال، اندازه کوچک مدل محدودیتهایی نیز دارد. در مسائل چندمرحلهای پیچیده ممکن است عملکرد آن به اندازه مدلهای بزرگتر قابل اعتماد نباشد و در برخی وظایف نیز محدودیتهای بیشتری داشته باشد.
در نتیجه، Phi-3.5 Mini بیشتر برای کارهایی مناسب است که سرعت و مصرف پایین حافظه اهمیت بیشتری از توانایی استدلال پیچیده دارند.
Llama 3.1 (8B)
یک مدل همهمنظوره متعادل
Llama 3.1 8B یکی از متعادلترین گزینهها برای اجرای محلی است. این مدل میتواند در طیف گستردهای از وظایف عمومی و استدلالی عملکرد مناسبی ارائه دهد و به همین دلیل برای کاربرانی که تنها یک مدل محلی میخواهند، گزینه جذابی محسوب میشود.
با استفاده از کوانتیزهسازی ۴ بیتی، نیاز حافظه مدل به میزان قابلتوجهی کاهش پیدا میکند و اجرای آن روی GPUهای دارای ۸ گیگابایت VRAM امکانپذیرتر میشود.
البته کوانتیزهسازی شدیدتر یک هزینه نیز دارد. کاهش دقت عددی میتواند کیفیت خروجی را تا حدی کاهش دهد؛ با این حال، در سیستمهایی که رم ویدیویی محدود دارند، استفاده از نسخه ۴ بیتی معمولاً انتخاب منطقیتری است، زیرا اجرای نسخه دقیقتر میتواند بخش زیادی از حافظه گرافیکی را اشغال کند.
Mistral 7B (v0.3)
سریع و پایدار
Mistral 7B یکی دیگر از مدلهای محبوب در این محدوده است و نسبت مناسبی میان سرعت و کیفیت ایجاد میکند. نسخه v0.3 این مدل نسبت به نسخه قبلی، واژگان گستردهتری دارد و برای استفاده با ابزارهای مختلف اجرای مدل طراحی شده است.
کوانتیزهسازی ۴ بیتی نیز میتواند مصرف حافظه Mistral 7B را کاهش دهد و امکان اجرای آن را روی سیستمهای دارای VRAM محدود فراهم کند.
با وجود این، مدلهای مختلف Mistral محدودیتهایی در طول زمینه یا Context دارند که بسته به نسخه و ابزار اجرای مورد استفاده باید در نظر گرفته شوند. برای کارهای فنی و پروژههایی که به زمینه بسیار طولانی نیاز دارند، ممکن است مدلهای دیگری گزینه مناسبتری باشند.
در مقابل، برای نویسندگی خلاقانه و بسیاری از وظایف سادهتر، Mistral 7B همچنان میتواند گزینهای سریع و کاربردی باشد.
Qwen 2.5 (7B)
قدرتمند اما کمی رسمی
Qwen 2.5 7B یکی از گزینههای مناسب برای اجرای محلی است؛ بهخصوص برای کاربرانی که به پشتیبانی از زبانهای مختلف اهمیت میدهند.
این مدل برای وظایف چندزبانه عملکرد مناسبی دارد و میتواند متن را در زبانهای مختلف پردازش و تولید کند. اندازه ۷ میلیارد پارامتری آن نیز باعث میشود با کوانتیزهسازی مناسب بتوان آن را در محدوده سختافزاری ۸ گیگابایت VRAM اجرا کرد.
یکی از ویژگیهایی که ممکن است برای بعضی کاربران مزیت و برای برخی دیگر نقطه ضعف باشد، لحن نسبتاً رسمی پاسخها است. همین ویژگی باعث میشود Qwen 2.5 برای وظایف فنی و متون ساختاریافته گزینه خوبی باشد؛ اما برای مکالمههای کاملاً خودمانی یا تولید محتوای خلاقانه شاید انتخاب اول نباشد.
Gemma 2 (9B)
قدرتمندترین گزینه در این محدوده
Gemma 2 9B یکی از بزرگترین مدلهای این فهرست است که میتوان با ۸ گیگابایت VRAM و کوانتیزهسازی مناسب سراغ آن رفت.
مدل ۹ میلیارد پارامتری Gemma 2 در مقایسه با مدلهای کوچکتر، توانایی بیشتری در بسیاری از وظایف پیچیده دارد. با این حال، اجرای آن روی ۸ گیگابایت VRAM به کوانتیزهسازی ۴ بیتی نیاز دارد و فضای بسیار کمی برای سایر مصرفهای حافظه باقی میگذارد.
از سوی دیگر، سرعت آن لزوماً به اندازه مدلهای ۷ میلیارد پارامتری یا کوچکتر نیست. بنابراین اگر سرعت پاسخدهی اهمیت بیشتری از کیفیت خروجی داشته باشد، یک مدل کوچکتر میتواند انتخاب مناسبتری باشد.
DeepSeek-R1-Distill-Qwen (7B)
مدل DeepSeek برای سیستمهای دارای ۸ گیگابایت رم ویدیویی
DeepSeek-R1-Distill-Qwen 7B نسخه تقطیرشدهای از خانواده DeepSeek-R1 است که قابلیتهای استدلالی این خانواده را در قالب مدلی کوچکتر ارائه میکند.
این مدل با کوانتیزهسازی Q4 میتواند روی سیستمهای دارای VRAM محدود اجرا شود و برای وظایفی که به استدلال چندمرحلهای نیاز دارند، جذاب است.
نقطه ضعف اصلی چنین مدلهایی این است که فرایند استدلال میتواند پاسخگویی را نسبت به مدلهای سادهتر کندتر کند. در نتیجه، اگر سرعت پاسخ اهمیت اصلی داشته باشد، مدلهای کوچکتر و سریعتر گزینه مناسبتری هستند؛ اما برای حل مسئله و وظایف نیازمند استدلال، DeepSeek-R1-Distill-Qwen میتواند ارزش بررسی داشته باشد.
DeepSeek-Coder (6.7B)
DeepSeek تخصصی برای برنامهنویسی
همانطور که از نام آن مشخص است، DeepSeek-Coder برای وظایف مرتبط با برنامهنویسی و اشکالزدایی طراحی شده است.
اندازه ۶.۷ میلیارد پارامتری این مدل باعث میشود با کوانتیزهسازی ۴ بیتی بتوان آن را با محدودیت حافظه ۸ گیگابایتی اجرا کرد و همچنان فضای بیشتری برای پردازش درخواستهای نسبتاً سنگین باقی بماند.
با این حال، تخصصی بودن مدل یک نقطه ضعف نیز محسوب میشود. DeepSeek-Coder برای تولید محتوای خلاقانه و وظایف عمومی الزاماً به اندازه مدلهای همهمنظوره مناسب نیست. بنابراین اگر هدف اصلی برنامهنویسی و اشکالزدایی باشد، این مدل انتخاب مناسبی است؛ در غیر این صورت بهتر است سراغ یک مدل عمومیتر رفت.
Gemma 2 (2B)
دانش عمیق از جهان نقطه ضعف آن است
Gemma 2 2B یکی از سبکترین گزینههای این فهرست است و برای سیستمهایی طراحی شده که حافظه گرافیکی بسیار محدودی دارند.
اندازه کوچک این مدل باعث میشود سرعت اجرای آن بالا باشد و برای کارهایی که به پاسخ سریع نیاز دارند گزینه مناسبی باشد. در عوض، تنها ۲ میلیارد پارامتر دارد و نمیتوان از آن انتظار سطح دانش و توانایی استدلال مدلهای بزرگتر را داشت.
به همین دلیل، Gemma 2 2B بیشتر برای وظایف سادهای مانند ترجمه محلی، خلاصهسازی و پردازشهای سریع متن مناسب است. برای پرسشهای پیچیده یا وظایفی که به دانش گسترده و استدلال عمیق نیاز دارند، بهتر است از مدل بزرگتری استفاده شود.
مقایسه عملکرد مدلها
نتیجهگیری از آزمایشها
برای مقایسه مدلها میتوان از یک اسکریپت آزمایشی در Arch Linux و ابزارهایی مانند Ollama استفاده کرد. در سیستمهای مجهز به GPUهای AMD، نصب و استفاده از ROCm نیز اهمیت زیادی دارد و پشتیبانی Ollama از پردازندههای گرافیکی AMD مبتنی بر ROCm امکان اجرای مدلهای محلی را روی طیف گستردهای از سختافزارهای این شرکت فراهم میکند.
در آزمایشهایی با Ryzen AI Max 390 میتوان دو حالت مختلف حافظه گرافیکی را مقایسه کرد: حالت Auto که حافظه موردنیاز GPU را بهصورت پویا اختصاص میدهد و حالت محدودشده به ۸ گیگابایت.
نتایج بنچمارک و عملکرد مدلهای مختلف هوش مصنوعی در حالتی که رم ویدیویی محدودیت ۸ گیگابایتی دارد به صورت زیر است:
در چنین مقایسهای، حالت Auto معمولاً میتواند اندکی عملکرد بهتری ارائه دهد؛ زیرا سیستم مجبور نیست خود را به یک سقف ثابت حافظه محدود کند. با این حال، نتیجه دقیق به سختافزار و شرایط اجرای مدل بستگی دارد. نمودار زیر عملکرد مدلهای مختلف هوش مصنوعی در حالتی که سقف رم ویدیویی محدود نیست را نشان میدهد.
همچنین عملکرد GPU مجتمع به دمای سیستم و محدودیتهای توان وابسته است. پس از اجرای طولانیمدت، افزایش دما میتواند باعث کاهش سرعت پردازش شود. بنابراین نتایج یک آزمایش کوتاه لزوماً عملکرد مداوم یک سیستم را نشان نمیدهد.
انتظارات خود را از ۸ گیگابایت رم ویدیویی مدیریت کنید
۸ گیگابایت VRAM برای اجرای مدلهای هوش مصنوعی محلی یک نقطه شروع مناسب است؛ اما محدودیتهای آن خیلی زود مشخص میشوند.
هرچه مدل بزرگتر باشد، حافظه بیشتری برای وزنهای مدل نیاز دارد. علاوه بر این، بخشی از VRAM ممکن است توسط سیستمعامل و رابط گرافیکی مصرف شود و تمام ظرفیت اسمی کارت گرافیک در اختیار مدل قرار نگیرد.
موضوع مهم دیگر KV Cache است. این حافظه با ادامه یافتن مکالمه و افزایش تعداد توکنهای موجود در Context بزرگتر میشود و در نتیجه میتواند بهتدریج بخش بیشتری از حافظه را اشغال کند.
به همین دلیل، ممکن است مدلی که در یک گفتوگوی کوتاه بهراحتی روی ۸ گیگابایت VRAM اجرا میشود، هنگام پردازش مکالمهای طولانیتر با محدودیت حافظه مواجه شود.
با وجود این محدودیتها، ۸ گیگابایت رم ویدیویی به معنای غیرممکن بودن اجرای هوش مصنوعی محلی نیست. مدلهای کوچک و کوانتیزهشده میتوانند بسیاری از وظایف روزمره را بهصورت محلی انجام دهند و نقطه شروع مناسبی برای ورود به دنیای اجرای مدلهای هوش مصنوعی روی سختافزار شخصی باشند.
نتیجهی کلی بنچمارک را بررسی کنید:
در واقع، انتخاب مدل مناسب اهمیت بیشتری از صرفاً انتخاب بزرگترین مدل ممکن دارد. برای ترجمه و خلاصهسازی سریع، یک مدل کوچک مانند Gemma 2 2B میتواند کافی باشد؛ برای استفاده عمومی Llama 3.1 8B یا Qwen 2.5 7B گزینههای متعادلتری هستند و برای برنامهنویسی یا وظایف استدلالی میتوان سراغ مدلهای تخصصیتر رفت.
اینتوتک










