راهنمای خرید

هوش مصنوعی لوکال و آفلاین؛ راهنمای جامع مدل‌ها، سرورها و مقایسه با آنلاین

تصویر مفهومی سرور رک‌مونت و ورک‌استیشن هوش مصنوعی روی زمینه قرمز

هوش مصنوعی لوکال (Local AI) یا آفلاین (Offline AI) به شما اجازه می‌دهد مدل را روی کامپیوتر، ورک‌استیشن یا سرور تحت کنترل خودتان اجرا کنید. در این هوش مصنوعی محلی، پرسش‌ها، فایل‌ها و فرایند تولید پاسخ می‌توانند داخل دستگاه یا شبکه داخلی باقی بمانند؛ حتی زمانی که اینترنت قطع است. این ویژگی برای تیم‌های توسعه، شرکت‌هایی با اسناد محرمانه، استودیوهای تولید محتوا و کسب‌وکارهایی که به دسترسی پایدار نیاز دارند، یک مزیت عملی است.

اما آیا یک سرور شخصی واقعاً می‌تواند جای هوش مصنوعی آنلاین را بگیرد؟ چه مدلی روی ۱۶، ۳۲ یا ۹۶ گیگابایت حافظه گرافیکی اجرا می‌شود؟ تفاوت یک کیس AI با NVIDIA DGX Spark چیست؟ در این راهنما، ابتدا انواع مدل و سخت‌افزار را بررسی می‌کنیم، سپس ظرفیت اجرای مدل‌ها را توضیح می‌دهیم و محصولات استوک‌لند را به‌عنوان مثال واقعی کنار این اصول قرار می‌دهیم.

هوش مصنوعی لوکال و آفلاین دقیقاً چه تفاوتی دارند؟

«لوکال» محل اجرای مدل را مشخص می‌کند: محاسبات روی دستگاه خودتان یا سرور سازمان انجام می‌شود. «آفلاین» به وابستگی نداشتن فرایند اجرا به اینترنت اشاره دارد. بنابراین یک سیستم می‌تواند لوکال باشد، ولی برای جست‌وجوی وب یا اتصال به ابزار ابری همچنان اینترنت بخواهد. از طرف دیگر، یک سرور داخلی می‌تواند از طریق شبکه شرکت به چند کاربر خدمات بدهد و بدون اتصال به اینترنت عمومی کار کند.

برای اجرای واقعاً آفلاین، فقط دانلود وزن مدل کافی نیست. نرم‌افزار اجرا، توکنایزر، فایل‌های تنظیمات، کتابخانه‌ها و درایورها نیز باید آماده باشند. اگر تحلیل PDF، تشخیص متن تصویر، تبدیل گفتار به متن یا جست‌وجوی اسناد می‌خواهید، تمام اجزای این زنجیره باید محلی باشند. استفاده از یک مدل محلی همراه با سرویس ابری OCR یا Embedding، کل فرایند را آفلاین نمی‌کند.

  • اجرای شخصی: مدل و رابط گفت‌وگو روی همان کامپیوتر قرار دارند؛ مناسب یادگیری، تولید متن و کمک به برنامه‌نویسی.
  • سرور داخلی: یک دستگاه قدرتمند در شبکه شرکت به چند کاربر یا نرم‌افزار پاسخ می‌دهد؛ ظرفیت هم‌زمانی باید جداگانه سنجیده شود.
  • اجرای ترکیبی: کارهای روزمره و اسناد حساس روی سرور داخلی پردازش می‌شوند و کارهای منتخب با اجازه و سیاست مشخص به سرویس آنلاین می‌روند.

برتری‌های هوش مصنوعی آفلاین نسبت به سرویس‌های آنلاین

۱. کنترل بیشتر بر داده و حریم خصوصی

در اجرای محلی می‌توانید مسیر ذخیره و پردازش داده را تعیین کنید: متن قرارداد، کد اختصاصی، پرونده پژوهشی یا مکاتبات داخلی مجبور نیست برای تولید پاسخ از سازمان خارج شود. همچنین می‌توان سطح دسترسی کاربران، مدت نگهداری مکالمات و محل نسخه پشتیبان را با قواعد شرکت هماهنگ کرد. این کنترل برای سازمانی که مالکیت و محل پردازش داده برایش مهم است، ارزش مستقلی دارد.

البته آفلاین بودن به‌تنهایی امنیت کامل ایجاد نمی‌کند. دسترسی غیرمجاز به دستگاه، افزونه نامطمئن یا ذخیره نامناسب فایل‌ها همچنان مشکل‌ساز است. مزیت سرور داخلی در این است که امکان طراحی و کنترل این لایه‌ها را در اختیار دارید؛ کیفیت اجرای آن‌ها به مدیریت سیستم بستگی دارد.

۲. ادامه کار هنگام قطع یا اختلال اینترنت

پس از نصب کامل، یک مدل آفلاین برای خلاصه‌سازی سند، تولید متن یا پاسخ به پرسش درباره فایل‌های داخلی به اتصال خارجی وابسته نیست. برای محیط‌هایی با ارتباط ناپایدار، کارگاه‌ها، دفاتر شعب و تیم‌هایی که توقف کار برایشان هزینه دارد، این مزیت محسوس است. برق، سلامت سخت‌افزار و دسترسی به شبکه داخلی همچنان لازم‌اند.

۳. اختیار در انتخاب مدل و نسخه

در یک سیستم لوکال می‌توانید مدل کوچک و سریع را برای طبقه‌بندی انتخاب کنید و مدل بزرگ‌تر را برای تحلیل پیچیده نگه دارید. امکان تثبیت نسخه مدل، تنظیم قالب پاسخ و ارزیابی تغییرات پیش از ارتقا هم وجود دارد. این موضوع در سامانه‌هایی مهم است که باید رفتار نسبتاً قابل تکرار داشته باشند و تغییر ناگهانی پاسخ‌ها به فرایند کسب‌وکار آسیب می‌زند.

۴. هزینه قابل برنامه‌ریزی در مصرف مداوم

اگر حجم پردازش دائمی و قابل پیش‌بینی باشد، مالکیت سخت‌افزار می‌تواند هزینه هر کار موفق را کاهش دهد. در اجرای محلی، صورتحساب به تعداد توکن‌های سرویس خارجی وابسته نیست؛ اما هزینه اولیه دستگاه، برق، نگهداری، ارتقا و زمان متخصص باقی می‌ماند. برای مصرف پراکنده یا پروژه کوتاه، سرویس آنلاین ممکن است اقتصادی‌تر باشد. نتیجه به میزان استفاده واقعی از دستگاه بستگی دارد.

۵. اتصال مستقیم به اسناد و نرم‌افزارهای داخلی

یک سرور AI داخلی می‌تواند به آرشیو فایل‌ها، سامانه تیکتینگ یا پایگاه دانش شرکت متصل شود. برای پاسخ‌گویی به پرسش‌های سازمانی، اغلب ابتدا بازیابی اسناد مرتبط یا RAG ارزش بیشتری از بزرگ‌تر کردن مدل دارد. مدل مناسب همراه با منابع دقیق می‌تواند پاسخ کاربردی‌تری از یک مدل بزرگِ بدون دسترسی به اطلاعات شما بسازد.

مقایسه کامل هوش مصنوعی لوکال با آنلاین

آیکون‌های Gemini، LM Studio و ChatGPT بالای کادر گفت‌وگو روی پس‌زمینه بنفش
مقایسه ابزارهای اجرای محلی و سرویس‌های آنلاین؛ کیفیت پاسخ به مدل، تنظیمات و ابزارهای در دسترس وابسته است.

انتخاب بر اساس نیاز واقعی

معیارهوش مصنوعی لوکال / آفلاینهوش مصنوعی آنلاین
مسیر دادهقابل نگهداری در دستگاه یا شبکه خودتان، با پیکربندی درستپردازش در زیرساخت ارائه‌دهنده؛ قواعد داده تابع سرویس و قرارداد
اینترنتبرای اجرای آماده‌شده لازم نیست؛ وب‌گردی به اتصال نیاز دارداستفاده از سرویس خارجی به ارتباط شبکه وابسته است
شروع کارنیازمند نصب، انتخاب مدل و تنظیم سخت‌افزارمعمولاً شروع ساده‌تر از طریق رابط یا API
کیفیت پاسخوابسته به مدل، زبان، داده، Quantization و ابزارهاوابسته به مدل و پلن؛ دسترسی به مدل‌های پرقدرت می‌تواند مزیت باشد
هزینهخرید و نگهداری زیرساخت؛ مناسب بررسی برای مصرف مداوماشتراک یا پرداخت مصرفی؛ مناسب بررسی برای مصرف متغیر
تعداد کاربرانمحدود به حافظه، توان دستگاه و نرم‌افزار سرویس‌دهیمقیاس‌پذیری ارائه‌دهنده همراه با سهمیه و محدودیت‌های سرویس
سفارشی‌سازیکنترل نسخه، RAG، قالب پاسخ و در موارد مناسب Fine-tuningوابسته به امکانات و محدودیت‌های ارائه‌دهنده
اطلاعات تازهنیازمند داده تازه داخلی یا ابزار جست‌وجوی متصلدر صورت داشتن ابزار جست‌وجو به اطلاعات تازه دسترسی می‌یابد
مسئولیت عملیاتنصب، امنیت، مانیتورینگ، پشتیبان و ارتقا با مالک سیستمبخش مهم عملیات زیرساخت با ارائه‌دهنده

محلی یا آنلاین بودن، به‌خودی‌خود میزان هوشمندی را تعیین نمی‌کند. اگر همان مدل با همان وزن‌ها، دقت عددی، تنظیمات و ابزارها در دو محل اجرا شود، کیفیت باید با آزمون یکسان مقایسه شود. اختلاف معمولاً از مدل انتخابی، فشرده‌سازی، طول ورودی، منابع در دسترس و طراحی نرم‌افزار می‌آید. پس «لوکال» یک شیوه استقرار است و به‌تنهایی رتبه کیفیت محسوب نمی‌شود.

خدماتی مانند ChatGPT، Claude و Gemini مجموعه‌ای از مدل، رابط، ابزار و زیرساخت هستند. مقایسه یک فایل مدل محلی با کل این خدمات بدون مشخص کردن وظیفه، دقیق نیست. برای نمونه، خلاصه‌سازی پرونده‌های داخلی، حل یک مسئله دشوار، تحلیل تصویر و جست‌وجوی خبر روز چهار آزمون متفاوت‌اند و ممکن است چهار انتخاب متفاوت داشته باشند.

چه مدل‌های هوش مصنوعی را می‌توان به‌صورت لوکال نصب کرد؟

مدل‌های قابل نصب بسیار متنوع‌اند؛ فهرست همه نسخه‌ها، تنظیم‌های تخصصی و فایل‌های فشرده‌شده در یک مقاله ثابت نمی‌ماند. دسته‌بندی زیر خانواده‌های اصلی و نمونه‌های مشخص و قابل بررسی را نشان می‌دهد. نام مدل را همراه نسخه، مجوز و فرمت فایل بررسی کنید؛ شهرت یک برند به معنی یکسان بودن همه مدل‌های آن نیست.

نقشه مدل‌های قابل اجرای محلی

دستهنمونه مشخصکاربرد و نکته انتخاب
متن و استدلالQwen3-8B / 14B / 32B؛ Qwen3.6-27Bگفت‌وگو، تحلیل متن و کمک به کدنویسی؛ نسخه جدیدتر نیازمند Runtime سازگار
کدنویسیQwen3-Coder-30B-A3B-Instructمدل MoE برای کار با کد؛ ۳۰٫۵B پارامتر کل و ۳٫۳B فعال
استدلال با مدل تقطیرشدهDeepSeek-R1-Distill-Qwen-14B / 32Bنمونه‌های کوچک‌تر؛ با DeepSeek-R1 کامل یکسان نیستند
متن در مقیاس بزرگ‌ترLlama-3.3-70B-Instructمدل متنی ۷۰B؛ آزمون فارسی و بررسی مجوز لازم است
مدل‌های میان‌ردهMistral Small 3.1 24B؛ Microsoft Phi-4 14Bگفت‌وگو و استدلال؛ Mistral Small 3.1 تحلیل تصویر هم دارد
چندوجهیGemma 3 4B / 12B / 27B؛ Gemma 4 12B / 31Bتحلیل متن و تصویر؛ قابلیت صوت بسته به نسخه فرق می‌کند
MoE با وزن بازgpt-oss-20b / 120bمدل‌های متنی و استدلال؛ فرمت MXFP4 و پشتیبانی موتور اجرا مهم است
تولید تصویرFLUX.1-schnellتولید تصویر محلی؛ رزولوشن و اجزای زنجیره مصرف حافظه را تغییر می‌دهند
گفتار به متنWhisper large-v3 با faster-whisperپیاده‌سازی محلی رونویسی صوت؛ کیفیت باید روی صدای واقعی سنجیده شود
جست‌وجوی اسنادQwen3-Embedding-0.6B و مدل‌های Rerankerتبدیل سند به بردار و رتبه‌بندی نتایج؛ جایگزین مدل پاسخ‌ساز نیستند

Qwen: از مدل سبک تا مدل چندوجهی و تخصصی کد

نمای معرفی خانواده Qwen با نشان مدل و لپ‌تاپ در پس‌زمینه بنفش
خانواده Qwen برای کاربردهای مختلف نسخه‌های متنوعی دارد؛ قابلیت‌ها و مجوز هر نسخه را در کارت همان مدل بررسی کنید.
خانواده Qwen گزینه‌های متنوعی برای شروع و توسعه دارد. کارت رسمی Qwen3-32B تعداد پارامتر را ۳۲٫۸ میلیارد اعلام می‌کند. برای دستگاه کوچک‌تر می‌توان نسخه‌های ۸B یا ۱۴B را بررسی کرد. Qwen3.6-27B نیز یک گزینه جدیدتر با ورودی متن و تصویر است؛ توان نامی آن به معنی سازگاری خودکار با همه نرم‌افزارهای محلی نیست و باید نسخه موتور اجرا و فایل مناسب آن بررسی شود.
برای پروژه برنامه‌نویسی، Qwen3-Coder-30B-A3B-Instruct نمونه‌ای تخصصی است. این مدل حدود ۳۰٫۵ میلیارد پارامتر کل و ۳٫۳ میلیارد پارامتر فعال دارد. پارامتر فعال پایین‌تر می‌تواند بار محاسباتی هر مرحله را کاهش دهد، ولی برای حافظه نمی‌توان وزن‌های کل مدل را نادیده گرفت. خروجی کد باید اجرا و آزمایش شود؛ نصب مدل به‌تنهایی یک عامل برنامه‌نویسی کامل نمی‌سازد.
دریافت Qwen3-8B در فرمت GGUFفایل‌های رسمی Qwen برای شروع با مدل کوچک‌تر؛ نسخه کوانتیزه را مطابق حافظه دستگاه و پشتیبانی موتور انتخاب کنید.

DeepSeek: مدل کامل را از نسخه Distill جدا کنید

نشان سفید نهنگ DeepSeek و نوشته DeepSeek R1 روی پس‌زمینه بنفش
DeepSeek-R1 و نسخه‌های Distill اندازه و نیاز سخت‌افزاری یکسانی ندارند؛ نام دقیق نسخه در انتخاب سرور اهمیت دارد.
در مخزن رسمی DeepSeek-R1 مدل کامل ۶۷۱ میلیارد پارامتر کل و ۳۷ میلیارد پارامتر فعال دارد. نسخه‌های Distill با اندازه‌های کوچک‌تر بر پایه Qwen یا Llama عرضه شده‌اند. بنابراین اجرای DeepSeek-R1-Distill-Qwen-32B روی یک ورک‌استیشن، به معنی اجرای مدل کامل R1 نیست. این تفاوت برای تبلیغ ظرفیت سرور بسیار مهم است: عبارت «اجرای DeepSeek» بدون نام نسخه، اطلاعات کافی به خریدار نمی‌دهد.
دریافت DeepSeek-R1-Distill-Qwen-32Bوزن‌های رسمی نسخه تقطیرشده ۳۲B؛ این مخزن، مدل کامل ۶۷۱B نیست و فایل GGUF آماده ارائه نمی‌کند.

Llama، Mistral و Phi: گزینه‌هایی برای نیازهای متفاوت

Llama 3.3 70B Instruct یک مدل متنی بزرگ‌تر برای گفت‌وگو است. فارسی در فهرست زبان‌های رسمی پشتیبانی‌شده این نسخه قرار ندارد؛ برای کاربرد فارسی باید خروجی و محدودیت مجوز را جداگانه بررسی کرد. Mistral Small 3.1 24B ورودی تصویر هم می‌پذیرد و فارسی را در فهرست زبان‌ها آورده است. Phi-4 مایکروسافت یک نمونه ۱۴ میلیاردپارامتری است که می‌توان برای وظایف استدلالی ارزیابی کرد.

Gemma و مدل‌های چندوجهی: دیدن تصویر با ساختن تصویر فرق دارد

در Gemma 3 نسخه‌های ۴B، ۱۲B و ۲۷B برای متن و تصویر قابل بررسی‌اند. Gemma 4 نیز خانواده‌ای با اندازه‌های گوناگون است؛ نسخه ۳۱B متن و تصویر می‌گیرد و خروجی متن می‌دهد، درحالی‌که پشتیبانی صوت در نسخه‌های مشخص این خانواده وجود دارد. مدل تحلیل تصویر لزوماً تصویر تولید نمی‌کند. برای خواندن تصویرِ فاکتور و ساختن تصویر تبلیغاتی، دو زنجیره نرم‌افزاری متفاوت لازم است.

gpt-oss: تعداد پارامتر تنها معیار ظرفیت نیست

نام gpt-oss و نشان OpenAI روی پس‌زمینه آبی
مدل‌های gpt-oss با وزن باز؛ فرمت وزن‌ها و سازگاری موتور اجرا در ظرفیت حافظه موردنیاز نقش دارند.
طبق کارت رسمی gpt-oss، نسخه ۱۲۰b با قالب MXFP4 برای اجرا روی یک GPU با ۸۰ گیگابایت حافظه معرفی شده و نسخه ۲۰b در محدوده ۱۶ گیگابایت حافظه قابل اجراست. این مشخصات وابسته به فرمت وزن‌ها و موتور سازگار است؛ از آن نمی‌توان نتیجه گرفت هر مدل ۱۲۰ میلیاردپارامتری روی همان دستگاه اجرا می‌شود. ابزارهای وب یا اجرای کد نیز باید جداگانه به مدل متصل شوند.
دریافت وزن‌های رسمی gpt-oss-20bنسخه کوچک‌تر خانواده gpt-oss؛ قالب MXFP4 و موتور سازگار را مطابق کارت مدل بررسی کنید.

تصویر، صوت و RAG: هوش مصنوعی آفلاین فقط چت نیست

FLUX.1-schnell نمونه‌ای برای تولید تصویر با مجوز Apache 2.0 است. برای تبدیل گفتار به متن، faster-whisper با مدل large-v3 اجرای محلی را ممکن می‌کند. در بازیابی اسناد نیز Qwen3-Embedding-0.6B یک نمونه برای ساخت بردارهای جست‌وجو است. این ابزارها کاربردهای متفاوت دارند و جدول ظرفیت مدل‌های زبانی را نباید بدون تغییر به تولید ویدئو یا تصویر تعمیم داد.
خودروی مسابقه‌ای مشکی با نوشته Flux در نمای حرکت، تصویر بخش تولید تصویر
تولید تصویر از کاربردهای هوش مصنوعی محلی است؛ مدل، رزولوشن و اجزای فرایند، نیاز حافظه را تعیین می‌کنند.

برای کاربرد فارسی، اندازه مدل فقط یک نشانه است. نگارش رسمی و محاوره‌ای، اعداد فارسی، نیم‌فاصله، اصطلاحات تخصصی، متن اسکن‌شده و لهجه در صوت می‌توانند نتیجه را تغییر دهند. بهتر است چند مدل را با نمونه‌های واقعی خودتان مقایسه کنید. در RAG نیز کیفیت استخراج متن و بازیابی سند می‌تواند از اختلاف دو مدل زبانی مهم‌تر باشد.

پارامتر چیست و چرا حافظه GPU این‌قدر مهم است؟

تصویر مفهومی مدل زبانی بزرگ با عبارت LLM و نمادهای پردازش، ترجمه و گفت‌وگو
مدل‌های زبانی بزرگ برای تولید پاسخ به حافظه وزن‌ها و داده‌های زمان اجرا نیاز دارند؛ تعداد پارامتر تنها معیار انتخاب نیست.

پارامترها اعداد آموخته‌شده مدل‌اند. حرف B در نام مدل معمولاً به میلیارد اشاره دارد؛ مثلاً ۸B یعنی حدود هشت میلیارد پارامتر. مدل برای تولید پاسخ باید وزن‌ها را از حافظه بخواند و محاسبات لازم را انجام دهد. برای همین ظرفیت و پهنای باند حافظه نقش مهمی دارند. تعداد پارامتر بیشتر الزاماً کیفیت بهتر در همه کارها یا سرعت بیشتر ایجاد نمی‌کند.

Quantization یا کوانتیزه‌سازی، وزن‌ها را با دقت عددی کم‌حجم‌تری ذخیره می‌کند. BF16 و FP16 معمولاً برای هر وزن دو بایت می‌خواهند؛ ۸ بیت حدود یک بایت و ۴ بیت در حالت نظری نیم‌بایت. فایل واقعی به مقیاس‌ها، فراداده و بخش‌هایی که با دقت بالاتر نگهداری شده‌اند هم نیاز دارد. پس «مدل ۳۲B چهاربیتی = دقیقاً ۱۶GB» فقط یک محاسبه خام است.

حافظه خام وزن‌ها؛ بدون سربار و حافظه مکالمه

اندازه اسمی مدلFP16 / BF16۸ بیت۴ بیت نظری
۸ میلیارد پارامتر۱۶ GB۸ GB۴ GB
۱۴ میلیارد پارامتر۲۸ GB۱۴ GB۷ GB
۳۲ میلیارد پارامتر۶۴ GB۳۲ GB۱۶ GB
۷۰ میلیارد پارامتر۱۴۰ GB۷۰ GB۳۵ GB
۱۲۰ میلیارد پارامتر۲۴۰ GB۱۲۰ GB۶۰ GB
۲۰۰ میلیارد پارامتر۴۰۰ GB۲۰۰ GB۱۰۰ GB

یک مثال دقیق: Qwen3-32B روی کارت ۲۴ گیگابایتی

در فایل‌های رسمی Qwen3-32B-GGUF، نسخه Q4_K_M حدود ۱۹٫۸ GB و نسخه Q8_0 حدود ۳۴٫۸ GB حجم دارند. همین مثال نشان می‌دهد محاسبه نیم‌بایت برای همه وزن‌ها کافی نیست. نسخه چهاربیتی می‌تواند نامزد اجرا روی کارت ۲۴GB باشد، اما طول مکالمه باید محدود شود و موتور اجرا نیز حافظه اضافی می‌خواهد. کارت ۳۲GB فضای بیشتری برای همان مدل فراهم می‌کند.
دریافت فایل GGUF برای Qwen3-32Bبرای مثال این مقاله، Q4_K_M با حجم حدود ۱۹٫۸GB را انتخاب کنید؛ فایل وزن، حافظه مکالمه و سربار اجرا را شامل نمی‌شود.
با استفاده از تنظیمات معماری Qwen3-32B می‌توان KV Cache متعارف BF16 را نیز برآورد کرد: ۶۴ لایه، ۸ سر KV و بُعد ۱۲۸، برای کلید و مقدار در مجموع حدود ۲۵۶ KiB به‌ازای هر توکن و هر دنباله می‌خواهند. در طول ۴۰۹۶ توکن، این عدد حدود ۱ GiB و در ۳۲۷۶۸ توکن حدود ۸ GiB است. این برآورد مخصوص این معماری و این دقت Cache است؛ موتورهایی با Cache فشرده یا مدیریت متفاوت، مصرف متفاوتی خواهند داشت.

نتیجه عملی روشن است: جا شدن فایل مدل روی GPU، به معنی اجرای همان مدل با مکالمه بسیار طولانی یا چند کاربر هم‌زمان نیست. اگر یک مدل با ورودی کوتاه اجرا می‌شود ولی با فایل بزرگ خطای کمبود حافظه می‌دهد، ممکن است وزن‌ها مشکلی نداشته باشند و فشار از حافظه مکالمه آمده باشد.

با هر ظرفیت VRAM چند میلیارد پارامتر می‌توان اجرا کرد؟

جدول زیر پیشنهاد اولیه برای یک GPU، استنتاج یک کاربر و شروع با Context حدود ۴K است. ستون‌ها «سقف قطعی» نیستند؛ فرض اصلی، نسخه چهاربیتی مناسب و Runtime سازگار است. برای سفارش نهایی، فایل دقیق مدل، حجم واقعی وزن و حافظه آزاد دستگاه باید بررسی شود.

راهنمای محافظه‌کارانه ظرفیت استنتاج محلی

حافظه GPUاندازه‌های مناسب برای بررسیشرط و محدودیت
۸ تا ۱۲ GBمدل‌های ۳B تا ۸B با Q4برای شروع و کار سبک؛ طول ورودی و ظرفیت آزاد مهم است
۱۶ GB۸B تا ۱۴B با Q4؛ gpt-oss-20b در قالب سازگار۳۲B متراکم در نسخه‌های متداول Q4 معمولاً کامل روی یک GPU جا نمی‌شود
۲۴ GB۱۴B تا ۳۲B با Q4مدل ۳۲B نزدیک‌تر به مرز حافظه؛ Context محدود و آزمون لازم
۳۲ GB۲۷B تا ۳۲B با Q4، با فضای بیشتر نسبت به ۲۴GBسربار تحلیل تصویر و کاربران اضافی جداگانه محاسبه شود
۴۸ GBمدل ۷۰B با Q4، بسته به فایلبرای ۷۰B، Context و هم‌زمانی می‌توانند محدود باشند
۷۲ GB۷۰B با Q4 و فضای بیشتر برای Cache۷۰B با ۸ بیت لزوماً همراه سربار جا نمی‌شود
۸۴ تا ۹۶ GB۷۰B با Q4؛ gpt-oss-120b در فرمت و Runtime مناسبنام مدل ۱۲۰B به‌تنهایی تضمین سازگاری نیست
۱۲۸ GB حافظه یکپارچه DGX Spark۷۰B و ۱۲۰B مناسب بررسی؛ تا ۲۰۰B طبق اعلام انویدیاحافظه بین CPU و GPU مشترک است؛ سقف ۲۰۰B مشروط است

اگر وزن مدل از VRAM بزرگ‌تر باشد، بعضی موتورها بخشی از مدل را در RAM سیستم می‌گذارند؛ به این کار Offload می‌گویند. امکان اجرا افزایش می‌یابد، اما جابه‌جایی داده و سرعت حافظه اصلی می‌توانند پاسخ را کند کنند. دو سوکت CPU و رم فراوان ارزش دارند، ولی جایگزین مستقیم حافظه گرافیکی پرسرعت نیستند.

در سیستم چند GPU نیز جمع ظرفیت‌ها فقط وقتی به اجرای یک مدل کمک می‌کند که موتور، تقسیم مدل را پشتیبانی کند. دو کارت ۲۴GB الزاماً مانند یک کارت ۴۸GB رفتار نمی‌کنند. نوع تقسیم، اتصال بین کارت‌ها، مسیر PCIe و پشتیبانی نرم‌افزار در سرعت نهایی دخالت دارند. تعداد کارت قابل نصب را از تعداد گزینه‌های فروشگاه یا نام کیس نتیجه نگیرید.

کدام سخت‌افزار برای هوش مصنوعی آفلاین مناسب است؟

  • کامپیوتر عمومی با CPU: برای یادگیری، مدل‌های کوچک و بعضی پردازش‌های کم‌حجم؛ سرعت مدل‌های بزرگ باید آزمایش شود.
  • ورک‌استیشن با GPU مجزا: انتخابی قابل ارتقا برای مدل زبانی، تصویر و کدنویسی؛ VRAM و سازگاری موتور در اولویت‌اند.
  • دستگاه با حافظه یکپارچه: مانند DGX Spark یا برخی پلتفرم‌های دیگر؛ ظرفیت مشترک بالاتر مفید است، ولی پهنای باند و معماری با GPU مجزا تفاوت دارد.
  • سرور رک‌مونت: برای استقرار در رک، مدیریت سرویس و بار سازمانی؛ برق، تهویه، شبکه و شرایط محیط باید متناسب باشند.
  • سیستم چندشتاب‌دهنده دیتاسنتری: برای مدل‌های بسیار بزرگ، آموزش و سرویس‌دهی در مقیاس بالا؛ هزینه و نیازهای زیرساخت با یک کیس شخصی قابل قیاس مستقیم نیست.

در انتخاب قطعات، ابتدا مدل و وظیفه را مشخص کنید و بعد سخت‌افزار را انتخاب کنید. VRAM تعیین می‌کند چه چیزی در حافظه گرافیکی جا می‌شود؛ پهنای باند و پردازش تعیین می‌کنند با چه سرعتی پاسخ می‌گیرید. RAM برای بارگذاری، Offload، دیتاست و سرویس‌های جانبی لازم است. SSD سریع بارگذاری را بهتر می‌کند، ولی فضای ذخیره‌سازی چندترابایتی به‌تنهایی ظرفیت اجرای مدل را افزایش نمی‌دهد.

خانواده DGX انویدیا؛ از میز کار تا دیتاسنتر

NVIDIA DGX Spark: حافظه زیاد در دستگاهی کوچک

طبق راهنمای سخت‌افزار DGX Spark، نسخه مورد بررسی دارای تراشه GB10 Grace Blackwell، CPU بیست‌هسته‌ای Arm و ۱۲۸GB حافظه یکپارچه LPDDR5x است. نمونه موجود در کاتالوگ استوک‌لند، SSD چهارترابایتی دارد. این ۱۲۸GB را نباید «۱۲۸GB VRAM مجزا به‌علاوه RAM» تعبیر کرد؛ CPU، GPU و سیستم‌عامل از منابع مشترک استفاده می‌کنند.
انویدیا برای DGX Spark استنتاج مدل‌های تا ۲۰۰ میلیارد پارامتر و توان اسمی تا یک پتافلاپ FP4 را اعلام می‌کند. این اعداد به دقت عددی و شرایط بار کاری وابسته‌اند و سرعت گفت‌وگوی یک مدل مشخص را نشان نمی‌دهند. مثال عددی: وزن خام یک مدل ۲۰۰B در چهار بیت حدود ۱۰۰GB است؛ با وزن واقعی و Cache ممکن است فضای باقی‌مانده محدود شود. بنابراین این سقف، وعده اجرای هر مدل ۲۰۰B با هر طول ورودی و تعداد کاربر نیست.

DGX Spark برای توسعه، آزمایش مدل‌های بزرگ‌تر و کار با اکوسیستم نرم‌افزاری انویدیا گزینه قابل بررسی است. هنگام انتخاب میان Spark و ورک‌استیشن GPU مجزا، علاوه بر ظرفیت حافظه، سرعت مدل هدف، امکان ارتقا و سازگاری نرم‌افزار با معماری Arm را مقایسه کنید. ممکن است یک GPU مجزا برای مدل کوچک‌تر سریع‌تر باشد؛ بدون آزمون یکسان نمی‌توان حکم کلی داد.

DGX Station: کلاس متفاوتی از AI دسکتاپ

صفحه فعلی DGX Station انویدیا برای نسل GB300، حافظه همدوس ۷۴۸GB و توان اسمی تا ۲۰ پتافلاپ AI اعلام می‌کند و اجرای مدل‌های تا یک تریلیون پارامتر را مطرح می‌سازد. این مشخصات مربوط به نسل GB300 است؛ DGX Station A100 دستگاه دیگری با مشخصات دیگر محسوب می‌شود. ظرفیت همدوس را نیز نباید با حافظه HBM اختصاصی GPU یکی دانست. مدل، دقت اجرا و سهم حافظه بخش‌های مختلف باید روشن باشند.

DGX H100، H200، B200 و سیستم‌های رک‌مقیاس

در کلاس دیتاسنتر، فهرست رسمی سیستم‌های DGX ظرفیت مجموع حافظه GPU را برای H100 برابر ۶۴۰GB، برای H200 برابر ۱۱۲۸GB و برای B200 برابر ۱۴۴۰GB نشان می‌دهد. DGX B200 هشت GPU و اتصال NVLink/NVSwitch دارد. این سیستم‌ها برای بارهای بزرگ و توزیع مدل طراحی شده‌اند؛ ظرفیت مجموع حافظه بدون نرم‌افزار تقسیم مدل به معنای یک حافظه تک‌کارت نیست.
یک مثال صرفاً محاسباتی: وزن خام مدل ۶۷۱B در BF16 حدود ۱۳۴۲GB می‌شود. بنابراین حتی کنار ظرفیت ۱۴۴۰GB یک B200، باید فضای Cache و بافرها را جدا حساب کرد؛ آموزش کامل همین مدل به حافظه بسیار بیشتری نیاز دارد. در مقیاس بزرگ‌تر، DGX GB300 یک سامانه رک‌مقیاس با ۷۲ GPU و حدود ۲۰TB حافظه GPU است. چنین زیرساختی نیازمند طراحی دیتاسنتر است و در این مقاله صرفاً برای شناخت رده‌های سخت‌افزار معرفی می‌شود.

سرورهای استوک‌لند چند پارامتر را هندل می‌کنند؟

محصولات PC Land و سیستم‌های AI کاتالوگ، عمدتاً بر پایه پردازنده ثابت و انتخاب رم، SSD و GPU عرضه شده‌اند. در نتیجه نسبت دادن یک عدد مانند «۷۰ میلیارد پارامتر» به نام Astra یا Atlas، بدون ذکر GPU انتخابی، دقیق نیست. جدول زیر مشخصات ثبت‌شده هر محصول را کنار سناریوی استنتاج قرار می‌دهد. این‌ها بررسی کاتالوگ و محاسبه ظرفیت‌اند؛ بنچمارک حضوری دستگاه نیستند.

مشخصات ثبت‌شده و ظرفیت وابسته به کانفیگ

مدل در استوک‌لندپلتفرم ثبت‌شدهحافظهسناریوی ظرفیت استنتاج
PC Land Astra2 × Xeon Gold 6150DDR4 ECC۱۶GB GPU: ۸–۱۴B Q4؛ ۲۴–۳۲GB: تا حدود ۳۲B Q4؛ ۴۸–۹۶GB: ۷۰B Q4، مشروط به کانفیگ
PC Land Orion2 × Xeon Platinum 8173MDDR4 ECC۱۶GB GPU: ۸–۱۴B Q4؛ ۲۴–۳۲GB: تا حدود ۳۲B Q4؛ ۴۸–۹۶GB: ۷۰B Q4، مشروط به کانفیگ
ASUS PA6022 × Xeon Gold 8269CYDDR4 ECC۱۶GB GPU: ۸–۱۴B Q4؛ ۲۴–۳۲GB: تا حدود ۳۲B Q4؛ ۴۸–۹۶GB: ۷۰B Q4، مشروط به کانفیگ
HP Z8 G52 × Xeon Platinum 8481CDDR5 ECC۱۶GB GPU: ۸–۱۴B Q4؛ ۲۴–۳۲GB: تا حدود ۳۲B Q4؛ ۴۸–۹۶GB: ۷۰B Q4، مشروط به کانفیگ
PC Land Helios T12 × Xeon Platinum 8582CDDR5 ECC۱۶GB GPU: ۸–۱۴B Q4؛ ۲۴–۳۲GB: تا حدود ۳۲B Q4؛ ۴۸–۹۶GB: ۷۰B Q4، مشروط به کانفیگ
PC Land Helios T22 × Xeon Platinum 8582CDDR5 ECC۱۶GB GPU: ۸–۱۴B Q4؛ ۲۴–۳۲GB: تا حدود ۳۲B Q4؛ ۴۸–۹۶GB: ۷۰B Q4، مشروط به کانفیگ
PC Land Helios T32 × Xeon Platinum 8481CDDR5 ECC۱۶GB GPU: ۸–۱۴B Q4؛ ۲۴–۳۲GB: تا حدود ۳۲B Q4؛ ۴۸–۹۶GB: ۷۰B Q4، مشروط به کانفیگ
PC Land Helios T42 × Xeon Platinum 8383CDDR4 ECC۱۶GB GPU: ۸–۱۴B Q4؛ ۲۴–۳۲GB: تا حدود ۳۲B Q4؛ ۴۸–۹۶GB: ۷۰B Q4، مشروط به کانفیگ
PC Land Atlas R12 × Xeon Platinum 8582CDDR5 ECC۱۶GB GPU: ۸–۱۴B Q4؛ ۲۴–۳۲GB: تا حدود ۳۲B Q4؛ ۴۸–۹۶GB: ۷۰B Q4، مشروط به کانفیگ
PC Land Atlas R22 × Xeon Platinum 8582CDDR5 ECC۱۶GB GPU: ۸–۱۴B Q4؛ ۲۴–۳۲GB: تا حدود ۳۲B Q4؛ ۴۸–۹۶GB: ۷۰B Q4، مشروط به کانفیگ
PC Land Atlas R32 × Xeon Platinum 8481CDDR5 ECC۱۶GB GPU: ۸–۱۴B Q4؛ ۲۴–۳۲GB: تا حدود ۳۲B Q4؛ ۴۸–۹۶GB: ۷۰B Q4، مشروط به کانفیگ
PC Land Atlas R42 × Xeon Platinum 8383CDDR4 ECC۱۶GB GPU: ۸–۱۴B Q4؛ ۲۴–۳۲GB: تا حدود ۳۲B Q4؛ ۴۸–۹۶GB: ۷۰B Q4، مشروط به کانفیگ
NVIDIA DGX SparkGB10؛ CPU بیست‌هسته‌ای Arm۱۲۸GB LPDDR5x مشترک؛ SSD 4TBتا ۲۰۰B طبق اعلام سازنده؛ نیازمند فرمت و نرم‌افزار مناسب

Astra و Orion: نمونه‌هایی برای شروع و توسعه

Astra در کاتالوگ با دو Xeon Gold 6150 و Orion با دو Xeon Platinum 8173M ثبت شده‌اند؛ هر دو گزینه رم DDR4 ECC و GPU قابل انتخاب دارند. برای دستیار متن و جست‌وجوی اسناد، می‌توان کانفیگ با کارت استاندارد ۱۶GB را همراه مدل ۸B یا ۱۴B چهاربیتی بررسی کرد. اگر هدف Qwen3-32B است، انتخاب GPU با ۲۴ یا ترجیحاً ۳۲GB فضای بیشتری می‌دهد. رم بیشتر به اسناد و سرویس‌ها کمک می‌کند، اما یک مدل ۳۲B را به‌طور کامل داخل VRAM کارت ۱۶GB جا نمی‌دهد.

چهار گزینه برای شروع، توسعه و اجرای مدل‌های محلی

سرور هوش مصنوعی PC Land Astra AI Server
سرور هوش مصنوعی PC Land Astra AI ServerPC Land Astra AI Server با 2 پردازنده Intel Xeon Gold 6150، رم DDR4 ECC و انتخاب مستقل GPU حرفه‌ای و SSD NVMe برای تحلیل داده و رندر CPU. تصویر فعلی آزمایشی است و نمای واقعی شاسی نیست.مشاهده در استوک‌لند
سرور هوش مصنوعی PC Land Orion AI Server
سرور هوش مصنوعی PC Land Orion AI ServerPC Land Orion AI Server با 2 پردازنده Intel Xeon Platinum 8173M، رم DDR4 ECC و انتخاب مستقل GPU حرفه‌ای و SSD NVMe برای مجازی‌سازی و پردازش چندوظیفه‌ای. تصویر فعلی آزمایشی است و نمای واقعی شاسی نیست.مشاهده در استوک‌لند
سرور هوش مصنوعی ASUS PA602
سرور هوش مصنوعی ASUS PA602ASUS PA602 یک سرور هوش مصنوعی تاور دوپردازنده‌ای با 2× Xeon 8269CY، رم DDR4 ECC، شاسی ProArt با جریان هوای قوی و امکان انتخاب GPU حرفه‌ای و SSD NVMe است.مشاهده در استوک‌لند
ابرکامپیوتر هوش مصنوعی NVIDIA DGX Spark
ابرکامپیوتر هوش مصنوعی NVIDIA DGX SPARKNVIDIA DGX Spark یک کامپیوتر شخصی هوش مصنوعی جمع‌وجور و قدرتمند است که برای توسعه‌دهندگان، پژوهشگران، دانشمندان داده، تیم‌های هوش مصنوعی و کسب‌وکارهایی طراحی شده که به توان پردازشی بالا برای توسعه، تسمشاهده در استوک‌لند

کانفیگ، قیمت و موجودی را در صفحه هر محصول ببینید. در Astra، Orion و PA602 ظرفیت اجرای مدل به GPU انتخابی، فرمت وزن و طول ورودی وابسته است؛ ظرفیت DGX Spark را در بخش اختصاصی آن بررسی کردیم. تصاویر Astra و Orion در کاتالوگ آزمایشی معرفی شده‌اند و نمای تأییدشده شاسی نهایی نیستند.

Helios و Atlas: انتخاب فرم دستگاه و پلتفرم میزبان

Helios به شکل Tower معرفی شده و خانواده Atlas در توضیحات کاتالوگ برای استقرار رک مطرح است. T1 و T2 و همچنین R1 و R2 با دو Xeon Platinum 8582C ثبت شده‌اند؛ T3 و R3 با دو 8481C و T4 و R4 با دو 8383C. برای پلتفرم‌های DDR5 می‌توان ظرفیت رم و پردازش داده را بررسی کرد، ولی با GPU یکسان، داشتن نام یا CPU متفاوت سقف حافظه مدل زبانی را به‌تنهایی تغییر نمی‌دهد.

برای مدل ۷۰B چهاربیتی، کانفیگ ۴۸GB ممکن است نقطه شروع باشد؛ ۷۲ تا ۹۶GB فضای بیشتری برای سربار می‌دهد. این پیشنهاد مشروط به تأیید نصب کارت، خنک‌کاری و موجودی است. تفاوت T1 با T2 یا R1 با R2 را از شماره نام نتیجه نگیرید: تعداد GPU، مادربرد، پاور و چیدمان حافظه نهایی باید در پیش‌فاکتور ثبت شوند.

HP Z8 G5 و ASUS PA602: بررسی کانفیگ دقیق اهمیت دارد

HP Z8 G5 در کاتالوگ با دو Xeon Platinum 8481C و رم DDR5، و سیستم مبتنی بر ASUS PA602 با دو Xeon Gold 8269CY و رم DDR4 ثبت شده‌اند. این مشخصات، اطلاعات فروشگاه درباره کانفیگ عرضه‌شده‌اند. PA602 نام شاسی است و ظرفیت AI را مادربرد، پردازنده، GPU و قطعات نصب‌شده تعیین می‌کنند. برای مدل HP نیز پارت‌نامبر و سازگاری کانفیگ ثبت‌شده باید بررسی شود؛ نام مدل به‌تنهایی تأیید کانفیگ کارخانه نیست.

برای محاسبه ظرفیت، از کارت‌هایی با حافظه و هویت فنی روشن استفاده کنید. برخی نام‌های خاص یا نسخه‌های تغییر‌یافته در گزینه‌های فروشگاه، مانند عنوان RTX 4090 با ۴۸GB، را نباید بدون تأیید مشخصات واقعی و سازگاری درایور با کارت استاندارد سازنده یکسان دانست. در پیشنهادهای این مقاله، مبنا ظرفیت مشخص و قابل تأیید است.

چهار پیشنهاد برای پروژه‌های بزرگ‌تر و استقرار سازمانی

Helios برای فرم تاور و Atlas برای استقرار رک در کاتالوگ معرفی شده‌اند. تعداد GPU، سازگاری کارت، توان پاور و خنک‌کاری باید در کانفیگ سفارش تأیید شوند. برای بررسی مدل ۷۰B چهاربیتی، حافظه گرافیکی ۴۸ تا ۹۶GB را با فایل مدل و طول ورودی واقعی آزمایش کنید؛ داشتن این شاسی‌ها به‌تنهایی تضمین اجرای ۷۰B نیست.

چطور قدرت واقعی یک سرور AI را قبل از خرید بسنجیم؟

قدرت واقعی فقط از عدد TFLOPS، هسته CPU یا تعداد پارامتر به دست نمی‌آید. برای تصمیم خرید، یک آزمون با مدل و فایل دقیق شما لازم است. نام GPU، ظرفیت حافظه آزاد، نسخه موتور، نوع Quantization، طول ورودی و تعداد کاربران باید در گزارش آزمون مشخص باشند؛ در غیر این صورت دو عدد سرعت قابل مقایسه نیستند.

  1. مدل را دقیق نام ببرید: مثلاً Qwen3-32B با فایل Q4_K_M، نه فقط «مدل ۳۲ میلیاردی».
  2. دو طول ورودی متناسب با کار انتخاب کنید: یک مکالمه کوتاه و یک سند طولانی؛ حجم خروجی را هم یکسان بگیرید.
  3. زمان تا اولین پاسخ را اندازه بگیرید: کاربر پیش از شروع خروجی چقدر منتظر می‌ماند؟
  4. سرعت ادامه پاسخ و زمان پایان کار را ثبت کنید: توکن‌برثانیه به‌تنهایی اثر طول پاسخ و مراحل استدلال را نشان نمی‌دهد.
  5. مصرف حافظه و پایداری را بررسی کنید: خطای کمبود حافظه، Offload، دما و افت عملکرد در بار طولانی اهمیت دارند.
  6. اگر چندکاربره است، آزمون را با تعداد درخواست هم‌زمان موردنظر تکرار کنید؛ عدد کاربر ثابت از ظرفیت VRAM نتیجه نمی‌شود.
  7. کیفیت را کنار سرعت بسنجید: پاسخ درست، استناد به سند، پیروی از قالب و نیاز به اصلاح انسانی را ثبت کنید.

برای مقایسه با آنلاین نیز از همان مجموعه پرسش و معیار استفاده کنید. پیشنهاد عملی، ساختن یک مجموعه ۵۰ تا ۱۰۰ نمونه از کارهای روزمره خودتان است: تولید متن فارسی، خلاصه سند، پاسخ مستند، کدنویسی و مواردی که جواب ندارند. بررسی کنید مدل در نبود سند، پاسخ ساختگی می‌دهد یا محدودیت اطلاعات را بیان می‌کند. برنده واقعی، سامانه‌ای است که کار موردنظر را با کیفیت، زمان و هزینه پذیرفتنی انجام دهد.

استنتاج، Fine-tuning و آموزش از صفر را یکی نگیرید

استنتاج یعنی استفاده از مدل آماده برای تولید پاسخ. Fine-tuning یعنی تغییر مدل با داده تخصصی؛ روش‌های LoRA و QLoRA می‌توانند نیاز حافظه را نسبت به تنظیم کامل کمتر کنند. آموزش از صفر مرحله‌ای بسیار پرهزینه‌تر است و به دیتاست، زمان و زیرساخت متفاوتی نیاز دارد. سروری که یک مدل ۷۰B چهاربیتی را اجرا می‌کند، الزاماً توان آموزش کامل همان مدل را ندارد.

نیاز حافظه آموزش علاوه بر وزن‌ها شامل گرادیان‌ها، وضعیت بهینه‌ساز و Activation است. به همین دلیل جدول استنتاج این مقاله برای خرید دستگاه آموزش از صفر کافی نیست. برای بسیاری از کسب‌وکارها، ابتدا RAG و تنظیم پرامپت منطقی‌تر است: اگر مشکل، ندانستن اطلاعات تازه شرکت باشد، بازیابی سند می‌تواند بدون تغییر وزن مدل آن را حل کند.

نرم‌افزارهای اجرای هوش مصنوعی لوکال

LM Studio یک مسیر دارای رابط گرافیکی برای اجرای مدل‌های دانلودشده و کار آفلاین ارائه می‌کند. Ollama برای مدیریت مدل و اتصال نرم‌افزارها کاربرد دارد و امکان غیرفعال کردن امکانات ابری را هم مستند کرده است. llama.cpp موتور اجرای مدل روی سخت‌افزارهای گوناگون و فرمت GGUF است. انتخاب نهایی به مدل، سیستم‌عامل و Backend مناسب GPU بستگی دارد.

دانلود نرم‌افزارهای اجرای محلی از منابع رسمی

دانلود LM Studioدریافت برنامه از سایت رسمی؛ نسخه مناسب سیستم‌عامل و معماری پردازنده را انتخاب کنید.دانلود Ollamaصفحه رسمی دریافت برای Windows، macOS و Linux؛ مدل‌ها را پس از نصب جداگانه دریافت کنید.دریافت نسخه‌های آماده llama.cppبخش Releases رسمی پروژه؛ بسته سازگار با سیستم‌عامل، معماری و Backend کارت گرافیک را انتخاب کنید.

لینک‌های مدل به فهرست فایل‌های مخزن رسمی می‌روند تا فرمت و دقت مناسب را انتخاب کنید؛ لازم نیست همه نسخه‌های کوانتیزه را دانلود کنید. GGUF با وزن‌های Safetensors یا MXFP4 یکسان نیست. برای مخزن چندبخشی، فایل تنظیمات و توکنایزر و تمام بخش‌های وزن موردنیاز موتور را هم آماده کنید. دانلود برنامه یا مدل به اینترنت نیاز دارد؛ کار آفلاین بعد از آماده‌سازی کامل آغاز می‌شود.

برای سرویس چندکاربره، موتورهایی مانند vLLM و SGLang نیز در مستندات بسیاری از مدل‌ها معرفی می‌شوند. رابط گفت‌وگو، موتور اجرا و خود مدل سه جزء مستقل‌اند. نصب یک رابط به معنی سازگار بودن همه مدل‌ها و کارت‌ها نیست. به‌خصوص برای مدل جدید، قالب چندوجهی، MXFP4 یا GPU غیرانویدیا، پشتیبانی نسخه نرم‌افزار باید بررسی شود.

راه‌اندازی یک سامانه واقعاً آفلاین، گام به گام

  1. کاربرد را تعریف کنید: چت، کد، تصویر، صوت یا پاسخ به اسناد؛ زبان، حجم داده و تعداد کاربران را مشخص کنید.
  2. یک مدل مناسب انتخاب کنید: کارت مدل، مجوز، نسخه و فرمت وزن را بخوانید و فایل لازم را دریافت کنید.
  3. موتور و درایور سازگار نصب کنید: روی GB10 سازگاری Arm و روی GPU مجزا Backend لازم را بررسی کنید.
  4. تمام وابستگی‌ها را آماده کنید: توکنایزر، OCR، Embedding، Reranker و اجزای موردنیاز زنجیره باید محلی باشند.
  5. ابتدا با ورودی کوتاه و یک کاربر اجرا کنید: از طول مکالمه کوچک شروع و مصرف حافظه را ثبت کنید.
  6. کاربرد سند را با فایل واقعی آزمایش کنید: متن استخراج‌شده، سند بازیابی‌شده و پاسخ نهایی را جدا بررسی کنید.
  7. حالت آفلاین را عملاً امتحان کنید: پس از آماده‌سازی، اینترنت خارجی را قطع و یک کار کامل اجرا کنید؛ هر وابستگی پنهان در این مرحله آشکار می‌شود.
  8. برای تیم، دسترسی و پشتیبان مشخص کنید: حساب‌ها، مجوز اسناد، نگهداری مکالمه و زمان به‌روزرسانی را تعریف کنید.

هزینه خرید سرور AI را چطور با آنلاین مقایسه کنیم؟

برای مقایسه اقتصادی، «هزینه مالکیت» را محاسبه کنید: قیمت دستگاه و ارتقا، نصب، برق، نگهداری، فضای استقرار و زمان نیروی فنی. در سرویس آنلاین نیز هزینه اشتراک یا API، حجم ورودی و خروجی، تعداد درخواست و امکانات لازم را وارد کنید. بهتر است معیار نهایی هزینه هر کار موفق باشد؛ مدلی که ارزان پاسخ می‌دهد ولی اصلاح زیادی می‌خواهد، ممکن است در عمل گران‌تر شود.

مثال فرضی محاسبه برق: اگر میانگین مصرف اندازه‌گیری‌شده یک سیستم ۶۰۰ وات باشد و ماهانه ۲۰۰ ساعت زیر بار کار کند، انرژی این بخش ۱۲۰ کیلووات‌ساعت است. تعرفه برق، مصرف زمان بیکار و خنک‌کاری را باید جدا اضافه کرد. عدد ۶۰۰ وات در این مثال مشخصات هیچ‌یک از محصولات معرفی‌شده نیست.

نقطه سربه‌سر را با دوره زمانی موردنظر حساب کنید: هزینه اولیه را بر صرفه‌جویی ماهانه واقعی نسبت به سرویس آنلاین تقسیم کنید. اگر دستگاه بیشتر ساعات بیکار بماند، بازگشت سرمایه طولانی می‌شود. اگر کار پیوسته، داده محرمانه یا هزینه توقف زیاد باشد، ارزش دسترسی مستقل و کنترل داده نیز باید کنار هزینه مالی دیده شود.

اشتباه‌های رایج در خرید سرور هوش مصنوعی آفلاین

  • خرید بر اساس CPU بدون مشخص کردن مدل هدف و VRAM؛ هسته بیشتر به‌تنهایی مدل بزرگ‌تر را روی GPU جا نمی‌دهد.
  • یکی دانستن RAM و VRAM؛ حافظه یکپارچه نیز معماری و پهنای باند متفاوتی دارد.
  • محاسبه ظرفیت MoE بر پایه پارامتر فعال؛ برای حافظه باید وزن کل مدل را بررسی کرد.
  • فرض اینکه مدل بزرگ‌تر همیشه برای فارسی یا کار تخصصی بهتر است؛ ارزیابی نمونه واقعی ضروری است.
  • نادیده گرفتن طول ورودی، تصویر و هم‌زمانی؛ هر سه می‌توانند فضای لازم را افزایش دهند.
  • اشتباه گرفتن توان اسمی FP4 یا FP8 با سرعت واقعی پاسخ؛ عددهای با دقت متفاوت مستقیماً هم‌ارز نیستند.
  • انتخاب GPU از فهرست گزینه‌ها بدون تأیید ابعاد، توان، تهویه و پشتیبانی نرم‌افزار.
  • مقایسه هزینه API با قیمت دستگاه و حذف برق، نگهداری و نیروی فنی.

برای هر نوع کاربر چه انتخابی منطقی‌تر است؟

برای یادگیری و دستیار شخصی، از مدل کوچک روی سخت‌افزار موجود شروع کنید؛ اگر کیفیت کافی بود، خرید دستگاه بزرگ‌تر ضرورتی ندارد. برای تیم برنامه‌نویسی، ابتدا مدل کدنویسی را روی نمونه مخزن خودتان بسنجید و بعد ظرفیت ۲۴ یا ۳۲GB را بررسی کنید. برای شرکت با اسناد داخلی، کیفیت RAG، دسترسی کاربران و حفظ داده در کنار GPU اهمیت دارند.

برای مدل‌های بزرگ‌تر و توسعه در اکوسیستم انویدیا، DGX Spark با حافظه یکپارچه قابل بررسی است. برای استقرار داخلی و نیاز به ارتقای قطعات، ورک‌استیشن یا سرور قابل پیکربندی را با مدل هدف مقایسه کنید. برای آموزش بزرگ یا سرویس‌دهی پرحجم، وارد رده تجهیزات دیتاسنتری می‌شوید و طراحی زیرساخت باید بخشی از پروژه باشد.

اگر قصد خرید دارید، در Astra، Helios T3، Atlas R4 و DGX Spark از مدل هدف شروع کنید و کانفیگ را بر همان اساس انتخاب کنید. برای مقایسه رده‌های سخت‌افزار، راهنمای کیس‌های AI انویدیا و AMD و برای هماهنگی سفارش صفحه تماس با استوک‌لند نیز در دسترس‌اند.

پرسش‌های متداول درباره هوش مصنوعی لوکال و آفلاین

آیا هوش مصنوعی لوکال بدون اینترنت کار می‌کند؟

بله، پس از آماده کردن وزن مدل، نرم‌افزار و همه وابستگی‌ها. جست‌وجوی وب و ابزارهای خارجی به اینترنت نیاز دارند. برای اطمینان، یک کار کامل را پس از قطع اینترنت آزمایش کنید.

آیا هوش مصنوعی آفلاین از آنلاین قوی‌تر است؟

برتری قطعی در همه کارها ندارد. مزیت اصلی، کنترل داده و استقلال در اجراست. کیفیت پاسخ را مدل، دقت اجرا، ابزارها و داده تعیین می‌کنند و باید با آزمون یکسان مقایسه شود.

برای مدل ۳۲ میلیاردپارامتری چقدر حافظه لازم است؟

فایل Qwen3-32B در Q4_K_M حدود ۱۹٫۸GB است؛ Cache و سربار به آن اضافه می‌شوند. کارت ۲۴GB با Context محدود نامزد اجراست و ۳۲GB حاشیه بیشتری دارد. این اعداد به نسخه فایل و موتور وابسته‌اند.

آیا کارت ۴۸GB مدل ۷۰B را اجرا می‌کند؟

نسخه چهاربیتی بعضی مدل‌های ۷۰B می‌تواند روی ۴۸GB قابل بررسی باشد، ولی طول ورودی و هم‌زمانی محدودیت ایجاد می‌کنند. فایل مدل و مصرف واقعی باید پیش از سفارش آزمایش شوند.

DGX Spark واقعاً مدل ۲۰۰B را هندل می‌کند؟

انویدیا برای نسخه ۱۲۸GB سقف استنتاج تا ۲۰۰ میلیارد پارامتر اعلام می‌کند. این سقف مشروط به فرمت و تنظیمات مناسب است و وعده اجرای همه مدل‌های ۲۰۰B با هر طول ورودی یا سرعت مشخص نیست.

آیا دو GPU حافظه‌شان خودکار جمع می‌شود؟

خیر. موتور باید تقسیم مدل را پشتیبانی کند و اتصال، روش تقسیم و سازگاری کارت‌ها بر نتیجه اثر دارند. دو کارت ۲۴GB الزاماً مانند یک کارت ۴۸GB عمل نمی‌کنند.

آیا روی سرور آفلاین می‌توان تصویر و صوت هم پردازش کرد؟

بله، با مدل و نرم‌افزار مناسب هر کار. مدل تحلیل تصویر با مدل تولید تصویر فرق دارد. تبدیل گفتار به متن و RAG نیز اجزای مستقل دارند که باید محلی نصب شوند.

آیا اجرای مدل با آموزش آن فرق دارد؟

بله. استنتاج از وزن آماده استفاده می‌کند؛ Fine-tuning و آموزش از صفر علاوه بر وزن به حافظه و محاسبات بیشتری نیاز دارند. ظرفیت استنتاج تضمین ظرفیت آموزش نیست.

آیا محصولات استوک‌لند با هر کانفیگ مدل ۷۰B را اجرا می‌کنند؟

خیر. برای محصولات قابل پیکربندی، ظرفیت به GPU، RAM، فایل مدل و Context وابسته است. کانفیگ ۱۶GB را نباید با کانفیگ ۴۸ یا ۹۶GB یکسان در نظر گرفت؛ موجودی پیش‌سفارش نیز جدا بررسی می‌شود.

منابع رسمی و روش این بررسی

این راهنما از مشخصات رسمی سازندگان، کارت مدل‌ها و داده فعلی کاتالوگ استوک‌لند استفاده می‌کند. اعداد حافظه خام و مثال KV Cache محاسبه‌شده‌اند؛ برای هیچ محصول، نرخ توکن‌برثانیه یا تعداد کاربر بدون آزمون اعلام نشده است. تصویر شاخص، تصویر مفهومی تولیدشده با هوش مصنوعی است و نمای دقیق یک کانفیگ قابل فروش نیست. کارت‌های محصول، عنوان، تصویر و لینک را از کاتالوگ فعلی می‌خوانند؛ برخی تصاویر کاتالوگ از جمله Astra و Orion آزمایشی‌اند و نمای تأییدشده کانفیگ نهایی نیستند.

دیدگاه خوانندگان

۰ دیدگاه منتشرشده
هنوز نظری منتشر نشده است

اولین دیدگاه مفید درباره این مطلب را شما بنویسید.

دیدگاه شما

درباره این مطلب چه فکر می‌کنید؟

نظر مرتبط و محترمانه پس از بررسی در همین صفحه منتشر می‌شود.