ورود به پنل ثبت‌ نام

سرور مجازی برای هوش مصنوعی

راهنمای انتخاب سرور مجازی برای هوش مصنوعی و اجرای مدل‌های زبانی محلی. چه چیزی روی پردازنده عملی است، چقدر حافظه لازم دارید و انتظار درست از سرعت.

قیمت‌ها، شروع از تهران

هزینه به‌صورت روزانه از کیف پول شما کسر می‌شود. هر زمان سرور را حذف کنید، کسر هزینه متوقف می‌شود. ارقام زیر مربوط به ارزان‌ترین لوکیشن است؛ قیمت در سایر لوکیشن‌ها متفاوت است.

پردازنده حافظه دیسک NVMe هزینه روزانه تقریباً ماهانه
۱ هسته ۱ گیگابایت ۳۰ گیگابایت ۲۸,۰۰۰ تومان ۸۴۰,۰۰۰ تومان ساخت سرور
۲ هسته ۲ گیگابایت ۵۰ گیگابایت ۴۴,۰۰۰ تومان ۱,۳۲۰,۰۰۰ تومان ساخت سرور
۲ هسته ۴ گیگابایت ۸۰ گیگابایت ۶۲,۰۰۰ تومان ۱,۸۶۰,۰۰۰ تومان ساخت سرور
۴ هسته ۸ گیگابایت ۱۶۰ گیگابایت ۱۱۴,۰۰۰ تومان ۳,۴۲۰,۰۰۰ تومان ساخت سرور

قیمت‌ها بدون احتساب مالیات بر ارزش افزوده است و در صورتحساب نهایی اضافه می‌شود. رقم ماهانه تقریبی و بر پایه ۳۰ روز محاسبه شده است. منابع دلخواه خود را می‌توانید در صفحه ساخت سرور دقیق‌تر تنظیم کنید.

بگذارید با صادقانه‌ترین نکته شروع کنیم: سرورهای ابری ابر سپهر کارت گرافیک ندارند. مدل‌ها روی پردازنده اجرا می‌شوند. این کار می‌کند، اما اگر انتظار سرعت پاسخ‌گویی سرویس‌های تجاری را دارید، ناامید خواهید شد.

با این حال دسته بزرگی از کارها وجود دارد که روی پردازنده کاملاً عملی‌اند و اتفاقاً همان‌هایی هستند که بیشتر کسب‌وکارها به آن نیاز دارند: خلاصه‌سازی متن، دسته‌بندی، استخراج داده ساخت‌یافته، و اتوماسیونی که در پس‌زمینه اجرا می‌شود. این صفحه کمک می‌کند بفهمید کدام دسته‌اید.

چه زمانی اجرای محلی مدل معنا دارد؟

اجرای مدل روی سرور خودتان وقتی درست است که:

  • داده نباید از سازمان خارج شود — قرارداد، پرونده پزشکی، اطلاعات مشتری
  • هزینه ثابت را به پرداخت به‌ازای هر درخواست ترجیح می‌دهید
  • محدودیت نرخ سرویس‌های آماده برایتان مشکل‌ساز شده
  • کار شما پس‌زمینه‌ای است و چند ثانیه تأخیر اهمیتی ندارد
  • می‌خواهید آزمایش کنید بدون آنکه هر آزمایش هزینه بدهد

و منطقی نیست وقتی:

  • به پاسخ بلادرنگ برای کاربری که منتظر نشسته نیاز دارید
  • به بهترین کیفیت ممکن نیاز دارید؛ مدل‌های کوچک با مدل‌های بزرگ تجاری قابل مقایسه نیستند
  • حجم درخواست‌هایتان کم است و API آماده ارزان‌تر تمام می‌شود

بزرگ‌ترین اشتباه در این حوزه، خرید سرور بزرگ و بعد فهمیدن این است که مدل دلخواهتان روی پردازنده خیلی کند است. اول با کمترین منابع یک مدل کوچک را امتحان کنید و سرعت واقعی را ببینید. با پرداخت روزانه این آزمایش چند هزار تومان هزینه دارد.

انتخاب منابع بر اساس اندازه مدل

حافظه تعیین‌کننده است، نه پردازنده. مدل باید کامل در رم جا شود؛ اگر جا نشود، سیستم شروع به استفاده از دیسک می‌کند و سرعت به‌شکل فاجعه‌باری افت می‌کند.

اندازه مدل حافظه لازم پردازنده دیسک مناسب چه کاری
تا ۳ میلیارد پارامتر ۴ گیگابایت ۲ هسته ۵۰ گیگابایت دسته‌بندی، برچسب‌گذاری
حدود ۷ تا ۸ میلیارد ۸ تا ۱۶ گیگابایت ۴ هسته ۸۰ گیگابایت خلاصه‌سازی، استخراج داده
بیش از ۱۳ میلیارد ۳۲ گیگابایت به بالا ۸ هسته ۱۰۰ گیگابایت روی پردازنده عملی نیست

کوانتیزه‌سازی مفهومی است که باید بشناسید: نسخه فشرده‌شده مدل که دقت عددی کمتری دارد و در نتیجه حافظه بسیار کمتری می‌خواهد. افت کیفیت معمولاً کم است اما صرفه‌جویی حافظه چشمگیر. برای اجرا روی پردازنده، عملاً همیشه نسخه کوانتیزه‌شده را انتخاب می‌کنید.

دیسک را دست‌کم نگیرید: هر مدل چند گیگابایت است و اگر بخواهید چند مدل را مقایسه کنید، فضا سریع پر می‌شود.

انتظار درست از سرعت

روی پردازنده، سرعت تولید معمولاً در حد چند توکن در ثانیه است. برای اینکه تصور ملموسی داشته باشید:

کاربرد روی پردازنده عملی است؟
خلاصه کردن یک متن در پس‌زمینه بله
دسته‌بندی خودکار تیکت‌های پشتیبانی بله
استخراج فیلد از فاکتور یا قرارداد بله
پاسخ‌گویی زنده به کاربر سایت خیر، کند است
تولید متن طولانی به‌صورت تعاملی خیر

الگوی رایج و درست این است: کار را در صف بگذارید. کاربر درخواست می‌دهد، سیستم می‌گوید «در حال پردازش»، و نتیجه چند ثانیه بعد آماده می‌شود. با این الگو، کندی مدل مشکلی ایجاد نمی‌کند.

کاربردی که بیشترین ارزش را می‌دهد: جستجو در اسناد خودتان

اگر بخواهیم یک کاربرد را نام ببریم که روی پردازنده کاملاً عملی است و ارزش واقعی می‌سازد، این است: پرسش‌وپاسخ روی اسناد داخلی سازمان.

الگو ساده است. اسناد شما — قراردادها، مستندات فنی، سوابق پشتیبانی — یک‌بار پردازش و به بردار تبدیل می‌شوند. هنگام پرسش، ابتدا بخش‌های مرتبط پیدا می‌شوند و فقط همان‌ها به مدل داده می‌شوند تا پاسخ بسازد.

چرا این روی پردازنده خوب کار می‌کند؟ چون بخش سنگین کار — جستجوی معنایی — با مدل‌های بسیار کوچک‌تری انجام می‌شود که سریع‌اند. مدل زبانی فقط برای جمع‌بندی نهایی وارد می‌شود و متن کوتاهی پردازش می‌کند.

و چرا محلی؟ چون دقیقاً همین داده‌ها معمولاً همان‌هایی هستند که نباید به سرویس بیرونی فرستاده شوند.

لوکیشن

لوکیشن خارج از کشور را انتخاب کنید. مدل‌ها از مخازن بین‌المللی دانلود می‌شوند و حجمشان چند گیگابایت است؛ روی سرور داخل کشور این مرحله دردسر دارد.

راه‌اندازی

مسیر معمول سه گام دارد:

۱. نصب Ollama — ساده‌ترین راه اجرای مدل‌های محلی. آموزش کامل در نصب Ollama روی سرور ابری.

۲. رابط گرافیکی — اگر می‌خواهید مثل یک چت با مدل کار کنید، نصب Open WebUI رابطی شبیه سرویس‌های تجاری روی سرور خودتان می‌سازد.

۳. اتصال به اتوماسیون — برای وصل کردن مدل به گردش کارهای واقعی، ساخت ایجنت هوش مصنوعی با n8n و MCP الگوی عملی را نشان می‌دهد. صفحه سرور برای n8n منابع لازم را توضیح می‌دهد.

نگهداری

کار دستور چه زمانی
به‌روزرسانی سیستم apt update && apt upgrade هفتگی
بررسی فضای دیسک df -h ماهانه
حذف مدل‌های بی‌استفاده ollama rm <model> هر وقت دیسک پر شد
بررسی مصرف حافظه free -h هنگام کندی

مدل‌های دانلودشده بزرگ‌ترین مصرف‌کننده دیسک هستند. اگر چند مدل را امتحان کرده‌اید، آن‌هایی که استفاده نمی‌کنید را حذف کنید.

جمع‌بندی

سرور مجازی برای هوش مصنوعی وقتی انتخاب درستی است که داده‌تان نباید جایی برود، هزینه ثابت را ترجیح می‌دهید، و کارتان پس‌زمینه‌ای است. مدل‌های کوچک کوانتیزه‌شده تا حدود ۸ میلیارد پارامتر روی پردازنده عملی‌اند.

حافظه را بر اساس اندازه مدل انتخاب کنید، نه پردازنده. و پیش از تعهد بلندمدت، با کمترین منابع یک مدل کوچک را امتحان کنید تا سرعت واقعی را ببینید.

ساخت سرور ابری برای هوش مصنوعی

سوال‌های پرتکرار

آیا سرور ابری کارت گرافیک دارد؟ +

خیر. سرورهای ابری ابر سپهر پردازنده‌ای هستند و GPU ندارند. یعنی مدل‌ها روی CPU اجرا می‌شوند که کار می‌کند، اما به‌مراتب کندتر از اجرای روی کارت گرافیک است. این را پیش از خرید بدانید تا انتظار درستی داشته باشید.

پس چه مدل‌هایی عملی هستند؟ +

مدل‌های کوچک و کوانتیزه‌شده تا حدود ۸ میلیارد پارامتر. این‌ها برای خلاصه‌سازی، دسته‌بندی متن، استخراج داده و پاسخ‌های کوتاه مناسب‌اند. مدل‌های بزرگ روی پردازنده آن‌قدر کند می‌شوند که عملاً قابل استفاده نیستند.

چقدر حافظه لازم دارم؟ +

قاعده سرانگشتی این است که مدل کوانتیزه‌شده حدود همان تعداد گیگابایت حافظه می‌خواهد که میلیارد پارامتر دارد، به‌علاوه چند گیگابایت برای سیستم. برای مدل ۷ میلیاردی، ۸ تا ۱۶ گیگابایت رم نقطه شروع منطقی است.

سرعت پاسخ چقدر است؟ +

روی پردازنده معمولاً چند توکن در ثانیه. برای پردازش دسته‌ای، کارهای پس‌زمینه و اتوماسیون کافی است؛ برای چتی که کاربر پشتش منتظر نشسته، کند به نظر می‌رسد.

چرا به‌جای API آماده، مدل را خودم اجرا کنم؟ +

سه دلیل رایج، داده‌ای که نباید از سازمان خارج شود، هزینه ثابت به‌جای پرداخت به‌ازای هر درخواست، و نبود محدودیت نرخ. اگر هیچ‌کدام برای شما مهم نیست، API آماده ساده‌تر است.

کدام لوکیشن برای این کار مناسب است؟ +

لوکیشن خارج از کشور، چون دانلود مدل‌ها از مخازن بین‌المللی انجام می‌شود و حجم آن‌ها چند گیگابایت است.

آموزش‌های مرتبط

کاربردها دیگر

آخرین به‌روزرسانی: ۰۹ مرداد ۱۴۰۵