سرور مجازی برای هوش مصنوعی
راهنمای انتخاب سرور مجازی برای هوش مصنوعی و اجرای مدلهای زبانی محلی. چه چیزی روی پردازنده عملی است، چقدر حافظه لازم دارید و انتظار درست از سرعت.
قیمتها، شروع از تهران
هزینه بهصورت روزانه از کیف پول شما کسر میشود. هر زمان سرور را حذف کنید، کسر هزینه متوقف میشود. ارقام زیر مربوط به ارزانترین لوکیشن است؛ قیمت در سایر لوکیشنها متفاوت است.
| پردازنده | حافظه | دیسک NVMe | هزینه روزانه | تقریباً ماهانه | |
|---|---|---|---|---|---|
| ۱ هسته | ۱ گیگابایت | ۳۰ گیگابایت | ۲۸,۰۰۰ تومان | ۸۴۰,۰۰۰ تومان | ساخت سرور |
| ۲ هسته | ۲ گیگابایت | ۵۰ گیگابایت | ۴۴,۰۰۰ تومان | ۱,۳۲۰,۰۰۰ تومان | ساخت سرور |
| ۲ هسته | ۴ گیگابایت | ۸۰ گیگابایت | ۶۲,۰۰۰ تومان | ۱,۸۶۰,۰۰۰ تومان | ساخت سرور |
| ۴ هسته | ۸ گیگابایت | ۱۶۰ گیگابایت | ۱۱۴,۰۰۰ تومان | ۳,۴۲۰,۰۰۰ تومان | ساخت سرور |
قیمتها بدون احتساب مالیات بر ارزش افزوده است و در صورتحساب نهایی اضافه میشود. رقم ماهانه تقریبی و بر پایه ۳۰ روز محاسبه شده است. منابع دلخواه خود را میتوانید در صفحه ساخت سرور دقیقتر تنظیم کنید.
بگذارید با صادقانهترین نکته شروع کنیم: سرورهای ابری ابر سپهر کارت گرافیک ندارند. مدلها روی پردازنده اجرا میشوند. این کار میکند، اما اگر انتظار سرعت پاسخگویی سرویسهای تجاری را دارید، ناامید خواهید شد.
با این حال دسته بزرگی از کارها وجود دارد که روی پردازنده کاملاً عملیاند و اتفاقاً همانهایی هستند که بیشتر کسبوکارها به آن نیاز دارند: خلاصهسازی متن، دستهبندی، استخراج داده ساختیافته، و اتوماسیونی که در پسزمینه اجرا میشود. این صفحه کمک میکند بفهمید کدام دستهاید.
چه زمانی اجرای محلی مدل معنا دارد؟
اجرای مدل روی سرور خودتان وقتی درست است که:
- داده نباید از سازمان خارج شود — قرارداد، پرونده پزشکی، اطلاعات مشتری
- هزینه ثابت را به پرداخت بهازای هر درخواست ترجیح میدهید
- محدودیت نرخ سرویسهای آماده برایتان مشکلساز شده
- کار شما پسزمینهای است و چند ثانیه تأخیر اهمیتی ندارد
- میخواهید آزمایش کنید بدون آنکه هر آزمایش هزینه بدهد
و منطقی نیست وقتی:
- به پاسخ بلادرنگ برای کاربری که منتظر نشسته نیاز دارید
- به بهترین کیفیت ممکن نیاز دارید؛ مدلهای کوچک با مدلهای بزرگ تجاری قابل مقایسه نیستند
- حجم درخواستهایتان کم است و API آماده ارزانتر تمام میشود
بزرگترین اشتباه در این حوزه، خرید سرور بزرگ و بعد فهمیدن این است که مدل دلخواهتان روی پردازنده خیلی کند است. اول با کمترین منابع یک مدل کوچک را امتحان کنید و سرعت واقعی را ببینید. با پرداخت روزانه این آزمایش چند هزار تومان هزینه دارد.
انتخاب منابع بر اساس اندازه مدل
حافظه تعیینکننده است، نه پردازنده. مدل باید کامل در رم جا شود؛ اگر جا نشود، سیستم شروع به استفاده از دیسک میکند و سرعت بهشکل فاجعهباری افت میکند.
| اندازه مدل | حافظه لازم | پردازنده | دیسک | مناسب چه کاری |
|---|---|---|---|---|
| تا ۳ میلیارد پارامتر | ۴ گیگابایت | ۲ هسته | ۵۰ گیگابایت | دستهبندی، برچسبگذاری |
| حدود ۷ تا ۸ میلیارد | ۸ تا ۱۶ گیگابایت | ۴ هسته | ۸۰ گیگابایت | خلاصهسازی، استخراج داده |
| بیش از ۱۳ میلیارد | ۳۲ گیگابایت به بالا | ۸ هسته | ۱۰۰ گیگابایت | روی پردازنده عملی نیست |
کوانتیزهسازی مفهومی است که باید بشناسید: نسخه فشردهشده مدل که دقت عددی کمتری دارد و در نتیجه حافظه بسیار کمتری میخواهد. افت کیفیت معمولاً کم است اما صرفهجویی حافظه چشمگیر. برای اجرا روی پردازنده، عملاً همیشه نسخه کوانتیزهشده را انتخاب میکنید.
دیسک را دستکم نگیرید: هر مدل چند گیگابایت است و اگر بخواهید چند مدل را مقایسه کنید، فضا سریع پر میشود.
انتظار درست از سرعت
روی پردازنده، سرعت تولید معمولاً در حد چند توکن در ثانیه است. برای اینکه تصور ملموسی داشته باشید:
| کاربرد | روی پردازنده عملی است؟ |
|---|---|
| خلاصه کردن یک متن در پسزمینه | بله |
| دستهبندی خودکار تیکتهای پشتیبانی | بله |
| استخراج فیلد از فاکتور یا قرارداد | بله |
| پاسخگویی زنده به کاربر سایت | خیر، کند است |
| تولید متن طولانی بهصورت تعاملی | خیر |
الگوی رایج و درست این است: کار را در صف بگذارید. کاربر درخواست میدهد، سیستم میگوید «در حال پردازش»، و نتیجه چند ثانیه بعد آماده میشود. با این الگو، کندی مدل مشکلی ایجاد نمیکند.
کاربردی که بیشترین ارزش را میدهد: جستجو در اسناد خودتان
اگر بخواهیم یک کاربرد را نام ببریم که روی پردازنده کاملاً عملی است و ارزش واقعی میسازد، این است: پرسشوپاسخ روی اسناد داخلی سازمان.
الگو ساده است. اسناد شما — قراردادها، مستندات فنی، سوابق پشتیبانی — یکبار پردازش و به بردار تبدیل میشوند. هنگام پرسش، ابتدا بخشهای مرتبط پیدا میشوند و فقط همانها به مدل داده میشوند تا پاسخ بسازد.
چرا این روی پردازنده خوب کار میکند؟ چون بخش سنگین کار — جستجوی معنایی — با مدلهای بسیار کوچکتری انجام میشود که سریعاند. مدل زبانی فقط برای جمعبندی نهایی وارد میشود و متن کوتاهی پردازش میکند.
و چرا محلی؟ چون دقیقاً همین دادهها معمولاً همانهایی هستند که نباید به سرویس بیرونی فرستاده شوند.
لوکیشن
لوکیشن خارج از کشور را انتخاب کنید. مدلها از مخازن بینالمللی دانلود میشوند و حجمشان چند گیگابایت است؛ روی سرور داخل کشور این مرحله دردسر دارد.
راهاندازی
مسیر معمول سه گام دارد:
۱. نصب Ollama — سادهترین راه اجرای مدلهای محلی. آموزش کامل در نصب Ollama روی سرور ابری.
۲. رابط گرافیکی — اگر میخواهید مثل یک چت با مدل کار کنید، نصب Open WebUI رابطی شبیه سرویسهای تجاری روی سرور خودتان میسازد.
۳. اتصال به اتوماسیون — برای وصل کردن مدل به گردش کارهای واقعی، ساخت ایجنت هوش مصنوعی با n8n و MCP الگوی عملی را نشان میدهد. صفحه سرور برای n8n منابع لازم را توضیح میدهد.
نگهداری
| کار | دستور | چه زمانی |
|---|---|---|
| بهروزرسانی سیستم | apt update && apt upgrade |
هفتگی |
| بررسی فضای دیسک | df -h |
ماهانه |
| حذف مدلهای بیاستفاده | ollama rm <model> |
هر وقت دیسک پر شد |
| بررسی مصرف حافظه | free -h |
هنگام کندی |
مدلهای دانلودشده بزرگترین مصرفکننده دیسک هستند. اگر چند مدل را امتحان کردهاید، آنهایی که استفاده نمیکنید را حذف کنید.
جمعبندی
سرور مجازی برای هوش مصنوعی وقتی انتخاب درستی است که دادهتان نباید جایی برود، هزینه ثابت را ترجیح میدهید، و کارتان پسزمینهای است. مدلهای کوچک کوانتیزهشده تا حدود ۸ میلیارد پارامتر روی پردازنده عملیاند.
حافظه را بر اساس اندازه مدل انتخاب کنید، نه پردازنده. و پیش از تعهد بلندمدت، با کمترین منابع یک مدل کوچک را امتحان کنید تا سرعت واقعی را ببینید.
سوالهای پرتکرار
آیا سرور ابری کارت گرافیک دارد؟ +
خیر. سرورهای ابری ابر سپهر پردازندهای هستند و GPU ندارند. یعنی مدلها روی CPU اجرا میشوند که کار میکند، اما بهمراتب کندتر از اجرای روی کارت گرافیک است. این را پیش از خرید بدانید تا انتظار درستی داشته باشید.
پس چه مدلهایی عملی هستند؟ +
مدلهای کوچک و کوانتیزهشده تا حدود ۸ میلیارد پارامتر. اینها برای خلاصهسازی، دستهبندی متن، استخراج داده و پاسخهای کوتاه مناسباند. مدلهای بزرگ روی پردازنده آنقدر کند میشوند که عملاً قابل استفاده نیستند.
چقدر حافظه لازم دارم؟ +
قاعده سرانگشتی این است که مدل کوانتیزهشده حدود همان تعداد گیگابایت حافظه میخواهد که میلیارد پارامتر دارد، بهعلاوه چند گیگابایت برای سیستم. برای مدل ۷ میلیاردی، ۸ تا ۱۶ گیگابایت رم نقطه شروع منطقی است.
سرعت پاسخ چقدر است؟ +
روی پردازنده معمولاً چند توکن در ثانیه. برای پردازش دستهای، کارهای پسزمینه و اتوماسیون کافی است؛ برای چتی که کاربر پشتش منتظر نشسته، کند به نظر میرسد.
چرا بهجای API آماده، مدل را خودم اجرا کنم؟ +
سه دلیل رایج، دادهای که نباید از سازمان خارج شود، هزینه ثابت بهجای پرداخت بهازای هر درخواست، و نبود محدودیت نرخ. اگر هیچکدام برای شما مهم نیست، API آماده سادهتر است.
کدام لوکیشن برای این کار مناسب است؟ +
لوکیشن خارج از کشور، چون دانلود مدلها از مخازن بینالمللی انجام میشود و حجم آنها چند گیگابایت است.
آموزشهای مرتبط
آموزش نصب Ollama روی سرور ابری و اجرای مدلهای هوش مصنوعی
نصب Ollama روی سرور ابری برای اجرای مدلهای زبانی متنباز؛ سرویس systemd، انتخاب مدل مناسب CPU، دسترسی امن با Nginx و Basic Auth و گواهی SSL.
ادامه مطلبنصب Open WebUI روی سرور ابری؛ رابط چت مدلهای محلی
نصب Open WebUI روی سرور ابری و اتصال آن به Ollama؛ یک رابط چت چندکاربره برای مدلهای زبانی متنباز، پشت وبسرور جلویی Nginx و گواهی SSL رایگان.
ادامه مطلبساخت ایجنت هوش مصنوعی با n8n و MCP روی سرور ابری
راهاندازی ایجنت هوش مصنوعی با n8n و پروتکل MCP؛ فعالسازی سرور MCP نمونه، اتصال کلاینت، دادن ابزار به ایجنت و انتشار گردشکار بهعنوان ابزار.
ادامه مطلبکاربردها دیگر
آخرین بهروزرسانی: ۰۹ مرداد ۱۴۰۵