
اجرای Llama روی VPS؛ آموزش نصب و اجرای مدل هوش مصنوعی روی سرور
Meta Description:
آموزش اجرای Llama روی VPS با Ollama؛ نصب Llama روی سرور لینوکس، انتخاب منابع مناسب، اجرای مدل، API، امنیت و بهینهسازی عملکرد.
اجرای Llama روی VPS
مدلهای زبانی بزرگ یا LLM دیگر فقط روی سرویسهای آنلاین اجرا نمیشوند. اگر VPS مناسبی در اختیار داشته باشید، میتوانید مدلهایی از خانواده Meta Llama را مستقیماً روی سرور خود اجرا کنید و یک محیط هوش مصنوعی خصوصی برای چت، تولید محتوا، برنامهنویسی، پردازش متن و حتی ساخت سرویسهای مبتنی بر API داشته باشید.
یکی از سادهترین روشها برای اجرای Llama روی سرور، استفاده از Ollama است. Ollama مدیریت دانلود مدل، اجرای آن و ارائه API را ساده میکند و روی لینوکس نیز بهصورت رسمی پشتیبانی میشود.
در این آموزش از صفر شروع میکنیم و یک Llama را روی VPS لینوکسی اجرا خواهیم کرد.
Llama چیست؟
Llama خانوادهای از مدلهای زبانی توسعهیافته توسط Meta است که برای طیف گستردهای از کاربردهای هوش مصنوعی استفاده میشود.
بسته به نسخه و اندازه مدل، میتوان از Llama برای کارهایی مانند:

- چت و پاسخگویی
- خلاصهسازی متن
- تولید محتوا
- برنامهنویسی
- تحلیل متن
- ساخت دستیار هوش مصنوعی
- پردازش اسناد
- ساخت API هوش مصنوعی
استفاده کرد.
برای اجرای مدل روی سرور، فقط نام مدل مهم نیست؛ تعداد پارامترها، کوانتایزیشن، طول Context، RAM، CPU و GPU هم روی عملکرد نهایی تأثیر دارند.
چرا Llama را روی VPS اجرا کنیم؟
اجرای مدل بهصورت محلی روی VPS چند مزیت مهم دارد.
🔐 کنترل بیشتر روی دادهها
در معماری Self-Hosted، پردازش مدل روی زیرساختی انجام میشود که خودتان کنترل میکنید. این موضوع برای پروژههایی که اطلاعات خصوصی یا داخلی دارند اهمیت زیادی دارد.
⚡ دسترسی دائمی
مدل پس از نصب روی سرور میتواند بدون نیاز به باز کردن مرورگر یا استفاده از یک سرویس چت عمومی در دسترس باشد.
🔌 امکان استفاده از API
Ollama یک API محلی ارائه میکند که میتوان از طریق آن Llama را به نرمافزار، وبسایت یا سرویس داخلی متصل کرد.
🧩 امکان ساخت سرویس اختصاصی
میتوانید Llama را پشت یک Backend قرار دهید و برای آن پنل کاربری، چتبات، API یا سیستم اتوماسیون اختصاصی بسازید.
چه VPS برای اجرای Llama مناسب است؟
اینجا مهمترین بخش ماجراست.
هر VPS برای اجرای هر مدل Llama مناسب نیست.
مدلهای کوچک را میتوان روی CPU اجرا کرد، اما برای مدلهای بزرگتر، GPU تفاوت بسیار زیادی در سرعت inference ایجاد میکند.
برای مثال، در کتابخانه Ollama، Llama 3.2 در اندازههای 1B و 3B ارائه شده و حجم مدلهای آن حدود ۱.۳ تا ۲ گیگابایت است؛ در مقابل Llama 3.3 یک مدل 70B است و نسخه فعلی آن حدود 43GB حجم مدل دارد.
پیشنهاد عملی برای منابع VPS
| نوع استفاده | CPU | RAM | GPU |
|---|---|---|---|
| تست Llama کوچک | 4 Core | 8GB | نیاز نیست |
| استفاده معمولی | ۶ تا ۸ Core | 16GB | ترجیحاً |
| مدلهای بزرگتر | ۸ تا ۱۶ Core | 32GB+ | توصیه میشود |
| Llama 70B | 16 Core+ | 64GB+ | بهشدت توصیه میشود |
این اعداد نسخه قطعی «حداقل سیستم» نیستند؛ مدل، quantization، context length و تعداد درخواستهای همزمان میتوانند نیاز حافظه را تغییر دهند.
سرور مجازی خارج برای اجرای Llama
اگر قصد دارید مدل هوش مصنوعی خود را روی زیرساخت خارج از ایران اجرا کنید، انتخاب سختافزار و دیتاسنتر اهمیت زیادی دارد.
برای پروژههایی که به منابع بیشتر، پهنای باند مناسب یا دسترسی پایدار به سرویسهای بینالمللی نیاز دارند، میتوانید سرویسهای سرور مجازی خارج نگارنوین را بررسی کنید:
برای مدلهای بزرگتر نیز بهتر است پیش از خرید، میزان RAM، CPU و در صورت نیاز نوع GPU را بر اساس مدل موردنظر مشخص کنید.
آموزش نصب Ollama روی VPS لینوکس
در این آموزش فرض میکنیم سیستمعامل سرور Ubuntu است.
ابتدا با SSH به سرور متصل شوید:
ssh root@SERVER_IP
سپس سیستم را بهروزرسانی کنید:
apt update && apt upgrade -y
اکنون Ollama را نصب کنید.
طبق دستور رسمی Ollama در لینوکس:
curl -fsSL https://ollama.com/install.sh | sh
پس از نصب، نسخه Ollama را بررسی کنید:
ollama --version
اگر نسخه نمایش داده شد، نصب با موفقیت انجام شده است.
اجرای اولین مدل Llama
یکی از مدلهای سبکتر برای شروع، Llama ۳.۲ است.
برای اجرای آن:
ollama run llama3.2
در صورت نبودن مدل روی سرور، Ollama آن را دریافت کرده و سپس اجرا میکند. خود کتابخانه Ollama نیز همین دستور را برای اجرای Llama ۳.۲ ارائه میکند.
پس از اجرا میتوانید مستقیماً با مدل گفتگو کنید.
مثلاً:
> سلام، خودت را معرفی کن
مدل پاسخ را مستقیماً در Terminal نمایش خواهد داد.
اجرای نسخه کوچکتر Llama ۳.۲
اگر VPS منابع محدودی دارد، میتوانید نسخه 1B را امتحان کنید:
ollama run llama3.2:1b
نسخه 3B نیز با دستور زیر قابل اجرا است:
ollama run llama3.2:3b
طبق اطلاعات کتابخانه Ollama، Llama ۳.۲ در دو اندازه 1B و 3B ارائه شده است.
اجرای Llama ۳.۳ روی VPS
اگر سرور منابع بیشتری دارد، میتوانید Llama ۳.۳ را اجرا کنید:
ollama run llama3.3
Llama ۳.۳ در Ollama بهعنوان مدل 70B ارائه شده و حجم فایل مدل در کتابخانه فعلی حدود 43GB است.
نکته مهم این است که حجم فایل مدل با میزان RAM موردنیاز در زمان اجرا یکسان نیست. Context و تنظیمات quantization میتوانند مصرف حافظه را تغییر دهند.
بنابراین برای اجرای مدلهای 70B روی VPS معمولی، صرفاً داشتن فضای دیسک کافی نیست.
بررسی مدلهای نصبشده
برای مشاهده مدلهایی که روی VPS دانلود شدهاند:
ollama list
نمونه خروجی:
NAME SIZE
llama3.2:latest 2.0 GB
حذف مدل از VPS
اگر دیگر به مدلی نیاز ندارید:
ollama rm llama3.2
برای مشاهده مدلهای موجود در سیستم:
ollama list
اجرای Llama از طریق API
یکی از جذابترین قابلیتهای Ollama این است که میتوانید مدل را به برنامه خود متصل کنید.
API محلی Ollama بهصورت پیشفرض روی پورت 11434 در دسترس است.
مثلاً میتوانید یک درخواست به API ارسال کنید:
curl http://localhost:11434/api/chat
-d '{
"model": "llama3.2",
"messages": [
{
"role": "user",
"content": "یک توضیح کوتاه درباره VPS بنویس"
}
]
}'
Ollama برای مدلهای خود نمونههای API با cURL، Python و JavaScript ارائه میکند.
اتصال Llama به Python
اگر با Python کار میکنید، میتوانید از کتابخانه Ollama استفاده کنید.
ابتدا:
pip install ollama
سپس:
from ollama import chat
response = chat(
model='llama3.2',
messages=[
{
'role': 'user',
'content': 'VPS چیست؟',
},
],
)
print(response.message.content)
این معماری برای ساخت Backendهای هوش مصنوعی بسیار کاربردی است.
اتصال Llama به JavaScript
برای پروژههای Node.js نیز امکان استفاده از کتابخانه JavaScript وجود دارد:
import ollama from 'ollama'
const response = await ollama.chat({
model: 'llama3.2',
messages: [
{
role: 'user',
content: 'VPS چیست؟'
}
]
})
console.log(response.message.content)
این قابلیت میتواند Llama را مستقیماً وارد معماری یک وباپلیکیشن کند.
آیا میتوان Llama را با GPU اجرا کرد؟
بله.
اگر VPS یا سرور شما GPU مناسب داشته باشد، Ollama میتواند از شتابدهی GPU استفاده کند.
برای NVIDIA در محیط Docker نیز Ollama استفاده از NVIDIA Container Toolkit را در مستندات خود توضیح داده است.
در عمل، برای مدلهای بزرگ، GPU مناسب میتواند تفاوت بسیار محسوسی در سرعت پاسخگویی ایجاد کند.
اجرای Ollama با Docker
اگر ترجیح میدهید Ollama را داخل Docker اجرا کنید، میتوانید از image رسمی استفاده کنید.
برای حالت CPU:
docker run -d
-v ollama:/root/.ollama
-p 11434:11434
--name ollama
ollama/ollama
برای NVIDIA GPU:
docker run -d
--gpus=all
-v ollama:/root/.ollama
-p 11434:11434
--name ollama
ollama/ollama
Ollama برای Docker image رسمی ارائه میکند و اجرای GPU با NVIDIA را نیز مستند کرده است.
امنیت Ollama روی VPS
این بخش را جدی بگیرید.
اگر Ollama را روی VPS نصب کردهاید، نباید API آن را بدون نیاز و بدون لایه امنیتی مستقیماً روی اینترنت عمومی قرار دهید.
پورت:
11434
برای دسترسی محلی مناسب است، اما اگر آن را عمومی کنید باید دسترسی را کنترل کنید.
راهکارهای مناسب:
- فایروال
- Reverse Proxy
- HTTPS
- احراز هویت
- محدود کردن IPهای مجاز
- VPN
- عدم باز کردن پورت ۱۱۴۳۴ برای همه اینترنت
مثلاً اگر API فقط توسط یک Backend روی همان سرور استفاده میشود، بهتر است ارتباط روی localhost باقی بماند.
چطور سرعت Llama را افزایش دهیم؟
سرعت پاسخ مدل به عوامل مختلفی وابسته است.
CPU
در اجرای CPU، تعداد هستهها و معماری پردازنده اهمیت زیادی دارد.
RAM
مدل باید فضای کافی برای بارگذاری و اجرای خود داشته باشد.
GPU
برای مدلهای بزرگ، GPU معمولاً مهمترین عامل افزایش سرعت inference است.
Quantization
نسخههای quantized میتوانند حافظه موردنیاز را کاهش دهند، هرچند ممکن است روی کیفیت خروجی یا سرعت بسته به سختافزار و نوع quantization اثر بگذارند.
Context Length
هرچه context بزرگتر شود، مصرف حافظه نیز میتواند افزایش پیدا کند.
Llama روی VPS چه کاربردهایی دارد؟
بعد از نصب مدل، کاربردهای بسیار بیشتری از یک چت ساده خواهید داشت.
🤖 ساخت چتبات اختصاصی
میتوانید Llama را به وبسایت خود متصل کنید و یک چتبات اختصاصی بسازید.
👨💻 دستیار برنامهنویسی
با اتصال مدل به محیط توسعه، میتوان از آن برای توضیح کد، تولید کد و بررسی خطاها استفاده کرد.
📝 تولید محتوا
Llama میتواند برای تولید، بازنویسی و خلاصهسازی متن استفاده شود.
📚 پردازش اسناد
میتوانید معماری RAG ایجاد کنید و مدل را به اسناد داخلی متصل کنید.
🔌 ساخت API هوش مصنوعی
Ollama میتواند لایه اجرای مدل باشد و Backend شما درخواستهای کاربران را مدیریت کند.
Llama روی VPS بهتر است یا استفاده از APIهای ابری؟
هر دو روش کاربرد خودشان را دارند.
| ویژگی | Llama روی VPS | API ابری |
|---|---|---|
| کنترل داده | بالا | وابسته به سرویس |
| کنترل زیرساخت | بالا | کم |
| هزینه | هزینه ثابت زیرساخت | معمولاً مصرفی |
| مقیاسپذیری | نیازمند مدیریت | معمولاً سادهتر |
| حریم خصوصی | مناسب برای Self-Hosting | وابسته به سیاست سرویس |
| نگهداری | با شما | با ارائهدهنده |
| سفارشیسازی | بالا | وابسته به API |
اگر تعداد درخواستها زیاد و الگوی مصرف نسبتاً ثابت باشد، Self-Hosting میتواند جذاب باشد. برای بارهای متغیر یا مدلهای بسیار بزرگ، سرویسهای ابری ممکن است منطقیتر باشند.
چه زمانی VPS معمولی کافی نیست؟
اگر قصد اجرای مدلهای بزرگ مانند 70B را دارید یا چندین کاربر قرار است بهصورت همزمان از مدل استفاده کنند، یک VPS معمولی ممکن است مناسب نباشد.
در این شرایط بهتر است به سراغ:
- سرور GPU
- RAM بالا
- NVMe سریع
- CPU چند هستهای قدرتمند
- شبکه مناسب
بروید.
برای مدلهای کوچکتر، VPS CPU-based میتواند نقطه شروع بسیار مناسبی باشد.
انتخاب لوکیشن برای اجرای Llama
لوکیشن سرور بیشتر به محل کاربران و معماری برنامه بستگی دارد.
اگر کاربران شما در ایران هستند، انتخاب یک سرور خارج با مسیر شبکه مناسب میتواند برای دسترسی به سرویسهای بینالمللی و زیرساختهای خارجی کاربردی باشد.
البته برای خود inference، محل جغرافیایی سرور بهاندازه منابع سختافزاری و کیفیت شبکه اهمیت ندارد؛ اگر مدل کاملاً روی همان سرور اجرا شود، پردازش اصلی داخل VPS انجام میشود.
نگارنوین؛ سرور مناسب برای پروژههای هوش مصنوعی
برای اجرای Llama، Ollama و سایر مدلهای متنباز، انتخاب VPS باید بر اساس منابع واقعی موردنیاز مدل انجام شود.
نگارنوین سرور مجازی خارج را در لوکیشنهای مختلف ارائه میکند و بسته به نوع پروژه میتوانید منابع CPU، RAM و فضای ذخیرهسازی موردنیاز خود را انتخاب کنید.
اگر هدف شما اجرای مدلهای بزرگ یا پردازش سنگین است، پیش از خرید VPS باید مشخص کنید مدل موردنظر چند پارامتر دارد، چه quantizationای استفاده میکنید و چند درخواست همزمان خواهید داشت.
چکلیست قبل از خرید VPS برای Llama
قبل از سفارش سرور این موارد را مشخص کنید:
- نام و نسخه مدل
- تعداد پارامترهای مدل
- حجم مدل
- میزان RAM موردنیاز
- تعداد هسته CPU
- نیاز یا عدم نیاز به GPU
- نوع GPU در صورت استفاده
- ظرفیت NVMe
- تعداد کاربران همزمان
- Context Length
- حجم درخواستهای روزانه
- لوکیشن کاربران
- پهنای باند موردنیاز
این چکلیست جلوی یک اشتباه رایج را میگیرد: خرید VPS صرفاً بر اساس تعداد Core یا RAM و بعد متوجه شدن اینکه مدل انتخابشده برای آن سختافزار مناسب نیست.
سوالات متداول اجرای Llama روی VPS
آیا میتوان Llama را روی VPS اجرا کرد؟
بله. مدلهای کوچکتر Llama را میتوان روی VPSهای CPU-based اجرا کرد و برای مدلهای بزرگتر استفاده از GPU و RAM بیشتر توصیه میشود.
بهترین روش نصب Llama روی VPS چیست؟
یکی از سادهترین روشها استفاده از Ollama است. Ollama امکان نصب مدل، اجرای آن و استفاده از API را فراهم میکند.
آیا برای اجرای Llama حتماً GPU لازم است؟
خیر. مدلهای کوچک را میتوان روی CPU اجرا کرد، اما برای مدلهای بزرگ و استفاده همزمان چند کاربر، GPU میتواند عملکرد را به شکل محسوسی بهتر کند.
آیا Llama ۳.۳ روی VPS معمولی اجرا میشود؟
Llama ۳.۳ یک مدل 70B است و مدل آن در Ollama حدود 43GB حجم دارد؛ بنابراین برای اجرای عملی آن باید RAM، quantization، context و در صورت نیاز GPU را جدی در نظر گرفت.
آیا میتوان Llama را به سایت متصل کرد؟
بله. با استفاده از API Ollama میتوانید Llama را به Backend سایت، Python، JavaScript یا سایر برنامهها متصل کنید.
آیا اجرای Llama روی VPS امن است؟
میتواند امن باشد، اما باید API، SSH، فایروال، احراز هویت و دسترسیهای شبکه بهدرستی پیکربندی شوند. باز گذاشتن API مدل روی اینترنت عمومی بدون کنترل دسترسی توصیه نمیشود.
جمعبندی
اجرای Llama روی VPS یکی از سادهترین راهها برای راهاندازی یک مدل زبانی Self-Hosted است. با ابزارهایی مانند Ollama میتوانید بدون درگیر شدن با پیچیدگیهای نصب مستقیم مدل، Llama را روی سرور لینوکسی اجرا کرده و از طریق Terminal یا API به آن دسترسی داشته باشید.
برای شروع، مدلهای کوچک مانند Llama ۳.۲ گزینه منطقیتری برای VPSهای معمولی هستند. اگر به مدلهای بزرگ مانند Llama ۳.۳ 70B، کاربران همزمان زیاد یا سرعت پاسخ بالا نیاز دارید، باید به سراغ سرورهایی با RAM بیشتر و ترجیحاً GPU بروید.
نکته کلیدی این است که اول مدل را انتخاب کنید، سپس منابع سرور را بر اساس همان مدل تعیین کنید؛ نه برعکس.