Ollama چیست؟ آموزش نصب و اجرای مدل زبانی روی سیستم خودتان
اگر بخواهید امروز یک مدل زبانی را روی سیستم خودتان اجرا کنید، تقریباً هر راهنمایی شما را به یک اسم میرساند: Ollama. ابزاری رایگان و متنباز که کل فرایند دردسرساز — دانلود مدل، بهینهسازی، تنظیم GPU و راهاندازی API — را در یک دستور خلاصه کرده است. در این آموزش از نصب تا اولین گفتوگو و اتصال برنامهها به آن میرویم.
Ollama چیست؟
اولاما یک اجراکنندهی مدلهای زبانی است: مثل داکر برای کانتینرها، اولاما برای مدلهاست. کتابخانهای از مدلهای آماده دارد (Qwen، Llama، Gemma، DeepSeek و دهها مدل دیگر)، نسخهی بهینهشدهی هر مدل را دانلود میکند، خودش تشخیص میدهد چقدر از کار را به GPU بسپارد و یک API استاندارد هم در اختیار برنامههای شما میگذارد. روی لینوکس، مک و ویندوز کار میکند.
نصب در یک دستور
در لینوکس (و مک با Homebrew) نصب یک خط است:
curl -fsSL https://ollama.com/install.sh | sh
برای ویندوز هم نصبکنندهی گرافیکی از سایت ollama.com قابل دانلود است.
اولین گفتوگو
برای شروع، مدل ۸ میلیاردی Qwen3 انتخاب خوبی است — تعادل عالی بین کیفیت و مصرف منابع:
ollama run qwen3:8b
بار اول، مدل (چند گیگابایت) دانلود میشود و بعد مستقیم وارد چت میشوید — به فارسی هم جواب میدهد. برای خروج /bye را بزنید. اگر سیستم ضعیفتری دارید با qwen3:4b شروع کنید؛ اگر GPU قوی دارید qwen3-coder:30b برای برنامهنویسی فوقالعاده است.
دستورات کاربردی
| دستور | کاربرد |
|---|---|
ollama run <model> | اجرا و چت با مدل |
ollama pull <model> | فقط دانلود مدل |
ollama list | مدلهای دانلودشده |
ollama ps | مدلهای در حال اجرا و مصرف حافظه |
ollama rm <model> | حذف مدل |
اتصال برنامهها: API داخلی
اولاما در پسزمینه یک API روی پورت 11434 بالا میآورد که با استاندارد OpenAI سازگار است؛ یعنی هر کتابخانه یا ابزاری که با API اوپنایآی کار میکند، با تغییر آدرس به http://localhost:11434/v1 به مدل محلی شما وصل میشود:
curl http://localhost:11434/v1/chat/completions -d '{
"model": "qwen3:8b",
"messages": [{"role": "user", "content": "سلام!"}]
}'
جمعبندی
اولاما اجرای مدل زبانی را به سه قدم رسانده: نصب با یک دستور، ollama run، و در صورت نیاز اتصال برنامهها به API سازگار با OpenAI. روی سیستم شخصی برای شروع عالی است؛ و وقتی خواستید مدل بزرگتری را ۲۴ ساعته در اختیار تیم بگذارید، همین اولاما را روی سرور GPU منیجیت اجرا کنید — آموزشش را در مطلب «اجرای LLM روی سرور ابری» ببینید.