
به اشتراک بگذارید

به اشتراک بگذارید
سرور و دیتاسنتر | بلاگ وبداده
سرور هوش مصنوعی چیست و برای آموزش و اجرای مدلهای AI چه سختافزاری لازم است؟
💡 خلاصه مقاله در ۳ خط
💡 سرور هوش مصنوعی = سختافزار متناسب با آموزش یا اجرای مدل
🔶 سرور اختصاصی HPE برای استنتاج روی CPU
📌 آنچه در این مقاله میخوانید
Dataset ➡️ [ Training: GPU cluster, BF16/FP16 ] ➡️ Model weights
⬇️
Quantize (INT8 / 4-bit, GGUF)
⬇️
User prompt ➡️ [ Inference: GPU or high-RAM CPU ] ➡️ Answer (tokens)

🔸 نکته فنی: گلوگاه اصلی استنتاج

| سختافزار | ظرفیت حافظه | پهنای باند حافظه | توان (TDP) |
|---|---|---|---|
| Xeon E5-2680 v4 (هر سوکت) | تا 1.5TB رم DDR4 | 76.8GB/s | 120W |
| NVIDIA L4 | 24GB | 300GB/s | 72W |
| NVIDIA L40S | 48GB GDDR6 با ECC | 864GB/s | 350W |
| NVIDIA H100 SXM | 80GB | 3.35TB/s | تا 700W |
| اندازه مدل | FP16/BF16 | INT8 | ۴ بیتی |
|---|---|---|---|
| 7B | حدود 14GB | حدود 7GB | حدود 3.5GB |
| 13B | حدود 26GB | حدود 13GB | حدود 6.5GB |
| 70B | حدود 140GB | حدود 70GB | حدود 35GB |
⚠️ محدودیت مهم: آموزش مدل روی CPU
sudo apt update && sudo apt install -y git cmake build-essential
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build
cmake --build build --config Release -j 28
/v1/chat/completions ارائه میدهد؛ پس بیشتر ابزارهای سازگار با OpenAI با تغییر آدرس به سرور شما وصل میشوند. این سرویس بهصورت پیشفرض روی 127.0.0.1 و پورت 8080 اجرا میشود؛ گزینه -t تعداد رشتهها و گزینه -c طول context را تعیین میکند../build/bin/llama-server -m models/model-Q4_K_M.gguf \
-t 28 -c 8192 --numa distribute \
--host 127.0.0.1 --port 8080 --api-key YOUR_SECRET_KEY
--numa حالتهای distribute، isolate و numactl را دارد و طبق مستندات، اگر قبلاً بدون آن اجرا کردهاید، پیش از استفاده کش صفحات سیستم را خالی کنید. تعداد بهینه رشتهها را هم با آزمایش پیدا کنید.📌 یک تخمین سرانگشتی برای سرعت پاسخ
--api-key کلید تعریف کنید و دسترسی بیرونی را از طریق reverse proxy مانند Nginx با TLS بدهید. سرور را هم طبق آموزش Hardening لینوکس ایمن کنید.
📚 از منابع معتبر
🔶 به GPU نیاز دارید؟
بله. llama.cpp استنتاج را روی CPU با دستورالعملهایی مانند AVX2، AVX-512 و AMX انجام میدهد و مدلهای کوانتیزه کوچک و متوسط روی سروری با رم کافی اجرا میشوند. محدودیت اصلی سرعت است: پاسخ کندتر از GPU تولید میشود و با افزایش کاربران همزمان افت میکند؛ پس این روش برای پایلوت و بار سبک مناسب است. پردازندههای قدیمیتر مانند Xeon E5-2680 v4 که AVX-512 و AMX ندارند، کندتر عمل میکنند.
طبق قاعده Hugging Face، هر میلیارد پارامتر در دقت ۱۶ بیتی حدود ۲ گیگابایت میخواهد؛ یعنی حدود 16GB. با کوانتیزاسیون ۸ بیتی حدود 8GB و با ۴ بیتی حدود 4GB برای وزنها کافی است. KV cache، حافظه سیستمعامل و سایر سرویسها را هم به این عدد اضافه کنید و حاشیه امن بگذارید.
در آموزش با دقت ترکیبی و AdamW، هر پارامتر حدود ۱۸ بایت حافظه میگیرد، بهعلاوه اکتیویشنها؛ برای همین آموزش مدلهای زبانی تقریباً همیشه روی GPU انجام میشود. استنتاج فقط وزنها و KV cache را لازم دارد و با کوانتیزاسیون سبکتر میشود، پس اجرای مدلهای کوچک روی CPU هم ممکن است.
خیر. پلن آماده سرور اختصاصی ایران وبداده بر پایه HPE DL360 Gen9 با دو Xeon و 64GB رم ECC است و GPU ندارد؛ این پلن برای استنتاج روی CPU و سرویسهای جانبی AI مناسب است. برای نیاز GPU، درخواست پیکربندی سفارشی را از طریق تیکت یا تماس ثبت کنید تا بررسی شود، یا سختافزار خودتان را با کولوکیشن مستقر کنید.
کوانتیزاسیون دقت ذخیره وزنها را از ۱۶ بیت به ۸، ۴ یا کمتر کاهش میدهد؛ نتیجه، حافظه کمتر و سرعت بیشتر است، چون به گفته NVIDIA پارامترهای بیشتری در همان پهنای باند منتقل میشوند. در مقابل، کیفیت پاسخ ممکن است افت کند، بهویژه در سطوح بسیار پایین؛ پس مدل کوانتیزه را با پرسشهای واقعی خودتان بسنجید.
برای ابزارهای سبک، مانند دستیارهای متصل به API خارجی یا مدلهای بسیار کوچک، سرور مجازی کافی است. اما اجرای محلی مدل زبانی به رم زیاد و دسترسی کامل به هستهها و پهنای باند حافظه نیاز دارد که در سرور مجازی محدودتر یا اشتراکی است. برای مدلهای ۷ میلیارد پارامتری به بالا، سرور اختصاصی انتخاب مطمئنتری است.
در این حالت کولوکیشن مناسب است: سختافزار متعلق به شماست و در رک دیتاسنتر با برق، خنکسازی و شبکه پایدار میزبانی میشود. پیش از ارسال، توان مصرفی کارتها، ابعاد سرور و نیاز شبکه را با تیم فنی هماهنگ کنید، چون GPUهایی مانند H100 SXM تا 700W مصرف دارند.