فشردهسازی و بهینهسازی LLM چیست؟
رشد شتابان مدلهای زبانی بزرگ یا LLMها در سالهای اخیر باعث شده معماری این مدلها به سرعت حجیمتر و پیچیدهتر شود؛ بهطوریکه بسیاری از آنها اکنون دهها تا صدها میلیارد پارامتر دارند. این افزایش اندازه اگرچه به معنای قابلیتهای بیشتر و کیفیت بالاتر خروجی است، اما در عمل چالشهایی جدی برای سازمانها بهخصوص هنگام استقرار و مقیاسدهیایجاد میکند. همین مسئله باعث شد موج جدیدی از توجه به «فشردهسازی و بهینهسازی مدلهای عظیم» شکل بگیرد؛ مجموعهای از روشهای علمی که تلاش میکنند مدلهایی کوچکتر، سریعتر و کممصرفتر تولید کنند؛ بدون آنکه دقت یا توانایی آنها قربانی شود.
در ایران نیز توسعه مدل زبانی بزرگ فارسی و پروژههایی مانند مدلهای زبانی بزرگ شریف اهمیت این موضوع را دوچندان کرده است. این مقاله یک بررسی علمی از روشهای فشردهسازی، آموزش مدلهای زبانی بزرگ، کاربرد LLMها و مسیر رسیدن به بهترین LLM فارسی ارائه میدهد.
در ابتدا شاید برایتان سوال شود
LLM چیست و مخفف چیست؟
LLM مخفف Large Language Model و به معنی مدل زبانی بزرگ است.
در حوزه هوش مصنوعی، وقتی میگوییم «LLM چیست»، معمولاً منظور سیستمی است که با یادگیری از حجم زیادی از دادهها، توانایی درک، تولید و تحلیل زبان طبیعی را پیدا میکند.
برای اطلاعات بیشتر میتوانید مقاله مدل های زبانی بزرگ را مطالعه کنید.
چرا فشردهسازی مدلهای بزرگ ضروری است؟
دلایل اصلی:
- کاهش هزینه و نیاز به GPU
- بهبود سرعت inference در کاربردهای صنعتی
- امکان اجرا روی موبایل، وب و دستگاههای کممصرف
- گسترش دسترسی به مدلهای زبانی بزرگ فارسی
در مدلهایی مثل GPT، LLaMA یا مدلهای زبانی بزرگ شریف، حجم مدل بدون فشردهسازی ممکن است از 30 تا 120 گیگابایت برسد.
تکنیکهای اصلی فشردهسازی مدلهای بزرگ
۱) Quantization (کوانتیزاسیون)
کوانتیزاسیون یکی از رایجترین تکنیکهای فشردهسازی است. در این روش، وزنهای مدل از دقت بالا (مثل Float32) به قالبهای سبکتر مثل INT8 یا FP8 تبدیل میشوند. نتیجه این کار:
- کاهش چشمگیر حافظه مورد نیاز تا ۷۵٪
- امکان استقرار مدل بزرگ روی سختافزار ارزانتر
- سرعت بالاتر استنتاج
- کاهش حجم
- قابلاستفاده در بهترین llm فارسی
مثال معروف آن اجرای مدل Llama 70B کوانتیزهشده روی یک GPU A100 است؛ در حالی که نسخه اصلی این مدل بدون کوانتیزاسیون نیازمند چهار کارت A100 است.
کوانتیزاسیون میتواند روی وزنها، فعالسازیها یا هر دو اعمال شود و امکان انجام آن قبل یا هنگام اجرا وجود دارد.
ابزارهای کاربردی:
- GPTQ
- AWQ
Bitsandbytes (HuggingFace)
۲) Knowledge Distillation (دانش تقطیر شده)
در این تکنیک یک مدل کوچکتر (Student) از مدل بزرگتر (Teacher) یاد میگیرد.
کاربرد در:
- مدل زبانی بزرگ فارسی سبکشده
- چتباتهای سازمانی مثل MayaBot
- اجرای LLM روی موبایل
این روش در دانشگاه شریف نیز برای ساخت مدلهای زبانی بزرگ شریف مورد استفاده قرار گرفته است.
۳) Pruning (هرس پارامترها)
روشهای دیگری مانند sparsity و pruning نیز وجود دارد که با حذف ارتباطهای بیاثر، اندازه مدل را کاهش میدهند. اگرچه این روشها کمتر از کوانتیزاسیون رایج هستند، اما نتایج بسیار ارزشمندی دارند.
الگوی Sparse Llama با نسبت ۲:۴ نمونه خوبی است؛ مدلی که در بنچمارکها توانست تا ۹۸.۴٪ دقت نسخه اصلی را بازیابی کند. پس از آموزش تکمیلی با تقطیر دانش، این مدل به ۳۰٪ توان عملیاتی بیشتر و ۲۰٪ کاهش تأخیر دست یافت. ترکیب sparsity با کوانتیزاسیون نیز میتواند مزایای هر دو روش را تجمیع کرده و مدلهایی فوقالعاده سریع ارائه دهد به عبارتی حذف وزنهای کماهمیت بدون کاهش کیفیت خروجی .
نتیجه:
- مدل ۳۰ تا ۵۰٪ کوچکتر
- سرعت بالاتر
مصرف RAM کمتر
۴) Low-Rank Adaptation
LoRA امکان فاینتیون سریع مدلهای بزرگ بدون نیاز به تغییر پارامترهای اصلی را فراهم میکند.
بههیچوجه حجم مدل اصلی تغییر نمیکند؛ اما نسخه فاینتیون بسیار کوچک و سریع است.
کاربرد:
- ساخت بهترین LLM فارسی
- آموزش مدلهای سازمانی
پردازش زبان فارسی و عربی
۵)مخزن مدلهای بهینهشده Red Hat AI
برای سازمانهایی که نمیخواهند از صفر آغاز کنند، Red Hat یک مخزن کامل از مدلهای بهینهشده ارائه کرده است که در Hugging Face در دسترس قرار دارد. این مخزن شامل نسخههای فشرده و کوانتیزهشده مدلهایی مثل Llama، Granite، Qwen و DeepSeek است.
این نسخههای آماده دارای موارد زیر هستند:
- تانسورهای ایمن و سازگار با انواع سرورهای استنتاج
- راهنمای اجرای سریع با vLLM
- گزارش کامل قبل/بعد از فشردهسازی
این مدلها میتوانند هزینه GPU مورد نیاز را تقریباً نصف کنند و استقرار را بسیار سادهتر سازند.
۶)بهینهسازی مدل شخصی با کتابخانه LLM Compressor
برای پژوهشگران و توسعهدهندگانی که مدل اختصاصی خود را دارند، کتابخانه متنباز LLM Compressor راهکار مناسبی است. این ابزار همان تکنیکهای پیشرفته کوانتیزاسیون و sparsity را در اختیار شما قرار میدهد و تنها با چند خط کد میتوانید یک مدل سفارشی را فشرده کنید.
روشهای پشتیبانیشده:
- GPTQ (کوانتیزاسیون ۴ بیتی)
- SmoothQuant (کوانتیزاسیون INT8 فعالسازیها)
- SparseGPT (هرس ۵۰٪ ساختاریافته)
مدل فشردهشده بهراحتی در vLLM قابل ارائه برای استنتاج سریع است.
مدل زبانی بزرگ فارسی: چالشها و راهکارها
برخلاف زبان انگلیسی، برای فارسی:
- داده کم است
- تنوع نویسه زیاد است
- ساختار جملهها پیچیدهتر است
بنابراین استفاده از فشردهسازی و تکنیکهای دانش انتقالی (Transfer Learning) ضروری است.
نمونه مدلهای فارسی:
- مدلهای زبانی بزرگ شریف
- پارسیگپ
- GPT-JT Persian
- Persian LLaMA
مزایای عملی فشردهسازی مدل و بررسی نمونههای واقعی
بسیاری از شرکتهای فناوری جهان هماکنون از مدلهای بهینهشده برای کاهش هزینه محاسبات، اجرای سریعتر و استقرار آسانتر استفاده میکنند.
برای مثال، مدلهای اختصاصی EON که بر اساس نسخههای متنباز LLM توسعه یافتهاند و با دادههای خاص لینکدین تنظیم شدهاند، توانستهاند هزینه اجرای ویژگیهای هوش مصنوعی را کاهش دهند و همزمان حجم درخواستهای پردازشی را حدود ۳۰٪ کمتر کنند. این کار در حالی انجام شده که اصول AI مسئولانه نیز رعایت شده است.
در نمونهای دیگر، شرکت Roblox با بهینهسازی زیرساخت ابری ترکیبی خود و استفاده از ابزارهای متنباز مانند vLLM و Ray، توانست تعداد خطوط لوله استنتاج همزمان خود را از کمتر از ۵۰ به بیش از ۲۵۰ افزایش دهد. این ارتقا باعث شد عملیات یادگیری ماشین هم در GPUها و هم در CPUها هماهنگتر اجرا شود و هزینه محاسباتی به شکل محسوسی کاهش یابد. این مثالها نشان میدهد که بهینهسازی مدلها نهتنها سرعت و مقیاسپذیری را افزایش میدهد، بلکه تجربه کاربری را نیز بهبود میبخشد.
استقرار مدلهای بهینهشده در معماریهای ابری و هیبریدی
بسیاری از کسبوکارها اکنون ترکیبی از ابر عمومی و ابر خصوصی را برای اجرای مدلهای خود ترجیح میدهند. ابزار vLLM بهعنوان یکی از بهترین موتورهای استنتاج LLM این امکان را فراهم میکند که مدلهای بهینهشده را روی هر محیطی – از لینوکس تا Kubernetes – اجرا کنید. این موتور برای توان عملیاتی بالا طراحی شده و با فشردهسازی مدلها عملکردش چند برابر بهتر میشود.
همچنین با KServe و Ray میتوان استنتاج بدون سرور و توزیع حجم کار روی سختافزارهای مختلف را انجام داد. در اکوسیستم Red Hat، پلتفرم OpenShift AI امکانات کامل برای استقرار LLM در محیطهای هیبریدی ارائه میکند.
در آخر
فشردهسازی و بهینهسازی مدلهای زبانی بزرگ، مسیر اصلی برای توسعه نسل جدید مدلهای زبانی بزرگ فارسی و جهانی است. با استفاده از تکنیکهای Quantization، LoRA، Knowledge Distillation و Pruning، میتوان مدلهایی سریع، سبک و قابلاستفاده در مقیاس صنعتی ایجاد کرد. این رویکرد نهتنها آینده LLMهای جهانی را شکل میدهد، بلکه مسیر رسیدن به بهترین LLM فارسی را هموار میکند و دسترسی سازمانها به هوش مصنوعی پیشرفته را افزایش میدهد.
این روند نهتنها آینده LLMهای جهانی را شکل میدهد، بلکه مسیر ساخت بهترین LLM فارسی را نیز هموار میکند.
برای مطاله بیشتر میتوانید مقاله های زیر را مطالعه کنید:



