راز اجرای یک هوش مصنوعی بزرگ روی رایانه شخصی، حذف هوش آن نیست؛ عوضکردن شیوه نگهداری میلیونها و میلیاردها عدد آن است.
به گزارش خبرگزاری ۶۰ثانیه، یک مدل ۸ میلیاردپارامتری لاما ۳٫۱، اگر وزنهایش با دقت افپی۳۲ (FP32) ذخیره شوند، حدود ۳۲٫۱ گیگابایت فضا فقط برای وزنها میخواهد؛ اما همین مدل در قالب کوانتایش کیو۴کیام (Q4_K_M) به حدود ۴٫۹ گیگابایت میرسد. برای مدل ۷۰ میلیاردپارامتری، این رقم از ۲۸۰٫۹ گیگابایت به ۴۳٫۱ گیگابایت سقوط میکند.
یعنی مدل کوچک نشده و چیزی از «مغزش» حذف نشده؛ فقط عددهای داخل آن با زبان فشردهتری ذخیره شدهاند.
کوانتایش یعنی عددهای مدل را در جعبه کوچکتری بچینیم برای فهم ماجرا، «پارامتر» را مثل پیچ تنظیم یک دستگاه تصور کنید. یک مدل میلیاردها پیچ عددی دارد که شدت اثر ویژگیهای مختلف را مشخص میکنند.
حالا فرض کنید برای هر پیچ، عددی با جزئیات بسیار زیاد ثبت کنیم؛ مثل اینکه قیمت کالایی را با دهها رقم اعشار روی برچسب بنویسیم. افپی۳۲ برای هر عدد ۳۲ بیت فضا میگیرد و افپی۱۶ (FP16) این میزان را تقریباً نصف میکند.
در اینت۸ (INT8)، هر عدد با ۸ بیت نمایش داده میشود و در اینت۴ (INT4)، با ۴ بیت؛ از نظر تئوری، ۸ بیت ۲۵۶ حالت و ۴ بیت فقط ۱۶ حالت عددی در اختیار میگذارد. بنابراین کوانتایش شبیه این است که بهجای نگهداشتن صدها درجه ظرافت، عددها را در چند «پله» نزدیک به مقدار اصلی قرار دهیم.
پس چرا یک عدد تقریبی میتواند کافی باشد؟ چون همه رقمهای یک عدد برای پاسخ نهایی مدل به یک اندازه حیاتی نیستند.
تصور کنید دماسنجی دارید که باید به شما بگوید هوا سرد است یا گرم. برای این تصمیم، دانستن اینکه دما دقیقاً ۲۱٫۳۷ درجه است شاید لازم نباشد؛ دانستن اینکه حدود ۲۱ درجه است ممکن است کاملاً کافی باشد.
در مدل زبانی هم بسیاری از وزنها را میتوان با دقت کمتر نگه داشت، بدون اینکه رفتار کلی مدل فروبپاشد. البته این تقریب هزینه دارد: هرچه بیت کمتر شود، خطر خطای عددی بیشتر میشود و بنابراین روش فشردهسازی اهمیت پیدا میکند.
خود لاماسیپیپی برای گونههای مختلف کوانتایش، اندازه و میزان افت متفاوتی گزارش میکند.
ایدبلیوکیو وزنهای مهمتر را دستنخوردهتر نگه میدارد ایدبلیوکیو یا «کوانتایش وزنِ آگاه از فعالسازی» (Activation-aware Weight Quantization) دقیقاً از همین منطق استفاده میکند: همه عددهای مدل ارزش یکسانی ندارند. این روش با بررسی «فعالسازی»ها ــ یعنی اینکه هنگام عبور داده از مدل، کدام بخشها بیشتر و شدیدتر درگیر میشوند ــ بخش کوچکی از وزنهای حساستر را پیدا میکند و در برابر خطای کوانتایش بیشتر محافظت میکند.
پژوهش اصلی میگوید حتی محافظت از حدود ۱ درصد وزنهای شاخص میتواند خطای کوانتایش را بهطور چشمگیری کاهش دهد. این مسئله شبیه این است که هنگام اسبابکشی، بیشتر وسایل را در جعبههای فشرده بگذارید، اما چند ظرف ظریف را جداگانه و با دقت بیشتری بستهبندی کنید.
جیپیتیکیو خطای گردکردن را تا حد ممکن مهار میکند جیپیتیکیو (GPTQ) هم یک روش کوانتایش پس از آموزش است، اما مسئله را از زاویه دیگری دنبال میکند. تصور کنید یک انباردار باید میلیونها کالای دقیق را با چند برچسب محدود طبقهبندی کند.
اگر هر کالا را به نزدیکترین برچسب بچسباند، بخشی از دقت از دست میرود؛ کار جیپیتیکیو این است که این خطاها را طوری مدیریت کند که اثر مجموع آنها روی رفتار مدل کمینه شود. پژوهش اصلی نشان داد مدل ۱۷۵ میلیاردپارامتری را میتوان به ۳ یا ۴ بیت برای هر وزن فشرده کرد و با افت اندک نسبت به نسخه اصلی، آن را برای استنتاج روی یک پردازنده گرافیکی اجرا کرد.
اینجا فناوری از یک ایده ریاضی به چیزی تبدیل میشود که کاربر عادی میتواند لمس کند. لاماسیپیپی از کوانتایشهای ۱٫۵ تا ۸ بیتی پشتیبانی میکند و امکان اجرای مدل روی پردازنده مرکزی، کارت گرافیکی و چندین نوع شتابدهنده را فراهم کرده است؛ حتی میتواند بخشی از محاسبات را روی پردازنده و بخشی را روی کارت گرافیکی انجام دهد.
در اندروید نیز برای اجرای محلی مدلها مسیر رسمی دارد. نتیجه این است که دیگر الزاماً لازم نیست تمام مدل در یک حافظه گرافیکی عظیم جا شود تا بتوان با آن کار کرد.
حریم خصوصی هم از همین کوچکشدن سود میبرد اجرای محلی فقط مسئله هزینه نیست؛ مسئله این است که داده برای پاسخگرفتن مجبور نباشد دستگاه شما را ترک کند. اولاما در سیاست حریم خصوصی خود که در مارس ۲۰۲۶ بهروزرسانی شده، میگوید وقتی مدل بهصورت محلی اجرا شود، اعلانها، پاسخها و تعاملات روی دستگاه باقی میمانند و این شرکت به محتوای آنها دسترسی ندارد.
به همین دلیل کوانتایش را میتوان یکی از قطعات مهم پازل «هوش مصنوعی محلی» دانست: مدلی که قبلاً برای اجرای آن به زیرساخت بسیار بزرگ نیاز داشت، حالا میتواند به اندازهای فشرده شود که روی سختافزار شخصی قابل استفاده باشد.
کوانتایش مدل را ارزانتر میکند، نه لزوماً بینقصتر اینجا باید مراقب یک سوءبرداشت باشیم: «۴ بیت» به معنی این نیست که کیفیت مدل دقیقاً مثل نسخه اصلی باقی میماند یا هر مدل غولپیکری روی هر لپتاپی اجرا خواهد شد. نوع کوانتایش، اندازه گروهها، سختافزار و حتی نوع کاری که مدل انجام میدهد مهم است؛ لاماسیپیپی برای گونههای مختلف ۴ بیتی نیز اندازه و افت متفاوتی ثبت میکند.
بنابراین اتفاق بزرگتر از یک عدد مانند ۴٫۹ گیگابایت این است: کوانتایش مرز میان هوش مصنوعیای که فقط در مرکز داده قابل اجرا بود و هوش مصنوعیای که میتواند روی میز کار، لپتاپ یا حتی گوشی قرار بگیرد را جابهجا کرده است.