چرا شرکتهای بزرگ فناوری با وجود صرف میلیاردها دلار برای خرید پردازندهها، اکنون با اتمام متون باکیفیت انسانی برای آموزش نسل بعدی ماشینها مواجه شدهاند؟
به گزارش خبرگزاری ۶۰ثانیه، بر اساس برآورد «اپوک ایآی»، ذخیره مؤثر متن عمومیِ انسانیِ باکیفیت برای آموزش مدلهای زبانی حدود ۳۰۰ تریلیون توکن است و اگر روند فعلی ادامه پیدا کند، این ذخیره میتواند بین سالهای ۲۰۲۶ تا ۲۰۳۲ بهطور گسترده مصرف شود. همزمان، برآورد دیگری از همین مؤسسه نشان میدهد هزینه آموزش مدلهای پیشتاز از سال ۲۰۱۶ بهطور متوسط سالانه ۲٫۴ برابر شده و ادامه این روند میتواند هزینه بزرگترین آموزشها را در ۲۰۲۷ به بیش از یک میلیارد دلار برساند.
بنابراین مسابقه هوش مصنوعی دیگر فقط مسابقه خرید تراشه نیست؛ مسئله این است که برای این همه محاسبه، چقدر داده تازه و باکیفیت باقی مانده است؟
قانون مقیاسپذیری از همین رابطه ساده بیرون آمد «قوانین مقیاسپذیری» (Scaling Laws) میگویند عملکرد مدلهای زبانی با افزایش اندازه مدل، مقدار داده و توان محاسباتی، طبق الگوهای نسبتاً منظمی بهتر میشود. مقاله مشهور سال ۲۰۲۰ پژوهشگران اوپنایآی نشان داد خطای مدل با هر سه عامل، یعنی اندازه مدل، اندازه مجموعهداده و محاسبه، تقریباً از یک قانون توانی پیروی میکند.
به زبان ساده، این یافته به صنعت گفت اگر بودجه و سختافزار بیشتری در اختیار دارید، میتوانید مدل بزرگتری را روی داده بیشتری آموزش دهید و انتظار بهبود قابل پیشبینی داشته باشید. همین ایده یکی از موتورهای اصلی بزرگشدن مدلهای یادگیری عمیق شد.
اما چینیچیلا نشان داد فقط بزرگتر کردن مدل کافی نیست در سال ۲۰۲۲، پژوهشگران دیپمایند با آموزش بیش از ۴۰۰ مدل، از ۷۰ میلیون تا بیش از ۱۶ میلیارد پارامتر، نتیجهای مهم گرفتند: مدلهای آن دوره عموماً کمآموزشدیده بودند؛ یعنی مدل بزرگ ساخته میشد، اما داده کافی به آن داده نمیشد. مدل ۷۰ میلیاردپارامتری «چینیچیلا» با همان بودجه محاسباتی مدل ۲۸۰ میلیاردپارامتری «گافر» و با حدود چهار برابر داده بیشتر، در مجموعه بزرگی از آزمونها بهتر عمل کرد.
پیام روشن بود: رشد هوش فقط با افزودن «پارامتر» اتفاق نمیافتد؛ باید اندازه مدل و مقدار داده را متناسب با هم بالا برد.
حالا مشکل اینجاست که داده انسانی بینهایت نیست یک مثال ساده، قفسه یک کتابخانه است. اگر مدل هرچه بزرگتر شود، کتاب بیشتری بخواهد، دیر یا زود همه کتابهای ارزشمند موجود را خوانده است.
مسئله فقط تعداد داده نیست؛ تکرار همان مطالب یا استفاده از متنهای کمکیفیت، ارزش آموزشی یکسانی ندارد. اپوک ایآی در برآورد خود تأکید میکند داده وب، اگر بهدقت پالایش شود، میتواند بسیار ارزشمندتر از برآوردهای قدیمی باشد و یک مجموعه نیز چند بار قابل استفاده است؛ بنابراین «دیوار داده» یک عدد قطعی و یک تاریخ قطعی نیست، بلکه برآوردی وابسته به کیفیت، تکرارپذیری و شیوه آموزش است.
داده مصنوعی در را باز میکند، اما کلید مطمئنی نیست راه طبیعی بعدی استفاده از «داده مصنوعی» (Synthetic Data) است؛ یعنی بهجای منتظر ماندن برای متن تازه انسانی، از خود مدل بخواهیم مثال، مسئله، پاسخ یا کد تولید کند و نسل بعدی را با آن آموزش دهیم. این روش واقعاً میتواند مفید باشد، بهویژه در حوزههایی مثل ریاضیات و برنامهنویسی که امکان تولید و بررسی نمونهها بیشتر است.
اما پژوهش منتشرشده در «نیچر» هشدار مهمی دارد: اگر مدلها بدون کنترل، روی محتوایی آموزش ببینند که نسل قبلی هوش مصنوعی تولید کرده، بهتدریج بخشهایی از توزیع واقعی داده را از دست میدهند؛ پدیدهای که «فروپاشی مدل» (Model Collapse) نام گرفته است. یعنی ماشین ممکن است کمکم روی نسخهای که خودش از جهان ساخته، دوباره آموزش ببیند.
پس جنگ فقط بر سر داده و تراشه نیست حتی اگر داده و پردازنده بیشتری فراهم شود، خود معماری هم میتواند گلوگاه باشد. ترنسفورمر برای توجه به تمام موقعیتهای یک دنباله طولانی، در بخش توجه هزینهای دارد که با افزایش طول دنباله بهشدت رشد میکند.
«مامبا» (Mamba) در سال ۲۰۲۳ با استفاده از «مدلهای فضای حالت گزینشی» پیشنهاد کرد بخشی از این مسئله را با معماری متفاوت حل کند؛ نویسندگان گزارش کردند که این مدل در برخی آزمایشها در استنتاج تا پنج برابر بازده بیشتری از ترنسفورمر داشته و هزینه آن با طول دنباله بهصورت خطی رشد میکند. این به معنی کنار رفتن ترنسفورمر نیست؛ بلکه نشان میدهد وقتی مقیاس بزرگتر میشود، معماری هم باید برای هر واحد محاسبه ارزش بیشتری تولید کند.
مقیاسپذیری حالا فقط با بزرگتر شدن تعریف نمیشود سرمایهگذاری نیز هنوز خلاف این تصور را نشان نمیدهد که مقیاسپذیری تمام شده است. اپوک ایآی گزارش کرده مجموع مخارج سرمایهای آلفابت، آمازون، متا، مایکروسافت و اوراکل از زمان عرضه جیپیتیـ۴ حدود چهار برابر شده و با روند مشاهدهشده، این پنج شرکت میتوانستند در سال ۲۰۲۶ حدود ۷۷۰ میلیارد دلار هزینه سرمایهای داشته باشند.
از سوی دیگر، پژوهشهای جدید نشان میدهند افزایش محاسبه در زمان پاسخگویی نیز میتواند برای برخی مسائل، بهجای بزرگترکردن مدل، راه دیگری برای بهبود عملکرد باشد. بنابراین دیوار داده الزاماً پایان یادگیری عمیق و مدلهای زبانی بزرگ نیست؛ فقط قواعد بازی را عوض میکند: از «بزرگتر بساز» به «از هر واحد داده و محاسبه، هوشمندانهتر استفاده کن».