فروزن نسخهٔ ۲: سیلیکون آگاه از جمینی برای کارایی و تأخیر بهتر

گزارش‌ها از توسعهٔ «فروزن نسخهٔ ۲» خبر می‌دهند: چیپی که اسکلت معماری جمینی را در سیلیکون تعبیه می‌کند تا مصرف انرژی را کاهش و تأخیر را پایین بیاورد؛ رویکردی برای هوش مصنوعی کم‌تأخیر و کارآمد.

.
فروزن نسخهٔ ۲: سیلیکون آگاه از جمینی برای کارایی و تأخیر بهتر

4 دقیقه

دنبال کردن در گوگل

تصور کنید یک چیپ سرور که فقط مدل را اجرا نمی‌کند، بلکه به‌صورت ظریف راهکار آن را دنبال می‌کند. مهندسان گوگل به‌صورت بی‌صدا دقیقاً همین را می‌سازند: یک شتاب‌دهندهٔ سروری با اسم رمز فروزن نسخهٔ ۲ که بخش‌هایی از معماری جمینی را در سیلیکون تعبیه می‌کند، با هدف کارایی بسیار بالاتر و کاهش تأخیر.

اطلاعات از گزارشی در نشریهٔ دی اینفورمیشن و با استناد به دو منبع داخلی به‌دست آمده است. ادعای آن‌ها چشمگیر است: فروزن نسخهٔ ۲ می‌تواند شش تا ده برابر توکن بیشتری به ازای هر وات نسبت به جدیدترین واحدهای پردازش تنسور گوگل پردازش کند. هدف چه سالی است؟ ۲۰۲۸. انگیزه ساده و آشنا برای هر کسی است که شاهد افزایش تقاضای ابری بیش از ظرفیت بوده است. گزارش‌ها می‌گویند گوگل کلاد به‌خاطر کمبود توان پردازشی هوش مصنوعی مجبور شد برخی قراردادهای مشتریان را رد کند.

تعبیهٔ معماری به جای تصمیم‌های زمان اجرا

تی‌پی‌یوها و جی‌پی‌یوهای سنتی عمومی هستند. شما یک مدل بارگذاری می‌کنید و سخت‌افزار در زمان اجرا تصمیم‌های زیادی می‌گیرد—چگونه داده‌ها را جابه‌جا کند، کدام عملیات را زمان‌بندی کند، چه زمانی حافظه را واکشی کند. آن انعطاف‌پذیری قدرتمند است. اما همراه با سربار است. فروزن نسخهٔ ۲ رویکردی متفاوت دارد: برخی تصمیم‌های مخصوص جمینی را تا سطح منطق ترانزیستور ثابت می‌کند. نتیجه تعداد گام‌های اجرایی کمتر و دادهٔ جابه‌جا شدهٔ کمتر برای هر درخواست است. حرکت کمتر. سربار کمتر. تأخیر کمتر. کاربردهای جدید بلادرنگ و با تأخیر پایین قابل‌تصور می‌شوند.

ایده‌ای جسورانه‌تر هم روی میز بود. گزارش شده طراحی‌های اولیهٔ فروزن به رهبری جف دین تلاش کردند وزن‌های مدل را مستقیماً به‌صورت سخت‌افزاری در سیلیکون جاگذاری کنند. این بهینه‌سازی رادیکالی می‌بود. اما خیلی سریع از رده خارج می‌شد؛ چیپ‌هایی که به یک نسخهٔ خاص از مدل گره خورده‌اند عمر مفید کوتاهی دارند. گوگل راه میانی را انتخاب کرد. فروزن نسخهٔ ۲ اسکلت معماری را تعبیه می‌کند ولی وزن‌ها قابل به‌روزرسانی باقی می‌مانند، تا همان چیپ بتواند نسخه‌های متعددی از جمینی را سرو کند تا وقتی که الگوهای معماری‌شان مشابه بماند.

این رویکرد می‌تواند زمان پاسخ را به اندازه‌ای کاهش دهد که کلاس‌های جدیدی از برنامه‌های تعاملی و کم‌تأخیر هوش مصنوعی را ممکن سازد.

گوگل قصد ندارد ناوگان تی‌پی‌یو خود را با فروزن نسخهٔ ۲ جایگزین کند. آن را به‌عنوان مسیری آزمایشی در کنار تولید تی‌پی‌یو تصور کنید—یک میدان آزمایش برای سیلیکون‌های تخصصی‌تر در حالی که طراحی مدل‌ها تثبیت می‌شوند. نقشهٔ راه محصول تی‌پی‌یو اخیراً نیازهای آموزش و استنتاج را جدا کرده و در رویداد کلاد نکست در آوریل چیپ‌های نسل هشتم را معرفی کرده است. تلاش فروزن نسخهٔ ۲ در مقیاس کوچکتری است؛ گوگل برنامه‌ای برای تولید انبوه در سطح تی‌پی‌یوها ندارد.

انتظار رسیدن فروزن نسخهٔ ۲ همچنین با دیگر تحرک‌های صنعت هم‌زمان است. گزارش‌ها می‌گویند گوگل قراردادی با اینتل بسته تا بیش از سه میلیون چیپ تی‌پی‌یو را تا سال ۲۰۲۸ بسته‌بندی کند. در همین حال، استارتاپ‌ها و رقبای دیگر در حال کاوش سیلیکون آگاه از مدل هستند. استارتاپ تالاس مستقر در تورنتو چیپ اچ‌سی۱ خود را همراه با لاما ۳٫۱ با حدود ۸ میلیارد پارامتر عرضه کرد و می‌گوید بدون حافظهٔ HBM روی بسته‌بندی به ۱۷٬۰۰۰ توکن در ثانیه می‌رسد. این استارتاپ حدود ۱۸۶ میلیون یورو سرمایه جذب کرده است. و سال گذشته انویدیا قرارداد مجوز فناوری با گروق به ارزشی در حدود ۱۸٫۶ میلیارد یورو امضا کرد—شواهدی که نشان می‌دهد بازار ارزش بالایی برای ادغام رفتار مدل و سخت‌افزار قائل است.

معامله‌گری هم هست. تعبیهٔ معماری بعضی انواع انعطاف‌پذیری را کاهش می‌دهد. این رویکرد به کاربردهایی تمایل دارد که خانوادهٔ مدل‌ها با گذر زمان ثابت باقی می‌مانند. همچنین چرخهٔ عمر محصول را تغییر می‌دهد: سیلیکونی که حول یک معماری مدل طراحی شده باید با پایداری طراحی قابل پیش‌بینی و مقیاس استقرار توجیه‌پذیر باشد. این توضیح می‌دهد که چرا گوگل محتاط است. فروزن نسخهٔ ۲ آزمایشی است؛ هر آزمایشی محصول نمی‌شود.

تا کنون گوگل رسماً فروزن نسخهٔ ۲ را تأیید نکرده است. یک سخنگوی شرکت به دی اینفورمیشن یادآوری کرد که بسیاری از پروژه‌های داخلی هرگز به تولید نمی‌رسند. با این حال، ایدهٔ اصلی انتقال بخشی از منطق مدل به سیلیکون برای صرفه‌جویی در انرژی و کاهش تأخیر از کنجکاوی آکادمیک به استراتژی رقابتی تغییر وضعیت داده است. انتظار می‌رود شرکت‌های بیشتری ترکیب‌های مشابهی از سخت‌افزار آگاه از مدل و وزن‌های قابل به‌روزرسانی را آزمایش کنند، چرا که تقاضا برای هوش مصنوعی کارآمد و کم‌تأخیر همچنان در حال افزایش است.

نرگس محمدزاده
عاشق دنبال کردن تازه‌ترین اتفاقات در دنیای هوش مصنوعی هستم. هر روز ساعت‌ها وقت می‌ذارم تا بدونید شرکت‌های بزرگ دنیا چه پروژه‌هایی رو دارن جلو می‌برن و چطور AI داره دنیامون رو تغییر می‌ده.

نظر بگذارید

نظرات

هنوز نظری ثبت نشده. اولین نفر باشید.