یک باگ که ردیابیاش به 1981 برمیگردد و دههها نامرئی مانده بود، اولین رخداد بود. این اتفاق فضای رونمایی اخیر Zhipu AI را رقم زد: GLM-5.3، یک مدل زبانی با 743 میلیارد پارامتر که برای کدنویسی، گردشکارهای عاملمحور و تحلیل امنیت سایبری بهینه شده است.
Zhipu AI میگوید GLM-5.3 نه بهعنوان یک مدل پایه بزرگتر، بلکه بهعنوان یک مدل هوشمندتر عرضه میشود. وزنها همچنان روی 743 میلیارد پارامتر باقی ماندهاند، با این حال تیم لایه پس از آموزش را بازطراحی کرد (محیطهای شبیهسازی غنیتر، تنوع گستردهتر وظایف و محاسبات تعاملی سنگینتر) تا به بهبود عملکرد دست یابد. نتیجه کمتر شبیه مقیاسبندی خشن و بیشتر شبیه پالایش دقیق است.
دسترسی از طریق طرح پرداختی GLM Coding Plan و پلتفرم ZCode آغاز میشود. دسترسی API و وزنهای قابل دانلود مدل قرار است پس از بررسیهای امنیتی مرحلهای در هفتههای آتی بهصورت تدریجی منتشر شوند، که به سازمانها امکان میدهد مدل را زودتر آزمایش کنند در حالی که Zhipu آن را برای توزیع گستردهتر بررسی میکند.

کارآمدی توکن یک معیار برجسته بود. در Code Bench خود Z.ai، GLM-5.3 با استفاده از تقریبا 75,000 توکن خروجی موفقیت 34.5% را ثبت کرد، در مقایسه با GLM-5.2 که موفقیت 23.4% را با حدود 96,000 توکن داشت. به عبارت ساده: حرف کمتر، نتایج بیشتر. این نوع بهبودی است که مهندسان ابتدا متوجه آن میشوند.
وقتی بحث توانایی خام برنامهنویسی مطرح میشود، تصویر ترکیبی است. Terminal Bench 3.0 (که عملکرد را در محیطهای زنده لینوکس و سیستمهای خودکار ارزیابی میکند) GLM-5.3 را به امتیاز 28.3 رساند، در برابر 4.6 در نسل قبلی. چشمگیر است. با این حال رقبا تجاری هنوز پیشتازند؛ Claude Fable 5 امتیاز 33.7 و GPT-5.6 Sol امتیاز 34.6 را کسب کردند و موقعیتهای برتر را حفظ کردند.
در رفع باگهای دنیای واقعی که با DeepSWE v1.1 آزمایش شد، GLM-5.3 امتیاز 66.9 را ثبت کرد، که نسبت به نسل قبلی بهطور قابل توجهی پیشرفت داشت اما کمی کمتر از رقبایی مانند Kimi K3 (67.5) و Fable 5 (69.7) بود. نتیجهگیری: GLM-5.3 فاصله را با رقابتهای متنباز و غیرمتنباز کاهش میدهد، اما پشتههای برتر سازمانی همچنان رقابتی شدید دارند.

جایی که GLM-5.3 واقعا شگفتیآفرین است، در حوزه امنیت سایبری است: این مدل با امتیاز 84.5% در بنچمارک CyberGym در صدر قرار گرفت و کمی جلوتر از Fable 5 (83.8%) و GPT-5.6 Sol (83.6%) ایستاد. Zhipu یک پرونده امنیتی منتشر کرد که نشان میدهد GLM-5.3 توانسته 2,436 آسیبپذیری را در بین 269 پروژه متنباز شناسایی کند، که 1,097 مورد از آنها در ردههای خطر متوسط تا بحرانی طبقهبندی شدهاند. یک کشف برجسته وجود دارد: یک اکسپلویت که منشأ آن به 1981 بازمیگردد و گزارش شده توسط اسکنرها و پژوهشگران قبلی بهطور متوسط به مدت 26.6 سال شناسایی نشده بود.
تمام اینها GLM-5.3 را بهعنوان یک رقیب قابلاعتنا برای رقبای منطقهای مانند Kimi K3 و یک رقیب تحریکآمیز در مقابل مدلهای تجاری آمریکایی قرار میدهد. این تنها یک انتشار دیگر نیست؛ این یک مطالعه موردی در مبادله رشد خام پارامترها با آموزش پس از آموزش هدفمند و هوشمند است و بهطور جانبی منافع امنیت سایبری هم به همراه داشته است.
آیا GLM-5.3 تولیدکنندگان را وادار خواهد کرد که ابزارچینهای خود را بازتر کنند یا دور تازهای از مهندسی محور بر بنچمارکها را تحمیل خواهد کرد؟ چند ماه آینده از طریق آزمایشهای API و بررسی جامعه پاسخ خواهد داد.
.avif)



نظر بگذارید
نظرات
هنوز نظری ثبت نشده. اولین نفر باشید.