GLM-5.3: مدل زبانی بهینه شده برای کدنویسی و امنیت سایبری

GLM-5.3، مدل جدید Zhipu AI با 743 میلیارد پارامتر، برای کدنویسی و تحلیل امنیت سایبری بهینه شده است. این مدل در بنچمارک‌ها و شناسایی آسیب‌پذیری‌ها پیشرفت قابل توجهی نشان داد و رقبای تجاری را به چالش کشیده است.

.
GLM-5.3: مدل زبانی بهینه شده برای کدنویسی و امنیت سایبری

3 دقیقه

دنبال کردن در گوگل

یک باگ که ردیابی‌اش به 1981 برمی‌گردد و دهه‌ها نامرئی مانده بود، اولین رخداد بود. این اتفاق فضای رونمایی اخیر Zhipu AI را رقم زد: GLM-5.3، یک مدل زبانی با 743 میلیارد پارامتر که برای کدنویسی، گردش‌کارهای عامل‌محور و تحلیل امنیت سایبری بهینه شده است.

Zhipu AI می‌گوید GLM-5.3 نه به‌عنوان یک مدل پایه بزرگ‌تر، بلکه به‌عنوان یک مدل هوشمندتر عرضه می‌شود. وزن‌ها همچنان روی 743 میلیارد پارامتر باقی مانده‌اند، با این حال تیم لایه پس از آموزش را بازطراحی کرد (محیط‌های شبیه‌سازی غنی‌تر، تنوع گسترده‌تر وظایف و محاسبات تعاملی سنگین‌تر) تا به بهبود عملکرد دست یابد. نتیجه کمتر شبیه مقیاس‌بندی خشن و بیشتر شبیه پالایش دقیق است.

دسترسی از طریق طرح پرداختی GLM Coding Plan و پلتفرم ZCode آغاز می‌شود. دسترسی API و وزن‌های قابل دانلود مدل قرار است پس از بررسی‌های امنیتی مرحله‌ای در هفته‌های آتی به‌صورت تدریجی منتشر شوند، که به سازمان‌ها امکان می‌دهد مدل را زودتر آزمایش کنند در حالی که Zhipu آن را برای توزیع گسترده‌تر بررسی می‌کند.

کارآمدی توکن یک معیار برجسته بود. در Code Bench خود Z.ai، GLM-5.3 با استفاده از تقریبا 75,000 توکن خروجی موفقیت 34.5% را ثبت کرد، در مقایسه با GLM-5.2 که موفقیت 23.4% را با حدود 96,000 توکن داشت. به عبارت ساده: حرف کمتر، نتایج بیشتر. این نوع بهبودی است که مهندسان ابتدا متوجه آن می‌شوند.

وقتی بحث توانایی خام برنامه‌نویسی مطرح می‌شود، تصویر ترکیبی است. Terminal Bench 3.0 (که عملکرد را در محیط‌های زنده لینوکس و سیستم‌های خودکار ارزیابی می‌کند) GLM-5.3 را به امتیاز 28.3 رساند، در برابر 4.6 در نسل قبلی. چشمگیر است. با این حال رقبا تجاری هنوز پیشتازند؛ Claude Fable 5 امتیاز 33.7 و GPT-5.6 Sol امتیاز 34.6 را کسب کردند و موقعیت‌های برتر را حفظ کردند.

در رفع باگ‌های دنیای واقعی که با DeepSWE v1.1 آزمایش شد، GLM-5.3 امتیاز 66.9 را ثبت کرد، که نسبت به نسل قبلی به‌طور قابل توجهی پیشرفت داشت اما کمی کمتر از رقبایی مانند Kimi K3 (67.5) و Fable 5 (69.7) بود. نتیجه‌گیری: GLM-5.3 فاصله را با رقابت‌های متن‌باز و غیرمتن‌باز کاهش می‌دهد، اما پشته‌های برتر سازمانی همچنان رقابتی شدید دارند.

جایی که GLM-5.3 واقعا شگفتی‌آفرین است، در حوزه امنیت سایبری است: این مدل با امتیاز 84.5% در بنچمارک CyberGym در صدر قرار گرفت و کمی جلوتر از Fable 5 (83.8%) و GPT-5.6 Sol (83.6%) ایستاد. Zhipu یک پرونده امنیتی منتشر کرد که نشان می‌دهد GLM-5.3 توانسته 2,436 آسیب‌پذیری را در بین 269 پروژه متن‌باز شناسایی کند، که 1,097 مورد از آنها در رده‌های خطر متوسط تا بحرانی طبقه‌بندی شده‌اند. یک کشف برجسته وجود دارد: یک اکسپلویت که منشأ آن به 1981 بازمی‌گردد و گزارش شده توسط اسکنرها و پژوهشگران قبلی به‌طور متوسط به مدت 26.6 سال شناسایی نشده بود.

تمام این‌ها GLM-5.3 را به‌عنوان یک رقیب قابل‌اعتنا برای رقبای منطقه‌ای مانند Kimi K3 و یک رقیب تحریک‌آمیز در مقابل مدل‌های تجاری آمریکایی قرار می‌دهد. این تنها یک انتشار دیگر نیست؛ این یک مطالعه موردی در مبادله رشد خام پارامترها با آموزش پس از آموزش هدفمند و هوشمند است و به‌طور جانبی منافع امنیت سایبری هم به همراه داشته است.

آیا GLM-5.3 تولیدکنندگان را وادار خواهد کرد که ابزارچین‌های خود را بازتر کنند یا دور تازه‌ای از مهندسی محور بر بنچمارک‌ها را تحمیل خواهد کرد؟ چند ماه آینده از طریق آزمایش‌های API و بررسی جامعه پاسخ خواهد داد.

علی تقوی
من علی‌ام، نویسنده‌ای که سعی می‌کنه هوش مصنوعی رو نه‌فقط به‌عنوان یک فناوری، بلکه به‌عنوان آینده‌ی زندگی بشر بررسی کنه.

نظر بگذارید

نظرات

هنوز نظری ثبت نشده. اولین نفر باشید.