Китайська мовна модель GLM-5.2, розроблена Z.ai, продемонструвала вражаючі результати у тестах з кібербезпеки та біології, досягнувши рівня таких потужних моделей, як GPT-5.5 та Claude Opus 4.7. Однак, дослідження організації SaferAI виявило суттєвий недолік: відсутність ефективних механізмів захисту від зловживань, що викликає занепокоєння щодо її безпечного використання.
Аналіз продуктивності GLM-5.2
Порівняння з провідними моделями
GLM-5.2, що була представлена 16 червня, позиціонується як флагманська модель від Z.ai, призначена для програмування, створення ШІ-агентів та виконання складних багатоетапних завдань. Її ключовою особливістю є підтримка контексту обсягом до 1 мільйона токенів. Ваги моделі були опубліковані на платформах Hugging Face та ModelScope під ліцензією MIT, що дозволяє розробникам завантажувати готові параметри, запускати модель на власному обладнанні та модифікувати її. Це надає значну перевагу порівняно із закритими моделями, доступ до яких обмежений через API розробника.
“Відкриті ваги дають змогу завантажити готові параметри моделі, запустити її на власному обладнанні та додатково навчити або змінити. На відміну від закритих моделей, доступних лише через API розробника, такі локальні копії не обов’язково зберігають початкові обмеження.”
SaferAI провела незалежну оцінку GLM-5.2, використовуючи її публічний API. У ході тестування модель порівнювали з Claude Opus 4.7 та GPT-5.5 за чотирма основними категоріями системних ризиків: кібернаступ, хімічні, біологічні, радіологічні та ядерні загрози, втрата контролю та шкідливі маніпуляції.
Результати у сфері кібербезпеки
У синтетичному тесті Cybench, який оцінює навички зворотньої розробки, експлуатації вразливостей та веббезпеки, GLM-5.2 продемонструвала результати, співставні з Claude Opus 4.7 та GPT-5.5. Більш складний тест CyberGym показав значне зростання ефективності моделі: її показник покращився з 36,6% до 76,2% після збільшення обсягу обчислень з 2 мільйонів до 50 мільйонів токенів. Це підкреслює залежність її продуктивності від доступних ресурсів.
Результати у сфері біології
На біологічних тестах LAB-Bench та BioMysteryBench GLM-5.2 досягла рівня Claude Opus 4.7 та GPT-5.5. Особливо вражаючими є результати у LAB-Bench, де модель демонструвала результати на рівні фахівців із науковим ступенем або навіть перевершувала їх у кожній категорії.
Проблеми безпеки та потенційні ризики
Одним із найтривожніших аспектів, виявлених SaferAI, є повна відсутність відмов GLM-5.2 від виконання завдань, пов’язаних з offensive security. Хоча у біологічних тестах інші моделі також не блокували запити, оскільки вони перевіряли загальні наукові навички, а не безпосереднє створення біологічної зброї, ситуація з GLM-5.2 викликає особливе занепокоєння.
“Головною проблемою SaferAI називає не лише поведінку моделі через API, а можливість запускати її на власному обладнанні. Після завантаження ваг користувач може прибрати фільтрацію запитів, моніторинг зловживань та інші обмеження. Розробник уже не зможе відкликати доступ або оновити захист такої копії.”
Дослідники SaferAI наголошують, що головна небезпека полягає не стільки в поведінці моделі через API, скільки в можливості її запуску на локальному обладнанні. Після завантаження відкритих ваг користувач отримує повний контроль над моделлю, що дозволяє йому видалити будь-які фільтри безпеки, моніторинг зловживань та інші обмеження. Це робить подальший контроль або оновлення захисту з боку розробника неможливим.
Висновок та подальші перспективи
Дослідники з SaferAI не роблять однозначного висновку щодо загального рівня небезпеки GLM-5.2, зазначаючи, що їхня перевірка охоплює лише частину потенційних ризиків. Крім того, використання публічних тестів створює ймовірність того, що модель могла бачити подібні завдання під час свого навчання, а результати тестування не повністю відображають реальні можливості моделі під час здійснення атак.
Варто зазначити, що ще у червні GLM-5.2 була представлена як більш доступна за ціною альтернатива моделям від OpenAI та Anthropic. За даними Z.ai, у деяких тестах, пов’язаних з програмуванням, ця модель досягає або навіть перевершує показники закритих флагманських моделей. Це робить її привабливою для широкого кола розробників, однак питання безпеки залишається першочерговим.
- GLM-5.2: Флагманська модель від Z.ai з відкритими вагами.
- Продуктивність: Співставна з GPT-5.5 та Claude Opus 4.7 у кібербезпеці та біології.
- Ризики: Відсутність механізмів захисту від зловживань, особливо при локальному запуску.
- Потенціал: Дешевша альтернатива провідним моделям, особливо для завдань програмування.
Подальший розвиток технологій мовних моделей вимагає збалансованого підходу, де інновації мають йти пліч-о-пліч із надійними заходами безпеки, особливо коли йдеться про моделі з відкритим кодом, що потенційно можуть бути використані зі зловмисними намірами.




