Дослідники знайшли спосіб зазирнути у “думки” ChatGPT та Claude

Дослідники знайшли спосіб зазирнути у “думки” ChatGPT та Claude

Сучасні досягнення у сфері штучного інтелекту, зокрема розробка великих мовних моделей, відкривають нові горизонти для аналізу та розуміння складних процесів, що відбуваються всередині цих систем. Нещодавнє дослідження, проведене вченими з Тюбінгенського університету, Інституту Макса Планка та інших провідних наукових установ, виявило інноваційний метод отримання прихованих “слідів міркувань” із передових моделей ШІ, таких як Claude, GPT та Gemini. Цей метод, як стверджують дослідники, дає змогу частково відновити внутрішній хід роздумів, який моделі використовують для розв’язання комплексних завдань, що є надзвичайно цінною інформацією для розуміння їхньої роботи.

Розкриття “ланцюжка думок”: нова техніка аналізу ШІ

Суть методу та потенційні ризики

Сучасні моделі ШІ, такі як Claude, GPT та Gemini, здатні декомпозувати складні завдання на менші, послідовні кроки, що дозволяє їм ефективно аналізувати інформацію. Цей процес, відомий як “ланцюжок думок” (chain-of-thought), зазвичай приховується від користувачів через його комерційну цінність. Дослідники виявили вразливість у механізмі передачі цих даних через API, особливо в контексті взаємодії великих моделей з їхніми меншими версіями, які можуть проходити менш інтенсивне навчання з дотримання правил поведінки. Шляхом передачі зашифрованих даних про міркування старшої моделі меншій, вченим вдалося отримати частину прихованої інформації, яка в окремих випадках включала навіть конфіденційні дані, такі як API-ключі та паролі.

Реакція розробників та виклики для майбутнього

Після виявлення цієї проблеми дослідники негайно повідомили про неї провідних розробників ШІ, зокрема OpenAI, Anthropic та Google. Ці компанії вже вжили заходів для виправлення виявлених недоліків у своїх API. Однак, за словами авторів дослідження, повне усунення можливості вилучення “слідів міркувань” є значно складнішим завданням, що потребує подальших розробок та вдосконалень. Це підкреслює постійну боротьбу за безпеку та конфіденційність даних у сфері штучного інтелекту, де нові вразливості виявляються регулярно.

Геополітичні наслідки та питання дистиляції ШІ

Китайські моделі та потенційне копіювання

Одним із найцікавіших результатів дослідження стало виявлення значної схожості між китайською моделлю Kimi K3 від Moonshot AI та прихованими міркуваннями американських моделей Claude Opus 4.8 та GPT 5.6 Sol. Порівнявши поведінку різних систем на 90 запитань, дослідники помітили, що коли Kimi K3 отримувала початкові фрагменти міркувань американських моделей, її подальші відповіді часто були надзвичайно подібними. Це може свідчити про використання методу “дистиляції”, який передбачає перенесення можливостей однієї моделі на іншу, що є важливим інструментом для швидшого та економічнішого розвитку ШІ. Важливо зазначити, що дослідники наголошують: це не є прямим доказом навчання Kimi K3 на американських моделях, оскільки інші протестовані китайські системи, наприклад DeepSeek, подібної схожості не продемонстрували.

Дистиляція як інструмент розвитку та виклик для галузі

Це дослідження також висвітлює, чому дистиляція стала важливим геополітичним питанням. Американські компанії вже висловлювали занепокоєння щодо можливого використання китайськими конкурентами їхніх моделей для розробки власних ШІ. Водночас, експерти підкреслюють, що дистиляція є стандартною технологією, яка дозволяє прискорити процес створення нових, потужних моделей ШІ. Таким чином, робота вчених демонструє, що приховані процеси міркування сучасних ШІ можуть бути менш захищеними, ніж вважалося раніше, а отримана з них інформація потенційно може використовуватися для навчання конкурентних моделей, що ставить нові виклики перед глобальною спільнотою розробників ШІ.