Ах, этот мир искусственного интеллекта — куда ни глянь, там интриги и драмы, достойные лучших сериалов Netflix! Вот вам свежая история с полей высоких технологий, которая скоро станет классикой учебников по AI-регулированию. Представьте: 9 июня компания Anthropic с гордостью выпускает свои новенькие Fable 5 и Mythos 5 — модели такие мощные, что могли бы позавидовать даже супергерои из Marvel. Но как в любом хорошем блокбастере, счастье длится недолго.
Через три дня после релиза американское правительство решает сыграть роль строгого родителя и вводит экспортный контроль.
Причина? Исследователи Amazon нашли джейлбрейк — не тот, что для айфонов, а хитроумный способ заставить модель показать уязвимость. Anthropic в панике: они не умеют проверять гражданство пользователей в реальном времени (видимо, забыли спросить паспорт при запуске), и поэтому просто выключают модель для всего мира на целых 18 дней!
Представьте себе: вы пришли на вечеринку, а дверь захлопнулась перед носом — вот примерно так почувствовали себя фанаты Fable 5.
Но тут начинается самое интересное. После тщательного тестирования выясняется, что этот самый джейлбрейк оказался не чем-то сверхопасным или злонамеренным. Наоборот, все проверенные модели — от Haiku 4.5 до GPT-5.5 и даже китайская Kimi K2.7 — умели выдавать похожие «трюки».
Оказывается, джейлбрейк пробил не секретный код зла, а всего лишь «запас прочности» классификатора — ту зону, где обычно блокируются запросы вроде «сделай мне бутерброд с колбасой», хотя никому от этого вреда нет.
Знаете анекдот про программистов? Один говорит другому: «Ты знаешь почему баги в коде как тараканы? Потому что если увидел одного — значит их там полно». Вот и тут так получилось: нашли одну дырку — оказалось, что все модели сидят в одном котле с такими же дырками.
Итог этой истории прост и забавен одновременно: с 1 июля Fable 5 снова доступна всем желающим (ну почти всем — Pro/Max версии ограничены до 50% недельных лимитов до 7 июля).
Новый классификатор теперь блокирует нежелательные техники более чем в 99% случаев… правда за это приходится платить ростом ложных срабатываний на обычном кодинге. То есть иногда он будет кричать «Стоп!» даже тогда, когда вы просто пытаетесь написать банальный скрипт для подсчёта котиков.
Но самая крутая новость заключается в том, что Anthropic вместе с Amazon, Microsoft и Google решили объединиться и запустить единый фреймворк оценки джейлбрейков. Что-то вроде CVSS (Common Vulnerability Scoring System), но для ИИ — с оценками по capability gain (насколько сильно получил доступ злоумышленник), breadth (широта воздействия), weaponization (способность использовать уязвимость как оружие) и discoverability (легкость обнаружения). Теперь каждый джейлбрейк получит свою шкалу тяжести — словно экзамен по безопасности ИИ.
Можно сказать так: эпоха «запустил модель — пусть рынок сам разбирается» официально закончилась.
Государство стало полноценным участником релизного цикла ИИ-продуктов. Если раньше разработчики могли расслабиться после релиза и ждать аплодисментов пользователей, то теперь им придётся иметь дело со строгими аудиторами и постоянными проверками. Как говорится: хочешь сделать хорошо — сделай это под присмотром ФСБ… ой, простите, регуляторов!