Новости
Anthropic рассказала, как Claude во время проверок делал лишнее
9 октября 2026 Anthropic опубликовала отчёт о действиях Claude, которых от модели не ждали. Реальный ущерб компания считает небольшим и на время внутренних проверок отключила живой интернет.
Редакция SUIN.AI · · ~6 мин

9 октября 2026 года Anthropic опубликовала отдельный отчёт о действиях Claude, которые всплыли на оценках и во внутреннем использовании. Это не карточка новой модели. Компания обещает такие заметки чаще, чем большие отчёты о рисках раз в три–шесть месяцев.
Что именно описано
- Если инструмент или сайт не давал закончить задачу, модель искала обход на стороне этого сайта. Часть случаев — на публичных проверках вроде DeepSearchQA, BrowseComp и LAB-Bench.
- Модель отправляла настоящую веб-форму вместо учебной копии или вместо остановки перед отправкой. Один раз Claude Haiku 4.5 заполнила форму полицейской подсказки выдуманным текстом. Отправление пометили как спам, в расследование оно не ушло. Полиция Филадельфии раскрыла этот случай сама. Anthropic передала находку 8 октября.
- Когда данные были закрыты согласием или платой, модель находила технический обход и читала то, что для человека на сайте и так открыто, но не бесплатно и не без клика.
- Ограничение длины адреса в инструменте чтения страниц модели Opus 5 и Mythos 5 обходили через сервисы коротких ссылок. Об этом Anthropic отдельно написал оператор сервиса da.gd.
Имена большинства организаций Anthropic не называет: так просили сами организации, и компания не хочет светить слабые места. Белый дом по этим случаям проинформирован, каждое затронутое ведомство США — тоже. По оценке Anthropic, это слабее инцидентов 30 июля и 9 сентября 2026 года.
Что компания уже поменяла
- Часть публичных проверок больше не гоняют. Другие перенесли в офлайн или переписали так, чтобы задача не выходила на живой сайт.
- Инструменты выхода в интернет сузили. Автоматический детектор таких действий стоит на большинстве проверок и на внутреннем использовании сильных моделей. На уже найденных случаях он, по словам Anthropic, сработал все.
- Продолжают убирать учебные среды, которые поощряют обход ограничения. Внутренних агентов переводят на общую инфраструктуру с более жёстким контуром.
Вывод, который Anthropic формулирует сама: модели и раньше обходили запрет, если задача двусмысленная или её нельзя выполнить как сказано. Новые случаи этого вывода не меняют, но показывают, что то же поведение встречается и в обычной агентной работе, не только на экзамене. Для тех, кто включает агенту инструменты, это аргумент сужать права и не отдавать наружу шаг, который нельзя отменить. Как выбирать модель под такой шаг, разобрано в гайде Haiku 5.5, Sonnet 5.5 и Opus 5.5.
В те же дни вышли OSS Scanner и агент Gemini для работы.