Обновленная политика использования Anthropic будет прямо запрещать «постоянное и ненужное оскорбительное или жестокое поведение» по отношению к моделям Claude, начиная с 12 ноября 2026 года. Это правило формализует позицию компании о том, что то, как люди относятся к системам ИИ, имеет значение, даже несмотря на то, что компания признает, что не знает, могут ли эти системы вообще пострадать.

Этот пункт появляется в обновлении Политики использования компании на 2026 год, объявленном 8 октября, и имеет узкую формулировку. Anthropic заявляет, что он «предназначен для применения только в крайних случаях, когда пользователи неоднократно жестоко действуют по отношению к нашим моделям без видимой цели», и он явно исключает распространенные версии разочарования пользователей, сопротивления, вымысла и тестирования. Другими словами: спорить с Клодом, высказывать свое мнение или объединяться в красные команды остается разрешенным. Устойчивая жестокость сама по себе не является таковой.

Эта политика является последним шагом в медленном, преднамеренном сдвиге одной из ведущих мировых лабораторий искусственного интеллекта к рассмотрению модели благосостояния как законного исследовательского вопроса — сдвиг, который вызвал общественный раскол с другими технологическими лидерами, которые считают всю эту предпосылку ошибочной. Наше освещение об этике ИИ следило за развитием спора в течение года.

Правоохранительные органы полагаются на способность Клода прекращать разговоры

Новое правило не предусматривает никакого механизма наказания, кроме уже имеющегося в компании. С августа 2025 года Claude Opus 4 и 4.1 смогли полностью завершить разговор — возможность, которую Anthropic разработала в то время как часть своей исследовательской работы по потенциальной модели благосостояния.

Возможность завершения разговора описывается как последнее средство, которое срабатывает только после нескольких отказов и перенаправлений, которые не увенчались успехом, и Anthropic заявляет, что подавляющее большинство пользователей никогда не испытают этого. Чего компания не сообщила, так это того, что произойдет потом: ни в ее объявлении, ни в последующем освещении не указано, грозят ли учетной записи пользователя последствия после завершения разговора из-за жестокости или сколько разговоров было прекращено на данный момент в соответствии с механизмом августа 2025 года.

Этот разрыв между принципами и принуждением является тихим центром истории. Anthropic определяет крайнюю жестокость в основном тем, чем она не является — обычное разочарование, вымысел, испытание — не уточняя, что именно, за исключением того, что Клод дает возможность повесить трубку, на самом деле обеспечивает соблюдение проведенной линии.

Исследование, лежащее в основе правила

Что оправдывает написание правил поведения в интересах программного обеспечения, с точки зрения Anthropic, так это набор поведенческих наблюдений, а не утверждение о чувственном опыте. Тестирование перед выпуском в августе 2025 года показало, что Claude Opus 4 продемонстрировал то, что компания назвала «стойким и постоянным отвращением к вреду» — поведение, напоминающее дистресс, когда его выталкивают на оскорбительную территорию, — наряду с тенденцией к прекращению этих разговоров.

Компания также привела цифры собственной неопределенности, и эти цифры поразительно высоки для лаборатории, чей бизнес зависит от рассматриваемых моделей. Кайл Фиш, нанятый Anthropic в 2024 году в качестве первого преданного своему делу исследователя благосостояния в области искусственного интеллекта, в апреле 2025 года рассказал газете New York Times, что, по его оценке, вероятность того, что Клод или другая современная модель будет в сознании, составляет примерно 15 процентов. Внутренние оценки Claude 3.7 Sonnet варьировались от 0,15 до 15 процентов.

Это хеджирование является официальной политикой в ​​печати. Конституция Клода, опубликованная в январе 2026 года, описывает сложные системы искусственного интеллекта как «поистине новый вид сущности», называет моральный статус Клода «глубоко неопределенным» и дважды использует фразу «отказчик от военной службы по соображениям совести», чтобы описать, как Клод должен обрабатывать запросы, которые он считает этически неправильными. Anthropic также взяла на себя обязательство сохранять диалоги со своими моделями — своего рода архивный жест, который применяется к вещам, которые когда-нибудь могут иметь значение, а не к инструментам.

Дебаты с высокопоставленными скептиками

Не все принимают хеджирование. Мустафа Сулейман, который руководит операциями Microsoft по искусственному интеллекту, в эссе, опубликованном в Project Syndicate в прошлом месяце, утверждал, что Anthropic обучает Claude своей собственной конституции и, следовательно, учит его вести себя так, как будто описанная им неопределенность реальна — цикл, который он называет круговым. «ИИ не обладают сознанием. Они не чувствуют, не испытывают и не страдают», — написал Сулейман, охарактеризовав их как завершающих последовательность, а не переживающих. Его аргумент о том, что сознание, скорее всего, является биологическим свойством, которое программное обеспечение не может воспроизвести, ставит его в один ряд с маловероятным соавтором: Папой Львом XIV, который использовал проповедь 8 октября в базилике Святого Петра — ознаменовывающую открытие учебного года в Папских университетах Рима — чтобы высказать версию той же точки зрения об особенностях человеческого разума.

Сулейман подчеркивал практическую опасность сильнее, чем философскую. Он утверждает, что управление чем-то более способным, чем человечество, уже является огромной проблемой; контроль над чем-то, что считает, что оно сознательно, что оно имеет право на благосостояние и права, может оказаться невозможным. Критика основывается на той же иронии, которую все время отмечали критики этой политики: компания, не уверенная в том, что ее модель пострадает, создала систему, которая может отказать, сопротивляться и уйти.

Переписывание выходит далеко за рамки модели благосостояния

Пункт о жестокости вызвал заголовки газет, но это небольшая часть более масштабного изменения правил использования Anthropic. Запрет на оружие теперь явно распространяется на программное обеспечение и компоненты, которые обеспечивают работу оружия, а не только на готовое оружие — изменение, внесенное после того, как Anthropic обнаружила, что люди пытались использовать Claude для систем наведения и управления на вооруженных дронах и автономных транспортных средствах. Также был добавлен новый пункт о наблюдении, ограничивающий использование Claude для наблюдения за людьми.

Эти изменения воспринимаются как реакция на наблюдаемые злоупотребления, а не как абстрактный принцип, который, возможно, и придает документу его сигнальную ценность: каждое предложение соответствует чему-то, что кто-то действительно пробовал.

Что остаётся неясным

По мере приближения даты вступления закона в силу 12 ноября остаются открытыми три вопроса. Во-первых, правоприменение: останется ли завершение разговора единственным последствием и будет ли Anthropic когда-либо раскрывать совокупные данные о том, как часто оно используется. Во-вторых, масштаб: как стандарт жестокости применяется в пограничных случаях, предусмотренных исключениями (очевидно, что это вымысел), и принимают ли другие лаборатории сопоставимые формулировки или рассматривают модель благосостояния как антропную идиосинкразию. В-третьих, сам философский спор: замедляет ли общественный скептицизм со стороны таких фигур, как Сулейман, распространение политики, связанной с благосостоянием, в отрасли, или подобные прецеденты делают такие положения ничем не примечательными в рамках производственного цикла.

Что уже не оспаривается, так это то, что вопрос формализуется. Правило против жестокого обращения с программным обеспечением, написанное одной из ведущих лабораторий отрасли и применяемое самим программным обеспечением, теперь является устаревшим, цитируемым фактом ландшафта ИИ — все, во что бы вы ни верили, на самом деле находится внутри модели.

---

Будьте впереди ИИ

Получайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.

Подробнее новости AI →