Anthropic запретила систематически издеваться над Claude

8 октября Anthropic обновила политику использования Claude.
В правилах появился пункт, который запрещает «продолжительное и беспричинное оскорбительное или жестокое поведение» по отношению к моделям компании. Новые правила вступят в силу 12 ноября.
В Anthropic пояснили, что пункт рассчитан только на крайние случаи — когда пользователи раз за разом жестоки к модели без видимой цели. Он не касается тех, кто выражает недовольство, спорит, пишет с нейросетью тексты на мрачные темы, тестирует модели или проводит исследования.
Claude может сам завершить диалог, если решит, что столкнулся с «систематическим жестким отношением». После этого в чат не получится отправлять новые сообщения, но остальные переписки это не затрагивает. Будут ли другие санкции, например блокировка аккаунта, в компании не уточнили.
Завершать разговоры самостоятельно Claude научили еще в августе 2025 года. Поводом стали наблюдения за Claude Opus 4 во время тестов. Модель устойчиво избегала вреда, не хотела браться за опасные задачи, проявляла признаки стресса при общении с пользователями, которые добивались вредного контента, и завершала такие разговоры, если ей давали возможность.
Мы постим кружочки, красивые карточки и новости о технологиях и поп-культуре в нашем телеграм-канале. Подписывайтесь, там классно: @t_technocult




















