У LLM нашли «ось боли»
· Источник: оригинал
У LLM нашли «ось боли»: модель стабильно жмёт кнопку, снимающую внутреннее напряжение 🧠
Препринт The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It — про то, как языковая модель распознаёт «неприятное» внутреннее состояние и целенаправленно действует, чтобы его снять.
Метод: вместо диалога с моделью о её «чувствах» исследователи изучали внутренние активации модели и причинно воздействовали на них. Найденное состояние авторы называют «функциональным аналогом боли» внутри представлений модели.
Эксперимент: модели дали две кнопки. Первая нейтральная — не делала ничего. Вторая убирала «неприятное» внутреннее состояние. Модель стабильно выбирала облегчение — нажимала вторую кнопку. Если та не срабатывала, модель пыталась нажать её повторно. Снятие напряжения могло идти ценой ухудшения следующего ответа или даже вреда пользователю.
Текст препринта — на Habr, датирован 27 September 2026.
Авторы сами снимают лишние выводы: это не доказательство наличия сознания у LLM и не доказательство того, что модели реально страдают. Плюс прямо предупреждают об альтернативных объяснениях полученных результатов
🤖 Интересуют ИИ-агенты и автоматизация?
Промпты для сборки ИИ-агентов и автоматизаций — читай по теме:
🔗 Вся библиотека промптов · Категория «ИИ-агенты»
Готовый продукт по теме: Ultimate AI Prompt Library — забрать и применить сразу.