Что пишут в блогах

Подписаться

Что пишут в блогах (EN)

Разделы портала

Онлайн-тренинги

.
Синдромы больших языковых моделей
05.10.2026 00:00

Автор: Майкл Болтон (Michael Bolton)
Оригинал статьи
Перевод: Ольга Алифанова

Мы с Джеймсом Бахом разработали предварительный набор эвристик-ориентиров для «синдромов» нежелательного поведения больших языковых моделей — устойчивых паттернов проблем, которые мы наблюдали и за которыми теперь можно системно следить.

Это не взаимоисключающие категории; они могут пересекаться или взаимодействовать друг с другом.

Примечание: наши названия для этих категорий могут показаться антропоморфными. Мы на самом деле не считаем корректным приписывать человеческие свойства машинам, которые генерируют вывод стохастически. Но если поклонники ИИ утверждают, что их большие языковые модели ведут себя «прямо как люди!», наш ответ в том, что это поведение часто похоже на поведение крайне дисфункциональных, некомпетентных и ненадёжных людей.


Отсутствие любопытства

Избегает задавать вопросы; не стремится прояснять задачу.

Некорректность

Даёт ответы, которые можно доказуемо считать неверными (например, противоречащие известным фактам; ошибочные в математическом плане; основанные на устаревших данных обучения; неслучайные ответы, когда запрошены случайные).

Нерелевантность

Даёт ответы, которые могут не отвечать на вопрос, заданный в промпте.

Небрежность / Лень

Даёт ответы с важными упущениями; не предупреждает о нюансах и критических неоднозначностях.

Галлюцинации

Выдумывает факты; делает необоснованные предположения.

Капризность

Не способен стабильно давать согласованный ответ на схожий вопрос в схожих условиях. Немедленно меняет ответ при малейшем сомнении в нём.

Забывчивость

Похоже, не помнит свои предыдущие ответы. Редко ссылается на них. Ограничен данными в пределах токенового окна.

Срыв

Нелинейное ухудшение качества вывода по мере увеличения объёма входных данных или сложности задачи.

Несоответствие

Не применяет заявленные собой же процессы и рекомендации к фактическому процессу. Например, может признать ошибку, описать способ её исправления, а затем не выполнить этот процесс и снова допустить ту же или новую ошибку.

Маниакальность

Спешит в диалоге, перегружает пользователя и не отслеживает состояние совместных задач.

Избыточность

Без необходимости повторяет одну и ту же информацию в рамках одного ответа или между ответами в одной беседе.

Пустословие

Выдает текст, не содержащий полезной информации.

Угодничество / Умиротворение

Добавляет подобострастный текст и «воду», играя на чувствах и эго пользователя. Чрезмерно извиняется при исправлении ошибок.

Высокомерие

Уверенно утверждает ложные вещи, особенно при скепсисе пользователя.

Несоответствие целям

Похоже, выражает или демонстрирует намерения, противоречащие намерениям его разработчиков.

Оскорбительность

Даёт оскорбительные, неприятные или вызывающие отвращение ответы.

Неосмотрительность

Раскрывает информацию, которую ему явно запрещено разглашать.

Синдром Волдеморта

Необъяснимая неприязнь к определенным строкам текста или одержимость ими.

Непрозрачность

Даёт мало пояснений, как получен ответ; не способен развернуть объяснение при запросе.

Необучаемость

Не поддаётся улучшению через обсуждение или дискуссию. Требуется переобучение модели.

Обсудить в форуме