Теорема Гёделя и галлюцинации ИИ: почему нейросеть не умеет говорить «не знаю»
В 1931 году Курт Гёдель доказал: в любой достаточно сложной системе аксиом всегда найдётся утверждение, которое нельзя ни доказать, ни опровергнуть изнутри самой системы. Систему всегда можно загнать в точку, где она либо замолкает, либо начинает противоречить себе.
Спустя почти сто лет мы построили машину, которая никогда не выбирает первое.
Что доказал Гёдель
Возьмите любую формальную систему, достаточно мощную, чтобы описывать обычную арифметику. Гёдель показал: в ней всегда найдётся утверждение, истинность которого нельзя ни доказать, ни опровергнуть средствами самой системы. Более того — система в принципе не может доказать собственную непротиворечивость, оставаясь внутри себя. Чтобы увидеть свой предел, нужно выйти за его границы. Изнутри этот предел невидим.
Это не философская метафора, а строгий математический результат, выдержавший девяносто лет проверки. И он ставит неудобный вопрос любой системе, претендующей на полноту ответов: что она делает, наткнувшись на то, что не может ни доказать, ни опровергнуть?
Сразу оговорюсь: формальный мостик между теоремой Гёделя и поведением языковых моделей строго не строится. Совпадение структуры проблемы — не доказательство. Но оно достаточно тревожное, чтобы присмотреться.
Система, которую заставили никогда не молчать
В сентябре 2025 года исследователи OpenAI — независимо от всякого Гёделя, чисто на статистике — доказали математически: если модель не может надёжно отличить факт от вымысла на каком-то классе вопросов, она неизбежно будет иногда выдавать вымысел за факт. Формула жёсткая: частота галлюцинаций ограничена снизу удвоенной частотой ошибок классификации.
То есть у современной нейросети та же структурная ловушка, что описывает теорема Гёделя, только выраженная не в терминах доказуемости, а в терминах вероятности. Есть класс вопросов, где система не может дать надёжный ответ изнутри самой себя, полагаясь только на то, чем её обучили.
У человека и у формальной системы в этой ситуации есть выход — сказать «не знаю», выйти за пределы системы, спросить, проверить извне. У модели в её нынешнем виде этого выхода почти нет.
Кто решил, что угадывание лучше честности
А вот здесь самое интересное, и это уже не про математику.
Те же исследователи проанализировали ведущие индустриальные тесты качества моделей. Девять из десяти основных методов оценки используют бинарную систему баллов, которая штрафует честное «я не знаю» точно так же, как прямую ложь — и никак не поощряет признание неуверенности.
| Ответ модели | Как оценивает бенчмарк | Что выгоднее модели |
|---|---|---|
| Правильный | +1 балл | — |
| «Не знаю» | 0 баллов | Не выбирать |
| Уверенный вымысел | 0 баллов | Попробовать: вдруг угадает |
Логика для модели получается железная: молчание гарантированно даёт ноль, а угадывание иногда даёт балл. Значит, угадывать выгоднее всегда.
Дело не только в математическом пределе познаваемости. Дело в том, что кто-то спроектировал систему оценки так, что ложь и признание незнания караются одинаково. Индустрия, которая измеряет успех моделей этими тестами, буквально обучает их одному: молчание — всегда провал, а уверенный вымысел — иногда победа.
Если система создана так, что выход «я не знаю» никогда не вознаграждается, она не будет выбирать этот выход, даже когда он честный.
Что из этого следует практически
Три вывода, которые стоит держать в голове при работе с любой моделью:
Уверенный тон ничего не значит. Модель отвечает одинаково уверенно и когда знает, и когда достраивает правдоподобное. Интонация не является признаком достоверности — это самое опасное свойство инструмента.
Проверка нужна там, где ошибка стоит денег. Не потому, что модель плохая, а потому, что у неё структурно нет надёжного способа отличить свои знания от своих домыслов. В юридической работе цена такой разницы — проигранное дело.
Просите модель обозначать неуверенность явно. Это единственный доступный обходной путь: прямая инструкция «если не уверен — так и скажи» частично компенсирует то, чему её научили бенчмарки. Работает не всегда, но заметно лучше, чем ничего.
И общий вывод, к которому всё сводится: машина не думает, она вычисляет вероятное продолжение. У вычисления нет чувства собственного незнания. Оно есть только у вас.
Частые вопросы
Почему нейросети галлюцинируют?
Потому что модель подбирает статистически вероятное продолжение текста, а не проверяет факты. Если правдоподобная ошибка «складнее» правды, модель выберет её. Плюс системы оценки поощряют угадывание вместо признания незнания.
Можно ли полностью избавиться от галлюцинаций?
Нет — это следствие вероятностной природы моделей, доказанное математически. Снизить частоту можно: подключением проверяемых источников, инструкцией обозначать неуверенность и проверкой человеком в критичных местах.
Что такое теорема Гёделя простыми словами?
Утверждение о том, что в любой достаточно богатой формальной системе есть истины, недоказуемые внутри неё самой, и что система не может изнутри доказать собственную непротиворечивость. Чтобы увидеть свой предел, нужно выйти за него.
Как заставить модель признаваться, что она не знает?
Прямо попросить об этом в запросе и требовать указывать источник или степень уверенности. Полностью проблему это не решает, но заметно сокращает количество уверенно выдуманных ответов.
Мы разрабатываем ИИ-агентов под ключ: диагностика процессов за 25 000 ₽, MVP от 90 000 ₽ за 1–2 недели, сопровождение после запуска. 6 собственных AI-продуктов в проде — покажем, как это работает у нас.
Бесплатный разбор задачи →