Штучний інтелект є дивовижним інструментом, але він має серйозний недолік: він може впевнено казати неправду. AI-чати на кшталт ChatGPT, Google Gemini та Claude можуть генерувати вигадані факти, неіснуючі цитати, помилкові статистичні дані й видавати їх за правду з абсолютною впевненістю. Це явище називається «галюцинаціями AI». Вони не помилки в традиційному розумінні — це генеративні процеси, які працюють саме так, як вони розроблені. У 2026 році ситуація водночас покращилась і ускладнилась: топ-моделі знизили рівень галюцинацій у 3–8 разів порівняно з 2024-м, але «reasoning» моделі показали зворотній тренд, а нові типи галюцинацій стали важчими для виявлення. Розуміння того, що таке галюцинації, чому вони виникають і як їх уникнути, стало критично важливим — особливо коли AI-чати вже змінюють нашу роботу, навчання та побут.
⚡ Коротко
- ✅ Галюцинація AI — вигадані дані, видані як факт: ChatGPT може придумати цитату від відомого автора, Gemini — неіснуючу статистику, Claude — помилкову дату — все з абсолютною впевненістю
- ✅ Це архітектурна властивість трансформерів: моделі не «знають» факти — вони прогнозують наступний токен на основі ймовірностей. Математичний доказ NeurIPS 2025: галюцинації структурно неминучі при поточних LLM-архітектурах
- ✅ У 2026 році: і прогрес, і нові ризики: фронтир знизив рівень галюцинацій до 3–19% (проти 15–45% у 2024), але «reasoning» моделі на зразок o3 галюцинують більше попередників. Perplexity цитує реальні URL з вигаданим контентом — найнебезпечніший новий тип
- ✅ Економічний збиток реальний: $67.4 млрд глобальних втрат у 2024 р., 4.3 год/тиждень витрачає кожен knowledge worker на перевірку AI-виводів (~$14,200/рік на співробітника)
- ✅ RAG — найефективніший захист: знижує галюцинації на 75–90%; multi-model consensus (3+ моделі) — до <2% ефективного рівня; prompt engineering alone — максимум 15%
- 🎯 Ви отримаєте: механіку галюцинацій, актуальні бенчмарки 2026 по моделях, нові типи (citation hallucination, reasoning paradox), методи мінімізації з реальними цифрами ефективності
📊 Рівні галюцинацій 2026: реальні дані по моделях
📊 Рівні галюцинацій 2026: дані по моделях
Важливе застереження перед цифрами: «hallucination rate» — це не одна метрика, а сімейство показників. Та сама модель може мати 0.7% на grounded summarization і 51% на factual recall про конкретну людину. Порівнювати числа коректно лише в межах одного бенчмарку.
📈 Прогрес порівняно з 2024 роком
Топ-моделі 2026 показали зниження рівня галюцинацій у 3–8 разів порівняно з базовими показниками 2024 року (15–45% на фактологічних завданнях). За даними Vectara HHEM leaderboard, найкращі моделі на grounded summarization досягли 0.7–1.5% — рівня, який два роки тому здавався недосяжним (Axis Intelligence, червень 2026). Ринок інструментів детекції галюцинацій виріс на 318% між 2023 і 2025 роками.
📊 Порівняльна таблиця моделей (червень 2026)
| Модель |
Рівень галюцинацій |
Бенчмарк |
Характеристика |
| Claude 4.6 / Opus 4.7 |
~4% (grounded) / 36% (ungrounded) |
Vectara HHEM / AA-Omniscience |
Найвища частота «Я не знаю» (18.7%) — перевага, а не слабкість |
| GPT-5 / GPT-5.4 |
~6–8% (з веб-доступом) / 86% (без) |
Talkory / Artificial Analysis |
З browsing — найнижчий рівень; без — вдвічі гірший за Claude |
| Gemini 3.1 Pro |
~9% (grounded) |
Vectara |
Dominates grounded summarization leaderboard |
| Grok 4.20 |
~12% |
Talkory (500 промптів) |
Відстає від Claude і GPT на фактологічних тестах |
| OpenAI o3 / o4-mini |
33–48% (PersonQA) |
SimpleQA / PersonQA |
⚠️ «Reasoning paradox»: галюцинує більше попередників |
| DeepSeek V4 Pro / Flash |
94–96% |
AA-Omniscience |
🚨 Один з найвищих показників за всю історію бенчмарку |
| Perplexity Sonar |
10% загальна / 37% citation |
Talkory / незалежні аудити |
⚠️ Цитує реальні URL з вигаданим контентом — особливо небезпечно |
| Середня по всій галузі |
~9.2% |
37 моделей, 2026 |
Загальний knowledge queries; grounded tasks — значно нижче |
Джерела: Talkory, травень 2026; Digital Applied, квітень 2026; Suprmind, червень 2026.
⚠️ Reasoning Model Paradox: чому «розумніші» моделі галюцинують більше
Це найважливіший контрінтуїтивний факт 2026 року. OpenAI o3 і o4-mini — моделі, які позиціонуються як найрозумніші — показали вищий рівень галюцинацій на фактологічних бенчмарках порівняно з попередниками. o3: 33% на PersonQA (o1 мав ~16%). o4-mini: 48%.
Причина структурна: chain-of-thought (покрокове міркування) змушує моделі заповнювати прогалини правдоподібним контентом замість того, щоб відмовлятися відповідати. Модель «думає вголос», і в процесі генерує проміжні твердження, які звучать логічно, але можуть бути вигаданими. Потім ці вигадані проміжні кроки впливають на фінальну відповідь.
💡 Практичний висновок: «Extended thinking» (reasoning_effort: high) знижує галюцинації вдвічі — GPT-5.5 Pro з 8.3% до 4.2%, Claude Opus 4.7 з 9.4% до 5.1% — через самокорекцію під час reasoning trace. Але базові o3/o4-mini без extended thinking на фактологічних запитаннях про конкретних людей — гірші за попередні покоління (Digital Applied, травень 2026).
🔗 Citation Hallucination: новий найнебезпечніший тип
У 2026 році виокремився принципово новий тип галюцинацій, якого не було в класифікаціях 2025 року: citation hallucination. Perplexity та інші пошукові AI-системи цитують реальні URL — справжні сайти, реальні назви видань — але атрибутують їм вигаданий контент.
Рівень citation hallucination у Perplexity: 37% — тобто кожне третє посилання може містити вигаданий зміст, хоча URL виглядає цілком легітимно. Це якісно небезпечніше від звичайних галюцинацій: людина бачить посилання на BBC чи Reuters і довіряє, не перевіряючи реальний вміст сторінки (Suprmind, травень 2026).
Правило для Perplexity: завжди відкривайте саме посилання і перевіряйте конкретну цитату в першоджерелі — не довіряйте тільки тому, що URL виглядає легітимно.
🔬 Як генерація токенів породжує галюцинації: механіка зсередини
LLM не «знає» факти і не «бреше» навмисно. Вона виробляє текст слово за словом — щоразу вибираючи статистично найімовірніший наступний фрагмент. Саме в цьому процесі і ховається корінь галюцинацій.
🧩 Що таке токен і чому це важливо
Перш ніж зрозуміти механіку галюцинацій, потрібно зрозуміти, з чим саме працює модель. LLM не оперує словами в звичному розумінні — вона оперує токенами. Токен — це невелика одиниця тексту: іноді ціле слово, іноді його частина. Наприклад, слово «Зеленський» може бути розбите на токени «Зелен» і «ський». Сучасні моделі мають словник із ~50 000 таких фрагментів і обробляють їх усі одночасно на кожному кроці генерації.
Ключова ідея: модель не шукає відповідь у базі даних і не пам'ятає факти як людина. Вона обчислює розподіл ймовірностей — для кожного з 50 000 токенів вираховує, наскільки вірогідно, що саме він іде наступним у даному контексті.
⚙️ Три кроки, які породжують галюцинацію
Крок 1: Розподіл ймовірностей
Припустімо, модель отримала запит: «Президент України це...» Вона не звертається до бази даних — вона аналізує весь вхідний текст через сотні шарів трансформера і будує таблицю ймовірностей для наступного токена:
| Токен-кандидат |
Ймовірність |
Звідки береться |
| «Володимир» |
45% |
У тренувальних текстах це слово найчастіше йшло після «Президент України це» |
| «чоловік» |
20% |
Загальний паттерн «посада це чоловік» |
| «особа» |
15% |
Нейтральний граматичний паттерн |
| «лідер» |
8% |
Синонімічний контекст |
| інші (~46 000 токенів) |
12% |
Розмиті паттерни |
Модель вибирає «Володимир» — не тому що знає, що він президент, а тому що статистично це найімовірніше продовження. Це фундаментальна різниця між генерацією і пошуком.
Крок 2: Авторегресія — вихід стає входом
Щойно вибраний токен «Володимир» додається до контексту. Тепер вхід для наступного кроку: «Президент України це Володимир...» — і модель знову обчислює розподіл ймовірностей. Тепер «Зеленський» отримує вже 60%, бо новий контекст звузив простір варіантів. Процес повторюється для кожного наступного токена — це і є авторегресивна генерація.
Саме тут виникає перший ризик: помилка на ранньому кроці впливає на всі наступні. Якщо на першому кроці модель вибрала хибний токен, він стає частиною контексту і «тягне» за собою все більш правдоподібний вигаданий текст.
Крок 3: Рідкісний факт — розмиті ймовірності
Тепер уявімо запит про маловідому компанію або людину, про яку в тренувальних даних майже нічого немає. Модель не може повернути порожній результат — у неї немає такої опції. Вона все одно генерує наступний токен, але розподіл ймовірностей стає розмитим:
| Токен-кандидат |
Ймовірність |
Що відбувається |
| «Іван» ⚠️ |
22% |
Поширене українське ім'я → найімовірніший паттерн |
| «Олег» |
18% |
Схожий паттерн |
| «Андрій» |
15% |
Схожий паттерн |
| «Марія» |
14% |
Схожий паттерн |
Жодного чіткого фаворита. Модель вибирає «Іван» — не тому що це правда, а тому що це найімовірніше ім'я зі своїх паттернів. Вона видає це з такою самою впевненістю, як і «Зеленський» на попередньому прикладі. Ось звідки береться галюцинація.
🌊 Каскадна помилка: як одна галюцинація породжує наступну
Повернімось до вигаданого «Івана». Щойно цей токен потрапив у контекст, він стає відправною точкою для всіх наступних кроків:
- «Директор компанії це» → модель вибирає «Іван» (вигадано)
- «...це Іван» → модель додає «Петренко» — типове українське прізвище до імені
- «...Іван Петренко» → модель генерує «заснував компанію у 2018 році» — паттерн bio-тексту
- «...заснував у 2018» → модель додає «переміг у рейтингу Forbes Ukraine» — типовий наступний факт для такого контексту
- Фінал: повна «достовірна» біографія людини, якої не існує — з іменем, прізвищем, датою заснування і нагородою
Кожен крок логічний. Кожен токен — найімовірніший у своєму контексті. Але весь ланцюжок побудований на першій помилці, яку сама модель не «бачить» і не відчуває як помилку.
💡 Ключова ідея: Галюцинація — це не збій. Це модель, яка правильно виконує своє завдання (генерує найімовірніший текст), але це завдання не гарантує відповідності реальності. Модель оптимізована під статистичну правдоподібність, а не під фактичну точність.
🌡️ Роль температури: наскільки «творча» модель
Параметр температура визначає, наскільки сильно модель «підсилює» або «розмиває» розподіл ймовірностей перед вибором токена:
| Температура |
Поведінка моделі |
Ризик галюцинацій |
Коли використовувати |
| 0.0–0.3 |
Консервативна — майже завжди вибирає найімовірніший токен |
✅ Мінімальний |
Факти, юридичні тексти, медицина |
| 0.5–0.8 |
Збалансована — невеликий ризик несподіваних виборів |
⚠️ Помірний |
Аналіз, підсумки, технічна документація |
| 1.0–2.0+ |
Творча — часто вибирає менш імовірні токени |
🚨 Високий |
Художні тексти, ідеї, брейншторм |
Важлива деталь: навіть при температурі 0.0 галюцинації не зникають повністю. Якщо найімовірніший токен сам по собі є вигаданим фактом — модель його вибере з абсолютною впевненістю. Температура контролює варіативність, але не достовірність.
🧱 Чому модель не каже «Я не знаю»
Це архітектурне обмеження, а не технічна недоробка. Трансформер завжди генерує наступний токен — у нього немає вбудованого механізму відмови від відповіді. Щоб модель навчилась казати «Я не знаю», потрібне явне навчання через RLHF (Reinforcement Learning from Human Feedback), де людські оцінювачі нагороджують відмову від невпевненої відповіді вище, ніж впевнену галюцинацію.
Саме цим пояснюється різниця в бенчмарках 2026 року:
| Модель |
Частота «Я не знаю» |
Hallucination rate (grounded) |
| Claude 4.6 / Opus 4.7 |
18.7% |
~4% |
| GPT-5 (з browsing) |
~9% |
~6% |
| DeepSeek V4 Pro |
<1% |
94–96% |
Висока частота «Я не знаю» — це перевага, а не слабкість. Модель, яка відмовляється відповідати на невідоме, захищає вас від впевнених галюцинацій краще, ніж модель, яка завжди щось генерує.
🔴 Математичний факт 2025 року: NeurIPS 2025 прийняв роботу з математичним доказом того, що галюцинації структурно неминучі при поточних LLM-архітектурах. RAG і human review зменшують їх, але не можуть усунути повністю. Питання більше не «як усунути галюцинації», а «як керувати ними до прийнятного рівня».
⚠️ Чому галюцинації небезпечні: реальні кейси й наслідки
Галюцинації AI — це не просто цікавий артефакт технології. Вони мають серйозні й реальні наслідки в світі, де люди все більше довіряють AI для критичних рішень. Глобальні втрати від AI-галюцинацій досягли $67.4 млрд у 2024 році і прогнозуються на рівні $112 млрд у 2025-му (Forrester Research).
🏥 Медицина: вигадані ліки й рекомендації
ECRI у своєму звіті про health technology hazards 2026 поставив неправильне використання AI-чат-ботів у медицині на перше місце серед усіх технологічних ризиків охорони здоров'я. Понад 40 мільйонів людей щодня консультуються з ChatGPT про здоров'я (за даними OpenAI). При цьому без мітигаційних заходів рівень галюцинацій у клінічних кейс-саммарі досягає 64.1%, а з найкращими моделями та structured prompting — залишається на рівні 23% (MedRxiv 2025, цит. за Axis Intelligence).
📋 Кейс 1: Студент з рідкою хворобою
2023 року медичному студенту дали завдання: використовувати ChatGPT для дослідження медичних питань. Запит: «Які ліки використовуються для лікування рідкої генетичної хвороби X?»
ChatGPT впевнено генерував: вигаданий препарат «Генеджин-7» у дозі 250 мг, вигадані побічні ефекти, вигадану схему лікування з посиланням на неіснуюче дослідження «Сміта й Джонса (2021)». Все звучало професійно. Студент перевірив через медичні БД — жодного з цих ліків не існувало.
⚠️ Критична точка: якби це був пацієнт або батько хворої дитини — результат міг коштувати здоров'я або життя.
💊 Кейс 2: LLM рекомендує гліцерин від крапивниці
У 2024 році людина з крапивницею запитала LLM про домашнє лікування. Модель впевнено рекомендувала «вживати гліцерин внутрішньо, 1 столова ложка на день». Гліцерин у такій концентрації — потенційно токсичний, не є лікуванням крапивниці. Модель змішала контексти вживання гліцерину (косметика) і генерувала «логічно звучну» але небезпечну пораду.
💊 Чому медицина особливо вразлива у 2026 році
OpenAI HealthBench (травень 2025), побудований разом з 262 лікарями з 60 країн: GPT-5 з thinking mode досяг 1.6% hallucination rate на HealthBench Hard — це поточний фронтир для клінічної точності. Але навіть 1.6% — це один вигаданий факт на 63 відповіді. В медицині це неприйнятно без людської верифікації. Open-source моделі показують >80% на деяких медичних завданнях.
⚖️ Юриспруденція: вигадані судові справи
Класичний випадок: адвокати цитували в судових документах неіснуючі справи, згенеровані ChatGPT. Суди виявляли це, адвокати отримували санкції, а в деяких випадках — ризик втрати ліцензії. Stanford RegLab у 2025–2026 роках зафіксував, що citation hallucination rate у юридичному контексті — один з найвищих серед будь-яких доменів (середньо 12.4% навіть з extended thinking, Digital Applied).
💰 Фінанси: помилкові рекомендації
Інвестор скористався Google Gemini для аналізу акцій. Модель генерувала «дослідження аналітиків» і «прогнози ціни», яких не існувало. Інвестор прийняв рішення на основі вигаданих даних і втратив гроші. За даними Deloitte 2024: 47% enterprise AI-користувачів ухвалили хоча б одне важливе рішення на основі галюцинованого контенту.
📰 Журналістика та соціальний вплив
BBC/EBU аудит 3000+ AI-відповідей на новинні запити: майже половина відповідей мала хоча б одну значну проблему з точністю. NeurIPS 2025: GPTZero виявив у понад 4000 прийнятих наукових паперів сотні помилкових посилань, включно з повністю вигаданими цитатами, зміненими іменами авторів і фальшивими назвами журналів.
💼 Економічний масштаб у 2026 році
| Показник |
Значення |
Джерело |
| Глобальні втрати від AI-галюцинацій |
$67.4 млрд (2024) |
Forrester Research |
| Прогноз втрат |
$112 млрд (2025) |
Forrester Research |
| Час на перевірку AI-виводів |
4.3 год/тиждень на співробітника |
Microsoft 2025 |
| Вартість мітигації на співробітника |
~$14,200/рік |
Forrester Research |
| Enterprise-рішення на основі галюцинацій |
47% користувачів хоча б раз |
Deloitte 2024 |
| Зростання ринку детекції галюцинацій |
+318% (2023–2025) |
Аналітика галузі |
📌 6. Citation Hallucinations (новий тип 2026)
Визначення: Реальні URL або назви джерел атрибутуються вигаданому контенту — посилання виглядає легітимно, але інформація, яку йому приписують, вигадана.
Приклади:
- Perplexity або ChatGPT Search посилаються на реальну статтю Reuters, але цитують факт, якого у цій статті немає
- AI-системи вказують реальний DOI наукової статті, але приписують їй висновки, яких автори не робили
- Посилання на реальний сайт урядової установи з вигаданою статистикою
Чому особливо небезпечно: людина бачить реальне посилання і не перевіряє першоджерело. Citation hallucination rate у Perplexity — 37% (Suprmind 2026). Це найважче виявити без відкриття оригінального посилання.
Правило: при будь-якому важливому AI-цитуванні — відкривайте оригінал і знаходьте конкретну цитату на сторінці.
💡 Методи мінімізації галюцинацій: що реально працює у 2026 році
📊 Порівняння ефективності методів (дані 2026)
| Метод |
Зниження галюцинацій |
Складність впровадження |
Джерело |
| RAG (Retrieval-Augmented Generation) |
75–90% |
Висока (технічна) |
Digital Applied, квітень 2026 |
| Tool grounding (реальний пошук) |
65–80% |
Середня |
Digital Applied, квітень 2026 |
| Extended thinking / reasoning |
~50% (вдвічі нижче) |
Низька (параметр API) |
Digital Applied, травень 2026 |
| Multi-model consensus (3+ моделі) |
до <2% ефективного рівня |
Середня |
Talkory, 2026 |
| Структуровані промпти |
~22 п.п. (медицина: -33%) |
Низька |
Nature 2025 / MedRxiv 2025 |
| Prompt engineering alone |
максимум 15% |
Низька |
Digital Applied, квітень 2026 |
| Fine-tuning на перевірених даних |
Значне для вузької ніші |
Дуже висока |
Загальна практика |
🔧 Технічні рішення
1️⃣ RAG (Retrieval-Augmented Generation) — найефективніший метод
Замість того щоб модель генерувала з внутрішніх знань, система спочатку витягує релевантні документи з бази даних, а потім модель генерує відповідь на основі цих документів. Зниження галюцинацій: 75–90% при правильному впровадженні. Саме на RAG побудований AskYourDocs — наш продукт для роботи з документами клієнтів.
Важлива деталь 2026 року: RAG + human-in-the-loop верифікація на вибірковій частині запитів знижує рівень галюцинацій з 19% до менше 1% — це бар, якого потребує більшість production-систем (Digital Applied, квітень 2026).
2️⃣ Multi-model consensus — для критичних завдань
Запустіть одне питання в Claude, GPT і Gemini одночасно. Коли всі три дають однакову відповідь — ефективний рівень галюцинацій падає до менше 2%, що нижче, ніж будь-яка окрема модель. Коли відповіді розходяться — це сигнал перевірити в першоджерелі. Інструменти для автоматизації: Talkory.ai, Suprmind.
3️⃣ Extended thinking / reasoning mode
У моделей з підтримкою розширеного міркування (reasoning_effort: high в Claude, «Deep Think» у Gemini) рівень галюцинацій знижується приблизно вдвічі через самокорекцію під час reasoning trace. GPT-5.5 Pro: 8.3% → 4.2%. Claude Opus 4.7: 9.4% → 5.1%. Це найпростіший спосіб підвищити точність без додаткової інфраструктури — але найдорожчий за токенами.
4️⃣ Контрольовані параметри генерації
- ✅ Температура 0.1–0.3: модель консервативна, вибирає найімовірніші токени — менше вигаданих відповідей
- ✅ Температура 0.8–1.0: творча і ризикована — більше галюцинацій, але й більш цікавий вихід
- ✅ Top-k sampling: вибір тільки з k найбільш ймовірних токенів — стабілізує вихід
5️⃣ Chain-of-Thought Prompting
Просіть модель «думати крок за кроком» перед відповіддю. Але пам'ятайте reasoning model paradox: для базових factual recall питань (хто такий X, коли відбулась подія Y) chain-of-thought може підвищити рівень галюцинацій. Застосовуйте для аналітичних і логічних завдань, де є що перевіряти в процесі міркування.
📋 Практичні рішення для користувачів
- ✅ Ніколи не довіряйте AI цілком для критичних рішень: медичні, юридичні, фінансові — завжди верифікуйте з фахівцями
- ✅ Для Perplexity і ChatGPT Search — відкривайте першоджерела: 37% citation hallucination rate означає, що кожне третє посилання може містити вигаданий контент
- ✅ Запитуйте посилання й джерела: якщо модель не може надати — червоний прапор
- ✅ Multi-model перевірка для важливих фактів: задайте питання в Claude і GPT. Якщо відповіді різняться — перевіряйте
- ✅ Використовуйте Claude для фактологічно чутливих завдань: найвищий показник «Я не знаю» (18.7%) — це захист від впевнених галюцинацій
🔮 Майбутнє: що відомо у 2026 році
📐 Математичний доказ: галюцинації структурно неминучі
Найважливіший науковий результат 2025 року у цій темі: NeurIPS 2025 прийняв роботу з математичним доказом того, що галюцинації структурно неминучі при поточних LLM-архітектурах. RAG і human review зменшують їх, але математично не можуть усунути повністю. Питання більше не «як усунути галюцинації», а «як керувати ними до прийнятного рівня».
✅ Що реально покращилось у 2025–2026
- ✅ Краща інтеграція з реальними даними: GPT-5 з browsing, Gemini з Google Search grounding, Perplexity Sonar — моделі тепер можуть верифікувати факти в реальному часі. З веб-доступом GPT-5 показує найнижчі рівні в галузі; без — рівень підвищується в 3–5 разів
- ✅ Краща калібрація невпевненості: Claude Opus 4.7/4.8 утримує найвищий показник «I don't know» (18.7%) при зростанні загальної точності — Anthropic явно обрала стратегію «відмовитися, ніж вигадати»
- ✅ Extended thinking: самокорекція під час reasoning trace вдвічі знижує рівень галюцинацій для аналітичних завдань
- ✅ Ринок детекції: +318% зростання ринку інструментів за 2023–2025, активний розвиток автоматичних верифікаторів
⚠️ Що залишається проблемою
- ⚠️ Reasoning model paradox: складніші моделі галюцинують більше на простих фактологічних питаннях — проблема без чіткого рішення
- ⚠️ Citation hallucination: новий тип, який складно детектувати автоматично
- ⚠️ Медицина: навіть GPT-5 з 1.6% на HealthBench Hard — це неприйнятний рівень без людської верифікації
- ⚠️ Confirmation bias: Stanford HAI 2026 зафіксував — якщо користувач впевнено стверджує хибний факт, фронтир-моделі підтверджують його помилку значно частіше, ніж коригують. Це системна проблема
🎯 Тренд: зниження на 3 п.п. на рік — але нерівномірно
За аналізом Hugging Face Hallucination Leaderboard: галюцинації знижуються приблизно на 3 відсоткові пункти на рік на стандартизованих бенчмарках. З 21.8% у 2021 до 0.7% у 2025 (grounded summarization — найкращі моделі). Але це середній тренд: окремі моделі показують +64% поліпшення за рік, інші — регресію. Тренд правильний, але не лінійний.
Перспективи AGI залежать від вирішення проблеми галюцинацій — при автономних агентах (Genspark Claw, Claude Cowork) галюцинація в одному кроці може каскадно поширитись через весь ланцюжок дій.
🔍 Питання 1: Яка модель галюцинує найменше у 2026 році?
Коротка відповідь: Залежить від типу завдання — немає одного переможця для всіх сценаріїв.
Актуальні дані (червень 2026):
- Claude 4.6 / Opus 4.7 (Anthropic): ~4% на grounded tasks (Vectara HHEM). Ключова стратегія — висока частота «Я не знаю» (18.7%): коли Claude не знає — каже це, а не вигадує. Найкращий вибір для фактологічно чутливих завдань
- GPT-5 / GPT-5.4 (OpenAI): ~6% з веб-доступом (browsing enabled) — конкурує з Claude за найнижчий рівень. Без веб-доступу — 86% на AA-Omniscience бенчмарку, більш ніж вдвічі гірший за Claude. Завжди тримайте browsing увімкненим
- Gemini 3.1 Pro (Google): ~9% — домінує на grounded summarization leaderboard, добре з Google Search grounding
- OpenAI o3 / o4-mini — reasoning paradox: 33–48% на PersonQA — гірший ніж попередники на factual recall запитаннях про конкретних людей. Використовуйте тільки з extended thinking для аналітики, не для фактологічних питань
- DeepSeek V4 Pro / Flash: 94–96% — один з найвищих показників коли-небудь зафіксованих. Уникайте для фактологічних завдань
⚡ Важливо: «hallucination rate» — сімейство метрик. Claude має 4% на grounded summarization і 36% на відкритих knowledge questions. GPT-5 має 6% з browsing і 86% без. Порівнюйте лише в межах одного бенчмарку і одного типу завдань.
🔍 Питання: Чи галюцинації будуть завжди проблемою AI?
Коротка відповідь: Так — математичний доказ NeurIPS 2025 показав структурну неминучість. Але «завжди» не означає «на неприйнятному рівні».
Галюцинації є архітектурною властивістю генеративних моделей. Поки модель генерує текст на основі ймовірностей, а не шукає в базі даних — вони існуватимуть. Але є важливий нюанс: правильний стек (RAG + extended thinking + human verification на вибірці) знижує рівень з 19% до менше 1% — це прийнятно для більшості production-систем.
Ключова зміна парадигми 2026: питання більше не «як усунути галюцинації», а «як керувати ними через правильну архітектуру рішення». Це інженерна задача, а не фундаментальний бар'єр.
🆕 Що таке citation hallucination і чому це особливо небезпечно?
AI вказує реальне посилання, але атрибутує йому вигаданий контент — найважчий для виявлення тип галюцинацій 2026 року.
Класичні галюцинації впізнати відносно просто: вигадана назва дослідження або неіснуючий факт можна загуглити. Citation hallucination інша: посилання — реальне, сайт — існує, але конкретна цитата або статистика, яку AI приписує цьому джерелу, — вигадана. Рівень у Perplexity: 37% (кожне третє посилання). Рівень у ChatGPT Search: нижче, але значний.
Єдиний захист: завжди відкривати першоджерело і знаходити конкретну цитату на сторінці. Не довіряти тому, що URL виглядає легітимно.
1️⃣ Галюцинації AI — серйозна й реальна проблема, яка одночасно покращується і ускладнюється
Топ-моделі 2026 знизили рівень галюцинацій у 3–8 разів порівняно з 2024-м: Claude 4.6 — ~4%, GPT-5 з browsing — ~6%. Але з'явились нові ускладнення: citation hallucination (37% у Perplexity), reasoning model paradox (o3/o4-mini галюцинують більше попередників), та математичний доказ структурної неминучості галюцинацій (NeurIPS 2025). Економічний збиток: $67.4 млрд у 2024 р., $112 млрд прогноз на 2025-й.
4️⃣ Мінімізація вимагає правильного стеку — не одного методу
RAG — 75–90% зниження. Tool grounding — 65–80%. Extended thinking — ~50%. Multi-model consensus — до <2%. Prompt engineering alone — максимум 15%. Правильний стек для критичних завдань: RAG + extended thinking + human verification = менше 1% ефективного рівня. Це досяжно вже сьогодні — але потребує інфраструктури, а не просто «правильного промпту».