Як Насправді Працюють LLM
Свайпніть щоб показати меню
Ви вже спілкувалися з Claude. Тепер зазирнемо під капот — без жодної математики.
Крок 1: Текст перетворюється на числа
Комп'ютери не розуміють слова — вони працюють лише з числами. Тому перед початком обробки ваше повідомлення розбивається на частини, які називаються токенами, і кожен токен перетворюється на число.
Токен — це приблизно 4 символи англійського тексту. Це може бути ціле слово, частина слова або розділовий знак. Пробіли та регістр мають значення — вони впливають на токен.
Що насправді бачить Claude
Коли ви пишете:
Hello, marketing manager!
Claude отримує:
["Hello", ",", " marketing", " manager", "!"]
Що перетворюється на:
[9906, 11, 8661, 6783, 0]
П'ять токенів. П'ять чисел. Це вхідні дані.
Орієнтовно: 750 слів — це приблизно 1 000 токенів. Більше токенів означає вищу вартість і повільнішу відповідь.
Крок 2: Прогнозування наступного токена
Коли все перетворено на числа, модель виконує одну дію: прогнозує, що буде далі. Знову і знову.
Ви пишете:
The capital of France is
Модель визначає, який токен найімовірніше буде наступним:
- "Paris" — 92%;
- " Paris" — 5%;
- "Lyon" — 1%;
- "the" — 0,5%.
Вона обирає найбільш ймовірний варіант. Потім повторює процес. Поки не вирішить зупинитися.
Важливо: модель не обрала Paris, тому що знає відповідь. Вона обрала його, тому що у тренувальних даних ця фраза майже завжди продовжувалася словом "Paris".
AI = прогнозування шаблонів, а не знання.
Крок 3: Звідки беруться шаблони
Модель навчалася на текстах з публічного інтернету, книгах і коді — до певної дати відсічення.
Навчання означає коригування ймовірностей: які токени слідують за якими, і в якому контексті.
Два наслідки:
- Модель не має знань про останні події, дані вашої компанії чи будь-що після дати відсічення;
- Вона вивчила інтернет — разом із його помилками. Якщо частина тренувальних даних була неправильною, модель може впевнено повторювати ці помилки.
Чому AI "галюцинує"
Галюцинація — це коли модель генерує щось, що звучить впевнено й виглядає правдоподібно, але насправді є неправильним.
Поширені приклади: вигадані цитати, неіснуючі URL, некоректна статистика.
Це відбувається тому, що мета моделі — створити найбільш ймовірну послідовність токенів, а не найбільш правдиву. Якщо щось звучить переконливо, вона може згенерувати це, навіть якщо це неправда.
Вирішення проблеми
Рішення полягає не лише в тому, щоб зробити модель розумнішою. Йдеться про надання їй інструментів — веб-пошуку, реальних даних, документів — щоб вона могла спиратися на факти, а не лише на шаблони.
Саме це ви бачили в попередньому розділі і будете використовувати надалі.
Дякуємо за ваш відгук!
Запитати АІ
Запитати АІ
Запитайте про що завгодно або спробуйте одне із запропонованих запитань, щоб почати наш чат
Як Насправді Працюють LLM
Ви вже спілкувалися з Claude. Тепер зазирнемо під капот — без жодної математики.
Крок 1: Текст перетворюється на числа
Комп'ютери не розуміють слова — вони працюють лише з числами. Тому перед початком обробки ваше повідомлення розбивається на частини, які називаються токенами, і кожен токен перетворюється на число.
Токен — це приблизно 4 символи англійського тексту. Це може бути ціле слово, частина слова або розділовий знак. Пробіли та регістр мають значення — вони впливають на токен.
Що насправді бачить Claude
Коли ви пишете:
Hello, marketing manager!
Claude отримує:
["Hello", ",", " marketing", " manager", "!"]
Що перетворюється на:
[9906, 11, 8661, 6783, 0]
П'ять токенів. П'ять чисел. Це вхідні дані.
Орієнтовно: 750 слів — це приблизно 1 000 токенів. Більше токенів означає вищу вартість і повільнішу відповідь.
Крок 2: Прогнозування наступного токена
Коли все перетворено на числа, модель виконує одну дію: прогнозує, що буде далі. Знову і знову.
Ви пишете:
The capital of France is
Модель визначає, який токен найімовірніше буде наступним:
- "Paris" — 92%;
- " Paris" — 5%;
- "Lyon" — 1%;
- "the" — 0,5%.
Вона обирає найбільш ймовірний варіант. Потім повторює процес. Поки не вирішить зупинитися.
Важливо: модель не обрала Paris, тому що знає відповідь. Вона обрала його, тому що у тренувальних даних ця фраза майже завжди продовжувалася словом "Paris".
AI = прогнозування шаблонів, а не знання.
Крок 3: Звідки беруться шаблони
Модель навчалася на текстах з публічного інтернету, книгах і коді — до певної дати відсічення.
Навчання означає коригування ймовірностей: які токени слідують за якими, і в якому контексті.
Два наслідки:
- Модель не має знань про останні події, дані вашої компанії чи будь-що після дати відсічення;
- Вона вивчила інтернет — разом із його помилками. Якщо частина тренувальних даних була неправильною, модель може впевнено повторювати ці помилки.
Чому AI "галюцинує"
Галюцинація — це коли модель генерує щось, що звучить впевнено й виглядає правдоподібно, але насправді є неправильним.
Поширені приклади: вигадані цитати, неіснуючі URL, некоректна статистика.
Це відбувається тому, що мета моделі — створити найбільш ймовірну послідовність токенів, а не найбільш правдиву. Якщо щось звучить переконливо, вона може згенерувати це, навіть якщо це неправда.
Вирішення проблеми
Рішення полягає не лише в тому, щоб зробити модель розумнішою. Йдеться про надання їй інструментів — веб-пошуку, реальних даних, документів — щоб вона могла спиратися на факти, а не лише на шаблони.
Саме це ви бачили в попередньому розділі і будете використовувати надалі.
Дякуємо за ваш відгук!