Великі мовні моделі
Сучасні LLM не думають словами. Вони працюють із векторами, ймовірнісними розподілами та матрицями ваг.
Будь-який текст для моделі — це просто послідовність токенів, що трансформується через мільярди параметрів у ймовірнісний розподіл наступного токена.
Але саме ця математична абстракція породжує феномен, який ми називаємо розумінням.
### Контекстне вікно
Одна з головних характеристик LLM — обсяг контекстного вікна.
Це розмір робочої пам’яті моделі під час генерації. Все, що виходить за межі контексту, модель «забуває».
Сучасні архітектури активно розширюють контекст: від кількох тисяч токенів до мільйонів.
Однак просте збільшення контексту породжує нові проблеми:
* **Lost in the Middle:** модель чудово пам’ятає початок і кінець контексту, але може «втрачати» деталі з середини;
* **Квадратична складність уваги:** стандартний механізм Attention вимагає $O(N^2)$ ресурсів від довжини контексту, що змушує шукати нові архітектурні оптимізації (FlashAttention, RoPE, Sparse Attention).
### RAG (Retrieval-Augmented Generation)
Моделі не зберігають усю інформацію у вагах. Знання у вагах зафіксовані на момент навчання.
Для вирішення цієї проблеми використовується RAG:
1. Документи розбиваються на чанки.
2. Чанки перетворюються на ембедінги (векторні представлення).
3. Вектори зберігаються у векторну базу даних (Chroma, Qdrant, Milvus, pgvector).
4. На запит користувача система шукає найбільш близькі за значенням вектори.
5. Знайдений контекст підставляється у промпт моделі.
RAG дозволяє збагатити модель свіжими приватними даними без дорогого донавчання.
### Fine-Tuning та LoRA
Базова модель (Base Model) вміє лише продовжувати текст. Щоб перетворити її на корисного асистента (Instruct Model), застосовують вирівнювання (Alignment):
* **SFT (Supervised Fine-Tuning):** навчання на парах «запитання-відповідь»;
* **RLHF / DPO (Direct Preference Optimization):** навчання на вподобаннях людини для зниження галюцинацій та шкідливих відповідей.
Для ефективного донавчання без перенавчання мільярдів ваг використовують **LoRA (Low-Rank Adaptation)** — впровадження невеликих низькорангових матриць у шари уваги. Це знижує вимоги до відеопам’яті у десятки разів.
### Майбутнє LLM
Розвиток іде у бік:
* **Мультимодальності:** одночасна робота з текстом, кодом, аудіо, відео та зображеннями в єдиному латентному просторі;
* **Агентних систем:** моделі перестають бути просто чат-ботами і стають агентами, здатними викликати зовнішні API, виконувати код, планувати завдання та використовувати інструменти;
* **Локального виконання:** оптимізовані квантовані моделі (GGUF, AWQ) запускаються безпосередньо на пристроях користувачів (ноутбуки, смартфони, edge-залізо).
LLM — це не остаточний ШІ, але найважливіша цеглина у фундаментальній інфраструктурі нового цифрового світу.