dimabagow

Великі мовні моделі

Сучасні LLM не думають словами. Вони працюють із векторами, ймовірнісними розподілами та матрицями ваг.

Будь-який текст для моделі — це просто послідовність токенів, що трансформується через мільярди параметрів у ймовірнісний розподіл наступного токена.

Але саме ця математична абстракція породжує феномен, який ми називаємо розумінням.

### Контекстне вікно

Одна з головних характеристик LLM — обсяг контекстного вікна.

Це розмір робочої пам’яті моделі під час генерації. Все, що виходить за межі контексту, модель «забуває».

Сучасні архітектури активно розширюють контекст: від кількох тисяч токенів до мільйонів.

Однак просте збільшення контексту породжує нові проблеми:

* **Lost in the Middle:** модель чудово пам’ятає початок і кінець контексту, але може «втрачати» деталі з середини;
* **Квадратична складність уваги:** стандартний механізм Attention вимагає $O(N^2)$ ресурсів від довжини контексту, що змушує шукати нові архітектурні оптимізації (FlashAttention, RoPE, Sparse Attention).

### RAG (Retrieval-Augmented Generation)

Моделі не зберігають усю інформацію у вагах. Знання у вагах зафіксовані на момент навчання.

Для вирішення цієї проблеми використовується RAG:

1. Документи розбиваються на чанки.
2. Чанки перетворюються на ембедінги (векторні представлення).
3. Вектори зберігаються у векторну базу даних (Chroma, Qdrant, Milvus, pgvector).
4. На запит користувача система шукає найбільш близькі за значенням вектори.
5. Знайдений контекст підставляється у промпт моделі.

RAG дозволяє збагатити модель свіжими приватними даними без дорогого донавчання.

### Fine-Tuning та LoRA

Базова модель (Base Model) вміє лише продовжувати текст. Щоб перетворити її на корисного асистента (Instruct Model), застосовують вирівнювання (Alignment):

* **SFT (Supervised Fine-Tuning):** навчання на парах «запитання-відповідь»;
* **RLHF / DPO (Direct Preference Optimization):** навчання на вподобаннях людини для зниження галюцинацій та шкідливих відповідей.

Для ефективного донавчання без перенавчання мільярдів ваг використовують **LoRA (Low-Rank Adaptation)** — впровадження невеликих низькорангових матриць у шари уваги. Це знижує вимоги до відеопам’яті у десятки разів.

### Майбутнє LLM

Розвиток іде у бік:

* **Мультимодальності:** одночасна робота з текстом, кодом, аудіо, відео та зображеннями в єдиному латентному просторі;
* **Агентних систем:** моделі перестають бути просто чат-ботами і стають агентами, здатними викликати зовнішні API, виконувати код, планувати завдання та використовувати інструменти;
* **Локального виконання:** оптимізовані квантовані моделі (GGUF, AWQ) запускаються безпосередньо на пристроях користувачів (ноутбуки, смартфони, edge-залізо).

LLM — це не остаточний ШІ, але найважливіша цеглина у фундаментальній інфраструктурі нового цифрового світу.