dimabagow

Большие языковые модели

Современные LLM не думают словами. Они работают с векторами, вероятностными распределениями и матрицами весов.

Любой текст для модели — это просто последовательность токенов, трансформируемая через миллиарды параметров в вероятностное распределение следующего токена.

Но именно эта математическая абстракция порождает феномен, который мы называем пониманием.

### Контекстное окно

Одна из главных характеристик LLM — объем контекстного окна.

Это размер рабочей памяти модели во время генерации. Все, что выходит за пределы контекста, модель «забывает».

Современные архитектуры активно расширяют контекст: от нескольких тысяч токенов до миллионов.

Однако простое увеличение контекста порождает новые проблемы:

* **Lost in the Middle:** модель отлично помнит начало и конец контекста, но может «терять» детали из середины;
* **Квадратичная сложность внимания:** стандартный механизм Attention требует $O(N^2)$ ресурсов от длины контекста, что заставляет искать новые архитектурные оптимизации (FlashAttention, RoPE, Sparse Attention).

### RAG (Retrieval-Augmented Generation)

Модели не хранят всю информацию в весах. Знания в весах зафиксированы на момент обучения.

Для решения этой проблемы используется RAG:

1. Документы разбиваются на чанки.
2. Чанки превращаются в эмбеддинги (векторные представления).
3. Векторы сохраняются в векторную базу данных (Chroma, Qdrant, Milvus,pgvector).
4. На запрос пользователя система ищет наиболее близкие по смыслу векторы.
5. Найденный контекст подставляется в промпт модели.

RAG позволяет обогатить модель свежими приватными данными без дорогостоящего дообучения.

### Fine-Tuning и LoRA

Базовая модель (Base Model) умеет только продолжать текст. Чтобы превратить её в полезного ассистента (Instruct Model), применяют выравнивание (Alignment):

* **SFT (Supervised Fine-Tuning):** обучение на парах «вопрос-ответ»;
* **RLHF / DPO (Direct Preference Optimization):** обучение на предпочтениях человека для снижения галлюцинаций и вредных ответов.

Для эффективного дообучения без переобучения миллиардов весов используют **LoRA (Low-Rank Adaptation)** — внедрение небольших низкоранговых матриц в слои внимания. Это снижает требования к видеопамяти в десятки раз.

### Будущее LLM

Развитие идет в сторону:

* **Мультимодальности:** одновременная работа с текстом, кодом, аудио, видео и изображениями в едином латентном пространстве;
* **Агентных систем:** модели перестают быть просто чат-ботами и становятся агентами, способными вызывать внешние API, исполнять код, планировать задачи и использовать инструменты;
* **Локального исполнения:** оптимизированные квантованные модели (GGUF, AWQ) запускаются непосредственно на пользовательских устройствах (ноутбуки, смартфоны, edge-железо).

LLM — это не окончательный ИИ, но важнейший кирпич в фундаментальной инфраструктуре нового цифрового мира.