Большие языковые модели
Современные LLM не думают словами. Они работают с векторами, вероятностными распределениями и матрицами весов.
Любой текст для модели — это просто последовательность токенов, трансформируемая через миллиарды параметров в вероятностное распределение следующего токена.
Но именно эта математическая абстракция порождает феномен, который мы называем пониманием.
### Контекстное окно
Одна из главных характеристик LLM — объем контекстного окна.
Это размер рабочей памяти модели во время генерации. Все, что выходит за пределы контекста, модель «забывает».
Современные архитектуры активно расширяют контекст: от нескольких тысяч токенов до миллионов.
Однако простое увеличение контекста порождает новые проблемы:
* **Lost in the Middle:** модель отлично помнит начало и конец контекста, но может «терять» детали из середины;
* **Квадратичная сложность внимания:** стандартный механизм Attention требует $O(N^2)$ ресурсов от длины контекста, что заставляет искать новые архитектурные оптимизации (FlashAttention, RoPE, Sparse Attention).
### RAG (Retrieval-Augmented Generation)
Модели не хранят всю информацию в весах. Знания в весах зафиксированы на момент обучения.
Для решения этой проблемы используется RAG:
1. Документы разбиваются на чанки.
2. Чанки превращаются в эмбеддинги (векторные представления).
3. Векторы сохраняются в векторную базу данных (Chroma, Qdrant, Milvus,pgvector).
4. На запрос пользователя система ищет наиболее близкие по смыслу векторы.
5. Найденный контекст подставляется в промпт модели.
RAG позволяет обогатить модель свежими приватными данными без дорогостоящего дообучения.
### Fine-Tuning и LoRA
Базовая модель (Base Model) умеет только продолжать текст. Чтобы превратить её в полезного ассистента (Instruct Model), применяют выравнивание (Alignment):
* **SFT (Supervised Fine-Tuning):** обучение на парах «вопрос-ответ»;
* **RLHF / DPO (Direct Preference Optimization):** обучение на предпочтениях человека для снижения галлюцинаций и вредных ответов.
Для эффективного дообучения без переобучения миллиардов весов используют **LoRA (Low-Rank Adaptation)** — внедрение небольших низкоранговых матриц в слои внимания. Это снижает требования к видеопамяти в десятки раз.
### Будущее LLM
Развитие идет в сторону:
* **Мультимодальности:** одновременная работа с текстом, кодом, аудио, видео и изображениями в едином латентном пространстве;
* **Агентных систем:** модели перестают быть просто чат-ботами и становятся агентами, способными вызывать внешние API, исполнять код, планировать задачи и использовать инструменты;
* **Локального исполнения:** оптимизированные квантованные модели (GGUF, AWQ) запускаются непосредственно на пользовательских устройствах (ноутбуки, смартфоны, edge-железо).
LLM — это не окончательный ИИ, но важнейший кирпич в фундаментальной инфраструктуре нового цифрового мира.