dimabagow

Велики језички модели

Савремени LLM не размишљају речима. Они раде са векторима, вероватносним расподелама и матрицама тежина.

Било који текст за модел је једноставно низ токена који се трансформише кроз милијарде параметара у вероватносну расподелу следећег токена.

Али управо та математичка апстракција рађа феномен који називамо разумевањем.

### Контекстни прозор

Једна од главних карактеристика LLM је величина контекстног прозора.

То је величина радне меморије модела током генерације. Све што излази ван граница контекста модел «заборавља».

Савремене архитектуре активно проширују контекст: од неколико хиљада токена до милиона.

Међутим, једноставно повећање контекста рађа нове проблеме:

* **Lost in the Middle:** модел одлично памти почетак и крај контекста, али може «губити» детаље из средине;
* **Квадратна сложеност пажње:** стандардни механизам Attention захтева $O(N^2)$ ресурса од дужине контекста, што приморава на тражење нових архитектонских оптимизација (FlashAttention, RoPE, Sparse Attention).

### RAG (Retrieval-Augmented Generation)

Модели не чувају све информације у тежинама. Знање у тежинама зафиксирано је у тренутку обуке.

За решавање овог проблема користи се RAG:

1. Документи се деле на делове (чанке).
2. Делови се претварају у ембединге (векторске репрезентације).
3. Вектори се чувају у векторској бази података (Chroma, Qdrant, Milvus, pgvector).
4. На упит корисника систем тражи векторе који су најближи по значењу.
5. Пронађени контекст убацује се у промпт модела.

RAG омогућава обогаћивање модела свежим приватним подацима без скупог додатног обучавања.

### Fine-Tuning и LoRA

Основни модел (Base Model) уме само да настави текст. Да би се претворио у корисног асистента (Instruct Model), примењује се подешавање (Alignment):

* **SFT (Supervised Fine-Tuning):** обучавање на паровима «питање-одговор»;
* **RLHF / DPO (Direct Preference Optimization):** обучавање на људским преференцијама ради смањења халуцинација и штетних одговора.

За ефикасно додатно обучавање без преобучавања милијарди тежина користи се **LoRA (Low-Rank Adaptation)** — уграђивање малих нискорангираних матрица у слојеве пажње. То смањује захтеве за видео меморијом десетинама пута.

### Будућност LLM

Развој иде у смеру:

* **Мултимодалности:** истовремени рад са текстом, кодом, аудиом, видеом и сликама у јединственом латентном простору;
* **Агентских система:** модели престају да буду само чет-ботови и постају агенти способни да позивају спољне API-је, извршавају код, планирају задатке и користе алате;
* **Локалног извршавања:** оптимизовани квантовани модели (GGUF, AWQ) покрећу се директно на корисничким уређајима (лаптопови, паметни телефони, edge хардвер).

LLM није коначна вештачка интелигенција, али је најважнија цигла у фундаменталној инфраструктури новог дигиталног света.