LLM
Large Language Model
LLM (large language model, большая языковая модель) — нейросеть на архитектуре трансформер, обученная на огромных текстовых данных предсказывать следующий токен. Понимает и генерирует текст: GPT, Claude, LLaMA, Qwen, DeepSeek.
Что такое LLM
LLM (Large Language Model, большая языковая модель) — это нейросеть на архитектуре трансформер, обученная на огромных объёмах текста решать одну простую задачу: предсказывать следующий токен. Из этой задачи вырастает способность понимать и генерировать текст, писать код, отвечать на вопросы и рассуждать.
Простыми словами: LLM «прочитала» значительную часть интернета и научилась продолжать любой текст статистически правдоподобным образом. Именно на LLM работают ChatGPT, Claude, Gemini, а также открытые LLaMA, Qwen и DeepSeek.
Как работает LLM
- Токенизация. Текст разбивается на токены — части слов (см. связанный термин «Токенизатор»). Модель работает не с буквами, а с токенами.
- Трансформер и self-attention. Ключевой механизм — внимание (attention): для каждого токена модель взвешивает, насколько важны все остальные токены контекста. Это позволяет улавливать связи на большом расстоянии.
- Авторегрессия. LLM генерирует ответ по одному токену за раз: предсказала токен → добавила во вход → предсказала следующий. Отсюда две фазы инференса — prefill (обработка промпта) и decode (генерация).
- Параметры (веса). «Размер» LLM измеряется в параметрах: 7B, 70B, 405B. Больше параметров — обычно выше качество, но и больше требований к VRAM.
Экспертные мнения: что такое LLM
Единого определения нет — ведущие исследователи ИИ описывают LLM по-разному, от «статистической машины» до «понимающей реальность» системы. Вот спектр мнений.
«По сути это статистическая машина, которая генерирует каждый следующий токен, — без собственной воли, эмоций и намерений. LLM — не „цифровое существо“, а скорее эфирный призрак, имитирующий человеческую культуру, впитанную из огромного массива текстов.»
— Андрей Карпатый, сооснователь OpenAI, экс-директор по ИИ в Tesla, с 2026 года — в команде пре-трейнинга Anthropic
«Хорошо предсказывать следующий токен — значит понимать реальность, которая привела к появлению этого токена.»
— Илья Суцкевер, сооснователь и бывший главный научный сотрудник OpenAI
«LLM не понимает, что если столкнуть стакан со стола, он разобьётся, — она лишь знает, что слова „стакан“ и „разбить“ часто встречаются вместе. Это полезный инструмент, но тупиковая ветвь на пути к интеллекту человеческого уровня.»
— Ян Лекун, лауреат премии Тьюринга, один из «крёстных отцов» глубокого обучения, экс-глава ИИ-исследований Meta (FAIR), профессор Нью-Йоркского университета
«Языковая модель наугад сшивает последовательности языковых форм по вероятностям их сочетаний — без какой-либо связи со смыслом. Это „стохастический попугай“.»
— Эмили Бендер (профессор компьютерной лингвистики Вашингтонского университета) и Тимнит Гебру (экс-технический со-лид команды этики ИИ в Google, основатель исследовательского института DAIR), из работы «On the Dangers of Stochastic Parrots» (2021)
Как обучают LLM
| Этап | Что делает |
|---|---|
| Pretraining | Обучение на терабайтах текста — модель усваивает язык и знания. Самый дорогой этап (тысячи GPU). |
| Fine-tuning / SFT | Дообучение на инструкциях, чтобы модель следовала запросам (см. «Fine-tuning»). |
| RLHF / alignment | Обучение с обратной связью от человека — модель становится полезной и безопасной. |
Какие бывают LLM
| Модель | Разработчик | Веса | Размеры |
|---|---|---|---|
| GPT-4o / o1 | OpenAI | Закрытые | — |
| Claude (Sonnet, Opus) | Anthropic | Закрытые | — |
| Gemini | Закрытые | — | |
| LLaMA 3.1 | Meta | Открытые | 8B, 70B, 405B |
| Qwen 2.5 | Alibaba | Открытые | 0.5B–72B |
| DeepSeek-R1 / V3 | DeepSeek | Открытые | 1.5B–671B |
| Mistral / Mixtral | Mistral AI | Открытые | 7B, 8×7B |
Open-source vs проприетарные LLM
Проприетарные (GPT, Claude, Gemini) — доступны только через API вендора, максимальное качество, но данные уходят на зарубежные серверы и оплата в валюте.
Открытые LLM (LLaMA, Qwen, DeepSeek, Mistral) — веса можно скачать и запустить у себя: полный контроль над данными, никаких лимитов и цензуры чужого API, коммерческое использование. Именно открытые модели чаще всего запускают на арендованных GPU.
Лучшие LLM: как сравнивают
Качество LLM оценивают по бенчмаркам (MMLU, GPQA, HumanEval для кода) и по «народному» рейтингу LLM Arena (люди вслепую сравнивают ответы, модели ранжируются по Elo). «Лучшей» LLM в вакууме нет — выбор зависит от задачи: рассуждения, код, русский язык, длина контекста, бюджет.
Как запустить LLM
Есть два пути — и они не исключают друг друга:
- Через API (без своего сервера). Самый быстрый способ: отправляете запрос на готовый OpenAI-совместимый эндпоинт и платите по токенам. Подходит, когда нужен результат, а не инфраструктура.
- Self-host на GPU. Скачиваете открытую модель и запускаете на своей (арендованной) видеокарте через Ollama, vLLM или TGI. Даёт полный контроль, приватность данных и отсутствие лимитов.
Сколько VRAM нужно для локальной LLM
Ориентир для запуска в квантизации Q4 (4-bit):
| Размер модели | VRAM (Q4) | Пример GPU |
|---|---|---|
| 7–8B | ~5–6 ГБ | RTX 3090 |
| 13B | ~9 ГБ | RTX 3090 / 4090 |
| 70B | ~40–44 ГБ | A100 80 ГБ / 2×RTX 4090 |
| 405B+ | 200+ ГБ | Кластер H100 |
Запустите LLM без своего сервера
Открытые LLM — DeepSeek, Qwen и другие — доступны через AI API Интелион Облако: единый OpenAI- и Anthropic-совместимый API, оплата в рублях, локальные модели в РФ. Нужен полный контроль — арендуйте GPU-сервер и поднимите модель через Ollama или vLLM за пару минут.