Архитектуры моделей 95 просмотров

LLM

Large Language Model

LLM (large language model, большая языковая модель) — нейросеть на архитектуре трансформер, обученная на огромных текстовых данных предсказывать следующий токен. Понимает и генерирует текст: GPT, Claude, LLaMA, Qwen, DeepSeek.

Что такое LLM

LLM (Large Language Model, большая языковая модель) — это нейросеть на архитектуре трансформер, обученная на огромных объёмах текста решать одну простую задачу: предсказывать следующий токен. Из этой задачи вырастает способность понимать и генерировать текст, писать код, отвечать на вопросы и рассуждать.

Простыми словами: LLM «прочитала» значительную часть интернета и научилась продолжать любой текст статистически правдоподобным образом. Именно на LLM работают ChatGPT, Claude, Gemini, а также открытые LLaMA, Qwen и DeepSeek.

Как работает LLM

  1. Токенизация. Текст разбивается на токены — части слов (см. связанный термин «Токенизатор»). Модель работает не с буквами, а с токенами.
  2. Трансформер и self-attention. Ключевой механизм — внимание (attention): для каждого токена модель взвешивает, насколько важны все остальные токены контекста. Это позволяет улавливать связи на большом расстоянии.
  3. Авторегрессия. LLM генерирует ответ по одному токену за раз: предсказала токен → добавила во вход → предсказала следующий. Отсюда две фазы инференса — prefill (обработка промпта) и decode (генерация).
  4. Параметры (веса). «Размер» LLM измеряется в параметрах: 7B, 70B, 405B. Больше параметров — обычно выше качество, но и больше требований к VRAM.

Экспертные мнения: что такое LLM

Единого определения нет — ведущие исследователи ИИ описывают LLM по-разному, от «статистической машины» до «понимающей реальность» системы. Вот спектр мнений.

«По сути это статистическая машина, которая генерирует каждый следующий токен, — без собственной воли, эмоций и намерений. LLM — не „цифровое существо“, а скорее эфирный призрак, имитирующий человеческую культуру, впитанную из огромного массива текстов.»

— Андрей Карпатый, сооснователь OpenAI, экс-директор по ИИ в Tesla, с 2026 года — в команде пре-трейнинга Anthropic

«Хорошо предсказывать следующий токен — значит понимать реальность, которая привела к появлению этого токена.»

— Илья Суцкевер, сооснователь и бывший главный научный сотрудник OpenAI

«LLM не понимает, что если столкнуть стакан со стола, он разобьётся, — она лишь знает, что слова „стакан“ и „разбить“ часто встречаются вместе. Это полезный инструмент, но тупиковая ветвь на пути к интеллекту человеческого уровня.»

— Ян Лекун, лауреат премии Тьюринга, один из «крёстных отцов» глубокого обучения, экс-глава ИИ-исследований Meta (FAIR), профессор Нью-Йоркского университета

«Языковая модель наугад сшивает последовательности языковых форм по вероятностям их сочетаний — без какой-либо связи со смыслом. Это „стохастический попугай“.»

— Эмили Бендер (профессор компьютерной лингвистики Вашингтонского университета) и Тимнит Гебру (экс-технический со-лид команды этики ИИ в Google, основатель исследовательского института DAIR), из работы «On the Dangers of Stochastic Parrots» (2021)

Как обучают LLM

Этап Что делает
Pretraining Обучение на терабайтах текста — модель усваивает язык и знания. Самый дорогой этап (тысячи GPU).
Fine-tuning / SFT Дообучение на инструкциях, чтобы модель следовала запросам (см. «Fine-tuning»).
RLHF / alignment Обучение с обратной связью от человека — модель становится полезной и безопасной.

Какие бывают LLM

Модель Разработчик Веса Размеры
GPT-4o / o1 OpenAI Закрытые
Claude (Sonnet, Opus) Anthropic Закрытые
Gemini Google Закрытые
LLaMA 3.1 Meta Открытые 8B, 70B, 405B
Qwen 2.5 Alibaba Открытые 0.5B–72B
DeepSeek-R1 / V3 DeepSeek Открытые 1.5B–671B
Mistral / Mixtral Mistral AI Открытые 7B, 8×7B

Open-source vs проприетарные LLM

Проприетарные (GPT, Claude, Gemini) — доступны только через API вендора, максимальное качество, но данные уходят на зарубежные серверы и оплата в валюте.

Открытые LLM (LLaMA, Qwen, DeepSeek, Mistral) — веса можно скачать и запустить у себя: полный контроль над данными, никаких лимитов и цензуры чужого API, коммерческое использование. Именно открытые модели чаще всего запускают на арендованных GPU.

Лучшие LLM: как сравнивают

Качество LLM оценивают по бенчмаркам (MMLU, GPQA, HumanEval для кода) и по «народному» рейтингу LLM Arena (люди вслепую сравнивают ответы, модели ранжируются по Elo). «Лучшей» LLM в вакууме нет — выбор зависит от задачи: рассуждения, код, русский язык, длина контекста, бюджет.

Как запустить LLM

Есть два пути — и они не исключают друг друга:

  • Через API (без своего сервера). Самый быстрый способ: отправляете запрос на готовый OpenAI-совместимый эндпоинт и платите по токенам. Подходит, когда нужен результат, а не инфраструктура.
  • Self-host на GPU. Скачиваете открытую модель и запускаете на своей (арендованной) видеокарте через Ollama, vLLM или TGI. Даёт полный контроль, приватность данных и отсутствие лимитов.

Сколько VRAM нужно для локальной LLM

Ориентир для запуска в квантизации Q4 (4-bit):

Размер модели VRAM (Q4) Пример GPU
7–8B ~5–6 ГБ RTX 3090
13B ~9 ГБ RTX 3090 / 4090
70B ~40–44 ГБ A100 80 ГБ / 2×RTX 4090
405B+ 200+ ГБ Кластер H100

Запустите LLM без своего сервера

Открытые LLM — DeepSeek, Qwen и другие — доступны через AI API Интелион Облако: единый OpenAI- и Anthropic-совместимый API, оплата в рублях, локальные модели в РФ. Нужен полный контроль — арендуйте GPU-сервер и поднимите модель через Ollama или vLLM за пару минут.

Связанные термины

Требует
Используется в
Улучшается
Включает

Попробуйте на практике

Арендуйте GPU и запустите ML-модели в Intelion Cloud

Начать работу