Перейти до вмісту

Яка модель запуститься на моїй відеокарті або Mac

Наївна оцінка «7 мільярдів × 4 біти = 4 ГБ» ламається на довгому контексті: KV-кеш може важити більше за самі ваги. Тут порахований і він.

Без реєстрації та email

На RTX 3090 24GB з контекстом 8K вміщається 8 моделей із 12 у списку.

МодельПараметрівМаксимальна якість, що влазитьТреба пам'ятіВердикт
Qwen3 4BAlibaba4BFP169,5 ГБваги 7,5 ГБ + KV-кеш 1,1 ГБ + накладні 1,0 ГБвміщається
Gemma 3 4BGoogle4.3BFP1610,1 ГБваги 8,0 ГБ + KV-кеш 1,1 ГБ + накладні 1,0 ГБвміщається
Llama 3.1 8BMeta8BFP1617,2 ГБваги 14,9 ГБ + KV-кеш 1,0 ГБ + накладні 1,3 ГБвміщається
Qwen3 8BAlibaba8.2BFP1617,8 ГБваги 15,3 ГБ + KV-кеш 1,1 ГБ + накладні 1,4 ГБвміщається
Gemma 3 12BGoogle12.2BQ815,5 ГБваги 11,4 ГБ + KV-кеш 3,0 ГБ + накладні 1,2 ГБвміщається
Mistral Small 3.2 24BMistral AI24BQ5_K_M18,3 ГБваги 15,6 ГБ + KV-кеш 1,3 ГБ + накладні 1,4 ГБвміщається
Gemma 3 27BGoogle27.4BQ4_K_M19,7 ГБваги 14,5 ГБ + KV-кеш 3,9 ГБ + накладні 1,3 ГБвміщається
Qwen3 32BAlibaba32.8B20,9 ГБваги 17,4 ГБ + KV-кеш 2,0 ГБ + накладні 1,5 ГБвпритул
Qwen3 30B-A3B (MoE)Alibaba30.5B3.3B activeQ4_K_M18,4 ГБваги 16,2 ГБ + KV-кеш 0,8 ГБ + накладні 1,4 ГБвміщається
Llama 3.3 70BMeta70.6B42,5 ГБваги 37,5 ГБ + KV-кеш 2,5 ГБ + накладні 2,5 ГБне вміщається
Qwen3 235B-A22B (MoE)Alibaba235B22B active133,1 ГБваги 124,8 ГБ + KV-кеш 1,5 ГБ + накладні 6,8 ГБне вміщається
DeepSeek V3 671B (MoE)DeepSeek671B37B active405,1 ГБваги 356,2 ГБ + KV-кеш 30,5 ГБ + накладні 18,4 ГБне вміщається

Дані звірено 2026-08-12

Як це рахується

Пам'ять = ваги (параметри × байтів на параметр обраного квантування) + KV-кеш (2 × шари × KV-голови × розмір голови × токени контексту × 2 байти) + накладні на буфери й рушій. «Впритул» означає заповнення понад 85% — технічно влазить, але перший довший запит, найімовірніше, впаде з нестачею пам'яті. Ми не обіцяємо швидкість: вона залежить від рушія, квантування та пропускної здатності пам'яті.

А тепер головне питання

Порахувати вартість токенів — легко. Значно важче зрозуміти, які саме процеси у вашій компанії варто віддати AI-агентам і в якому порядку. Для цього ми зробили оргсхему компанії з AI-ролями.

FAQ

Що таке квантування і скільки якості воно з'їдає?
Квантування зменшує точність ваг: замість 16 біт на параметр — 8, 6, 5 або 4. Q8 практично не відрізняється від оригіналу, Q5 і Q6 втрачають небагато, Q4 помітно просідає на складних задачах, зате вміщає удвічі більшу модель.
Чому на Mac доступно менше пам'яті, ніж встановлено?
У Mac пам'ять спільна для системи й графіки. Частина завжди зайнята macOS і застосунками, тому ми рахуємо приблизно дві третини на машинах до 24 ГБ і три чверті на старших.
А якщо модель не вміщається — вона взагалі не запуститься?
Запуститься, але частина шарів піде в оперативну пам'ять або на диск, і швидкість впаде в рази. Для діалогу це зазвичай неприйнятно, для нічної пакетної обробки — інколи прийнятно.

uk

Чи потягне моя відеокарта цю LLM — калькулятор пам'яті для локальних моделей | AI Advisory Board