Яка модель запуститься на моїй відеокарті або Mac
Наївна оцінка «7 мільярдів × 4 біти = 4 ГБ» ламається на довгому контексті: KV-кеш може важити більше за самі ваги. Тут порахований і він.
Без реєстрації та email
На RTX 3090 24GB з контекстом 8K вміщається 8 моделей із 12 у списку.
| Модель | Параметрів | Максимальна якість, що влазить | Треба пам'яті | Вердикт |
|---|---|---|---|---|
| Qwen3 4BAlibaba | 4B | FP16 | 9,5 ГБваги 7,5 ГБ + KV-кеш 1,1 ГБ + накладні 1,0 ГБ | вміщається |
| Gemma 3 4BGoogle | 4.3B | FP16 | 10,1 ГБваги 8,0 ГБ + KV-кеш 1,1 ГБ + накладні 1,0 ГБ | вміщається |
| Llama 3.1 8BMeta | 8B | FP16 | 17,2 ГБваги 14,9 ГБ + KV-кеш 1,0 ГБ + накладні 1,3 ГБ | вміщається |
| Qwen3 8BAlibaba | 8.2B | FP16 | 17,8 ГБваги 15,3 ГБ + KV-кеш 1,1 ГБ + накладні 1,4 ГБ | вміщається |
| Gemma 3 12BGoogle | 12.2B | Q8 | 15,5 ГБваги 11,4 ГБ + KV-кеш 3,0 ГБ + накладні 1,2 ГБ | вміщається |
| Mistral Small 3.2 24BMistral AI | 24B | Q5_K_M | 18,3 ГБваги 15,6 ГБ + KV-кеш 1,3 ГБ + накладні 1,4 ГБ | вміщається |
| Gemma 3 27BGoogle | 27.4B | Q4_K_M | 19,7 ГБваги 14,5 ГБ + KV-кеш 3,9 ГБ + накладні 1,3 ГБ | вміщається |
| Qwen3 32BAlibaba | 32.8B | — | 20,9 ГБваги 17,4 ГБ + KV-кеш 2,0 ГБ + накладні 1,5 ГБ | впритул |
| Qwen3 30B-A3B (MoE)Alibaba | 30.5B3.3B active | Q4_K_M | 18,4 ГБваги 16,2 ГБ + KV-кеш 0,8 ГБ + накладні 1,4 ГБ | вміщається |
| Llama 3.3 70BMeta | 70.6B | — | 42,5 ГБваги 37,5 ГБ + KV-кеш 2,5 ГБ + накладні 2,5 ГБ | не вміщається |
| Qwen3 235B-A22B (MoE)Alibaba | 235B22B active | — | 133,1 ГБваги 124,8 ГБ + KV-кеш 1,5 ГБ + накладні 6,8 ГБ | не вміщається |
| DeepSeek V3 671B (MoE)DeepSeek | 671B37B active | — | 405,1 ГБваги 356,2 ГБ + KV-кеш 30,5 ГБ + накладні 18,4 ГБ | не вміщається |
Дані звірено 2026-08-12
Як це рахується
Пам'ять = ваги (параметри × байтів на параметр обраного квантування) + KV-кеш (2 × шари × KV-голови × розмір голови × токени контексту × 2 байти) + накладні на буфери й рушій. «Впритул» означає заповнення понад 85% — технічно влазить, але перший довший запит, найімовірніше, впаде з нестачею пам'яті. Ми не обіцяємо швидкість: вона залежить від рушія, квантування та пропускної здатності пам'яті.
А тепер головне питання
Порахувати вартість токенів — легко. Значно важче зрозуміти, які саме процеси у вашій компанії варто віддати AI-агентам і в якому порядку. Для цього ми зробили оргсхему компанії з AI-ролями.
FAQ
- Що таке квантування і скільки якості воно з'їдає?
- Квантування зменшує точність ваг: замість 16 біт на параметр — 8, 6, 5 або 4. Q8 практично не відрізняється від оригіналу, Q5 і Q6 втрачають небагато, Q4 помітно просідає на складних задачах, зате вміщає удвічі більшу модель.
- Чому на Mac доступно менше пам'яті, ніж встановлено?
- У Mac пам'ять спільна для системи й графіки. Частина завжди зайнята macOS і застосунками, тому ми рахуємо приблизно дві третини на машинах до 24 ГБ і три чверті на старших.
- А якщо модель не вміщається — вона взагалі не запуститься?
- Запуститься, але частина шарів піде в оперативну пам'ять або на диск, і швидкість впаде в рази. Для діалогу це зазвичай неприйнятно, для нічної пакетної обробки — інколи прийнятно.
uk