Чому ніхто не пише про головний дефіцит найближчих місяців
Екстраполяція експоненційного попиту на обчислювальні потужності — квартал за кварталом, до квадрильйонної ери.
Опубліковано · Ярослав Максимович
Не розумію, чому ніхто крім мене про це не пише.
Ми в експоненційному рості попиту на процесорні потужності для АІ.
Це значить - катастрофічний дефіцит, в найближчі місяці (не роки).
Який тягне за собою здорожчання компютингу.
КВАРТАЛ,ОБСЯГ (Tрильйонів токенів / тиждень),
📅 Q2 2026,🟢 45 T,
ШІ-агенти стають стандартними співробітниками в офісах.
📅 Q3 2026,🟡 150 T,
ШІ починає «читати» цілі бібліотеки даних за секунду.
📅 Q4 2026,🟡 520 T,
"Одна компанія генерує більше тексту, ніж все людство за рік."
📅 Q1 2027,"🟠 1,800 T",
"Епоха ""Матриці"": ШІ спілкуються між собою без людей."
📅 Q2 2027,"🟠 6,500 T",
"Нове залізо трохи рятує ситуацію, але черги за токенами лишаються."
📅 Q3 2027,"🔴 22,000 T",
"ШІ-окуляри аналізують все, що ви бачите, в реальному часі."
📅 Q4 2027,"🔴 80,000 T",
ШІ сам купує собі ресурси та оплачує власну електрику.
📅 Q1 2028,"🔥 280,000 T","Квадрильйонна ера. Текст стає майже безкоштовним, але дефіцитним."
Що я зробив:
Заніс в Gemini графік приросту споживання токенів (з мого попереднього поста).
Попросив зробити екстраполяцію на два роки, виходячи з того темпу приросту швидкості росту, який спостерігаємо від кінця грудня, коли 0,0001% людей потрошки почали розбиратись з AI-агентами.
А, самі Агенти, по своїй природі, їдять памяті (не токенів) в 50-100 раз більше, аніж людські запити.
Кількість токенів - може вирости не суттєво, а памяті - для генерації тої самої кількості токенів - потрібно в 50 раз більше.
.
Ось прогноз від Gemini (який корелює з моїми думками):
Ситуація, яку ви описуєте, — це класичний сценарій «ідеального шторму» в інфраструктурі. Коли попит (агенти) зростає експоненційно, а пропозиція (GPU) — лінійно, ринок не просто стає дорожчим, він структурно переламується.
.
Ось прогноз Gemini, про перевищення попиту та фізичної реальності на 2026–2027 роки:
1. Точка розриву: Попит vs Залізо
Ми вже в стадії прихованого дефіциту.
Фізичний ліміт: Виготовлення одного H100/B200 займає місяці (цикл TSMC). Навіть якщо Nvidia подвоїть виробництво, воно не наздожене 10% тижневого зростання попиту на OpenRouter.
Наслідок:
В 2026 році ми побачимо «Inference Rationing» (нормування виведення). Провайдери почнуть обмежувати кількість токенів на добу навіть для платних підписок.
.
2. Що буде з цінами та якістю?
Тут відбудеться контрінтуїтивний поділ ринку:
Дорожча вартість за "Якісний Контекст": Ціна за 1 млн вхідних токенів (Input) зросте. Чому? Бо саме довгий контекст (пам'ять агента) «забиває» VRAM відеокарт. Тримати 128k контексту в пам'яті GPU — це розкіш.
Деградація якості ("Lazy Models"): Щоб зекономити ресурси, OpenAI та Google почнуть таємно «стискати» моделі (Quantization). Ви помітите, що ШІ стає тупішим, частіше помиляється в деталях або дає коротші відповіді. Це спосіб провайдерів втиснути більше юзерів на один сервер.
Поява "Fast & Cheap" Tier: Виникне величезний ринок дешевих, але примітивних моделей (типу Llama 3-8B), які будуть виконувати 90% чорнової роботи агентів.
3. Масовий перехід на локальні моделі (Edge AI)
Для вашого проекту aiadvisoryboard.me це ключовий тренд.
Через дорожнечу хмарних API, бізнес почне купувати власне залізо (наприклад, Mac Studio з 192GB RAM або кластери з RTX 5090).
Локальна пам'ять: Локально ви не платите за токени. Ваш адвайзер зможе "тримати в голові" всю історію компанії безкоштовно.
Приватність: У B2B це стане стандартом. Жоден СЕО не захоче, щоб його емоційний стан або стратегічні плани "витікали" на сервери OpenAI.
4. Неочевидні наслідки (Black Swans)
А. "Token Arbitrage" (Арбітраж токенів)
З'являться агенти, які будуть перевіряти ціни на різних провайдерах (OpenRouter, Groq, AWS) в реальному часі і перекидати запити туди, де в цю секунду є вільна ємність. Це як ринок електроенергії: вночі дешевше, вдень дорожче.
Б. "Context Distillation" (Дистиляція контексту)
Ми перестанемо відправляти ШІ цілі документи. Популярними стануть «стискачі контексту» — окремі моделі, які перетворюють 100 сторінок вашого Lorebook у 1 сторінку надщільного коду, який розуміє тільки інший ШІ. Це дозволить агентам працювати в умовах дефіциту пам'яті.
В. Енергетичні квоти
Дата-центри почнуть обмежувати обчислення не через нестачу GPU, а через нестачу електрики. У пікові години (коли весь світ прокидається і запускає своїх агентів) ціна токена може злітати в 5-10 разів.
Як це вплине на aiadvisoryboard.me?
Гнучкість: Ваш софт має вміти перемикатися між хмарним Claude та локальною Llama.
Економія: Якщо ви навчите свого адвайзера працювати на "стиснутому" контексті, ви виграєте цінову війну.
Статус: У світі дефіциту обчислень, наявність "розумного адвайзера з глибокою пам'яттю" стане таким же показником статусу компанії, як власний офіс у центрі міста.
---
Ось прогноз розвитку подій з точки зору економіки токенів та дефіциту.
1. Прогноз вартості токенів: "Цінові ножиці"
Якщо попит (агенти з великим контекстом) перевищує пропозицію (доступні GPU) у співвідношенні 2.5 : 1, ми побачимо парадоксальну ситуацію:
Для вхідних токенів (Input/Context): Ціна піде ВГОРУ. Провайдери API почнуть вводити "податок на пам'ять". Оскільки агенти "блокують" GPU гігабайтами контексту, ціна за 1 млн токенів у контексті може зрости в 2-3 рази, щоб обмежити безглузде "спалювання" ресурсів.
Для вихідних токенів (Output/Generation): Ціна буде СТАБІЛЬНОЮ або ПАДАТИ. Завдяки новим методам (Speculative Decoding), генерація тексту стає швидшою, але вона все одно впирається в ліміт пам'яті GPU.
2. Як вирішуватиметься дефіцит? (Механізми ринку)
Коли фізично неможливо виробити достатньо H100/B200, ринок перейде до наступних стратегій:
А. Пріоритезація трафіку (Token Auction)
Провайдери (OpenRouter, Azure, AWS) введуть аукціонну модель.
Економ-клас: Повільні відповіді, низький пріоритет (як безкоштовний ChatGPT).
Agentic-клас: Миттєві відповіді для автономних систем за потрійним тарифом. Для вашого aiadvisoryboard.me це означає, що собівартість адвайзера може зрости, якщо йому потрібна швидка реакція.
Б. Архітектурна революція (Context Compression)
Оскільки агенти "з'їдають" 75% ємності через контекст, галузь перейде на:
Persistent KV Caching: Провайдери будуть зберігати контекст вашого проекту (Lorebook) прямо в пам'яті GPU, щоб не перераховувати його щоразу. Це зменшить навантаження в 5-10 разів.
Малі моделі (SLM): Замість того, щоб ганяти 150 трильйонів токенів через "важку" модель, агенти будуть використовувати "мікро-моделі" для 90% рутинних задач.
В. "GPU-Каннібалізм"
Компанії почнуть відключати вторинні сервіси, щоб звільнити ресурси для найбільш прибуткових агентів. Тренувальні кластери (ті самі 40%) будуть частково "здаватися в оренду" під Inference в періоди між тренуваннями великих моделей.
3. Ризик для aiadvisoryboard.me: "Ексклюзивність обчислень"
У світі дефіциту доступ до API стане схожим на доступ до нафти в 70-х роках.
Ваша стратегія: Виграє не той, хто "спалює" більше токенів, а той, хто робить це ефективно.
Якщо ви реалізуєте в своєму проекті стиснення пам'яті (Memory Persistence), ви зможете надавати преміальний сервіс, витрачаючи в 5 разів менше дефіцитних ресурсів GPU, ніж конкуренти.
.
Підсумок
Дефіцит призведе до сегментації. "Розумні" агенти з глибокою пам'яттю стануть дорогим елітарним інструментом, а звичайні чат-боти залишаться дешевими, але "дурними" через малий ліміт контексту.
.
Що робити?
Та все те ж
.
Upd:
Знайшов таке:
Під час конференц-колу Alphabet (материнської компанії Google) за результатами Q4 2025 року, яке відбулося 4 лютого 2026 року. CEO Сундар Пічаї відповів на запитання аналітика про те, що "не дає спати ночами" (what keeps us up at night), вказавши саме на вичислальні потужності (compute capacity).
А в січні вони скоротили розмір звітів Deep Research в три рази. Тепер це всього 20-ть сторінок замість звиклих 60, як було весь попередній період.
Що ж.
Можна лише побажати всім нам таких проблем, коли не справляєшся з потоком клієнтів.
Джерела
Наступний крок
Пов'язані матеріали
- Есе
Економіка AI-токенів на власних цифрах: чому ціна мусила вирости і що це значить для кожної компанії.
- Есе
Прогноз Дженсена Хуанга у прикладному розрізі: що станеться з бюджетами компаній, коли токени стануть головною статтею витрат.
Як зроблено. Це мій пост у Facebook від 13.02.2026, збережений тут без змін.
Якщо хочете розібрати свою задачу — напишіть мені в Telegram: t.me/YaroslavMaxymovych