LLM становятся commodity — это вопрос не «если», а «когда». Недавний релиз GLM-5.2 — неплохая засечка: open-source модель вплотную приближается к проприетарным БЯМам на инженерных бенчмарках.
Я не могу представить мир через пять лет, где мы по-прежнему зависим исключительно от API OpenAI и Anthropic. Компании, которые не строят собственную AI-инфраструктуру, обречены проигрывать властителям видеокарточек и цепочек поставок. Попытки крупных лабораторий «зайти в продукт» провалятся.
На какие навыки в ближайшее время я ставлю свой самый дорогой ресурс:
- выбрать подходящую модель и поднять её — не обучить с нуля, а грамотно задеплоить и настроить под задачу;
- выбрать правильный runtime — vLLM, TGI, llama.cpp, Ollama и т. д.;
- натюнить LoRA-адаптеры, когда это необходимо — про то, когда понять, что это необходимо, писал тут;
- понимать, как устроен inference на большом скейле — у Дваркеша есть подробный разбор;
- выжать максимум из local/on-prem сетапа — здесь платим за компьют, а не за токены.
Видится мне, что мы конвергируем к схеме, похожей на hybrid cloud: часть запросов уходит в облачные модели, остальное крутится на локальной инфре или прямо на edge-девайсе. На WWDC26 Apple развила именно такую многоуровневую модель: Foundation Models framework даёт доступ к on-device модели, Apple Foundation Model в Private Cloud Compute и сторонним провайдерам через общий протокол.
Сейчас крупные рыбы как не в себя подписывают enterprise-контракты с Anthropic, платя субсидированные цены. Когда этот аттракцион невиданной щедрости закончится и CFO перестанут выделять раздутые бюджеты на токены без понятного ROI, человек, который умеет делать всё перечисленное выше, начнёт по-настоящему курить бамбук — рынок для таких спецов станет куда больше нынешнего.
AI engineering — прекрасный мостик для AI-инженеров второго типа (тут писал про два типа AI-инженеров), тех, у кого не было опыта в core ML. Да, сейчас мы строим приложения на базе моделей, спрятанных за API, но кто будет настраивать весь local inference setup, когда придёт такая потребность? Проактивный AI-инженер или LLMOps — хайпующий DevOps’ер.
Нужно больше чипов!
Те, кто владеют инфраструктурой, — главные гигачады. Может быть, датацентры в космосе нам очень даже «к чему»? 🤔
viva la open source 🐧