惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
DataBreaches.Net
N
Netflix TechBlog - Medium
F
Fortinet All Blogs
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
宝玉的分享
宝玉的分享
Y
Y Combinator Blog
博客园 - 聂微东
WordPress大学
WordPress大学
酷 壳 – CoolShell
酷 壳 – CoolShell
B
Blog RSS Feed
小众软件
小众软件
The GitHub Blog
The GitHub Blog
S
SegmentFault 最新的问题
Hugging Face - Blog
Hugging Face - Blog
Jina AI
Jina AI
Microsoft Azure Blog
Microsoft Azure Blog
V
V2EX
B
Blog
H
Help Net Security
D
Docker
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
罗磊的独立博客
月光博客
月光博客
博客园 - 司徒正美

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания
Конец бесплатного кремния: как Google AI Studio превратил...
Максим · 2026-05-26 · via Все публикации подряд на Хабре

Простой

3 мин

14K

У каждого из нас в закладках браузера есть Google AI Studio. Еще год назад это было место силы.

Давайте вспомним лето 2025-го. Релиз Gemini 2.5 Pro. Google выкатывает модель с невероятным контекстным окном и делает немыслимое: дает разработчикам практически безлимитную квоту через API и веб интерфейс. Ты мог загрузить туда библиотеку кода, пару книг, логи сервера за месяц и весь день задавать модели вопросы. Лимиты казались бесконечными. Сообщество ликовало: "Наконец-то корпорация повернулась лицом к энтузиастам! OpenAI повержен!"

А потом наступил 2026 год. Вышли Gemini 3.0, а за ней и 3.1 Pro. И карета превратилась в тыкву.

Сегодня попытка вести долгую сессию с 3.1 Pro в AI Studio напоминает изощренную пытку. Десять сообщений с плотным контекстом и вы ловите Quota Exceeded. Чтобы закончить архитектурный ресерч или дописать сложный модуль, люди вынуждены регистрировать по 5-6 альт аккаунтов, перебрасывая контекст из одного окна в другое, пока Google не забанит их по IP.

Почему AI Studio так стремительно скатилась ? Многие думают, что Google просто стал жадным. Но мы с вами знаем: корпорации не бывают жадными или щедрыми. Корпорации умеют считать деньги и тепловыделение.

1. Бесплатный сыр и жажда данных (RLHF-ферма)

Лето 2025 года было не благотворительностью. Это была самая масштабная в истории операция по сбору высококачественных пользовательских данных для Long Context RLHF.

Google отчаянно нуждался в понимании того, как именно разработчики используют окна в 1 миллионов токенов. Им нужны были ваши репозитории, ваши архитектурные споры, ваши паттерны поиска багов в мегабайтах логов. Давая нам безлимитный Gemini 2.5 Pro, Google превратил нас в бесплатных разметчиков данных. Мы сами показали им, где модель теряет фокус, а где галлюцинирует.

К выходу Gemini 3.0 они собрали необходимый датасет. Выучили паттерны. Улучшили метрики маршрутизации внутри слоев. Ферма выполнила свою задачу. Надобность оплачивать ваши круглосуточные эксперименты отпала.

2. Физика KV кэша и термодинамика

Вторая причина аппаратная. Gemini 3.1 Pro это не просто 2.5 Pro с новыми весами. Это фундаментально более тяжелая модель (вероятно, массивный MoE с огромной размерностью скрытого состояния).

Каждый раз, когда вы держите в AI Studio контекст на 500к токенов, сервер Google должен хранить ключи и значения для каждого из этих токенов в сверхдорогой видеопамяти.

Давайте посчитаем: для тяжелой модели 500k токенов контекста на одного пользователя могут занимать от 10 до 40 ГБ видеопамяти просто для поддержания сессии. А теперь представьте, что таких любителей бесплатного сыра миллион.
Google не стал жадным. Инженеры Google просто посмотрели на счета за электричество от своих TPU кластеров. Поддерживать сессии 3.1 Pro с длинным контекстом это буквально сжигать миллионы долларов в час в виде тепла.

В 2.5 Pro они компенсировали эту стоимость ради захвата рынка. В 3.1 Pro законы термодинамики и ограничения пропускной способности памяти взяли свое.

3. Смерть иллюзии бесконечности

Мы разбаловались. Мы поверили, что вычислительные мощности это нечто бесконечное, льющееся из розетки как вода. Google AI Studio летом 25 го поддерживала эту иллюзию.

Но сейчас индустрия ИИ уперлась в жесткий compute wall. Масштабирование интеллекта моделей 3 го поколения требует экспоненциально больше вычислений на инференсе.

Лимиты AI Studio сегодня это честное отражение реальной стоимости интеллекта. Если вам нужен гениальный программист-ассистент, способный удержать в голове 100к строк кода, вы не можете получать его бесплатно 24/7. Ни одна инфраструктура в мире этого не выдержит.

Время взрослеть

Нам больно и обидно переключаться между пятью Google аккаунтами, чтобы доделать задачу. Мы с ностальгией вспоминаем времена, когда можно было закинуть в Gemini целую кодовую базу и болтать об этом часами.

Но AI Studio не скатилась. Она просто столкнулась с реальностью. Экспериментальный полигон закрыт, началась коммерческая эксплуатация. Халява кончилась.

Что делать нам? Возвращаться к корням.
Перестать кидать моделям мусорные мегабайты текста на всякий случай. Учиться писать лаконичные, структурные промпты. Внедрять RAG на своей стороне, подавая в контекст только нужное. И, конечно же, поддерживать open source и локальные модели. Потому что пока вы зависите от чужого кластера, ваш интеллект ограничен чужой квотой.