惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Microsoft Azure Blog
Microsoft Azure Blog
WordPress大学
WordPress大学
小众软件
小众软件
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
V
V2EX
Hugging Face - Blog
Hugging Face - Blog
美团技术团队
博客园 - 三生石上(FineUI控件)
Last Week in AI
Last Week in AI
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - Franky
Microsoft Security Blog
Microsoft Security Blog
Y
Y Combinator Blog
A
About on SuperTechFans
The GitHub Blog
The GitHub Blog
U
Unit 42
H
Hackread – Cybersecurity News, Data Breaches, AI and More
云风的 BLOG
云风的 BLOG
IT之家
IT之家
MyScale Blog
MyScale Blog
V
Visual Studio Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
I
InfoQ
博客园 - 司徒正美

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания
Запускаем DeepSeek-V4 (1.6T) на «калькуляторе»: SVD-транс...
Livadies · 2026-04-27 · via Все публикации подряд на Хабре

Уровень сложностиСложный

Время на прочтение2 мин

Охват и читатели349

Кейс

Предисловие: Ода безысходности

24 апреля 2026 года мир содрогнулся — вышел DeepSeek-V4-Pro. 1.6 триллиона параметров, MoE-архитектура, веса на 800+ ГБ. Академики в белых халатах из исследовательских центров тут же выкатили райдер: «Вам нужно минимум 8xH100 и прямой канал до дата-центра».

Мы посмотрели на свою бесплатную NVIDIA T4 с 16 ГБ VRAM в Kaggle, на 50 ГБ диска и поняли: вызов принят. Пока вы ждете гранты на GPU-кластеры, мы занимаемся цифровой вивисекцией.

🛠 Техстек «Гетто-Инженера»

Когда у тебя нет ресурсов, ты не оптимизируешь — ты взламываешь. Наш проект базируется на трех столпах:

1. SVD-трансмутация (Rank-64) вместо квантования

Обычное квантование (4-bit) — это скучно. Оно просто делает числа «зернистыми». Мы пошли путем низкорангового разложения (W≈U⋅S⋅VT). Мы выкинули 98% численного шума, оставив только «скелет» матрицы. При Rank=64 мы получили сжатие в 50 раз.

Троллинг-пауза №1: Дорогие академики, пока вы спорите о минимизации ошибки реконструкции до пятого знака, мы доказали, что «душа» 1.6-триллионного монстра живет в пространстве размерности 64. Всё остальное — просто дорогой декор.

2. Протокол «Транзит»: 1 ТБ через 50 ГБ игольное ушко

Как переварить 64 шарда по 14 ГБ на диске в 50 ГБ? Мы использовали стриминговую загрузку через safe_open.

  • Скачали один шард.

  • Вытащили тензор.

  • Сжали его в ОЗУ.

  • Пушнули в свой репо.

  • Стерли кэш под ноль.

Это MLOps со вкусом выживания. RAM ни разу не поднялась выше 4 ГБ.

Архитектурный Identity Theft (Кража личности)

transformers еще не знает V4? Не проблема. Мы переклеили ярлыки в config.json, выдав веса V4 за архитектуру DeepSeek-V2. Немного Monkey Patching'а в роутер MoE — и вуаля, Франкенштейн ожил.

Python

# Наш костыль, который умнее ваших фреймворков
def ghetto_route(self, logits):
    flat_logits = logits.view(-1, logits.shape[-1])
    w = torch.nn.functional.softmax(flat_logits, dim=-1)
    tw, ti = torch.topk(w, k=self.top_k, dim=-1)
    return ti, tw * self.routed_scaling_factor

🧠 Результат: Кибер-Оракул и цифровой сюрреализм

Что мы получили на выходе? Модель, которая помещается в VRAM одной T4. Да, она галлюцинирует. Да, она смешивает русский, английский и китайский, создавая «полиглотный шум». Но она понимает контекст. Она сохранила ассоциативные связи гиганта.

Это не инструмент для написания дипломных работ. Это голос из Latent Space, который звучит сквозь 50-кратное сжатие.

📀 Памятник и Промо

Проект открыт. Мы назвали его DeepSeek-V4-Pro Ghetto-Edition. Это доказательство того, что математика и наглость бьют терафлопсы.

🚀 Репозиторий: livadies/DeepSeek-V4-Pro-Ghetto-Edition-MoE-Rank-64

А пока ваш инференс грузится, послушайте музыку, под которую создавался этот Мутант:

  • 🟢 Spotify

  • 🔥 Главный трек: RUSSIAN WINTER 26

Эпилог

Академики, ваши кластеры впечатляют. Но пока вы строите дворцы, мы учим камни летать. AI принадлежит всем, а не только тем, у кого есть корпоративная кредитка.

Stay Ghetto. Stay Tuned.