惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

G
Google Developers Blog
阮一峰的网络日志
阮一峰的网络日志
博客园 - 聂微东
F
Fortinet All Blogs
H
Help Net Security
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
D
DataBreaches.Net
MyScale Blog
MyScale Blog
B
Blog
I
InfoQ
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
GbyAI
GbyAI
Google DeepMind News
Google DeepMind News
IT之家
IT之家
The GitHub Blog
The GitHub Blog
有赞技术团队
有赞技术团队
博客园_首页
L
LangChain Blog
V
V2EX
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
T
The Blog of Author Tim Ferriss
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Microsoft Azure Blog
Microsoft Azure Blog
博客园 - Franky

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания
Четыре грабли, один вихрь и 60% на CIFAR-10 с M0+
Юрий Венедиктов · 2026-06-21 · via Все публикации подряд на Хабре

Средний

2 мин

37

Продолжение цикла. До этого были базовые цифры и анонс 5 архитектур. Теперь - что сломалось, как чинили, что узнали.


GraphKAN: полный датасет меняет всё

В прошлых постах я показывал 96.15% на MNIST на 10K сабсете. Переход на полный датасет (60K) - 94.46% после 20 эпох float + 5 STE. Нашёл баг: ternary_map[2]=0 - +1 молча обнулялся на unpack.

Fashion-MNIST: 76.6% -> 86.73% (30 эпох float + 10 STE, полный датасет, 49 минут).


CNN Fashion: аугментация + cosine annealing

Было 87-88%. Схема 10+20+5+10 эпох с аугментацией и cosine annealing дала 90.54%. Сжатие 16x. Тернарная версия не потеряла точность - выиграла 0.44 п.п.


ViT: история про взрыв дисперсии

Первая попытка: loss 8.57, accuracy 16.3%. Чуть лучше random. Копаю - attention scores в one-hot, градиенты нулевые. Причина: ternary Q/K/V без нормализации выхода дают variance на порядки выше, чем нужно. Softmax вырождается.

Фикс - learnable per-projection scaling: log_scale_qk, log_scale_v, log_scale_o, log_scale1, log_scale2. Пять параметров, каждый учится гасить variance до входа в softmax.

Результат: 60.30% на CIFAR-10, 25.4 КБ. Не SOTA, но для микроконтроллера без FPU - честно.


RNN/LSTM: не взлетело

SMNIST, 28 шагов по пикселям. RNN: 18.2%. LSTM: 20.64%. Float на той же архитектуре - ~25%. Причина: hidden_dim=64 не тянет 28 шагов. Нужно 128-256, но это 4-8x больше параметров. Тернарность тут ни при чём.


C-кодогенерация: все пять под Unicorn

5 архитектур генерируются в C11, компилируются под cortex-m0plus, прогоняются через Unicorn. Bit-exact для всех.

Архитектура

.bin

R0

Статус

GraphKAN MNIST

192 KB

-88

PASS

CNN Fashion

107 KB

0

PASS

Transformer

20 KB

0

PASS

LSTM

17 KB

-3

PASS

ViT CIFAR-10

43 KB

1

PASS

M0+ специфичные грабли

memset recursion с -O2. GCC превращает while(n–) в рекурсивный bl memset. Бесконечный цикл. Лечится -fno-builtin.

sat_q7(). (int8_t)(acc >> 7) - переполнение. Нужна явная saturation.

ternary_map[2]=0. В CNN-кодогенераторе третий элемент (val=2, +1) маппился в 0. Вес обнулялся.

output_idx uint8 -> uint16. Для моделей с >255 нейронов индексы выхода - 834-843. Не влезают в uint8.


Итог

192 файла, 34K строк, 95 тестов. Пайплайн замкнут: Python -> train -> export -> C11 -> arm-gcc -> .bin -> Unicorn. Две модели не взлетели (RNN/LSTM - архитектурное ограничение), остальные работают с приростом точности относительно float.


Ссылки:


2026. Fakeonomics. Все права защищены.