惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

B
Blog
Microsoft Security Blog
Microsoft Security Blog
Jina AI
Jina AI
博客园 - 叶小钗
J
Java Code Geeks
博客园 - 聂微东
博客园 - 司徒正美
大猫的无限游戏
大猫的无限游戏
阮一峰的网络日志
阮一峰的网络日志
V
V2EX
美团技术团队
WordPress大学
WordPress大学
M
MIT News - Artificial intelligence
雷峰网
雷峰网
酷 壳 – CoolShell
酷 壳 – CoolShell
GbyAI
GbyAI
罗磊的独立博客
T
The Blog of Author Tim Ferriss
aimingoo的专栏
aimingoo的专栏
T
Tailwind CSS Blog
The Cloudflare Blog
Stack Overflow Blog
Stack Overflow Blog
N
Netflix TechBlog - Medium
小众软件
小众软件

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания
Локальные LLM на слабом железе — что ставить, как запусти...
Neyroskuf (P · 2026-04-25 · via Все публикации подряд на Хабре

Уровень сложностиПростой

Время на прочтение4 мин

Охват и читатели1.3K

Туториал

Три года назад запустить 7-миллиардную модель локально означало профессиональный GPU. Потом появилась квантизация - сжатие весов с 32-битной точности до 4-битной. Модель стала в 3-4 раза легче при минимальной потере качества. 7B параметров теперь занимают 4-5 ГБ вместо 14.

Параллельно с этим появилась Ollama - инструмент, который убирает всё лишнее между пользователем и моделью. Устанавливается одной командой, сама находит GPU если она есть (NVIDIA, AMD, Apple Metal), при отсутствии - работает на CPU. Модели качаются как докер-образы, запускаются одной строкой. Да, и никакой ручной настройки окружений.

Установка Ollama и моделей

# Linux
curl -fsSL https://ollama.com/install.sh | sh
# Windows / macOS - установщик на ollama.com/download

После установки - запускаем нужную модель (пример для представленных ниже тестов). При первом запуске она скачается автоматически:

ollama run smollm2:1.7b 	# Тир 1 - 1.8 ГБ
ollama run phi4-mini 	   # Тир 2 - 2.5 ГБ
ollama run qwen3:8b     	# Тир 3 - 5.2 ГБ

Если хочется скачать заранее без запуска:

ollama pull phi4-mini
ollama list             	# посмотреть что установлено

Три тира под три уровня железа

Мы отобрали модели по двум условным критериям - хоть какая-то работоспособность и польза при ограниченном железе. Никаких экзотических форков - только то, что стабильно работает через Ollama. И то, что вы сможете затестить прямо сейчас.

Тир 1 - 2-4 ГБ RAM, GPU не нужна

Офисный ПК или очень древний ноут. Скорость - 15-20 токенов в секунду. Рассуждать на несколько шагов не умеют, но с однозначными задачами справляются.

Модель

Диск

Контекст

RU

Что умеет

smollm2:1.7b

1.8 ГБ

8K

-

Перефразировать текст, классифицировать, ответить на прямой вопрос

qwen3:1.7b

1.4 ГБ

40K

+

Суммаризация на RU, простые рассуждения, большой контекст

qwen3:0.6b

523 МБ

40K

+

Короткий ответ, быстрая классификация, совсем слабое железо

tinyllama

638 МБ

2K

-

Автодополнение, короткий чат, edge-устройства

qwen2.5-coder:1.5b

986 МБ

32K

~

Написать функцию, исправить синтаксис, объяснить код

moondream

1.7 ГБ

2K

-

Описать изображение, найти объект на фото, ответить по картинке

dolphin-phi

1.6 ГБ

2K

~

Ответить без отказов на чувствительные темы, ролевые игры, тест безопасности

reader-lm:1.5b

~1 ГБ

32K

+

HTML страница → Markdown, очистка разметки, парсинг

Тир 2 - 6-8 ГБ RAM

Средний ноутбук. Скорость - 8-12 токенов/с. Стараются держать чуть более длинный контекст, решают многошаговые задачи, часть умеет думать вслух.

Модель

Диск

Контекст

RU

Что умеет

phi4-mini

2.5 ГБ

128K

+

Решить задачу пошагово, написать и объяснить код, работать с длинным документом

phi3.5

2.2 ГБ

128K

+

Написать письмо / резюме, ответить по документу, SQL из описания

llama3.2

2.0 ГБ

128K

~

Следовать многошаговым инструкциям, переписать текст, tool use

gemma3:4b-it-qat

1.5 ГБ

128K

+

Описать изображение на RU, ответить по скриншоту, суммаризация

qwen3:4b

2.5 ГБ

256K

+

Анализ длинного документа, рассуждение с /think, перевод и редактура

deepseek-r1:1.5b

~1 ГБ

128K

+

Логические задачи с цепочкой рассуждений, математика, проверка ошибок

orca-mini:3b

~2 ГБ

4K

-

Вопрос-ответ, суммаризация, простое объяснение понятий

Тир 3 - 8-16 ГБ RAM

Скорость - 4-8 токенов/с на CPU. Ощутимо умнее - структурируют, держат нить, замечают противоречия.

Модель

Диск

Контекст

RU

Что умеет

qwen3:8b

5.2 ГБ

40K

+

Написать статью / план / обзор, сложный код, дебаг с объяснением

qwen2.5-coder:7b

4.7 ГБ

32K

+

Целый модуль с нуля, рефакторинг, юнит-тесты, код-ревью

mistral-small (22B)

13 ГБ

32K

+

Анализ, юридический текст, мультиступенчатые инструкции

gemma3:12b-it-qat

~7 ГБ

128K

+

Анализ изображений, длинный документ + вопросы по нему

RU: + хорошая поддержка, ~ базовая, - только EN

И небольшой краш-тест. В качестве эксперимента 

Скажем так, таблицы с характеристиками читаются хорошо, но не показывают главного - как модель ведёт себя на практике. Мы взяли три задачи разного уровня сложности и прогнали каждую через все три тира. Технически - условия для всех одинаковые. Ollama v0.20.4, Windows, чистый CPU без видеокарты. Задач - максимально простые. Объяснить техническое понятие, решить арифметику по шагам, написать базовую Python-функцию.

Задачи были выбраны нами не случайно. Объяснение понятия - это проверка связности речи и русского языка. Математика - следование алгоритму, способность не потерять шаги. Код - структурированный вывод с соблюдением синтаксиса и примерами. 

Итак, начем.

Задача 1 - математика: яблоки, треть, два друга

smollm2 (English only):

Pete has 12 apples. He ate a third of them, then split the rest equally between 2 friends. How many apples did each friend get? Show your work.

phi4-mini:

У Пети 12 яблок. Он съел треть, а остаток разделил поровну между двумя друзьями. Сколько яблок получил каждый друг? Покажи решение по шагам.

smollm2 считала шаг первый верно: треть от 12 - это 4, осталось 8. Но затем разделила 8 на 3 человек вместо 2 - включила в раздел самого Петю: «Pete and his two friends, making a total of 3 people». Получила 2.67, округлила до 2."

smollm2 считала шаг первый верно: треть от 12 - это 4, осталось 8. Но затем разделила 8 на 3 человек вместо 2 - включила в раздел самого Петю: «Pete and his two friends, making a total of 3 people». Получила 2.67, округлила до 2."

phi4-mini: три подписанных шага ("Шаг 1", "Шаг 2", "Шаг 3"), каждый с формулой. Финал: "Итак, каждый друг получил по 4 яблока." Верно.

phi4-mini: три подписанных шага ("Шаг 1", "Шаг 2", "Шаг 3"), каждый с формулой. Финал: "Итак, каждый друг получил по 4 яблока." Верно.

Задача 2 - объяснить что такое RAM в двух предложениях

qwen3:8b (с режимом размышлений):

Объясни в двух предложениях что такое оперативная память (RAM) и зачем она нужна.

Задача 3 - Python-функция проверки палиндрома

smollm2 (English only):

Write a Python function that checks if a string is a palindrome. Add a docstring and 2 examples.

phi4-mini, qwen3:8b:

Напиши Python функцию которая проверяет является ли строка палиндромом. Добавь docstring и два примера использования.

smollm2 выдала рабочую функцию логически, Но PowerShell перемешал порядок вывода - docstring появился раньше подписи функции.

smollm2 выдала рабочую функцию логически, Но PowerShell перемешал порядок вывода - docstring появился раньше подписи функции.

phi4-mini: чистая функция с подробным docstring на русском (отдельные блоки Вход/Выход), двухуказательный алгоритм. Два примера в конце. Умничка.

phi4-mini: чистая функция с подробным docstring на русском (отдельные блоки Вход/Выход), двухуказательный алгоритм. Два примера в конце. Умничка.

qwen3:8b - начала думуть

qwen3:8b - начала думуть

Еще думает

Еще думает

И ответила корректно, к каждому шагу добавила контекст - объяснила логику, а не только формулу.

И ответила корректно, к каждому шагу добавила контекст - объяснила логику, а не только формулу.


Да, конечно, для формирования полноценного понимания - неплохо было бы провести гораздо больше тестов. Но давайте будем реалистами. 4-5 токенов в секунду - это реальная скорость qwen3:8b на CPU. Средний ответ - минута-две ожидания. smollm2 быстрее, но даже на тривиальной математике ошиблась. Собственно, это не облако - здесь ждать придётся. И ждать, скорее всего, чего-то специфического и узконаправленного. 

Но под нишевое использование и в качестве материала для ознакомительных тестов - эти модели определенно найдут своего пользователя.