Локальные LLM Модели

Каталог оптимизированных моделей для домашнего использования. Полная свобода, полная приватность, полный контроль.

26B Параметров (макс)
3 Модели в каталоге
Q6_K Лучшее квантование
100% Без цензуры
Gemma4-26B-A4B-Uncensored
Uncensored Balanced

26 миллиардов параметров с оптимальным балансом скорости и качества. Идеальна для текстов, кода и анализа.

Квантование: Q6_K
Точность: 80%
mmproj-Gemma4-26B
Multimodal

Многомодальный проекционный слой для визуального анализа изображений. Работает в паре с основной моделью.

Формат: f16
VRAM: 8-12GB
omnicoder-9b
Coder

Специализированный код-ассистент на 9 миллиардов параметров. Генерация, объяснение и отладка кода на множестве языков.

Формат: bf16
VRAM: 8-12GB

Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced-Q6_K_P

26 миллиардов параметров • Квантование Q6_K • Uncensored

🎯 Особенности

Uncensored

Полностью свободная модель без цензуры. Генерирует любой контент без ограничений.

HauhauCS Оптимизация

Специальная оптимизация для домашнего использования. Максимальная эффективность.

Balanced Режим

Идеальный баланс между скоростью генерации и качеством ответа.

Q6_K Квантование

80% точности от оригинала при значительном снижении размера модели.

💻 Применение

Текстовый анализ

Глубокий анализ документов, статей, и других текстовых материалов.

Кодирование

Генерация, рефакторинг и объяснение кода на различных языках.

Анализ данных

Интерпретация и выводы из больших массивов данных.

Креативное письмо

Создание контента без ограничений по тематике.

📊 Технические характеристики

ПараметрЗначение
Полный размер26 миллиардов параметров
КвантованиеQ6_K (80% точности)
Размер квантованной модели~16-18 GB
Точность80% от оригинала
Скорость генерацииВысокая (Balanced)

mmproj-Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced-f16

Многомодальный проекционный слой • Формат f16

🎨 Особенности

Multi-modal Projection

Проекционный слой для обработки визуальной информации.

Поддержка изображений

Анализ и интерпретация изображений совместно с текстовой моделью.

f16 Формат

16-битный формат для оптимального баланса точности и памяти.

Комбинированная работа

Работает в паре с основной моделью Gemma4-26B.

🖼️ Применение

Визуальный анализ

Описание изображений, распознавание объектов и сцен.

OCR

Распознавание текста на изображениях с высокой точностью.

Визуальный код

Анализ и генерация кода для работы с изображениями.

Комбинированный AI

Создание мультимодальных приложений локально.

📊 Технические характеристики

ПараметрЗначение
ТипПроекционный слой (Projection)
Формат весовf16 (16-бит)
Размер слоя~2-4 GB
Требует совместную работуДа (с основной моделью)

omnicoder-9b-bf16

Специализированный код-ассистент • 9 миллиардов параметров

💻 Особенности

Код-специализация

Направлена исключительно на программирование и разработку.

bf16 Формат

Бритый 16-битный формат для точной работы с числами.

Множество языков

Поддержка Python, JavaScript, C++, Java, Go, Rust и многих других.

Эффективность

Меньший размер модели при высокой специализации.

🔧 Применение

Генерация кода

Создание кода с нуля по описанию задачи.

Объяснение кода

Детальный разбор и объяснение любого кода.

Отладка

Поиск и исправление ошибок в коде.

Рефакторинг

Оптимизация и улучшение структуры кода.

📊 Поддерживаемые языки

Языки программирования

Python, JavaScript, TypeScript, Java, C++, C#, Go, Rust, PHP, Ruby

Фреймворки

React, Vue, Django, Flask, Spring, FastAPI, Laravel и др.

Системные языки

Shell, Bash, SQL, GraphQL, Terraform, Dockerfile

Технологии

AI/ML, DevOps, Web, Mobile, Embedded, Desktop

📊 Технические характеристики

ПараметрЗначение
Полный размер9 миллиардов параметров
Квантованиеbf16 (бритый 16-бит)
Размер модели~10-12 GB
СпециализацияКодирование и разработка

📊 Сравнение моделей

Модель Параметры Квантование VRAM Специализация
🧠
Gemma4-26B
26B Q6_K (80%) 16-24 GB Общая (текст, код, анализ)
🎨
mmproj-Gemma4
Projection f16 (16-bit) 8-12 GB Визуальный анализ
💻
omnicoder-9b
9B bf16 (16-bit) 8-12 GB Кодирование

🎯 Когда использовать какую модель?

🧠 Gemma4-26B

Для общих задач: анализ документов, креативное письмо, комплексные задачи, когда нужна максимальная точность и гибкость.

🎨 mmproj-Gemma4

Для мультимодальных задач: анализ изображений, OCR, визуальное понимание контента. Требует совместной работы с основной моделью.

💻 omnicoder-9b

Для разработки: генерация кода, отладка, рефакторинг, изучение кода. Быстрее и эффективнее для задач программирования.

⚡ Производительность

Метрика Gemma4-26B mmproj-Gemma4 omnicoder-9b
Скорость токенов/сек~15-20~25-30~25-30
Потребление VRAMВысокоеСреднееНизкое
ТочностьВысокаяСредняяСредняя
Общая эффективность80%75%90%

🖥️ Требования к железу

Рекомендации для запуска локальных LLM моделей

🐌 Слабый ПК

  • VRAM: 4-8 GB
  • RAM: 16-24 GB
  • CPU: 4-6 ядер
  • omnicoder-9b (bf16)
  • Gemma4-26B (Q4_K, ~8GB)
  • Скорость: низкая

⚡ Средний ПК

  • VRAM: 8-12 GB
  • RAM: 32 GB
  • CPU: 6-8 ядер
  • omnicoder-9b (bf16)
  • mmproj-Gemma4 (f16)
  • Gemma4-26B (Q4_K)
  • Скорость: средняя

🚀 Сильный ПК

  • VRAM: 16-24 GB
  • RAM: 32-48 GB
  • CPU: 8+ ядер
  • Gemma4-26B (Q6_K)
  • mmproj-Gemma4 (f16)
  • omnicoder-9b (bf16)
  • Скорость: высокая

📋 Детальные требования

Модель VRAM (GPU) RAM (CPU) Рекомендуемая GPU OS
Gemma4-26B Q6_K16-24 GB32-48 GBRTX 3080/4070+Win 10/11, Linux
mmproj-Gemma4 f168-12 GB16-24 GBRTX 3060/3070+Win 10/11, Linux
omnicoder-9b bf168-12 GB16-24 GBRTX 3060/3070Win 10/11, Linux
Gemma4-26B Q4_K8-12 GB16-24 GBRTX 3060Win 10/11, Linux

💡 Оптимизация для CPU

Использование CPU

Модели можно запускать на CPU без GPU, но скорость будет значительно ниже. Используйте Q4_K или Q3_K квантование для экономии памяти.

Swap-память

При нехватке VRAM/RAM используйте swap-файл. Это замедлит работу, но позволит запускать модели.

Оптимизированные библиотеки

Используйте llama.cpp, MLX (Apple), или другие оптимизированные движки для лучшей производительности.

🔧 Программное обеспечение

Компонент Рекомендуемая версия Примечание
Python3.10+Для большинства инструментов
llama.cppLatestОсновной движок для CPU/GPU
OllamaLatestПростой локальный инференс
LM StudioLatestGUI для локального запуска
ComfyUILatestДля мультимодальных задач

🚀 Параметры запуска модели

Команда запуска (llama-server)

llama-server \
  -m '/model/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced-Q6_K_P.gguf' \
  --mmproj '/model/visual/mmproj-Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced-f16.gguf' \
  --host 0.0.0.0 \
  --port 8000 \
  -ngl 99 \
  --tensor-split 4,4,4,4 \
  --flash-attn on \
  -c 262144 \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  -b 4096 \
  -ub 1024 \
  -t 44 \
  -tb 44 \
  --temp 0.8 \
  --top-p 0.95 \
  --top-k 40 \
  --min-p 0.05 \
  --reasoning on

📊 Анализ производительности железа

На основе анализа логов работы модели Gemma4-26B, ваша система демонстрирует выдающиеся показатели:

  • Скорость генерации (Token Generation): Стабильно держится в районе ~100 tokens/s. Это невероятно высокий показатель для модели такого размера, что подтверждает практически полную загрузку видеопамяти (VRAM) и эффективную работу тензорного расщепления (--tensor-split 4,4,4,4).
  • Скорость обработки промпта (Prompt Processing): Достигает ~780-2200 tokens/s, что обеспечивает мгновенную реакцию модели на длинные входные данные.
  • Конфигурация: Использование 44 потоков и максимального переноса слоев на GPU (-ngl 99) позволяет выжать максимум из доступного железа.

💡 Итог: Ваше железо идеально подходит для работы с этой моделью, обеспечивая практически мгновенный отклик и высочайшую скорость генерации.