Виталий Алексеев

01 / 06 · Rust · CUDA · synaptix · syngui

synthos

Локальная нейросетевая студия для рабочего стола: чат с агентом, заметки и нодовый редактор для картинок, видео, музыки и речи — на одной видеокарте NVIDIA, без Python и облака.

Лицензия
MIT OR Apache-2.0
Платформа
Linux x86_64 · NVIDIA sm_80+
Пакеты
synthos-bin, synthos-git (AUR)
Статус
Ранняя стадия, один разработчик
synthos: рабочее пространство заметок, собранное агентом, и чат, вынесенный в плавающее окно
synthos: рабочее пространство заметок, собранное агентом, и чат, вынесенный в плавающее окно
MoE-модель для чата на ноутбучной карте 24 ГБ
125B
токенов контекста на той же карте
262k
декод Gemma-4 26B A4B
210tok/s
VRAM хватает любой модели
7 GB
01

Что это

synthos — одна программа для рабочего стола вокруг локальной видеокарты. Чат запускает модели от 27B до 125B из однофайловых бандлов .syn или из GGUF и через инструменты управляет всем остальным; режим заметок держит документы, канбан-доски, майнд-карты и календарь в одном файле проекта; нодовый редактор собирает генеративные модели в графы, которые можно запустить: промпт → картинка, картинка с инструкцией → отредактированная картинка, текст или картинка → видео со звуком, текст песни → музыка, сценарий → диалог на несколько голосов, звук → расшифровка.

Агент умеет сам собрать и запустить такой граф, писать в заметки, искать по базе знаний и читать веб. Всё считается на месте, на собственном движке synaptix — без Python, без torch и без облака. Данные не покидают машину.

02

Как это работает

Qwen3.8-Flash-Next, MoE на 125B, отвечает в реальном времени на ноутбучной RTX 5090 с 24 ГБ — без ускорения записи. Декод 21–23 ток/с; префилл промпта на 6,4k токенов — 4,5 с; повтор того же промпта из кэша префикс-KV — 1,1 с; занято около 21 из 24 ГБ видеопамяти.
03

Возможности

  • Чат с Qwen3, гибридами Qwen3.6 / 3.8, Qwen3.8-Flash-Next (MoE на 125B, которая работает на карте 24 ГБ), Gemma-3, Gemma-4 26B A4B, Muse Glimmer 30B и Llama — со зрением, если оно есть у модели.
  • Собственный инференс: NVFP4, MXFP8, SQ1…SQ8 и все типы квантования ggml, декод через CUDA-граф, спекулятивное декодирование MTP и DFlash, переиспользование префикс-KV между ходами и частичная выгрузка слоёв в оперативную память.
  • Агент с инструментами: поиск и чтение веба, поиск по базе знаний, сборка и запуск нодовых графов, полный доступ к заметкам, просмотр файлов своим зрением (view_media), вопрос пользователю посреди хода, субагенты и свои навыки.
  • Заметки, где весь проект — один файл .syn: визуальный блочный редактор поверх Markdown, страницы потоком или свободным холстом, канбан-доски, диаграммы Ганта, майнд-карты и календарь с напоминаниями.
  • Картинки: FLUX.1, FLUX.2 (dev, klein 4B / 9B), Qwen-Image 2.1, Qwen-Image-Edit 2509 / 2511 и SDXL.
  • Видео: LTX-2.3 (из текста, картинки или звука, управление через IC-LoRA) и MiniMax-H3 с синхронным стереозвуком и референсами — картинками, видео и звуком.
  • Музыка и речь: песни YuE2 через редактируемую партитуру ABC и каверы на запись, ACE-Step, клонирование голоса в VoxCPM2 и OmniVoice, диалог на несколько голосов в VibeVoice, распознавание речи GigaAM и разметка спикеров Sortformer.
  • Локальная база знаний (RAG): файлы, папки, PDF и ссылки, гибридный поиск BM25 + векторы с необязательным реранком, всё хранится во встроенном SQLite.
  • Редактор кода с подсветкой статуса git и встроенными терминалами, в которых работают полноэкранные TUI.
  • Браузер Hugging Face с панелью загрузок, упаковка моделей в .syn прямо в программе с квантованием по группам слоёв и интерфейс на 14 языках.
04

Замеры скорости

МодельПрефиллДекодПримечание
Gemma-4 26B A4B10 100 tok/s (4k)210 tok/s
Qwen3.8-27B hybrid1 450 tok/s (3.3k)47 tok/sMTP + CUDA graph
Qwen3.8-Flash-Next 125B MoE1 650 tok/s @ 260k17–22 tok/s262k context on 24 GB

Ход на 3k токенов поверх истории в 80k занимает 3,3 с благодаря префикс-KV. Картинки 1024²: SDXL за 30 шагов — 6,5 с, Qwen-Image 2.1 за 40 шагов — 30 с (MXFP8) или 23 с (NVFP4).

Замерено на ноутбучной RTX 5090 (24 ГБ) с 93 ГБ оперативной памяти, Arch Linux.

05

Установка

paru -S synthos-bin   # prebuilt binary — recommended
paru -S synthos-git   # build from source (CUDA toolkit, ~2 h, ~15 GB disk)

Другие дистрибутивы: архив со страницы Releases или сборка из исходников — бинарник собран под версии библиотек Arch. Модели, скачанные с Hugging Face, один раз упаковываются в файл .syn (Syn packages → Build a .syn); чат-модели в GGUF открываются напрямую.

Полная инструкция — в README →

06

Требования и ограничения

  • Только Linux x86_64. Нужны gtk3, wayland, libxkbcommon, fontconfig, драйвер Vulkan, alsa, ffmpeg.
  • Видеокарта NVIDIA от sm_80 (Ampere) и новее. Родные тензорные пути NVFP4 / MXFP8 — только на Blackwell (sm_120+), старые карты работают через переносимые ядра.
  • Чтобы запустить всё, хватает 7 ГБ видеопамяти, чтобы работало быстро — нужно 24 ГБ: на 7 ГБ гибрид 27B отвечает со скоростью 1–2 ток/с.
  • AMD (ROCm) и Apple (Metal) не поддерживаются. Сборка под Windows в планах, но её пока нет.
  • Веса моделей в комплект не входят: их скачиваете вы и принимаете лицензию каждой модели — некоторые только для некоммерческого использования.
  • Ранняя стадия: один разработчик, одна машина (ноутбучная RTX 5090, 24 ГБ, Arch Linux). Как программа поведёт себя на других картах и дистрибутивах, пока неизвестно — больше всего помогают баг-репорты с описанием железа.
07

Скриншоты

Вайбкодинг в Claude Code

Как сделано

Модель пишет код, тесты и большую часть документации; я решаю, что делать, проверяю и замеряю. Каждая цифра в README измерена на моей машине, и рядом с выигрышами записаны потери. synthos — мой собственный ежедневный редактор кода и чат.

Всё здесь написано вайбкодингом. github.com/VitaminDB/synthos