Суверенный ИИ · обучен с нуля

Языковая модель, которая не выходит из здания.

Kalorad обучает собственную модель — украинский, русский, английский, код — и запускает её внутри вашей сети. Без лицензии вендора. Без внешних вызовов. Веса, токенизатор и цикл обучения — ваши.

KaloradLM 683M · dense decoder · свой токенизатор · первый полный прогон претрейна завершён в сентябре 2026 на одной AMD MI300X

Kalorad · Chaton-prem
you
Що таке суверенна модель? Три речення.
KaloradLM 683M
Написать Kalorad…↵
Processes · mi300x-01R→U→T→O→R
pretrain-1b24 GPU 0
96 %
model-server :8000
41 req/min
embedder memory index
312 facts/s
cycle-manager stage T · promote in
06:12:44
KaloradLM · 683M · neural activitylayer 17 / 24
synapses 1 920firing 1 240 / sheads 24 · kv 4
context 4 096precision bf16 · fp32 mastersexternal calls 0
Generating · next-token distributionT = 0.7
pretrain.log · MI300Xlive
Memory · sqlite-vec4 ms
recallWhat did we decide about data residency?
каждое сообщение · каждый факт · локально · ваше
683Mпараметров 13.1Bтокенов 43 hодна MI300X $86компьют источник: pretrain.log · 16 750 шагов × 786 432 токена
Под капотом

Написано с нуля. Каждый слой — наш.

Никакого форкнутого чекпоинта, никакого чужого токенизатора. Архитектура ниже реализована на PyTorch в этом репозитории, протестирована на CPU и численно проверена на ROCm.

Архитектура
Плотный декодер
hidden 1536 · 24 слоя · GQA 24 : 4 головы · SwiGLU 4096
Позиции
RoPE + YaRN
расширение контекста без переобучения; RMSNorm pre-norm
Оптимизатор
Muon + AdamW
ортогонализованные (Ньютон–Шульц) обновления для матриц, AdamW для эмбеддингов и головы
Расписание
WSD + curriculum
разогрев – плато – затухание; смесь данных меняется по фазам
Корпус · 12.5B токенов · свой токенизатор SentencePiece
en 35 · uk 25 · ru 22 · code 18
АнглийскийУкраинскийРусскийКод
Точность
fp32-мастера
bf16 autocast для вычислений; мастер-веса в fp32, чтобы малые обновления не терялись
Верификация
3.3e-06
численный паритет CPU/GPU на фиксированном входе; 9 багов обучения найдены на железе, каждый стал тестом
Внутри Kalorad, живьём

Процессы, память, обучение — видны.

Ассистенту, который всё помнит и на всём учится, нужен взгляд оператора. Вот что узел делает прямо сейчас.

Процессы
Память
Обучение
node mi300x-01uptime 00:00:00cycle R→U→T→O→R
pidпроцесссостояниеgpu / cpuскорость
4112pretrain-1b24kalorad_model/pretrain.py · step 16 750обучение
88 041 tok/s
4188model-serverOpenAI-compatible · :8000обслуживает
41 req/min
3970corpus-builder14 workers · SentencePieceтокенизирует
1.2M tok/s
4201embeddernomic-embed-text · memory indexиндексирует
312 facts/s
4230memory-compactorsqlite-vec · nightlyпо расписанию
02:14:09
4007cycle-managerR→U→T→O→R · promotion checkстадия T
06:12:44

GPU 0 · загрузка

Цикл самоулучшения

Rзапуск
Uобновление
Tобучение
Oоптимизация
Rвывод
VRAM178 / 192 GBмощность612 Wчекпоинтstep_0016750loss4.8819
вспомнитьWhat did we decide about data residency?
индекс sqlite-vec · эмбеддинги nomic-embed-text · локально
задержка 4 ms · корпус каждое сообщение, каждый факт · хранение ваше

Первый прогон · что говорит кривая

Шаги 0 – 13 750: loss стоит на 6.1. Датасет сдвигал метки на один раз больше, чем модель, — 37 часов она училась предсказывать токен через один. Найдено по кривой, исправлено на узле, теперь под защитой test_training_objective.py.
Шаги 13 750 – 16 750: 6.1 → 4.88. Те же веса, правильная цель. Перплексия 132. Следующий прогон стартует с исправлением, эталонным Muon и fp32-мастерами.
токены13.1Bскорость88 041 tok/sвремя43 hстоимость$86
Превью консоли. Цифры обучения — из лога прогона; скорости процессов — иллюстративные.kalorad_model/reports/run_700m_20260910
Суверенность по конструкции

Не политика. Периметр.

Файнтюны западных открытых моделей наследуют лицензию и зависимость. Модель, обученная с нуля, не наследует ничего — она может жить в закрытой сети банка, министерства или больницы.

ПЕРИМЕТР КЛИЕНТА · ЗАКРЫТАЯ СЕТЬ Сотрудники Документы · БД KaloradLMвеса · память · цикл API вендора0 вызовов
01

Без лицензии вендора

Веса обучены нами, на нашем корпусе, нашим кодом. Нет чужих условий использования, которые можно унаследовать, отозвать или пересмотреть.

02

Без внешних вызовов

Инференс, память и дообучение работают на железе клиента. Ничего из написанного пользователем не покидает периметр — по архитектуре, а не по договору.

03

Модель, которая учится внутри

Цикл R→U→T→O→R дообучает модель на обратной связи организации, продвигает новую версию, когда она измеримо лучше, и выводит старую — всё внутри.

Доказательства, не обещания

Один полный прогон. Каждая цифра — из лога.

10–12 сентября 2026, одна AMD MI300X на кредитах. Не продуктовый чекпоинт — доказательство, что стек обучается от начала до конца, и посчитанный путь к продуктовой модели.

0
параметров
0
токенов пройдено
0
шагов оптимизатора
0
часов, одна GPU
0
весь компьют
0
токенов / секунду
0
финальная перплексия
3.3e-06
паритет CPU / GPU
Дальше: 1.24B × 25B токенов ≈ 163 GPU-часа ≈ $300 по рыночной цене MI300X.kalorad_model/reports/run_700m_20260910/pretrain.log
Дорожная карта

Что покупает следующий компьют.

Код написан; каждый шаг ниже — прогон, а не исследовательский вопрос. Порядок задан тем, что разблокирует следующий.

Сейчас

Продуктовый прогон 1.24B

25B трёхъязычных токенов, исправленная цель, эталонный Muon, fp32-мастера.

+1 неделя

SFT для чата

Короткий supervised-проход под формат чата и отказы.

+2 недели

Украинский бенчмарк

Опубликованный набор для оценки — цифра, которую покупатель может проверить.

+1 месяц

8 вертикальных LoRA

Юристы, медицина, финансы, госсектор… измерены против базы.

Позже

MoE 3.16B

1.84B активных параметров — ёмкость без счёта за инференс.

Pre-seed · $180k

Посмотрите, как модель работает по вашу сторону стены.

30-минутный созвон, живой узел и лог. Всё на этой странице воспроизводится из репозитория.