Суверенний ШІ · навчений з нуля

Мовна модель, яка не виходить з будівлі.

Kalorad навчає власну модель — українська, російська, англійська, код — і запускає її всередині вашої мережі. Без ліцензії вендора. Без зовнішніх викликів. Ваги, токенізатор і цикл навчання — ваші.

KaloradLM 683M · dense decoder · власний токенізатор · перший повний прогін претренування завершено у вересні 2026 на одній AMD MI300X

Kalorad · Chaton-prem
you
Що таке суверенна модель? Три речення.
KaloradLM 683M
Написати Kalorad…↵
Processes · mi300x-01R→U→T→O→R
pretrain-1b24 GPU 0
96 %
model-server :8000
41 req/min
embedder memory index
312 facts/s
cycle-manager stage T · promote in
06:12:44
KaloradLM · 683M · neural activitylayer 17 / 24
synapses 1 920firing 1 240 / sheads 24 · kv 4
context 4 096precision bf16 · fp32 mastersexternal calls 0
Generating · next-token distributionT = 0.7
pretrain.log · MI300Xlive
Memory · sqlite-vec4 ms
recallWhat did we decide about data residency?
кожне повідомлення · кожен факт · локально · ваше
683Mпараметрів 13.1Bтокенів 43 hодна MI300X $86обчислення джерело: pretrain.log · 16 750 кроків × 786 432 токени
Під капотом

Написано з нуля. Кожен шар — наш.

Жодного форкнутого чекпоінта, жодного чужого токенізатора. Архітектуру нижче реалізовано на PyTorch у цьому репозиторії, протестовано на CPU і чисельно перевірено на ROCm.

Архітектура
Щільний декодер
hidden 1536 · 24 шари · GQA 24 : 4 голови · SwiGLU 4096
Позиції
RoPE + YaRN
розширення контексту без перенавчання; RMSNorm pre-norm
Оптимізатор
Muon + AdamW
ортогоналізовані (Ньютон–Шульц) оновлення для матриць, AdamW для ембедингів і голови
Розклад
WSD + curriculum
розігрів – плато – загасання; суміш даних змінюється за фазами
Корпус · 12.5B токенів · власний токенізатор SentencePiece
en 35 · uk 25 · ru 22 · code 18
АнглійськаУкраїнськаРосійськаКод
Точність
fp32-мастери
bf16 autocast для обчислень; мастер-ваги у fp32, щоб малі оновлення не губилися
Верифікація
3.3e-06
чисельний паритет CPU/GPU на фіксованому вході; 9 багів навчання знайдено на залізі, кожен став тестом
Всередині Kalorad, наживо

Процеси, пам’ять, навчання — видно.

Асистенту, який усе пам’ятає і на всьому вчиться, потрібен погляд оператора. Ось що вузол робить просто зараз.

Процеси
Пам’ять
Навчання
node mi300x-01uptime 00:00:00cycle R→U→T→O→R
pidпроцесстанgpu / cpuшвидкість
4112pretrain-1b24kalorad_model/pretrain.py · step 16 750навчання
88 041 tok/s
4188model-serverOpenAI-compatible · :8000обслуговує
41 req/min
3970corpus-builder14 workers · SentencePieceтокенізує
1.2M tok/s
4201embeddernomic-embed-text · memory indexіндексує
312 facts/s
4230memory-compactorsqlite-vec · nightlyза розкладом
02:14:09
4007cycle-managerR→U→T→O→R · promotion checkстадія T
06:12:44

GPU 0 · завантаження

Цикл самовдосконалення

Rзапуск
Uоновлення
Tнавчання
Oоптимізація
Rвиведення
VRAM178 / 192 GBпотужність612 Wчекпоінтstep_0016750loss4.8819
пригадатиWhat did we decide about data residency?
індекс sqlite-vec · ембединги nomic-embed-text · локально
затримка 4 ms · корпус кожне повідомлення, кожен факт · зберігання ваше

Перший прогін · що каже крива

Кроки 0 – 13 750: loss стоїть на 6.1. Датасет зсував мітки на один раз більше, ніж модель, — 37 годин вона вчилася передбачати токен через один. Знайдено по кривій, виправлено на вузлі, тепер під захистом test_training_objective.py.
Кроки 13 750 – 16 750: 6.1 → 4.88. Ті самі ваги, правильна ціль. Перплексія 132. Наступний прогін стартує з виправленням, еталонним Muon і fp32-мастерами.
токени13.1Bшвидкість88 041 tok/sчас43 hвартість$86
Прев’ю консолі. Цифри навчання — з логу прогону; швидкості процесів — ілюстративні.kalorad_model/reports/run_700m_20260910
Суверенність за конструкцією

Не політика. Периметр.

Файнтюни західних відкритих моделей успадковують ліцензію і залежність. Модель, навчена з нуля, не успадковує нічого — вона може жити в закритій мережі банку, міністерства чи лікарні.

ПЕРИМЕТР КЛІЄНТА · ЗАКРИТА МЕРЕЖА Працівники Документи · БД KaloradLMваги · пам’ять · цикл API вендора0 викликів
01

Без ліцензії вендора

Ваги навчені нами, на нашому корпусі, нашим кодом. Немає чужих умов використання, які можна успадкувати, відкликати чи переглянути.

02

Без зовнішніх викликів

Інференс, пам’ять і донавчання працюють на залізі клієнта. Нічого з написаного користувачем не покидає периметр — за архітектурою, а не за договором.

03

Модель, яка вчиться всередині

Цикл R→U→T→O→R донавчає модель на зворотному зв’язку організації, просуває нову версію, коли вона вимірно краща, і виводить стару — усе всередині.

Докази, а не обіцянки

Один повний прогін. Кожна цифра — з логу.

10–12 вересня 2026, одна AMD MI300X на кредитах. Не продуктовий чекпоінт — доказ, що стек навчається від початку до кінця, і порахований шлях до продуктової моделі.

0
параметрів
0
токенів пройдено
0
кроків оптимізатора
0
годин, одна GPU
0
усі обчислення
0
токенів / секунду
0
фінальна перплексія
3.3e-06
паритет CPU / GPU
Далі: 1.24B × 25B токенів ≈ 163 GPU-години ≈ $300 за ринковою ціною MI300X.kalorad_model/reports/run_700m_20260910/pretrain.log
Дорожня карта

Що купують наступні обчислення.

Код написано; кожен крок нижче — прогін, а не дослідницьке питання. Порядок задано тим, що розблоковує наступний.

Зараз

Продуктовий прогін 1.24B

25B тримовних токенів, виправлена ціль, еталонний Muon, fp32-мастери.

+1 тиждень

SFT для чату

Короткий supervised-прохід під формат чату і відмови.

+2 тижні

Український бенчмарк

Опублікований набір для оцінки — цифра, яку покупець може перевірити.

+1 місяць

8 вертикальних LoRA

Юристи, медицина, фінанси, держсектор… виміряні проти бази.

Пізніше

MoE 3.16B

1.84B активних параметрів — ємність без рахунку за інференс.

Pre-seed · $180k

Подивіться, як модель працює по ваш бік стіни.

30-хвилинний дзвінок, живий вузол і лог. Усе на цій сторінці відтворюється з репозиторію.