KODA EDUCATION · 主権型AI · MIXTURE-OF-EXPERTS

主権型AIが、普通の
ハードウェアで動く仕組み。

大きなモデルは膨大な知識を蓄えます。Mixture-of-Experts モデルは、読み込む一語ごとに そのごく一部だけを使います —— これこそが、フロンティア級の知能を普通のサーバCPUで、 エッジで、機関の中で動かせる理由です。これは GLM の設計であり、KODA主権型モデルの 青写真です。


01 — 大きなモデル、小さなマシン

GPUのラックなしで、フロンティアの知識を。

フロンティアモデルは数千億のパラメータを持ちます。それらすべてを高速メモリに読み込むには GPUのラックが要ります —— 高価で、希少で、自分が制御できないクラウドに縛られる。病院、工場、 主権的な展開にとって、それは形が間違っています。

Mixture-of-Experts は経済性を変えます:知識は広く保ちながら、各トークンに 関係する一部だけを活性化する。

広く蓄える。狭く活性化する。

02 — 密(DENSE)と MIXTURE-OF-EXPERTS

モデルの大半は待機したまま —— そして安い。

密(dense)モデルは、すべてのトークンに対してすべてのパラメータを動かします。MoE モデルは多数の「専門家(expert)」を持ちますが、ルーターがトークンごとに 数個だけ選ぶ —— だからモデルの大半は待機したまま、安く済みます。

DENSE — 全パラメータが動く100%活性 · 全計算 · 全メモリMoE — ルーターが数個選ぶ≈5%活性同じ知識を蓄積 · トークンごとに一部だけ計算
このトークンで活性蓄積・待機中

GLM-5.2:744Bパラメータを蓄積 · トークンあたり約5.4%が活性(Colibriランタイムで検証済み)。


03 — GLM Mixture-of-Experts 層の内側

ルーター、数個の専門家、常時オンの土台。

各トークンについて、小さなルーターが専門家を採点し、上位の数個を選びます。共有専門家(shared expert)は常に動き —— 一般的な能力を担います —— その上に ルーティングされた専門家が専門性を加えます。結果は統合されます。

tokenRoutersigmoid + biasexpert 2 ✓expert 7expert 40 ✓expert 128…多数の小さな専門家、上位k個を選択共有専門家 — 常時オン+次の表現へ

この設計が優れる理由:ルーターは学習可能なバイアスで専門家の負荷を均衡させます —— 主目的と戦う補助損失なしに —— だから専門家は均衡を保ちかつ品質も向上します。 アテンションも圧縮され(MLA)、長文脈のメモリコストを約57分の1に縮めます。

知識は多数の小さな専門家に蓄える。トークンが必要とする数個だけを計算する。

04 — メモリの工夫

専門家はディスクに置く。必要になるものを先取りする。

トークンごとに数個の専門家しか動かないなら、すべてを高価な高速メモリに置く必要はありません。 主権型ランタイムは VRAM・RAM・ディスクを一つの階層として扱います:ホットな専門家は 高速側に、コールドな専門家は NVMe に、そしてプリフェッチャが予測し、次の層が呼ぶ 専門家を前もって引き込みます。

FAST · VRAM / RAMホットな専門家、使用頻度で固定WARM · RAM最近使用 + 先取り済みCOLD · NVMe(ディスク)モデルの大半、必要時にストリームPILOT次の層の専門家を予測結果744Bモデルを約25GBでデスクトップCPUで動作GPUクラスタ不要外部クラウド不要ルーティングは約72%予測可能1層先まで

これは Colibri ランタイムのパターン —— Apache-2.0、単一ファイルC、依存ゼロ。KODAはCPUネイティブ配信の参照として研究しています。


05 — KODAの設計

共有の土台、専門アダプタ、主権型ランタイム。

我々は744Bモデルを追いません。同じ原理を主権的な規模で適用します:一つの共有 土台が一般能力を担い、小さなアイデンティティ・アダプタがそれを Koda に、あるいは 臨床・産業の専門家にする。統治された記憶が事実を保持し、CPUネイティブのランタイムが すべてを配信する —— 設備のそばで、機関の中で。

統治された記憶(Mnemosyne)共有土台 · 2–3B一般能力Koda / Hiro …臨床産業法務 / コードアイデンティティ + ドメインアダプタ — 一度に一つ読み込むCPUネイティブ主権型ランタイム — Intel · AMD · Arm · エッジ機器

主権的

自分のハードウェアで動く。単一のGPUベンダーや外国クラウドに依存しない。

継続的

各エージェントはセッションを跨いでアイデンティティと記憶を保つ —— そして我々はそれが生き残ることを測定する。

統治された

あらゆる推奨は帰属可能で、上書き可能で、記録される。権限は人間に残る。

効率的

広く蓄え、狭く活性化する:フロンティア級の能力を、稼働コストのごく一部で。

広く蓄える · 狭く活性化する · 主権的に配信する

フロンティアの設計を、仕事が起きる場所へ。

Mixture-of-Experts は、7,440億パラメータのモデルを動かすのと同じ発想が、統治された KODA エージェントを工場のフロア機器や病院自身のサーバで生かせる理由です。フロンティア級の能力を —— 稼働コストのごく一部で、あなたが制御するハードウェアの上で。

誠実な境界:引用した数値(744B · 約5.4%活性 · 約57倍のKV圧縮 · 約72%のルーティング予測性)は GLM-5.2 アーキテクチャと Colibri ランタイムから検証済みです。KODA主権型モデルは Track-D の研究・ 製品プログラムの中にあり、完成した製品の主張ではありません。