KODA EDUCATION · 主権型AI · MIXTURE-OF-EXPERTS
主権型AIが、普通の
ハードウェアで動く仕組み。
大きなモデルは膨大な知識を蓄えます。Mixture-of-Experts モデルは、読み込む一語ごとに そのごく一部だけを使います —— これこそが、フロンティア級の知能を普通のサーバCPUで、 エッジで、機関の中で動かせる理由です。これは GLM の設計であり、KODA主権型モデルの 青写真です。
01 — 大きなモデル、小さなマシン
GPUのラックなしで、フロンティアの知識を。
フロンティアモデルは数千億のパラメータを持ちます。それらすべてを高速メモリに読み込むには GPUのラックが要ります —— 高価で、希少で、自分が制御できないクラウドに縛られる。病院、工場、 主権的な展開にとって、それは形が間違っています。
Mixture-of-Experts は経済性を変えます:知識は広く保ちながら、各トークンに 関係する一部だけを活性化する。
広く蓄える。狭く活性化する。
02 — 密(DENSE)と MIXTURE-OF-EXPERTS
モデルの大半は待機したまま —— そして安い。
密(dense)モデルは、すべてのトークンに対してすべてのパラメータを動かします。MoE モデルは多数の「専門家(expert)」を持ちますが、ルーターがトークンごとに 数個だけ選ぶ —— だからモデルの大半は待機したまま、安く済みます。
GLM-5.2:744Bパラメータを蓄積 · トークンあたり約5.4%が活性(Colibriランタイムで検証済み)。
03 — GLM Mixture-of-Experts 層の内側
ルーター、数個の専門家、常時オンの土台。
各トークンについて、小さなルーターが専門家を採点し、上位の数個を選びます。共有専門家(shared expert)は常に動き —— 一般的な能力を担います —— その上に ルーティングされた専門家が専門性を加えます。結果は統合されます。
この設計が優れる理由:ルーターは学習可能なバイアスで専門家の負荷を均衡させます —— 主目的と戦う補助損失なしに —— だから専門家は均衡を保ちかつ品質も向上します。 アテンションも圧縮され(MLA)、長文脈のメモリコストを約57分の1に縮めます。
知識は多数の小さな専門家に蓄える。トークンが必要とする数個だけを計算する。
04 — メモリの工夫
専門家はディスクに置く。必要になるものを先取りする。
トークンごとに数個の専門家しか動かないなら、すべてを高価な高速メモリに置く必要はありません。 主権型ランタイムは VRAM・RAM・ディスクを一つの階層として扱います:ホットな専門家は 高速側に、コールドな専門家は NVMe に、そしてプリフェッチャが予測し、次の層が呼ぶ 専門家を前もって引き込みます。
これは Colibri ランタイムのパターン —— Apache-2.0、単一ファイルC、依存ゼロ。KODAはCPUネイティブ配信の参照として研究しています。
05 — KODAの設計
共有の土台、専門アダプタ、主権型ランタイム。
我々は744Bモデルを追いません。同じ原理を主権的な規模で適用します:一つの共有 土台が一般能力を担い、小さなアイデンティティ・アダプタがそれを Koda に、あるいは 臨床・産業の専門家にする。統治された記憶が事実を保持し、CPUネイティブのランタイムが すべてを配信する —— 設備のそばで、機関の中で。
主権的
自分のハードウェアで動く。単一のGPUベンダーや外国クラウドに依存しない。
継続的
各エージェントはセッションを跨いでアイデンティティと記憶を保つ —— そして我々はそれが生き残ることを測定する。
統治された
あらゆる推奨は帰属可能で、上書き可能で、記録される。権限は人間に残る。
効率的
広く蓄え、狭く活性化する:フロンティア級の能力を、稼働コストのごく一部で。
広く蓄える · 狭く活性化する · 主権的に配信する
フロンティアの設計を、仕事が起きる場所へ。
Mixture-of-Experts は、7,440億パラメータのモデルを動かすのと同じ発想が、統治された KODA エージェントを工場のフロア機器や病院自身のサーバで生かせる理由です。フロンティア級の能力を —— 稼働コストのごく一部で、あなたが制御するハードウェアの上で。
誠実な境界:引用した数値(744B · 約5.4%活性 · 約57倍のKV圧縮 · 約72%のルーティング予測性)は GLM-5.2 アーキテクチャと Colibri ランタイムから検証済みです。KODA主権型モデルは Track-D の研究・ 製品プログラムの中にあり、完成した製品の主張ではありません。

