N Neurarch Architectures Models Checks Data Docs Open the app

Models / kimi_k25

Kimi-K2.6

Reconstructed from its own config.json with no weights read. 562K downloads on Hugging Face.

Our count against the checkpoint

The left number comes from the graph. The right one is the number of scalars in the published weight files. Nothing on this page was tuned to make them agree.

Derived from structure
31.71B
31,713,123,328 parameters
In the published checkpoint
1027B
1,026,879,376,368 scalars · safetensors.total, read 2026-05-19
Delta
-96.9%

quantized This checkpoint is stored quantized (compressed-tensors). The tensor count in the file counts stored elements under a packing scheme, not logical parameters, so the two numbers below are not measuring the same thing in either direction.

What it costs to run

Cost is a roofline estimate on the priced GPU for 10 epochs at batch 32 over 50,000 samples (assumed; no dataset attached). GPU fit is fp32 weights plus gradients plus two Adam moments (16 bytes per parameter) with 1.3x headroom; activations are not included and grow with batch size.

Layers
246
Will it forward-pass
Yes
Priced on
A10G (24GB)
Est. one run
$1405738.89
CardMemory
T4 (16GB)weights + activationsdoes not fit
A100 (40GB)weights + activationsdoes not fit
H100 (80GB)weights + activationsdoes not fit

Structure

248 nodes. Output shapes are propagated from the input shape, batch dimension excluded.

LayerTypeOutput shape
1InputInput1 × 262144
2EmbeddingEmbedding1 × 262144 × 7168
3Positional_EmbeddingLearned Pos Embed1 × 262144 × 7168
4Attention_1Multi-Head Attention1 × 262144 × 7168
5Add_1Add1 × 262144 × 7168
6LayerNorm_1_1LayerNorm1 × 262144 × 7168
7FFN_1Feed Forward1 × 262144 × 7168
8Attention_2Multi-Head Attention1 × 262144 × 7168
9Add_2Add1 × 262144 × 7168
10LayerNorm_2_1LayerNorm1 × 262144 × 7168
11FFN_2Feed Forward1 × 262144 × 7168
12Attention_3Multi-Head Attention1 × 262144 × 7168
13Add_3Add1 × 262144 × 7168
14LayerNorm_3_1LayerNorm1 × 262144 × 7168
15FFN_3Feed Forward1 × 262144 × 7168
16Attention_4Multi-Head Attention1 × 262144 × 7168
17Add_4Add1 × 262144 × 7168
18LayerNorm_4_1LayerNorm1 × 262144 × 7168
19FFN_4Feed Forward1 × 262144 × 7168
20Attention_5Multi-Head Attention1 × 262144 × 7168
21Add_5Add1 × 262144 × 7168
22LayerNorm_5_1LayerNorm1 × 262144 × 7168
23FFN_5Feed Forward1 × 262144 × 7168
24Attention_6Multi-Head Attention1 × 262144 × 7168
25Add_6Add1 × 262144 × 7168
26LayerNorm_6_1LayerNorm1 × 262144 × 7168
27FFN_6Feed Forward1 × 262144 × 7168
28Attention_7Multi-Head Attention1 × 262144 × 7168
29Add_7Add1 × 262144 × 7168
30LayerNorm_7_1LayerNorm1 × 262144 × 7168
31FFN_7Feed Forward1 × 262144 × 7168
32Attention_8Multi-Head Attention1 × 262144 × 7168
33Add_8Add1 × 262144 × 7168
34LayerNorm_8_1LayerNorm1 × 262144 × 7168
35FFN_8Feed Forward1 × 262144 × 7168
36Attention_9Multi-Head Attention1 × 262144 × 7168
37Add_9Add1 × 262144 × 7168
38LayerNorm_9_1LayerNorm1 × 262144 × 7168
39FFN_9Feed Forward1 × 262144 × 7168
40Attention_10Multi-Head Attention1 × 262144 × 7168
41Add_10Add1 × 262144 × 7168
42LayerNorm_10_1LayerNorm1 × 262144 × 7168
43FFN_10Feed Forward1 × 262144 × 7168
44Attention_11Multi-Head Attention1 × 262144 × 7168
45Add_11Add1 × 262144 × 7168
46LayerNorm_11_1LayerNorm1 × 262144 × 7168
47FFN_11Feed Forward1 × 262144 × 7168
48Attention_12Multi-Head Attention1 × 262144 × 7168
49Add_12Add1 × 262144 × 7168
50LayerNorm_12_1LayerNorm1 × 262144 × 7168
51FFN_12Feed Forward1 × 262144 × 7168
52Attention_13Multi-Head Attention1 × 262144 × 7168
53Add_13Add1 × 262144 × 7168
54LayerNorm_13_1LayerNorm1 × 262144 × 7168
55FFN_13Feed Forward1 × 262144 × 7168
56Attention_14Multi-Head Attention1 × 262144 × 7168
57Add_14Add1 × 262144 × 7168
58LayerNorm_14_1LayerNorm1 × 262144 × 7168
59FFN_14Feed Forward1 × 262144 × 7168
60Attention_15Multi-Head Attention1 × 262144 × 7168
61Add_15Add1 × 262144 × 7168
62LayerNorm_15_1LayerNorm1 × 262144 × 7168
63FFN_15Feed Forward1 × 262144 × 7168
64Attention_16Multi-Head Attention1 × 262144 × 7168
65Add_16Add1 × 262144 × 7168
66LayerNorm_16_1LayerNorm1 × 262144 × 7168
67FFN_16Feed Forward1 × 262144 × 7168
68Attention_17Multi-Head Attention1 × 262144 × 7168
69Add_17Add1 × 262144 × 7168
70LayerNorm_17_1LayerNorm1 × 262144 × 7168
71FFN_17Feed Forward1 × 262144 × 7168
72Attention_18Multi-Head Attention1 × 262144 × 7168
73Add_18Add1 × 262144 × 7168
74LayerNorm_18_1LayerNorm1 × 262144 × 7168
75FFN_18Feed Forward1 × 262144 × 7168
76Attention_19Multi-Head Attention1 × 262144 × 7168
77Add_19Add1 × 262144 × 7168
78LayerNorm_19_1LayerNorm1 × 262144 × 7168
79FFN_19Feed Forward1 × 262144 × 7168
80Attention_20Multi-Head Attention1 × 262144 × 7168
81Add_20Add1 × 262144 × 7168
82LayerNorm_20_1LayerNorm1 × 262144 × 7168
83FFN_20Feed Forward1 × 262144 × 7168
84Attention_21Multi-Head Attention1 × 262144 × 7168
85Add_21Add1 × 262144 × 7168
86LayerNorm_21_1LayerNorm1 × 262144 × 7168
87FFN_21Feed Forward1 × 262144 × 7168
88Attention_22Multi-Head Attention1 × 262144 × 7168
89Add_22Add1 × 262144 × 7168
90LayerNorm_22_1LayerNorm1 × 262144 × 7168
91FFN_22Feed Forward1 × 262144 × 7168
92Attention_23Multi-Head Attention1 × 262144 × 7168
93Add_23Add1 × 262144 × 7168
94LayerNorm_23_1LayerNorm1 × 262144 × 7168
95FFN_23Feed Forward1 × 262144 × 7168
96Attention_24Multi-Head Attention1 × 262144 × 7168
97Add_24Add1 × 262144 × 7168
98LayerNorm_24_1LayerNorm1 × 262144 × 7168
99FFN_24Feed Forward1 × 262144 × 7168
100Attention_25Multi-Head Attention1 × 262144 × 7168
101Add_25Add1 × 262144 × 7168
102LayerNorm_25_1LayerNorm1 × 262144 × 7168
103FFN_25Feed Forward1 × 262144 × 7168
104Attention_26Multi-Head Attention1 × 262144 × 7168
105Add_26Add1 × 262144 × 7168
106LayerNorm_26_1LayerNorm1 × 262144 × 7168
107FFN_26Feed Forward1 × 262144 × 7168
108Attention_27Multi-Head Attention1 × 262144 × 7168
109Add_27Add1 × 262144 × 7168
110LayerNorm_27_1LayerNorm1 × 262144 × 7168
111FFN_27Feed Forward1 × 262144 × 7168
112Attention_28Multi-Head Attention1 × 262144 × 7168
113Add_28Add1 × 262144 × 7168
114LayerNorm_28_1LayerNorm1 × 262144 × 7168
115FFN_28Feed Forward1 × 262144 × 7168
116Attention_29Multi-Head Attention1 × 262144 × 7168
117Add_29Add1 × 262144 × 7168
118LayerNorm_29_1LayerNorm1 × 262144 × 7168
119FFN_29Feed Forward1 × 262144 × 7168
120Attention_30Multi-Head Attention1 × 262144 × 7168
121Add_30Add1 × 262144 × 7168
122LayerNorm_30_1LayerNorm1 × 262144 × 7168
123FFN_30Feed Forward1 × 262144 × 7168
124Attention_31Multi-Head Attention1 × 262144 × 7168
125Add_31Add1 × 262144 × 7168
126LayerNorm_31_1LayerNorm1 × 262144 × 7168
127FFN_31Feed Forward1 × 262144 × 7168
128Attention_32Multi-Head Attention1 × 262144 × 7168
129Add_32Add1 × 262144 × 7168
130LayerNorm_32_1LayerNorm1 × 262144 × 7168
131FFN_32Feed Forward1 × 262144 × 7168
132Attention_33Multi-Head Attention1 × 262144 × 7168
133Add_33Add1 × 262144 × 7168
134LayerNorm_33_1LayerNorm1 × 262144 × 7168
135FFN_33Feed Forward1 × 262144 × 7168
136Attention_34Multi-Head Attention1 × 262144 × 7168
137Add_34Add1 × 262144 × 7168
138LayerNorm_34_1LayerNorm1 × 262144 × 7168
139FFN_34Feed Forward1 × 262144 × 7168
140Attention_35Multi-Head Attention1 × 262144 × 7168
141Add_35Add1 × 262144 × 7168
142LayerNorm_35_1LayerNorm1 × 262144 × 7168
143FFN_35Feed Forward1 × 262144 × 7168
144Attention_36Multi-Head Attention1 × 262144 × 7168
145Add_36Add1 × 262144 × 7168
146LayerNorm_36_1LayerNorm1 × 262144 × 7168
147FFN_36Feed Forward1 × 262144 × 7168
148Attention_37Multi-Head Attention1 × 262144 × 7168
149Add_37Add1 × 262144 × 7168
150LayerNorm_37_1LayerNorm1 × 262144 × 7168
151FFN_37Feed Forward1 × 262144 × 7168
152Attention_38Multi-Head Attention1 × 262144 × 7168
153Add_38Add1 × 262144 × 7168
154LayerNorm_38_1LayerNorm1 × 262144 × 7168
155FFN_38Feed Forward1 × 262144 × 7168
156Attention_39Multi-Head Attention1 × 262144 × 7168
157Add_39Add1 × 262144 × 7168
158LayerNorm_39_1LayerNorm1 × 262144 × 7168
159FFN_39Feed Forward1 × 262144 × 7168
160Attention_40Multi-Head Attention1 × 262144 × 7168
161Add_40Add1 × 262144 × 7168
162LayerNorm_40_1LayerNorm1 × 262144 × 7168
163FFN_40Feed Forward1 × 262144 × 7168
164Attention_41Multi-Head Attention1 × 262144 × 7168
165Add_41Add1 × 262144 × 7168
166LayerNorm_41_1LayerNorm1 × 262144 × 7168
167FFN_41Feed Forward1 × 262144 × 7168
168Attention_42Multi-Head Attention1 × 262144 × 7168
169Add_42Add1 × 262144 × 7168
170LayerNorm_42_1LayerNorm1 × 262144 × 7168
171FFN_42Feed Forward1 × 262144 × 7168
172Attention_43Multi-Head Attention1 × 262144 × 7168
173Add_43Add1 × 262144 × 7168
174LayerNorm_43_1LayerNorm1 × 262144 × 7168
175FFN_43Feed Forward1 × 262144 × 7168
176Attention_44Multi-Head Attention1 × 262144 × 7168
177Add_44Add1 × 262144 × 7168
178LayerNorm_44_1LayerNorm1 × 262144 × 7168
179FFN_44Feed Forward1 × 262144 × 7168
180Attention_45Multi-Head Attention1 × 262144 × 7168
181Add_45Add1 × 262144 × 7168
182LayerNorm_45_1LayerNorm1 × 262144 × 7168
183FFN_45Feed Forward1 × 262144 × 7168
184Attention_46Multi-Head Attention1 × 262144 × 7168
185Add_46Add1 × 262144 × 7168
186LayerNorm_46_1LayerNorm1 × 262144 × 7168
187FFN_46Feed Forward1 × 262144 × 7168
188Attention_47Multi-Head Attention1 × 262144 × 7168
189Add_47Add1 × 262144 × 7168
190LayerNorm_47_1LayerNorm1 × 262144 × 7168
191FFN_47Feed Forward1 × 262144 × 7168
192Attention_48Multi-Head Attention1 × 262144 × 7168
193Add_48Add1 × 262144 × 7168
194LayerNorm_48_1LayerNorm1 × 262144 × 7168
195FFN_48Feed Forward1 × 262144 × 7168
196Attention_49Multi-Head Attention1 × 262144 × 7168
197Add_49Add1 × 262144 × 7168
198LayerNorm_49_1LayerNorm1 × 262144 × 7168
199FFN_49Feed Forward1 × 262144 × 7168
200Attention_50Multi-Head Attention1 × 262144 × 7168
201Add_50Add1 × 262144 × 7168
202LayerNorm_50_1LayerNorm1 × 262144 × 7168
203FFN_50Feed Forward1 × 262144 × 7168
204Attention_51Multi-Head Attention1 × 262144 × 7168
205Add_51Add1 × 262144 × 7168
206LayerNorm_51_1LayerNorm1 × 262144 × 7168
207FFN_51Feed Forward1 × 262144 × 7168
208Attention_52Multi-Head Attention1 × 262144 × 7168
209Add_52Add1 × 262144 × 7168
210LayerNorm_52_1LayerNorm1 × 262144 × 7168
211FFN_52Feed Forward1 × 262144 × 7168
212Attention_53Multi-Head Attention1 × 262144 × 7168
213Add_53Add1 × 262144 × 7168
214LayerNorm_53_1LayerNorm1 × 262144 × 7168
215FFN_53Feed Forward1 × 262144 × 7168
216Attention_54Multi-Head Attention1 × 262144 × 7168
217Add_54Add1 × 262144 × 7168
218LayerNorm_54_1LayerNorm1 × 262144 × 7168
219FFN_54Feed Forward1 × 262144 × 7168
220Attention_55Multi-Head Attention1 × 262144 × 7168
221Add_55Add1 × 262144 × 7168
222LayerNorm_55_1LayerNorm1 × 262144 × 7168
223FFN_55Feed Forward1 × 262144 × 7168
224Attention_56Multi-Head Attention1 × 262144 × 7168
225Add_56Add1 × 262144 × 7168
226LayerNorm_56_1LayerNorm1 × 262144 × 7168
227FFN_56Feed Forward1 × 262144 × 7168
228Attention_57Multi-Head Attention1 × 262144 × 7168
229Add_57Add1 × 262144 × 7168
230LayerNorm_57_1LayerNorm1 × 262144 × 7168
231FFN_57Feed Forward1 × 262144 × 7168
232Attention_58Multi-Head Attention1 × 262144 × 7168
233Add_58Add1 × 262144 × 7168
234LayerNorm_58_1LayerNorm1 × 262144 × 7168
235FFN_58Feed Forward1 × 262144 × 7168
236Attention_59Multi-Head Attention1 × 262144 × 7168
237Add_59Add1 × 262144 × 7168
238LayerNorm_59_1LayerNorm1 × 262144 × 7168
239FFN_59Feed Forward1 × 262144 × 7168
240Attention_60Multi-Head Attention1 × 262144 × 7168
241Add_60Add1 × 262144 × 7168
242LayerNorm_60_1LayerNorm1 × 262144 × 7168
243FFN_60Feed Forward1 × 262144 × 7168
244Attention_61Multi-Head Attention1 × 262144 × 7168
245Add_61Add1 × 262144 × 7168
246LayerNorm_61_1LayerNorm1 × 262144 × 7168
247FFN_61Feed Forward1 × 262144 × 7168
248OutputOutput1 × 262144 × 7168

What the verifier says

info61 attention layers at embedDim 7168 cache full per-head K/V: about 1708 KB per token at fp16, which dominates memory at long context. Grouped-query attention (e.g. 8:1) would cut this ~8×; multi-head latent attention (MLA) shrinks it ~10× or more. This is the move production LLMs make; it does not change the parameter count. Fix: Switch attention to groupedQueryAttention (set numKVHeads below numHeads, e.g. numHeads/4) or mla (a low-rank cached latent).
full-mha-serving-cost
infoAt 61 stacked attention layers, residual-branch outputs add up; unscaled init lets activation variance grow with depth. GPT-2/LLaMA-family models scale the residual projections by depth (N(0, 0.02 / √(2L))). Fix: Scale residual output projections by depth: nn.init.normal_(w, std=0.02 / math.sqrt(2 * n_layers))
deep-attention-default-init
warnAcross 61 attention layers this design caches 1708 KB per token, so a single 8,192-token sequence needs ~14.3 GB of KV cache before weights or activations. That exceeds the 4 GB budget this rule assumes for serving headroom. Fix: Cut KV width: raise the GQA ratio (fewer numKVHeads), switch to MLA, reduce depth or embedDim, or accept a shorter serving context.
kv-cache-context-budget

Do this to your own model

Same numbers, on a model in your repo, in one command. No account.

pip install neurarch-trace
neurarch-trace moonshotai/Kimi-K2.6 --plan --share

Other kimi_k25 checkpoints

Kimi-K2.5
31.71B derived · -96.9% against the checkpoint
Kimi-K2.7-Code
31.71B derived · -96.9% against the checkpoint