N Neurarch Architectures Models Checks Data Docs Open the app

Models / exaone

EXAONE-3.5-7.8B-Instruct

Reconstructed from its own config.json with no weights read. 370K downloads on Hugging Face.

Our count against the checkpoint

The left number comes from the graph. The right one is the number of scalars in the published weight files. Nothing on this page was tuned to make them agree.

Derived from structure
5.94B
5,940,359,168 parameters
In the published checkpoint
7.82B
7,818,448,896 scalars · safetensors.total, read 2026-02-06
Delta
-24.0%

custom-code This repository ships its own modeling code (`auto_map`, e.g. `configuration_exaone.py`), so `config.json` names a class in the repo rather than an architecture `transformers` defines. The graph below is what those config keys mean under `transformers` semantics, which is not necessarily what the repo's own file builds. A gap here is a statement about what we read, not about the checkpoint.

What it costs to run

Cost is a roofline estimate on the priced GPU for 10 epochs at batch 32 over 50,000 samples (assumed; no dataset attached). GPU fit is fp32 weights plus gradients plus two Adam moments (16 bytes per parameter) with 1.3x headroom; activations are not included and grow with batch size.

Layers
196
Will it forward-pass
Yes
Priced on
A10G (24GB)
Est. one run
$12037.47
CardMemory
T4 (16GB)weights + activationsdoes not fit
A100 (40GB)weights + activationsdoes not fit
H100 (80GB)weights + activationsdoes not fit

Structure

198 nodes. Output shapes are propagated from the input shape, batch dimension excluded.

LayerTypeOutput shape
1InputInput1 × 32768
2EmbeddingEmbedding1 × 32768 × 4096
3RoPERoPE1 × 32768 × 4096
4LayerNorm_1_1LayerNorm1 × 32768 × 4096
5Attention_1Grouped Query Attn1 × 32768 × 4096
6Add_1_attnAdd1 × 32768 × 4096
7LayerNorm_1_2LayerNorm1 × 32768 × 4096
8FFN_1Feed Forward1 × 32768 × 4096
9Add_1_ffnAdd1 × 32768 × 4096
10LayerNorm_2_1LayerNorm1 × 32768 × 4096
11Attention_2Grouped Query Attn1 × 32768 × 4096
12Add_2_attnAdd1 × 32768 × 4096
13LayerNorm_2_2LayerNorm1 × 32768 × 4096
14FFN_2Feed Forward1 × 32768 × 4096
15Add_2_ffnAdd1 × 32768 × 4096
16LayerNorm_3_1LayerNorm1 × 32768 × 4096
17Attention_3Grouped Query Attn1 × 32768 × 4096
18Add_3_attnAdd1 × 32768 × 4096
19LayerNorm_3_2LayerNorm1 × 32768 × 4096
20FFN_3Feed Forward1 × 32768 × 4096
21Add_3_ffnAdd1 × 32768 × 4096
22LayerNorm_4_1LayerNorm1 × 32768 × 4096
23Attention_4Grouped Query Attn1 × 32768 × 4096
24Add_4_attnAdd1 × 32768 × 4096
25LayerNorm_4_2LayerNorm1 × 32768 × 4096
26FFN_4Feed Forward1 × 32768 × 4096
27Add_4_ffnAdd1 × 32768 × 4096
28LayerNorm_5_1LayerNorm1 × 32768 × 4096
29Attention_5Grouped Query Attn1 × 32768 × 4096
30Add_5_attnAdd1 × 32768 × 4096
31LayerNorm_5_2LayerNorm1 × 32768 × 4096
32FFN_5Feed Forward1 × 32768 × 4096
33Add_5_ffnAdd1 × 32768 × 4096
34LayerNorm_6_1LayerNorm1 × 32768 × 4096
35Attention_6Grouped Query Attn1 × 32768 × 4096
36Add_6_attnAdd1 × 32768 × 4096
37LayerNorm_6_2LayerNorm1 × 32768 × 4096
38FFN_6Feed Forward1 × 32768 × 4096
39Add_6_ffnAdd1 × 32768 × 4096
40LayerNorm_7_1LayerNorm1 × 32768 × 4096
41Attention_7Grouped Query Attn1 × 32768 × 4096
42Add_7_attnAdd1 × 32768 × 4096
43LayerNorm_7_2LayerNorm1 × 32768 × 4096
44FFN_7Feed Forward1 × 32768 × 4096
45Add_7_ffnAdd1 × 32768 × 4096
46LayerNorm_8_1LayerNorm1 × 32768 × 4096
47Attention_8Grouped Query Attn1 × 32768 × 4096
48Add_8_attnAdd1 × 32768 × 4096
49LayerNorm_8_2LayerNorm1 × 32768 × 4096
50FFN_8Feed Forward1 × 32768 × 4096
51Add_8_ffnAdd1 × 32768 × 4096
52LayerNorm_9_1LayerNorm1 × 32768 × 4096
53Attention_9Grouped Query Attn1 × 32768 × 4096
54Add_9_attnAdd1 × 32768 × 4096
55LayerNorm_9_2LayerNorm1 × 32768 × 4096
56FFN_9Feed Forward1 × 32768 × 4096
57Add_9_ffnAdd1 × 32768 × 4096
58LayerNorm_10_1LayerNorm1 × 32768 × 4096
59Attention_10Grouped Query Attn1 × 32768 × 4096
60Add_10_attnAdd1 × 32768 × 4096
61LayerNorm_10_2LayerNorm1 × 32768 × 4096
62FFN_10Feed Forward1 × 32768 × 4096
63Add_10_ffnAdd1 × 32768 × 4096
64LayerNorm_11_1LayerNorm1 × 32768 × 4096
65Attention_11Grouped Query Attn1 × 32768 × 4096
66Add_11_attnAdd1 × 32768 × 4096
67LayerNorm_11_2LayerNorm1 × 32768 × 4096
68FFN_11Feed Forward1 × 32768 × 4096
69Add_11_ffnAdd1 × 32768 × 4096
70LayerNorm_12_1LayerNorm1 × 32768 × 4096
71Attention_12Grouped Query Attn1 × 32768 × 4096
72Add_12_attnAdd1 × 32768 × 4096
73LayerNorm_12_2LayerNorm1 × 32768 × 4096
74FFN_12Feed Forward1 × 32768 × 4096
75Add_12_ffnAdd1 × 32768 × 4096
76LayerNorm_13_1LayerNorm1 × 32768 × 4096
77Attention_13Grouped Query Attn1 × 32768 × 4096
78Add_13_attnAdd1 × 32768 × 4096
79LayerNorm_13_2LayerNorm1 × 32768 × 4096
80FFN_13Feed Forward1 × 32768 × 4096
81Add_13_ffnAdd1 × 32768 × 4096
82LayerNorm_14_1LayerNorm1 × 32768 × 4096
83Attention_14Grouped Query Attn1 × 32768 × 4096
84Add_14_attnAdd1 × 32768 × 4096
85LayerNorm_14_2LayerNorm1 × 32768 × 4096
86FFN_14Feed Forward1 × 32768 × 4096
87Add_14_ffnAdd1 × 32768 × 4096
88LayerNorm_15_1LayerNorm1 × 32768 × 4096
89Attention_15Grouped Query Attn1 × 32768 × 4096
90Add_15_attnAdd1 × 32768 × 4096
91LayerNorm_15_2LayerNorm1 × 32768 × 4096
92FFN_15Feed Forward1 × 32768 × 4096
93Add_15_ffnAdd1 × 32768 × 4096
94LayerNorm_16_1LayerNorm1 × 32768 × 4096
95Attention_16Grouped Query Attn1 × 32768 × 4096
96Add_16_attnAdd1 × 32768 × 4096
97LayerNorm_16_2LayerNorm1 × 32768 × 4096
98FFN_16Feed Forward1 × 32768 × 4096
99Add_16_ffnAdd1 × 32768 × 4096
100LayerNorm_17_1LayerNorm1 × 32768 × 4096
101Attention_17Grouped Query Attn1 × 32768 × 4096
102Add_17_attnAdd1 × 32768 × 4096
103LayerNorm_17_2LayerNorm1 × 32768 × 4096
104FFN_17Feed Forward1 × 32768 × 4096
105Add_17_ffnAdd1 × 32768 × 4096
106LayerNorm_18_1LayerNorm1 × 32768 × 4096
107Attention_18Grouped Query Attn1 × 32768 × 4096
108Add_18_attnAdd1 × 32768 × 4096
109LayerNorm_18_2LayerNorm1 × 32768 × 4096
110FFN_18Feed Forward1 × 32768 × 4096
111Add_18_ffnAdd1 × 32768 × 4096
112LayerNorm_19_1LayerNorm1 × 32768 × 4096
113Attention_19Grouped Query Attn1 × 32768 × 4096
114Add_19_attnAdd1 × 32768 × 4096
115LayerNorm_19_2LayerNorm1 × 32768 × 4096
116FFN_19Feed Forward1 × 32768 × 4096
117Add_19_ffnAdd1 × 32768 × 4096
118LayerNorm_20_1LayerNorm1 × 32768 × 4096
119Attention_20Grouped Query Attn1 × 32768 × 4096
120Add_20_attnAdd1 × 32768 × 4096
121LayerNorm_20_2LayerNorm1 × 32768 × 4096
122FFN_20Feed Forward1 × 32768 × 4096
123Add_20_ffnAdd1 × 32768 × 4096
124LayerNorm_21_1LayerNorm1 × 32768 × 4096
125Attention_21Grouped Query Attn1 × 32768 × 4096
126Add_21_attnAdd1 × 32768 × 4096
127LayerNorm_21_2LayerNorm1 × 32768 × 4096
128FFN_21Feed Forward1 × 32768 × 4096
129Add_21_ffnAdd1 × 32768 × 4096
130LayerNorm_22_1LayerNorm1 × 32768 × 4096
131Attention_22Grouped Query Attn1 × 32768 × 4096
132Add_22_attnAdd1 × 32768 × 4096
133LayerNorm_22_2LayerNorm1 × 32768 × 4096
134FFN_22Feed Forward1 × 32768 × 4096
135Add_22_ffnAdd1 × 32768 × 4096
136LayerNorm_23_1LayerNorm1 × 32768 × 4096
137Attention_23Grouped Query Attn1 × 32768 × 4096
138Add_23_attnAdd1 × 32768 × 4096
139LayerNorm_23_2LayerNorm1 × 32768 × 4096
140FFN_23Feed Forward1 × 32768 × 4096
141Add_23_ffnAdd1 × 32768 × 4096
142LayerNorm_24_1LayerNorm1 × 32768 × 4096
143Attention_24Grouped Query Attn1 × 32768 × 4096
144Add_24_attnAdd1 × 32768 × 4096
145LayerNorm_24_2LayerNorm1 × 32768 × 4096
146FFN_24Feed Forward1 × 32768 × 4096
147Add_24_ffnAdd1 × 32768 × 4096
148LayerNorm_25_1LayerNorm1 × 32768 × 4096
149Attention_25Grouped Query Attn1 × 32768 × 4096
150Add_25_attnAdd1 × 32768 × 4096
151LayerNorm_25_2LayerNorm1 × 32768 × 4096
152FFN_25Feed Forward1 × 32768 × 4096
153Add_25_ffnAdd1 × 32768 × 4096
154LayerNorm_26_1LayerNorm1 × 32768 × 4096
155Attention_26Grouped Query Attn1 × 32768 × 4096
156Add_26_attnAdd1 × 32768 × 4096
157LayerNorm_26_2LayerNorm1 × 32768 × 4096
158FFN_26Feed Forward1 × 32768 × 4096
159Add_26_ffnAdd1 × 32768 × 4096
160LayerNorm_27_1LayerNorm1 × 32768 × 4096
161Attention_27Grouped Query Attn1 × 32768 × 4096
162Add_27_attnAdd1 × 32768 × 4096
163LayerNorm_27_2LayerNorm1 × 32768 × 4096
164FFN_27Feed Forward1 × 32768 × 4096
165Add_27_ffnAdd1 × 32768 × 4096
166LayerNorm_28_1LayerNorm1 × 32768 × 4096
167Attention_28Grouped Query Attn1 × 32768 × 4096
168Add_28_attnAdd1 × 32768 × 4096
169LayerNorm_28_2LayerNorm1 × 32768 × 4096
170FFN_28Feed Forward1 × 32768 × 4096
171Add_28_ffnAdd1 × 32768 × 4096
172LayerNorm_29_1LayerNorm1 × 32768 × 4096
173Attention_29Grouped Query Attn1 × 32768 × 4096
174Add_29_attnAdd1 × 32768 × 4096
175LayerNorm_29_2LayerNorm1 × 32768 × 4096
176FFN_29Feed Forward1 × 32768 × 4096
177Add_29_ffnAdd1 × 32768 × 4096
178LayerNorm_30_1LayerNorm1 × 32768 × 4096
179Attention_30Grouped Query Attn1 × 32768 × 4096
180Add_30_attnAdd1 × 32768 × 4096
181LayerNorm_30_2LayerNorm1 × 32768 × 4096
182FFN_30Feed Forward1 × 32768 × 4096
183Add_30_ffnAdd1 × 32768 × 4096
184LayerNorm_31_1LayerNorm1 × 32768 × 4096
185Attention_31Grouped Query Attn1 × 32768 × 4096
186Add_31_attnAdd1 × 32768 × 4096
187LayerNorm_31_2LayerNorm1 × 32768 × 4096
188FFN_31Feed Forward1 × 32768 × 4096
189Add_31_ffnAdd1 × 32768 × 4096
190LayerNorm_32_1LayerNorm1 × 32768 × 4096
191Attention_32Grouped Query Attn1 × 32768 × 4096
192Add_32_attnAdd1 × 32768 × 4096
193LayerNorm_32_2LayerNorm1 × 32768 × 4096
194FFN_32Feed Forward1 × 32768 × 4096
195Add_32_ffnAdd1 × 32768 × 4096
196Final_LayerNormLayerNorm1 × 32768 × 4096
197LM_HeadLinear1 × 32768 × 102400
198OutputOutput1 × 32768 × 102400

What the verifier says

infoAt 32 stacked attention layers, residual-branch outputs add up; unscaled init lets activation variance grow with depth. GPT-2/LLaMA-family models scale the residual projections by depth (N(0, 0.02 / √(2L))). Fix: Scale residual output projections by depth: nn.init.normal_(w, std=0.02 / math.sqrt(2 * n_layers))
deep-attention-default-init

Do this to your own model

Same numbers, on a model in your repo, in one command. No account.

pip install neurarch-trace
neurarch-trace LGAI-EXAONE/EXAONE-3.5-7.8B-Instruct --plan --share

Other exaone checkpoints

EXAONE-3.5-32B-Instruct-AWQ
23.03B derived · -28.0% against the checkpoint
EXAONE-3.5-7.8B-Instruct-AWQ
5.94B derived · -24.0% against the checkpoint