N Neurarch Architectures Checks Docs Open the app

Architectures / NLP/LLM

๐ŸŸฃ Qwen3-8B

Modern dense decoder LLM โ€” GQA with QK-RMSNorm on the query/key projections for training stability (Alibaba 2025)

Layers
221
Parameters
8.19B
Input
1 ร— 40960
Output
1 ร— 40960 ร— 151936
Verifier
1 advisory

Every number on this page is computed from the graph by the same functions the app runs, not written by hand.

Open Qwen3-8B on the canvas Free, no account needed

When to pick it

A clean, current dense-decoder reference. Pick when you want a straightforward modern LLM block without MoE routing.

Structure

221 layers. Output shapes are propagated from the input shape, batch dimension excluded.

LayerTypeParametersOutput shape
1InputInputshape=[1, 40960]1 ร— 40960
2EmbeddingEmbeddingvocabSize=1519361 ร— 40960 ร— 4096
3RMSNorm_1_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
4Attention_1Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
5Add_1_attnAdd1 ร— 40960 ร— 4096
6RMSNorm_1_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
7FFN_1SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
8Add_1_ffnAdd1 ร— 40960 ร— 4096
9RMSNorm_2_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
10Attention_2Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
11Add_2_attnAdd1 ร— 40960 ร— 4096
12RMSNorm_2_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
13FFN_2SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
14Add_2_ffnAdd1 ร— 40960 ร— 4096
15RMSNorm_3_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
16Attention_3Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
17Add_3_attnAdd1 ร— 40960 ร— 4096
18RMSNorm_3_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
19FFN_3SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
20Add_3_ffnAdd1 ร— 40960 ร— 4096
21RMSNorm_4_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
22Attention_4Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
23Add_4_attnAdd1 ร— 40960 ร— 4096
24RMSNorm_4_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
25FFN_4SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
26Add_4_ffnAdd1 ร— 40960 ร— 4096
27RMSNorm_5_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
28Attention_5Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
29Add_5_attnAdd1 ร— 40960 ร— 4096
30RMSNorm_5_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
31FFN_5SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
32Add_5_ffnAdd1 ร— 40960 ร— 4096
33RMSNorm_6_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
34Attention_6Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
35Add_6_attnAdd1 ร— 40960 ร— 4096
36RMSNorm_6_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
37FFN_6SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
38Add_6_ffnAdd1 ร— 40960 ร— 4096
39RMSNorm_7_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
40Attention_7Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
41Add_7_attnAdd1 ร— 40960 ร— 4096
42RMSNorm_7_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
43FFN_7SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
44Add_7_ffnAdd1 ร— 40960 ร— 4096
45RMSNorm_8_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
46Attention_8Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
47Add_8_attnAdd1 ร— 40960 ร— 4096
48RMSNorm_8_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
49FFN_8SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
50Add_8_ffnAdd1 ร— 40960 ร— 4096
51RMSNorm_9_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
52Attention_9Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
53Add_9_attnAdd1 ร— 40960 ร— 4096
54RMSNorm_9_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
55FFN_9SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
56Add_9_ffnAdd1 ร— 40960 ร— 4096
57RMSNorm_10_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
58Attention_10Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
59Add_10_attnAdd1 ร— 40960 ร— 4096
60RMSNorm_10_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
61FFN_10SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
62Add_10_ffnAdd1 ร— 40960 ร— 4096
63RMSNorm_11_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
64Attention_11Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
65Add_11_attnAdd1 ร— 40960 ร— 4096
66RMSNorm_11_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
67FFN_11SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
68Add_11_ffnAdd1 ร— 40960 ร— 4096
69RMSNorm_12_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
70Attention_12Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
71Add_12_attnAdd1 ร— 40960 ร— 4096
72RMSNorm_12_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
73FFN_12SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
74Add_12_ffnAdd1 ร— 40960 ร— 4096
75RMSNorm_13_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
76Attention_13Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
77Add_13_attnAdd1 ร— 40960 ร— 4096
78RMSNorm_13_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
79FFN_13SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
80Add_13_ffnAdd1 ร— 40960 ร— 4096
81RMSNorm_14_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
82Attention_14Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
83Add_14_attnAdd1 ร— 40960 ร— 4096
84RMSNorm_14_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
85FFN_14SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
86Add_14_ffnAdd1 ร— 40960 ร— 4096
87RMSNorm_15_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
88Attention_15Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
89Add_15_attnAdd1 ร— 40960 ร— 4096
90RMSNorm_15_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
91FFN_15SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
92Add_15_ffnAdd1 ร— 40960 ร— 4096
93RMSNorm_16_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
94Attention_16Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
95Add_16_attnAdd1 ร— 40960 ร— 4096
96RMSNorm_16_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
97FFN_16SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
98Add_16_ffnAdd1 ร— 40960 ร— 4096
99RMSNorm_17_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
100Attention_17Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
101Add_17_attnAdd1 ร— 40960 ร— 4096
102RMSNorm_17_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
103FFN_17SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
104Add_17_ffnAdd1 ร— 40960 ร— 4096
105RMSNorm_18_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
106Attention_18Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
107Add_18_attnAdd1 ร— 40960 ร— 4096
108RMSNorm_18_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
109FFN_18SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
110Add_18_ffnAdd1 ร— 40960 ร— 4096
111RMSNorm_19_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
112Attention_19Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
113Add_19_attnAdd1 ร— 40960 ร— 4096
114RMSNorm_19_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
115FFN_19SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
116Add_19_ffnAdd1 ร— 40960 ร— 4096
117RMSNorm_20_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
118Attention_20Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
119Add_20_attnAdd1 ร— 40960 ร— 4096
120RMSNorm_20_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
121FFN_20SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
122Add_20_ffnAdd1 ร— 40960 ร— 4096
123RMSNorm_21_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
124Attention_21Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
125Add_21_attnAdd1 ร— 40960 ร— 4096
126RMSNorm_21_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
127FFN_21SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
128Add_21_ffnAdd1 ร— 40960 ร— 4096
129RMSNorm_22_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
130Attention_22Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
131Add_22_attnAdd1 ร— 40960 ร— 4096
132RMSNorm_22_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
133FFN_22SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
134Add_22_ffnAdd1 ร— 40960 ร— 4096
135RMSNorm_23_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
136Attention_23Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
137Add_23_attnAdd1 ร— 40960 ร— 4096
138RMSNorm_23_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
139FFN_23SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
140Add_23_ffnAdd1 ร— 40960 ร— 4096
141RMSNorm_24_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
142Attention_24Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
143Add_24_attnAdd1 ร— 40960 ร— 4096
144RMSNorm_24_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
145FFN_24SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
146Add_24_ffnAdd1 ร— 40960 ร— 4096
147RMSNorm_25_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
148Attention_25Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
149Add_25_attnAdd1 ร— 40960 ร— 4096
150RMSNorm_25_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
151FFN_25SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
152Add_25_ffnAdd1 ร— 40960 ร— 4096
153RMSNorm_26_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
154Attention_26Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
155Add_26_attnAdd1 ร— 40960 ร— 4096
156RMSNorm_26_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
157FFN_26SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
158Add_26_ffnAdd1 ร— 40960 ร— 4096
159RMSNorm_27_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
160Attention_27Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
161Add_27_attnAdd1 ร— 40960 ร— 4096
162RMSNorm_27_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
163FFN_27SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
164Add_27_ffnAdd1 ร— 40960 ร— 4096
165RMSNorm_28_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
166Attention_28Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
167Add_28_attnAdd1 ร— 40960 ร— 4096
168RMSNorm_28_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
169FFN_28SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
170Add_28_ffnAdd1 ร— 40960 ร— 4096
171RMSNorm_29_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
172Attention_29Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
173Add_29_attnAdd1 ร— 40960 ร— 4096
174RMSNorm_29_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
175FFN_29SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
176Add_29_ffnAdd1 ร— 40960 ร— 4096
177RMSNorm_30_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
178Attention_30Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
179Add_30_attnAdd1 ร— 40960 ร— 4096
180RMSNorm_30_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
181FFN_30SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
182Add_30_ffnAdd1 ร— 40960 ร— 4096
183RMSNorm_31_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
184Attention_31Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
185Add_31_attnAdd1 ร— 40960 ร— 4096
186RMSNorm_31_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
187FFN_31SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
188Add_31_ffnAdd1 ร— 40960 ร— 4096
189RMSNorm_32_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
190Attention_32Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
191Add_32_attnAdd1 ร— 40960 ร— 4096
192RMSNorm_32_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
193FFN_32SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
194Add_32_ffnAdd1 ร— 40960 ร— 4096
195RMSNorm_33_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
196Attention_33Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
197Add_33_attnAdd1 ร— 40960 ร— 4096
198RMSNorm_33_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
199FFN_33SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
200Add_33_ffnAdd1 ร— 40960 ร— 4096
201RMSNorm_34_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
202Attention_34Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
203Add_34_attnAdd1 ร— 40960 ร— 4096
204RMSNorm_34_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
205FFN_34SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
206Add_34_ffnAdd1 ร— 40960 ร— 4096
207RMSNorm_35_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
208Attention_35Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
209Add_35_attnAdd1 ร— 40960 ร— 4096
210RMSNorm_35_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
211FFN_35SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
212Add_35_ffnAdd1 ร— 40960 ร— 4096
213RMSNorm_36_1RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
214Attention_36Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=81 ร— 40960 ร— 4096
215Add_36_attnAdd1 ร— 40960 ร— 4096
216RMSNorm_36_2RMSNormnormalizedShape=40961 ร— 40960 ร— 4096
217FFN_36SwiGLUembedDim=4096, intermediateSize=122881 ร— 40960 ร— 4096
218Add_36_ffnAdd1 ร— 40960 ร— 4096
219Final_RMSNormRMSNormnormalizedShape=40961 ร— 40960 ร— 4096
220LM_HeadLinearoutFeatures=151936, inFeatures=40961 ร— 40960 ร— 151936
221OutputOutput1 ร— 40960 ร— 151936

What the verifier says

The same 41 structural checks that run on every edit in the app, on this graph.

warn36 attention layer(s) present but no positional encoding found. Attention is permutation-invariant, without position information the model cannot distinguish token order. Fix: Add a PositionalEncoding (sinusoidal) or RoPE layer before the first attention layer. (Attention_1)
attention-no-pe
infoAt 36 stacked attention layers, residual-branch outputs add up; unscaled init lets activation variance grow with depth. GPT-2/LLaMA-family models scale the residual projections by depth (N(0, 0.02 / โˆš(2L))). Fix: Scale residual output projections by depth: nn.init.normal_(w, std=0.02 / math.sqrt(2 * n_layers)) (Attention_1)
deep-attention-default-init

The PyTorch it exports

Generated from the graph above. First 46 lines; the app exports the whole file, plus the training loop, the data contract and a deploy bundle.

# Architecture designed with Neurarch: https://neurarch.com
# PyTorch: compatible with Python 3.8+ and torch>=1.12
# Colab: pip install torch torchvision  (usually pre-installed)

import torch
import torch.nn as nn
import torch.nn.functional as F
from typing import Tuple

class Qwen3_8B(nn.Module):
    def __init__(self):
        super().__init__()

        self.embedding_1 = nn.Embedding(151936, 4096)
        self.rmsNorm_1 = nn.RMSNorm(4096)
        self.groupedQueryAttention_1 = nn.ModuleDict({
            'q_proj': nn.Linear(4096, 4096,        bias=False),   # 32 heads ร— 128
            'k_proj': nn.Linear(4096, 1024, bias=False),   # 8 KV heads ร— 128
            'v_proj': nn.Linear(4096, 1024, bias=False),
            'o_proj': nn.Linear(4096, 4096,        bias=False),
        })  # GQA: 32Q / 8KV heads (requires F.scaled_dot_product_attention)
        self.rmsNorm_2 = nn.RMSNorm(4096)
        self.swiglu_1 = nn.ModuleDict({
            'gate_proj': nn.Linear(4096, 12288, bias=False),
            'up_proj':   nn.Linear(4096, 12288, bias=False),
            'down_proj': nn.Linear(12288, 4096, bias=False),
        })  # SwiGLU FFN (LLaMA-style)
        self.rmsNorm_3 = nn.RMSNorm(4096)
        self.groupedQueryAttention_2 = nn.ModuleDict({
            'q_proj': nn.Linear(4096, 4096,        bias=False),   # 32 heads ร— 128
            'k_proj': nn.Linear(4096, 1024, bias=False),   # 8 KV heads ร— 128
            'v_proj': nn.Linear(4096, 1024, bias=False),
            'o_proj': nn.Linear(4096, 4096,        bias=False),
        })  # GQA: 32Q / 8KV heads (requires F.scaled_dot_product_attention)
        self.rmsNorm_4 = nn.RMSNorm(4096)
        self.swiglu_2 = nn.ModuleDict({
            'gate_proj': nn.Linear(4096, 12288, bias=False),
            'up_proj':   nn.Linear(4096, 12288, bias=False),
            'down_proj': nn.Linear(12288, 4096, bias=False),
        })  # SwiGLU FFN (LLaMA-style)
        self.rmsNorm_5 = nn.RMSNorm(4096)
        self.groupedQueryAttention_3 = nn.ModuleDict({
            'q_proj': nn.Linear(4096, 4096,        bias=False),   # 32 heads ร— 128
            'k_proj': nn.Linear(4096, 1024, bias=False),   # 8 KV heads ร— 128
            'v_proj': nn.Linear(4096, 1024, bias=False),
            'o_proj': nn.Linear(4096, 4096,        bias=False),

For agents

This architecture is machine-readable end to end. An agent can list the set, fetch this graph, edit it, and have the edit verified before any GPU time is spent.

Also in NLP/LLM

๐Ÿค– Transformer Block
Transformer encoder block
8 layers ยท 7.09M
๐Ÿ“– BERT Base
BERT-Base encoder โ€” bidirectional MHA
11 layers ยท 31.12M
๐Ÿง  GPT-2
GPT-2 Small โ€” causal transformer block
12 layers ยท 84.33M
๐Ÿฆ™ LLaMA-3 Block
LLaMA-3 decoder block โ€” GQA
10 layers ยท 702.55M