N Neurarch Architectures Checks Docs Open the app

Architectures / Multimodal

๐Ÿ‘๏ธ LLaVA-1.5

Vision-language model โ€” CLIP image encoder + MLP projector feed visual tokens into a LLaMA decoder (Liu 2023)

Layers
229
Parameters
7.06B
Input
3 ร— 336 ร— 336
Output
1 ร— 2624 ร— 32000
Verifier
1 advisory

Every number on this page is computed from the graph by the same functions the app runs, not written by hand.

Open LLaVA-1.5 on the canvas Free, no account needed

When to pick it

Pick to see the canonical VLM recipe: a frozen vision encoder bridged into an LLM by a small projector. Foundation for image chat / VQA.

Structure

229 layers. Output shapes are propagated from the input shape, batch dimension excluded.

LayerTypeParametersOutput shape
1imageInputshape=[3, 336, 336]3 ร— 336 ร— 336
2clip_patch_14Patch EmbedembedDim=1024, patchSize=14576 ร— 1024
3vis_posPositional EncodingembedDim=1024, maxLen=576576 ร— 1024
4clip_block_1Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
5clip_block_2Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
6clip_block_3Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
7clip_block_4Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
8clip_block_5Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
9clip_block_6Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
10clip_block_7Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
11clip_block_8Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
12clip_block_9Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
13clip_block_10Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
14clip_block_11Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
15clip_block_12Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
16clip_block_13Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
17clip_block_14Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
18clip_block_15Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
19clip_block_16Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
20clip_block_17Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
21clip_block_18Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
22clip_block_19Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
23clip_block_20Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
24clip_block_21Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
25clip_block_22Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
26clip_block_23Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
27clip_block_24Transformer BlockembedDim=1024, numHeads=16, ffDim=4096576 ร— 1024
28projector_1LinearoutFeatures=4096, inFeatures=1024576 ร— 4096
29projector_geluGELU576 ร— 4096
30projector_2LinearoutFeatures=4096, inFeatures=4096576 ร— 4096
31vision_tokensReshapeshape=[1, 576, 4096]1 ร— 576 ร— 4096
32text_tokensInputshape=[1, 2048]1 ร— 2048
33token_embedEmbedding1 ร— 2048 ร— 4096
34image+text_tokensConcatenate1 ร— 2624 ร— 4096
35llm_attn_norm_1RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
36llm_attn_1Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
37llm_res1_1Add1 ร— 2624 ร— 4096
38llm_ffn_norm_1RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
39llm_ffn_1SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
40llm_res2_1Add1 ร— 2624 ร— 4096
41llm_attn_norm_2RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
42llm_attn_2Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
43llm_res1_2Add1 ร— 2624 ร— 4096
44llm_ffn_norm_2RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
45llm_ffn_2SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
46llm_res2_2Add1 ร— 2624 ร— 4096
47llm_attn_norm_3RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
48llm_attn_3Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
49llm_res1_3Add1 ร— 2624 ร— 4096
50llm_ffn_norm_3RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
51llm_ffn_3SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
52llm_res2_3Add1 ร— 2624 ร— 4096
53llm_attn_norm_4RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
54llm_attn_4Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
55llm_res1_4Add1 ร— 2624 ร— 4096
56llm_ffn_norm_4RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
57llm_ffn_4SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
58llm_res2_4Add1 ร— 2624 ร— 4096
59llm_attn_norm_5RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
60llm_attn_5Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
61llm_res1_5Add1 ร— 2624 ร— 4096
62llm_ffn_norm_5RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
63llm_ffn_5SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
64llm_res2_5Add1 ร— 2624 ร— 4096
65llm_attn_norm_6RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
66llm_attn_6Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
67llm_res1_6Add1 ร— 2624 ร— 4096
68llm_ffn_norm_6RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
69llm_ffn_6SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
70llm_res2_6Add1 ร— 2624 ร— 4096
71llm_attn_norm_7RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
72llm_attn_7Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
73llm_res1_7Add1 ร— 2624 ร— 4096
74llm_ffn_norm_7RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
75llm_ffn_7SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
76llm_res2_7Add1 ร— 2624 ร— 4096
77llm_attn_norm_8RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
78llm_attn_8Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
79llm_res1_8Add1 ร— 2624 ร— 4096
80llm_ffn_norm_8RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
81llm_ffn_8SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
82llm_res2_8Add1 ร— 2624 ร— 4096
83llm_attn_norm_9RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
84llm_attn_9Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
85llm_res1_9Add1 ร— 2624 ร— 4096
86llm_ffn_norm_9RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
87llm_ffn_9SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
88llm_res2_9Add1 ร— 2624 ร— 4096
89llm_attn_norm_10RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
90llm_attn_10Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
91llm_res1_10Add1 ร— 2624 ร— 4096
92llm_ffn_norm_10RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
93llm_ffn_10SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
94llm_res2_10Add1 ร— 2624 ร— 4096
95llm_attn_norm_11RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
96llm_attn_11Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
97llm_res1_11Add1 ร— 2624 ร— 4096
98llm_ffn_norm_11RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
99llm_ffn_11SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
100llm_res2_11Add1 ร— 2624 ร— 4096
101llm_attn_norm_12RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
102llm_attn_12Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
103llm_res1_12Add1 ร— 2624 ร— 4096
104llm_ffn_norm_12RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
105llm_ffn_12SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
106llm_res2_12Add1 ร— 2624 ร— 4096
107llm_attn_norm_13RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
108llm_attn_13Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
109llm_res1_13Add1 ร— 2624 ร— 4096
110llm_ffn_norm_13RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
111llm_ffn_13SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
112llm_res2_13Add1 ร— 2624 ร— 4096
113llm_attn_norm_14RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
114llm_attn_14Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
115llm_res1_14Add1 ร— 2624 ร— 4096
116llm_ffn_norm_14RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
117llm_ffn_14SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
118llm_res2_14Add1 ร— 2624 ร— 4096
119llm_attn_norm_15RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
120llm_attn_15Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
121llm_res1_15Add1 ร— 2624 ร— 4096
122llm_ffn_norm_15RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
123llm_ffn_15SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
124llm_res2_15Add1 ร— 2624 ร— 4096
125llm_attn_norm_16RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
126llm_attn_16Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
127llm_res1_16Add1 ร— 2624 ร— 4096
128llm_ffn_norm_16RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
129llm_ffn_16SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
130llm_res2_16Add1 ร— 2624 ร— 4096
131llm_attn_norm_17RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
132llm_attn_17Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
133llm_res1_17Add1 ร— 2624 ร— 4096
134llm_ffn_norm_17RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
135llm_ffn_17SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
136llm_res2_17Add1 ร— 2624 ร— 4096
137llm_attn_norm_18RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
138llm_attn_18Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
139llm_res1_18Add1 ร— 2624 ร— 4096
140llm_ffn_norm_18RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
141llm_ffn_18SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
142llm_res2_18Add1 ร— 2624 ร— 4096
143llm_attn_norm_19RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
144llm_attn_19Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
145llm_res1_19Add1 ร— 2624 ร— 4096
146llm_ffn_norm_19RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
147llm_ffn_19SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
148llm_res2_19Add1 ร— 2624 ร— 4096
149llm_attn_norm_20RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
150llm_attn_20Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
151llm_res1_20Add1 ร— 2624 ร— 4096
152llm_ffn_norm_20RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
153llm_ffn_20SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
154llm_res2_20Add1 ร— 2624 ร— 4096
155llm_attn_norm_21RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
156llm_attn_21Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
157llm_res1_21Add1 ร— 2624 ร— 4096
158llm_ffn_norm_21RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
159llm_ffn_21SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
160llm_res2_21Add1 ร— 2624 ร— 4096
161llm_attn_norm_22RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
162llm_attn_22Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
163llm_res1_22Add1 ร— 2624 ร— 4096
164llm_ffn_norm_22RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
165llm_ffn_22SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
166llm_res2_22Add1 ร— 2624 ร— 4096
167llm_attn_norm_23RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
168llm_attn_23Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
169llm_res1_23Add1 ร— 2624 ร— 4096
170llm_ffn_norm_23RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
171llm_ffn_23SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
172llm_res2_23Add1 ร— 2624 ร— 4096
173llm_attn_norm_24RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
174llm_attn_24Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
175llm_res1_24Add1 ร— 2624 ร— 4096
176llm_ffn_norm_24RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
177llm_ffn_24SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
178llm_res2_24Add1 ร— 2624 ร— 4096
179llm_attn_norm_25RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
180llm_attn_25Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
181llm_res1_25Add1 ร— 2624 ร— 4096
182llm_ffn_norm_25RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
183llm_ffn_25SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
184llm_res2_25Add1 ร— 2624 ร— 4096
185llm_attn_norm_26RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
186llm_attn_26Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
187llm_res1_26Add1 ร— 2624 ร— 4096
188llm_ffn_norm_26RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
189llm_ffn_26SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
190llm_res2_26Add1 ร— 2624 ร— 4096
191llm_attn_norm_27RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
192llm_attn_27Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
193llm_res1_27Add1 ร— 2624 ร— 4096
194llm_ffn_norm_27RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
195llm_ffn_27SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
196llm_res2_27Add1 ร— 2624 ร— 4096
197llm_attn_norm_28RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
198llm_attn_28Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
199llm_res1_28Add1 ร— 2624 ร— 4096
200llm_ffn_norm_28RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
201llm_ffn_28SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
202llm_res2_28Add1 ร— 2624 ร— 4096
203llm_attn_norm_29RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
204llm_attn_29Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
205llm_res1_29Add1 ร— 2624 ร— 4096
206llm_ffn_norm_29RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
207llm_ffn_29SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
208llm_res2_29Add1 ร— 2624 ร— 4096
209llm_attn_norm_30RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
210llm_attn_30Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
211llm_res1_30Add1 ร— 2624 ร— 4096
212llm_ffn_norm_30RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
213llm_ffn_30SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
214llm_res2_30Add1 ร— 2624 ร— 4096
215llm_attn_norm_31RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
216llm_attn_31Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
217llm_res1_31Add1 ร— 2624 ร— 4096
218llm_ffn_norm_31RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
219llm_ffn_31SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
220llm_res2_31Add1 ร— 2624 ร— 4096
221llm_attn_norm_32RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
222llm_attn_32Grouped Query AttnembedDim=4096, numHeads=32, numKVHeads=321 ร— 2624 ร— 4096
223llm_res1_32Add1 ร— 2624 ร— 4096
224llm_ffn_norm_32RMSNormnormalizedShape=40961 ร— 2624 ร— 4096
225llm_ffn_32SwiGLUembedDim=4096, intermediateSize=110081 ร— 2624 ร— 4096
226llm_res2_32Add1 ร— 2624 ร— 4096
227final_normRMSNormnormalizedShape=40961 ร— 2624 ร— 4096
228lm_headLinearoutFeatures=32000, inFeatures=40961 ร— 2624 ร— 32000
229logitsOutput1 ร— 2624 ร— 32000

What the verifier says

The same 41 structural checks that run on every edit in the app, on this graph.

info32 attention layers at embedDim 4096 cache full per-head K/V: about 512 KB per token at fp16, which dominates memory at long context. Grouped-query attention (e.g. 8:1) would cut this ~8ร—; multi-head latent attention (MLA) shrinks it ~10ร— or more. This is the move production LLMs make; it does not change the parameter count. Fix: Switch attention to groupedQueryAttention (set numKVHeads below numHeads, e.g. numHeads/4) or mla (a low-rank cached latent). (llm_attn_1)
full-mha-serving-cost
infoAt 32 stacked attention layers, residual-branch outputs add up; unscaled init lets activation variance grow with depth. GPT-2/LLaMA-family models scale the residual projections by depth (N(0, 0.02 / โˆš(2L))). Fix: Scale residual output projections by depth: nn.init.normal_(w, std=0.02 / math.sqrt(2 * n_layers)) (llm_attn_1)
deep-attention-default-init
warnAcross 32 attention layers this design caches 512 KB per token, so a single 8,192-token sequence needs ~4.3 GB of KV cache before weights or activations. That exceeds the 4 GB budget this rule assumes for serving headroom. Fix: Cut KV width: raise the GQA ratio (fewer numKVHeads), switch to MLA, reduce depth or embedDim, or accept a shorter serving context. (llm_attn_1)
kv-cache-context-budget

The PyTorch it exports

Generated from the graph above. First 46 lines; the app exports the whole file, plus the training loop, the data contract and a deploy bundle.

# Architecture designed with Neurarch: https://neurarch.com
# PyTorch: compatible with Python 3.8+ and torch>=1.12
# Colab: pip install torch torchvision  (usually pre-installed)

import torch
import torch.nn as nn
import torch.nn.functional as F
from typing import Tuple

class LLaVA_15_7B(nn.Module):
    def __init__(self):
        super().__init__()

        self.patchEmbed_1 = nn.Conv2d(3, 1024, kernel_size=14, stride=14)  # Patch embedding (ViT-style)
        self.transformerBlock_1 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_2 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_3 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_4 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_5 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_6 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_7 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_8 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_9 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_10 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_11 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_12 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_13 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_14 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_15 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_16 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_17 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_18 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_19 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_20 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_21 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_22 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_23 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.transformerBlock_24 = nn.TransformerEncoderLayer(d_model=1024, nhead=16, dim_feedforward=4096, batch_first=True)
        self.linear_1 = nn.Linear(1024, 4096)
        self.gelu_1 = nn.GELU()
        self.linear_2 = nn.Linear(4096, 4096)
        self.embedding_1 = nn.Embedding(32000, 4096)
        self.rmsNorm_1 = nn.RMSNorm(4096)
        self.groupedQueryAttention_1 = nn.ModuleDict({
            'q_proj': nn.Linear(4096, 4096,        bias=False),   # 32 heads ร— 128
            'k_proj': nn.Linear(4096, 4096, bias=False),   # 32 KV heads ร— 128

For agents

This architecture is machine-readable end to end. An agent can list the set, fetch this graph, edit it, and have the edit verified before any GPU time is spent.

Also in Multimodal

๐Ÿ”— CLIP ViT-B/32
Dual-encoder contrastive model โ€” a ViT image tower and a Transformer text tower projected into a shared embedding space
38 layers ยท 151.20M