# vit-base-patch16-224

Hugging Face: `google/vit-base-patch16-224`
Reconstructed from `config.json` alone. No weights were read.

| | |
|---|---|
| Derived from structure | 85,357,056 |
| In the published checkpoint | 86,567,656 (safetensors.total, 2026-09-06) |
| Delta | -1.40% |
| Comparability | comparable |
| Layers | 74 |
| Priced on | A10G (24GB) |
| Est. one run | $0.98 |

## Structure

| # | Layer | Type | Output shape |
|---|---|---|---|
| 1 | Input | Input | 1 × 3 × 224 × 224 |
| 2 | PatchEmbedding | Embedding | 1 × 3 × 224 × 224 × 768 |
| 3 | Patch_Position_Embedding | Learned Pos Embed | 1 × 3 × 224 × 224 × 768 |
| 4 | Attention_1 | Multi-Head Attention | 1 × 3 × 224 × 224 × 768 |
| 5 | Add_1 | Add | 1 × 3 × 224 × 224 × 768 |
| 6 | LayerNorm_1_1 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 7 | FFN_1 | Feed Forward | 1 × 3 × 224 × 224 × 768 |
| 8 | Add_1_2 | Add | 1 × 3 × 224 × 224 × 768 |
| 9 | LayerNorm_1_2 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 10 | Attention_2 | Multi-Head Attention | 1 × 3 × 224 × 224 × 768 |
| 11 | Add_2 | Add | 1 × 3 × 224 × 224 × 768 |
| 12 | LayerNorm_2_1 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 13 | FFN_2 | Feed Forward | 1 × 3 × 224 × 224 × 768 |
| 14 | Add_2_2 | Add | 1 × 3 × 224 × 224 × 768 |
| 15 | LayerNorm_2_2 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 16 | Attention_3 | Multi-Head Attention | 1 × 3 × 224 × 224 × 768 |
| 17 | Add_3 | Add | 1 × 3 × 224 × 224 × 768 |
| 18 | LayerNorm_3_1 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 19 | FFN_3 | Feed Forward | 1 × 3 × 224 × 224 × 768 |
| 20 | Add_3_2 | Add | 1 × 3 × 224 × 224 × 768 |
| 21 | LayerNorm_3_2 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 22 | Attention_4 | Multi-Head Attention | 1 × 3 × 224 × 224 × 768 |
| 23 | Add_4 | Add | 1 × 3 × 224 × 224 × 768 |
| 24 | LayerNorm_4_1 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 25 | FFN_4 | Feed Forward | 1 × 3 × 224 × 224 × 768 |
| 26 | Add_4_2 | Add | 1 × 3 × 224 × 224 × 768 |
| 27 | LayerNorm_4_2 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 28 | Attention_5 | Multi-Head Attention | 1 × 3 × 224 × 224 × 768 |
| 29 | Add_5 | Add | 1 × 3 × 224 × 224 × 768 |
| 30 | LayerNorm_5_1 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 31 | FFN_5 | Feed Forward | 1 × 3 × 224 × 224 × 768 |
| 32 | Add_5_2 | Add | 1 × 3 × 224 × 224 × 768 |
| 33 | LayerNorm_5_2 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 34 | Attention_6 | Multi-Head Attention | 1 × 3 × 224 × 224 × 768 |
| 35 | Add_6 | Add | 1 × 3 × 224 × 224 × 768 |
| 36 | LayerNorm_6_1 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 37 | FFN_6 | Feed Forward | 1 × 3 × 224 × 224 × 768 |
| 38 | Add_6_2 | Add | 1 × 3 × 224 × 224 × 768 |
| 39 | LayerNorm_6_2 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 40 | Attention_7 | Multi-Head Attention | 1 × 3 × 224 × 224 × 768 |
| 41 | Add_7 | Add | 1 × 3 × 224 × 224 × 768 |
| 42 | LayerNorm_7_1 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 43 | FFN_7 | Feed Forward | 1 × 3 × 224 × 224 × 768 |
| 44 | Add_7_2 | Add | 1 × 3 × 224 × 224 × 768 |
| 45 | LayerNorm_7_2 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 46 | Attention_8 | Multi-Head Attention | 1 × 3 × 224 × 224 × 768 |
| 47 | Add_8 | Add | 1 × 3 × 224 × 224 × 768 |
| 48 | LayerNorm_8_1 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 49 | FFN_8 | Feed Forward | 1 × 3 × 224 × 224 × 768 |
| 50 | Add_8_2 | Add | 1 × 3 × 224 × 224 × 768 |
| 51 | LayerNorm_8_2 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 52 | Attention_9 | Multi-Head Attention | 1 × 3 × 224 × 224 × 768 |
| 53 | Add_9 | Add | 1 × 3 × 224 × 224 × 768 |
| 54 | LayerNorm_9_1 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 55 | FFN_9 | Feed Forward | 1 × 3 × 224 × 224 × 768 |
| 56 | Add_9_2 | Add | 1 × 3 × 224 × 224 × 768 |
| 57 | LayerNorm_9_2 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 58 | Attention_10 | Multi-Head Attention | 1 × 3 × 224 × 224 × 768 |
| 59 | Add_10 | Add | 1 × 3 × 224 × 224 × 768 |
| 60 | LayerNorm_10_1 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 61 | FFN_10 | Feed Forward | 1 × 3 × 224 × 224 × 768 |
| 62 | Add_10_2 | Add | 1 × 3 × 224 × 224 × 768 |
| 63 | LayerNorm_10_2 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 64 | Attention_11 | Multi-Head Attention | 1 × 3 × 224 × 224 × 768 |
| 65 | Add_11 | Add | 1 × 3 × 224 × 224 × 768 |
| 66 | LayerNorm_11_1 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 67 | FFN_11 | Feed Forward | 1 × 3 × 224 × 224 × 768 |
| 68 | Add_11_2 | Add | 1 × 3 × 224 × 224 × 768 |
| 69 | LayerNorm_11_2 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 70 | Attention_12 | Multi-Head Attention | 1 × 3 × 224 × 224 × 768 |
| 71 | Add_12 | Add | 1 × 3 × 224 × 224 × 768 |
| 72 | LayerNorm_12_1 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 73 | FFN_12 | Feed Forward | 1 × 3 × 224 × 224 × 768 |
| 74 | Add_12_2 | Add | 1 × 3 × 224 × 224 × 768 |
| 75 | LayerNorm_12_2 | LayerNorm | 1 × 3 × 224 × 224 × 768 |
| 76 | Output | Output | 1 × 3 × 224 × 224 × 768 |

## Do this to your own model

```
pip install neurarch-trace
neurarch-trace google/vit-base-patch16-224 --plan --share
```

- Page: https://neurarch.com/m/vit-base-patch16-224.html
- All models: https://neurarch.com/m/index.json
- The checks: https://neurarch.com/r/index.json
