Model library
Every entry is built from the published repository: parameter count, architecture, context length, licence, and the memory the weights and the cache actually need. 50 models listed.
| Model | Size | Context | Licence | Weights | Single card |
|---|---|---|---|---|---|
| nex-agi/Nex-N2.5-Pro | 396.8B | 262,144 | apache-2.0 | 379 GiB | multi-GPU |
| Gryphe/Pantheon-Reasoning-26B-A4B-1.1-V2 | 26.5B | 262,144 | apache-2.0 | 49 GiB | A100 80GB |
| nex-agi/Nex-N2.5-mini | 35.1B | 262,144 | apache-2.0 | 65 GiB | A100 80GB |
| zgcagi/ZGCM-1-7B | 7.4B | 262,144 | mit | 14 GiB | RTX 4090 24GB |
| nex-agi/Nex-N2.5-Max | 1600.8B | 1,048,576 | apache-2.0 | 1541 GiB | multi-GPU |
| openbmb/MiniCPM5-2B | 2.5B | 131,072 | apache-2.0 | 5 GiB | RTX 4090 24GB |
| TokenRhythm/NeoHorse-1-9B | 9B | 262,144 | apache-2.0 | 17 GiB | RTX 4090 24GB |
| TokenRhythm/NeoHorse-1-4B | 4.2B | 262,144 | apache-2.0 | 8 GiB | RTX 4090 24GB |
| inclusionAI/LLaDA2.2-mini | 16.3B | 131,072 | apache-2.0 | 30 GiB | L40S 48GB |
| ai-sage/GigaChat3.5-432B-A28B-Reasoning | 438.1B | 262,144 | mit | 415 GiB | multi-GPU |
| inclusionAI/Ling-3.0-flash-Fin | 127.5B | 262,144 | mit | 237 GiB | multi-GPU |
| IFM/K2-Horizon-375B-A23B | 379.2B | 524,288 | apache-2.0 | 706 GiB | multi-GPU |
| IFM/K2-Horizon-7B | 9B | 524,288 | apache-2.0 | 17 GiB | RTX 4090 24GB |
| IFM/K2-Horizon-3.7B | 5.1B | 524,288 | apache-2.0 | 9 GiB | RTX 4090 24GB |
| IFM/K2-Horizon-32B | 34.8B | 524,288 | apache-2.0 | 65 GiB | A100 80GB |
| IFM/K2-Horizon-MoVA-36B-A4B | 37.4B | 524,288 | apache-2.0 | 70 GiB | RTX PRO 6000 96GB |
| IFM/K2-Horizon-0.9B | 1.1B | 131,072 | apache-2.0 | 2 GiB | RTX 4090 24GB |
| openbmb/MiniCPM5-2B-Midtrain | 2.5B | 131,072 | apache-2.0 | 5 GiB | RTX 4090 24GB |
| Nanbeige/Nanbeige4.2-3B-DSpark | 848M | 262,144 | apache-2.0 | 2 GiB | RTX 4090 24GB |
| menezesbruno/manaca-1b-base | 1.7B | 4,096 | cc-by-4.0 | 3 GiB | RTX 4090 24GB |
| XHToken/Spark-X2.5-4B-Base | 4.1B | 1,048,576 | apache-2.0 | 8 GiB | RTX 4090 24GB |
| XHToken/Spark-X2.5-1.7B-Base | 1.7B | 1,048,576 | apache-2.0 | 3 GiB | RTX 4090 24GB |
| openbmb/MiniCPM5-2B-SFT | 2.5B | 131,072 | apache-2.0 | 5 GiB | RTX 4090 24GB |
| openbmb/MiniCPM5-2B-Base | 2.5B | 524,288 | apache-2.0 | 5 GiB | RTX 4090 24GB |
| tencent/Hy4-preview | 780B | 1,048,576 | apache-2.0 | 1453 GiB | multi-GPU |
| zai-org/GLM-5.3 | 753.3B | 1,048,576 | other | 704 GiB | multi-GPU |
| pipecat-ai/phonellm-alpha-1 | 31.6B | 262,144 | bsd-2-clause | 59 GiB | A100 80GB |
| XHToken/Spark-X2.5-4B | 4.1B | 1,048,576 | apache-2.0 | 8 GiB | RTX 4090 24GB |
| XHToken/Spark-X2.5-1.7B | 1.7B | 1,048,576 | apache-2.0 | 3 GiB | RTX 4090 24GB |
| ornith-ai/Ornith-1.5-35B-A3B | 36B | 262,144 | mit | 67 GiB | A100 80GB |
| ornith-ai/Ornith-1.5-9B | 9.7B | 262,144 | mit | 18 GiB | RTX 4090 24GB |
| incoai/Qwen3.8-27B-DFlash2 | 1.9B | 262,144 | apache-2.0 | 4 GiB | RTX 4090 24GB |
| z-lab/Qwen3.8-27B-DFlash2 | 1.9B | 262,144 | apache-2.0 | 4 GiB | RTX 4090 24GB |
| deepseek-ai/DeepSeek-V4-Pro-0813 | 1650.5B | 1,048,576 | mit | 831 GiB | multi-GPU |
| superwhisper/s1-mini | 752M | 40,960 | other | 1 GiB | RTX 4090 24GB |
| inclusionAI/Ling-3.0-tiny | 7.9B | 131,072 | mit | 15 GiB | RTX 4090 24GB |
| Qwen/Qwen3.8-2.4T-A95B | 2446.2B | 262,144 | other | 4556 GiB | multi-GPU |
| ibm-granite/granite-4.2-30b | 29.3B | 131,072 | apache-2.0 | 55 GiB | A100 80GB |
| ibm-granite/granite-4.2-8b | 8.8B | 131,072 | apache-2.0 | 16 GiB | RTX 4090 24GB |
| ibm-granite/granite-4.2-3b | 3.7B | 131,072 | apache-2.0 | 7 GiB | RTX 4090 24GB |
| Motif-Technologies/Motif-3 | 314.8B | 262,144 | mit | 586 GiB | multi-GPU |
| deepgrove/maple-preview | 20.2B | 131,072 | mit | 38 GiB | L40S 48GB |
| danish-foundation-models/DFM-Mimir | 1.8B | 4,096 | apache-2.0 | 3 GiB | RTX 4090 24GB |
| inclusionAI/Ling-3.0-flash | 127.5B | 262,144 | mit | 237 GiB | multi-GPU |
| deepseek-ai/DeepSeek-V4-Flash-0731 | 304.2B | 1,048,576 | mit | 155 GiB | multi-GPU |
| LiquidAI/LFM2.5-2.6B | 2.7B | 131,072 | other | 5 GiB | RTX 4090 24GB |
| Kwaipilot/KAT-Coder-V2.5-Dev | 34.7B | 262,144 | apache-2.0 | 65 GiB | A100 80GB |
| ai9stars/G9v3-39A5B | 39B | 131,072 | apache-2.0 | 73 GiB | RTX PRO 6000 96GB |
| Nanbeige/Nanbeige4.2-3B | 4.2B | 262,144 | apache-2.0 | 8 GiB | RTX 4090 24GB |
| poolside/Laguna-S-2.1 | 117.6B | 1,048,576 | openmdw-1.1 | 219 GiB | multi-GPU |
Hosting
Send us the model name and roughly what volume you expect. We reply with a price and an OpenAI-compatible endpoint. A model does not have to be on this list.