最佳本地聊天模型 — RTX 5070 Ti 16GB
甜点区间:75–75 分 · 39.4–39.4 tok/s,共 1 个模型符合。
- 1. Qwen3.8 27B — 75 分 · 39.4 tok/s · 14.6GB
- 2. Qwen3.6 27B — 72 分 · 39.4 tok/s · 14.4GB · AA 38
- 3. Muse Glimmer 30B — 56 分 · 36 tok/s · 14.3GB · AA 35
- 4. Qwen3.5 9B — 56 分 · 51.5 tok/s · 10.1GB
- 5. Gemma 4 12B It — 56 分 · 70.5 tok/s · 7.7GB
共 12 个装得下的可用模型。← RTX 5070 Ti 全部能力
常见问题
RTX 5070 Ti 上跑聊天模型最好的是哪个?
Qwen3.8 27B,75 分,39.4 tok/s,占用 14.6GB(RTX 5070 Ti 共 16GB)。
RTX 5070 Ti 上速度最快的是哪个?
GLM-4.7-Flash,150 tok/s,48 分,占用 15.5GB。分数最高的不一定最快——这台机器上两者是不同的模型。
显存/内存最省的是哪个?
BTL 3,只要 1.4GB,44 分。
有哪些模型这台机器装不下?
24 个,例如 Qwen3.6 35B-A3B(需 23GB)、Ornith 1.5 35B-A3B(需 22.9GB)、Gemma 4 31B(需 15.6GB)。