最佳本地聊天模型 — RTX 5070 Ti 16GB

甜点区间:75–75 分 · 39.4–39.4 tok/s,共 1 个模型符合。

  1. 1. Qwen3.8 27B — 75 分 · 39.4 tok/s · 14.6GB
  2. 2. Qwen3.6 27B — 72 分 · 39.4 tok/s · 14.4GB · AA 38
  3. 3. Muse Glimmer 30B — 56 分 · 36 tok/s · 14.3GB · AA 35
  4. 4. Qwen3.5 9B — 56 分 · 51.5 tok/s · 10.1GB
  5. 5. Gemma 4 12B It — 56 分 · 70.5 tok/s · 7.7GB

共 12 个装得下的可用模型。← RTX 5070 Ti 全部能力

常见问题

RTX 5070 Ti 上跑聊天模型最好的是哪个?

Qwen3.8 27B,75 分,39.4 tok/s,占用 14.6GB(RTX 5070 Ti 共 16GB)。

RTX 5070 Ti 上速度最快的是哪个?

GLM-4.7-Flash,150 tok/s,48 分,占用 15.5GB。分数最高的不一定最快——这台机器上两者是不同的模型。

显存/内存最省的是哪个?

BTL 3,只要 1.4GB,44 分。

有哪些模型这台机器装不下?

24 个,例如 Qwen3.6 35B-A3B(需 23GB)、Ornith 1.5 35B-A3B(需 22.9GB)、Gemma 4 31B(需 15.6GB)。