最佳本地聊天模型 — RTX 5090 32GB

甜点区间:75–75 分 · 60.3–60.3 tok/s,共 1 个模型符合。

  1. 1. Qwen3.8 27B — 75 分 · 60.3 tok/s · 17.3GB
  2. 2. Qwen3.6 27B — 72 分 · 60.3 tok/s · 17.6GB · AA 38
  3. 3. Qwen3.6 35B-A3B — 69 分 · 212.1 tok/s · 23GB · AA 32
  4. 4. Ornith 1.0 35B — 67 分 · 47.9 tok/s · 22.1GB
  5. 5. Gemma 4 31B — 63 分 · 54.6 tok/s · 19.2GB · AA 30

共 26 个装得下的可用模型。← RTX 5090 全部能力

常见问题

RTX 5090 上跑聊天模型最好的是哪个?

Qwen3.8 27B,75 分,60.3 tok/s,占用 17.3GB(RTX 5090 共 32GB)。

RTX 5090 上速度最快的是哪个?

Qwen3.6 35B-A3B,212.1 tok/s,69 分,占用 23GB。分数最高的不一定最快——这台机器上两者是不同的模型。

显存/内存最省的是哪个?

BTL 3,只要 1.4GB,44 分。

有哪些模型这台机器装不下?

10 个,例如 gpt-oss-120b(需 65.3GB)、Llama 3.3 70B(需 43.8GB)、DeepSeek V4 Flash 0731(需 108.1GB)。