最佳本地 Embedding / 检索 — RTX 5070 Ti 16GB

甜点区间:94–94 分 · 12–12 ktok/s,共 1 个模型符合。

  1. 1. Qwen3-Embedding-8B — 97 分 · 7 ktok/s · 9GB
  2. 2. Qwen3-Embedding-4B — 94 分 · 12 ktok/s · 5.3GB
  3. 3. Qwen3-Reranker-4B — 93 分 · 6 ktok/s · 9.1GB
  4. 4. Qwen3-Embedding-0.6B — 89 分 · 45 ktok/s · 1.6GB
  5. 5. gte-Qwen2-1.5B — 88 分 · 18 ktok/s · 4.1GB

共 10 个装得下的可用模型。← RTX 5070 Ti 全部能力

常见问题

RTX 5070 Ti 上跑 Embedding / 检索最好的是哪个?

Qwen3-Embedding-8B,97 分,7 ktok/s,占用 9GB(RTX 5070 Ti 共 16GB)。

RTX 5070 Ti 上速度最快的是哪个?

EmbeddingGemma-300M,60 ktok/s,80 分,占用 1.6GB。分数最高的不一定最快——这台机器上两者是不同的模型。

显存/内存最省的是哪个?

Qwen3-Embedding-0.6B,只要 1.6GB,89 分。

有哪些模型这台机器装不下?

没有——本站收录的该项能力模型,RTX 5070 Ti 全部装得下。