ROLE-BASED LLM EVALUATION MATRIX
RoleFit 模型选型矩阵,为岗位寻找最佳 AI 搭档。
通用基准高 ≠ 岗位适配好。基于 16 个真实业务角色、70% 岗位专属题目与质量/延迟/成本/稳定性 4 维动态加权,帮助团队做出科学的高性价比大模型选型决策。
16 大业务角色矩阵
点击切换角色岗位,查看定制化 4 维平衡权重与各模型适配排名
pm
项目经理/PMO
质量 Q: 65%
延迟 L: 10%
成本 C: 15%
稳定性 S: 10%
负责研发项目全生命周期管理、需求任务分解、开发工单派发、项目进度与阻碍跟踪、跨团队研发协同与交付把控。侧重结构化规划、执行编排与高稳定性。
项目经理/PMO (pm) · 2D 选型散点决策图
纵轴为综合质量能力分 $Q$(越高能力越强),横轴为成本性价比分 $C$(越靠右单套推理成本越经济)。四象限展示黄金选型与溢价分布。
GPT-6-Luna🏆 榜首(默认展示榜首 · 悬停表格或散点查看详情)
综合排名: #1 · RoleFit 综合分: 88.4
✅ 门禁通过
质量分 Q:85.5(专属: 4.22 / 通用: 4.36)
成本分 C:97.0(整套: ¥0.637)
延迟分 L:83.6(p50: 7.79s)
稳定性 S:99.4(基础: 4.57 / 幻觉: 4.56)
| 排名 | 模型名称 | RoleFit 综合分 ↓ | 质量 Q | 延迟 L (p50) | 成本 C (整套耗费) | 稳定性 S | 门禁状态 |
|---|---|---|---|---|---|---|---|
| 1 | GPT-6-LunaTOP 1 首选 | 88.4 | 85.5(专 4.22 / 通 4.36) | 83.6(7.79s) | 97.0(¥0.64) | 99.4(基 4.6 / 幻 4.6) | 通过 |
| #2 | MiniMax-M3.1-Flash-Preview估 | 88.4 | 88.3(专 4.32 / 通 4.59) | 96.2(5.42s) | 78.6(¥3.03) | 96.5(基 4.6 / 幻 4.6) | 通过 |
| #3 | Qwen3.8-Flash | 87.8 | 90.0(专 4.45 / 通 4.40) | 49.9(14.15s) | 96.4(¥0.71) | 98.4(基 4.5 / 幻 4.3) | 通过 |
| #4 | DeepSeek-V4.1-Flash估 | 87.2 | 88.4(专 4.35 / 通 4.43) | 58.7(12.48s) | 94.1(¥1.00) | 97.2(基 4.3 / 幻 4.7) | 通过 |
| #5 | DeepSeek-V4-Flash估 | 85.6 | 80.1(专 3.86 / 通 4.10) | 100.0(4.71s) | 95.8(¥0.79) | 91.5(基 4.3 / 幻 4.3) | 通过 |
| #6 | Claude Sonnet 5 | 83.3 | 85.8(专 4.37 / 通 4.29) | 84.4(7.66s) | 62.5(¥5.13) | 97.1(基 4.4 / 幻 4.5) | 通过 |
| #7 | Claude Opus 5 | 82.4 | 91.6(专 4.60 / 通 4.62) | 79.3(8.61s) | 34.8(¥8.72) | 96.6(基 4.9 / 幻 4.7) | 通过 |
| #8 | Claude Opus 4.6 | 80.7 | 85.3(专 4.32 / 通 4.20) | 71.9(10.00s) | 55.9(¥5.98) | 96.8(基 4.5 / 幻 4.6) | 通过 |
| #9 | Claude Opus 4.8 | 80.6 | 85.7(专 4.17 / 通 4.52) | 67.7(10.79s) | 55.0(¥6.09) | 98.5(基 4.6 / 幻 4.4) | 通过 |
| #10 | Kimi K2.7 Code估 | 80.4 | 79.3(专 3.83 / 通 4.49) | 71.7(10.04s) | 93.0(¥1.16) | 77.7(基 4.5 / 幻 4.3) | 通过 |
| #11 | DeepSeek-V4-Pro-0813估 | 79.8 | 86.5(专 4.43 / 通 4.12) | 35.8(16.81s) | 75.0(¥3.50) | 88.0(基 4.3 / 幻 4.3) | 通过 |
| #12 | MiniMax-M2.5 | 76.4 | 73.3(专 3.57 / 通 3.43) | 85.5(7.45s) | 100.0(¥0.24) | 52.6(基 4.0 / 幻 —) | 通过 |
| #13 | Qwen3.8-Max估 | 75.6 | 84.4(专 4.11 / 通 4.57) | 29.8(17.93s) | 52.4(¥6.44) | 98.5(基 4.7 / 幻 4.4) | 通过 |
| #14 | Claude Fable 5 | 75.4 | 89.9(专 4.48 / 通 4.56) | 76.6(9.12s) | 0.0(¥13.25) | 92.7(基 4.8 / 幻 4.7) | 通过 |
| #15 | Kimi K3估 | 72.2 | 80.4(专 3.97 / 通 4.54) | 30.2(17.86s) | 49.7(¥6.78) | 94.3(基 4.7 / 幻 4.4) | 通过 |
| #16 | MiniMax-M3估 | 71.4 | 72.3(专 3.85 / 通 2.75) | 15.2(20.69s) | 98.3(¥0.47) | 81.2(基 3.7 / 幻 —) | 基础题均分3.70<4.0 |
| #17 | MiniMax-M2.7-HS估 | 69.4 | 70.9(专 3.30 / 通 3.74) | 40.7(15.88s) | 97.8(¥0.53) | 46.0(基 3.9 / 幻 —) | 基础题均分3.90<4.0 |
| #18 | GLM-5.2估 | 68.8 | 79.8(专 3.84 / 通 4.31) | 0.0(23.55s) | 51.7(¥6.53) | 92.1(基 4.3 / 幻 4.4) | 通过 |
| — | Claude Sonnet 4 | — | —(专 — / 通 —) | —(—) | —(—) | —(基 — / 幻 —) | 待补测 (缺专属题) |
| — | DeepSeek-V4-Flash-0731 | — | —(专 — / 通 —) | —(—) | —(—) | —(基 — / 幻 —) | 待补测 (缺专属题) |
| — | GLM-5.1 | — | —(专 — / 通 —) | —(—) | —(—) | —(基 — / 幻 —) | 待补测 (缺专属题) |
| — | GPT-5.5 | — | —(专 — / 通 —) | —(—) | —(—) | —(基 — / 幻 —) | 待补测 (缺专属题) |
| — | Gemini 3.1 Pro | — | —(专 — / 通 —) | —(—) | —(—) | —(基 — / 幻 —) | 待补测 (缺专属题) |
| — | Gemini-3.7-Flash-High | — | —(专 — / 通 —) | —(—) | —(—) | —(基 — / 幻 —) | 待补测 (缺专属题) |
| — | Gemini-3.8-Flash-High | — | —(专 — / 通 —) | —(—) | —(—) | —(基 — / 幻 —) | 待补测 (缺专属题) |
| — | MiMo-V2.5 | — | —(专 — / 通 —) | —(—) | —(—) | —(基 — / 幻 —) | 待补测 (缺专属题) |
| — | MiMo-V2.5-Pro | — | —(专 — / 通 —) | —(—) | —(—) | —(基 — / 幻 —) | 待补测 (缺专属题) |
| — | MiniMax-M2.5-HS | — | —(专 — / 通 —) | —(—) | —(—) | —(基 — / 幻 —) | 待补测 (缺专属题) |
| — | MiniMax-M2.7 | — | —(专 — / 通 —) | —(—) | —(—) | —(基 — / 幻 —) | 待补测 (缺专属题) |
| — | Qwen3.5-397B-A17B | — | —(专 — / 通 —) | —(—) | —(—) | —(基 — / 幻 —) | 待补测 (缺专属题) |
| — | Qwen3.6-35B-A3B | — | —(专 — / 通 —) | —(—) | —(—) | —(基 — / 幻 —) | 待补测 (缺专属题) |
| — | Qwen3.7-Max | — | —(专 — / 通 —) | —(—) | —(—) | —(基 — / 幻 —) | 待补测 (缺专属题) |