信息仅供研究,不构成收益承诺或投资建议。本站不承诺项目真实性、盈利能力或可复制性;请自行核验。
ROLE-BASED LLM EVALUATION MATRIX

RoleFit 模型选型矩阵,为岗位寻找最佳 AI 搭档。

通用基准高 ≠ 岗位适配好。基于 16 个真实业务角色、70% 岗位专属题目与质量/延迟/成本/稳定性 4 维动态加权,帮助团队做出科学的高性价比大模型选型决策。

统一评测判官:deepseek-v4-flash-0731-bailian
样本池体量:326 份测试日志
平手判定阈值:|Δ| < 2 分
更新时间:2026/10/05
16 大业务角色矩阵
点击切换角色岗位,查看定制化 4 维平衡权重与各模型适配排名
pm

项目经理/PMO

质量 Q: 65%
延迟 L: 10%
成本 C: 15%
稳定性 S: 10%

负责研发项目全生命周期管理、需求任务分解、开发工单派发、项目进度与阻碍跟踪、跨团队研发协同与交付把控。侧重结构化规划、执行编排与高稳定性。

专属专业题占比: 70% (通用题: 30%)
门禁淘汰线: 基础题均分 ≥ 4.0 · 幻觉均分 ≥ 3.0

项目经理/PMO (pm) · 2D 选型散点决策图

纵轴为综合质量能力分 $Q$(越高能力越强),横轴为成本性价比分 $C$(越靠右单套推理成本越经济)。四象限展示黄金选型与溢价分布。

🌟 黄金首选 (高质高效)💎 旗舰溢价 (重质不惜成本)💡 极致性价比 (经济合格)⚠️ 综合受限 (建议复评)5060708090100020406080100成本性价比分 $C$ (越高越省) →综合质量能力分 $Q$ (越高越强) →🏆 GPT-6-Luna (Top 1)
GPT-6-Luna🏆 榜首(默认展示榜首 · 悬停表格或散点查看详情)
综合排名: #1 · RoleFit 综合分: 88.4
✅ 门禁通过
质量分 Q:85.5(专属: 4.22 / 通用: 4.36)
成本分 C:97.0(整套: ¥0.637)
延迟分 L:83.6(p50: 7.79s)
稳定性 S:99.4(基础: 4.57 / 幻觉: 4.56)

32 款模型全量评测与选型明细表

展示 32 / 32 款模型
排名 模型名称 RoleFit 综合分 ↓质量 Q 延迟 L (p50) 成本 C (整套耗费) 稳定性 S 门禁状态
1
GPT-6-LunaTOP 1 首选
88.485.5(专 4.22 / 通 4.36)83.6(7.79s)97.0(¥0.64)99.4(基 4.6 / 幻 4.6) 通过
#2
MiniMax-M3.1-Flash-Preview估
88.488.3(专 4.32 / 通 4.59)96.2(5.42s)78.6(¥3.03)96.5(基 4.6 / 幻 4.6) 通过
#3
Qwen3.8-Flash
87.890.0(专 4.45 / 通 4.40)49.9(14.15s)96.4(¥0.71)98.4(基 4.5 / 幻 4.3) 通过
#4
DeepSeek-V4.1-Flash估
87.288.4(专 4.35 / 通 4.43)58.7(12.48s)94.1(¥1.00)97.2(基 4.3 / 幻 4.7) 通过
#5
DeepSeek-V4-Flash估
85.680.1(专 3.86 / 通 4.10)100.0(4.71s)95.8(¥0.79)91.5(基 4.3 / 幻 4.3) 通过
#6
Claude Sonnet 5
83.385.8(专 4.37 / 通 4.29)84.4(7.66s)62.5(¥5.13)97.1(基 4.4 / 幻 4.5) 通过
#7
Claude Opus 5
82.491.6(专 4.60 / 通 4.62)79.3(8.61s)34.8(¥8.72)96.6(基 4.9 / 幻 4.7) 通过
#8
Claude Opus 4.6
80.785.3(专 4.32 / 通 4.20)71.9(10.00s)55.9(¥5.98)96.8(基 4.5 / 幻 4.6) 通过
#9
Claude Opus 4.8
80.685.7(专 4.17 / 通 4.52)67.7(10.79s)55.0(¥6.09)98.5(基 4.6 / 幻 4.4) 通过
#10
Kimi K2.7 Code估
80.479.3(专 3.83 / 通 4.49)71.7(10.04s)93.0(¥1.16)77.7(基 4.5 / 幻 4.3) 通过
#11
DeepSeek-V4-Pro-0813估
79.886.5(专 4.43 / 通 4.12)35.8(16.81s)75.0(¥3.50)88.0(基 4.3 / 幻 4.3) 通过
#12
MiniMax-M2.5
76.473.3(专 3.57 / 通 3.43)85.5(7.45s)100.0(¥0.24)52.6(基 4.0 / 幻 —) 通过
#13
Qwen3.8-Max估
75.684.4(专 4.11 / 通 4.57)29.8(17.93s)52.4(¥6.44)98.5(基 4.7 / 幻 4.4) 通过
#14
Claude Fable 5
75.489.9(专 4.48 / 通 4.56)76.6(9.12s)0.0(¥13.25)92.7(基 4.8 / 幻 4.7) 通过
#15
Kimi K3估
72.280.4(专 3.97 / 通 4.54)30.2(17.86s)49.7(¥6.78)94.3(基 4.7 / 幻 4.4) 通过
#16
MiniMax-M3估
71.472.3(专 3.85 / 通 2.75)15.2(20.69s)98.3(¥0.47)81.2(基 3.7 / 幻 —) 基础题均分3.70<4.0
#17
MiniMax-M2.7-HS估
69.470.9(专 3.30 / 通 3.74)40.7(15.88s)97.8(¥0.53)46.0(基 3.9 / 幻 —) 基础题均分3.90<4.0
#18
GLM-5.2估
68.879.8(专 3.84 / 通 4.31)0.0(23.55s)51.7(¥6.53)92.1(基 4.3 / 幻 4.4) 通过
—
Claude Sonnet 4
——(专 — / 通 —)—(—)—(—)—(基 — / 幻 —) 待补测 (缺专属题)
—
DeepSeek-V4-Flash-0731
——(专 — / 通 —)—(—)—(—)—(基 — / 幻 —) 待补测 (缺专属题)
—
GLM-5.1
——(专 — / 通 —)—(—)—(—)—(基 — / 幻 —) 待补测 (缺专属题)
—
GPT-5.5
——(专 — / 通 —)—(—)—(—)—(基 — / 幻 —) 待补测 (缺专属题)
—
Gemini 3.1 Pro
——(专 — / 通 —)—(—)—(—)—(基 — / 幻 —) 待补测 (缺专属题)
—
Gemini-3.7-Flash-High
——(专 — / 通 —)—(—)—(—)—(基 — / 幻 —) 待补测 (缺专属题)
—
Gemini-3.8-Flash-High
——(专 — / 通 —)—(—)—(—)—(基 — / 幻 —) 待补测 (缺专属题)
—
MiMo-V2.5
——(专 — / 通 —)—(—)—(—)—(基 — / 幻 —) 待补测 (缺专属题)
—
MiMo-V2.5-Pro
——(专 — / 通 —)—(—)—(—)—(基 — / 幻 —) 待补测 (缺专属题)
—
MiniMax-M2.5-HS
——(专 — / 通 —)—(—)—(—)—(基 — / 幻 —) 待补测 (缺专属题)
—
MiniMax-M2.7
——(专 — / 通 —)—(—)—(—)—(基 — / 幻 —) 待补测 (缺专属题)
—
Qwen3.5-397B-A17B
——(专 — / 通 —)—(—)—(—)—(基 — / 幻 —) 待补测 (缺专属题)
—
Qwen3.6-35B-A3B
——(专 — / 通 —)—(—)—(—)—(基 — / 幻 —) 待补测 (缺专属题)
—
Qwen3.7-Max
——(专 — / 通 —)—(—)—(—)—(基 — / 幻 —) 待补测 (缺专属题)