本地模型已经够用:质量差 3 分以内,墙钟 2.5–5.5 倍
25 组配对任务、四个场景,由更强的评审模型盲评:本地部署的 Qwen3.8-27B 在 100 分制上拿到 89.5,云端 deepseek-flash 是 92.6;全部编码任务两边全绿,代价只体现在时间上——2.5–5.5 倍墙钟。本地模型已经够日常使用。
2 篇
25 组配对任务、四个场景,由更强的评审模型盲评:本地部署的 Qwen3.8-27B 在 100 分制上拿到 89.5,云端 deepseek-flash 是 92.6;全部编码任务两边全绿,代价只体现在时间上——2.5–5.5 倍墙钟。本地模型已经够日常使用。
一次 Jev 调用从 141 个候选里挑一个技能,或者告诉你不必挑:首次命中 90.8%,比同题的强生成模型低三个百分点,成本却只有 1/9,速度快 3.6 倍。测量留下两条结论:Choice 必须带 none 选项,而判断型模型很适合做路由。