本地模型已经够用:质量差 3 分以内,墙钟 2.5–5.5 倍
25 组配对任务、四个场景,由更强的评审模型盲评:本地部署的 Qwen3.8-27B 在 100 分制上拿到 89.5,云端 deepseek-flash 是 92.6;全部编码任务两边全绿,代价只体现在时间上——2.5–5.5 倍墙钟。本地模型已经够日常使用。
1 篇
25 组配对任务、四个场景,由更强的评审模型盲评:本地部署的 Qwen3.8-27B 在 100 分制上拿到 89.5,云端 deepseek-flash 是 92.6;全部编码任务两边全绿,代价只体现在时间上——2.5–5.5 倍墙钟。本地模型已经够日常使用。