用四个 LLM 组队解一道组合题
我们把一道 16×16 铺砖题交给四个不同的模型,在 future-loop 控制平面下并行求解。4.5 小时、15 轮,答案从 30 一路降到经验证的 21——而两次决定性的突破都来自不同模型之间的分歧,而不是哪个模型想得更狠。
2 篇
我们把一道 16×16 铺砖题交给四个不同的模型,在 future-loop 控制平面下并行求解。4.5 小时、15 轮,答案从 30 一路降到经验证的 21——而两次决定性的突破都来自不同模型之间的分歧,而不是哪个模型想得更狠。
我们把三种上下文压缩策略放进同一场 178 题的考试。FutureOS 保住了被压缩掉内容的 83%;OpenCode 保住 47%,Codex 38%。差距不在摘要写得更好——而在每个系统认为一次压缩应该留下什么。