今天凌晨,开发者 Jun Song 在 X 上转发一组社区测试结果:DeepSeek V4 Pro 0813 搭载开源插件 J-Space Cognition Suite V3.6 后,在多项关键基准测试中全面超越Fable 5。帖子迅速走红,浏览量超过 25 万。

01
为什么DeepSeek V4很强,
却可能发挥失常
DeepSeek V4 Pro 0813拥有1.6T总参数、49B激活参数,支持1M上下文和多档推理强度(Non-think/Think High/Think Max)。其基础能力毋庸置疑。
然而,开发者Tiger3807861189的报告指出,从“具备能力”到“稳定完成任务”之间,存在巨大的“能力实现损失” 。这种损失并非模型“不够聪明”,而是源于推理模式、工具接口、状态管理、验证机制等多环节的失配。

社区实验发现了两个关键现象:
(1)接口过拟合(Minimal 依赖)
DeepSeek V4的Agent后训练对官方Minimal工具条件具有明显的接口依赖。首轮prompt的微小变化(如工具schema、自动注入内容)可能引发推理行为的“跃迁” ,而非平滑变化。
(2)思维链二极管(Chain-of-Thought Diode)
这不是官方架构名称,而是对黑盒行为的工程概括。它指模型推理存在非连续、路径依赖的现象:
-
首轮形成的“路径承诺”很难被后续指令改变。
-
极短推理链容易跳过关键验证,极长推理链又可能陷入“只思考不行动”的循环。
-
同一种推理轨迹并非适合所有任务(维护类 vs. 从零构建类)。
这两大现象叠加长程上下文漂移、工具调用接缝模糊等问题,共同构成了DeepSeek V4能力释放的“最后一公里”障碍。
02
J-Space:一套完整的
推理时控制系统
J-Space Cognition Suite V3.6并非修改模型权重的“外挂”,它是一套推理时控制协议。
它通过工作空间加载、选择性路由、功能性第一人称、稠密轨、持久账本、checkpoint、经验验证和恢复闭环,减少模型从“具备能力”到“稳定完成任务”之间的损失。
其核心目标不是“把弱模型变强”,而是帮助强模型更可靠地调用、维持、协调和验证自身已有能力。

社区开源报告公布了一组对照实验,在 DeepSeek Harness Minimal、reasoning_effort=max、temperature = 1.0、top_p = 0.95条件下,DeepSeek V4 Pro 0813 + J-Space 在多数 Agent/Coding 基准上超过公开对照中的 Fable 5。

GLM-5.3、Kimi-K3、Opus-4.8 与 Fable 5 保留各厂商公开时的评测方法,仅作为能力位置参照,不表示所有模型由同一 harness 重测。
03
总结
J-Space 这组实验真正有意思的地方,并不只是把 DeepSeek V4 Pro 0813 的几个 Benchmark 分数又往上推了一截。
它更像是在提醒我们,模型能力和最终 Agent 表现之间,并不是简单的等号。
同一个模型,换一套 Harness、工具 Schema、推理轨迹和状态管理方式,最后能释放出来的能力可能完全不同。模型越来越强之后,下一阶段的竞争也未必只是继续堆参数,而是谁能把模型已经学会的能力,更稳定地调出来。
END