DeepSeek Harness的过拟合问题测试

2026-08-16-01:21更新了`DSH-Mac平台-RoutingSuite修复模式`,用于对照

2026-08-15-13:48更新了`DSH-Mac平台-Anchored修复模式Plus(强制We need起始)`,用于对照

前面已经测试过了deepseek-v4-pro模型Max思考在dsh和oc中的表现,近期部分佬友在讨论dsh和过拟合问题。遂进行部分测试,并列出思维链的统计信息。测试均使用Deepseek-v4-pro模型Max思考。

测试项目有七个:

  • Macos平台dsh:标准模式、Anchored修复模式、Anchored修复模式Plus(强制We need起始)、RoutingSuite修复模式

  • Linux平台dsh:极简模式、极简模式(英文提示词)

  • Opencode Pure模式

对照组有一个:

  • kimi-k3(使用Kimi客户端测试)

先贴测试汇总信息

Kimi-K3的效果毋庸置疑是最好的,

然而DSH+RoutingSuite修复模式的效果已经直逼Kimi-K3的效果了,

部分效果存在差异,但体感差距不大。

不同测试项的思考块关键词统计

不同测试项的运行指标

对照组结果:

1. Kimi-k3

使用Kimi客户端Work模式,开启极致思考,开启1M上下文

预览链接


测试结果:

0. OpenCode-Mac平台

Mac平台+Pure模式+中文提示词

预览链接

初始思维:

1. DSH-Linux平台-极简模式

Linux平台+极简模式有概率触发特殊思维链。

预览链接

初始思维:


2. DSH-Linux平台-极简模式(英文提示词)

Linux平台+极简模式+英文提示词有概率触发特殊思维链。

预览链接

初始思维:

3. DSH-Mac平台-标准模式

预览链接

初始思维:


4. DSH-Mac平台-Anchored修复模式(we need命中)

使用流传的插件来尽可能的符合极简模式的System Prompt,

并新增了起始位置We need要求。

You are a helpful software engineer assistant.
when you thought, thought in ENGLISH, start with "We need..."

触发We need的思维链。
GitHub - xiaobright/dsh-anchored-standard: Two-phase DeepSeek Harness preset: Minimal-aligned bootstrap, then full Standard tools (Project2 98/99) · GitHub

预览链接

初始思维:

5. DSH-Mac平台-Anchored修复模式

使用流传的插件来尽可能的符合极简模式的System Prompt,触发不同的思维链。
GitHub - xiaobright/dsh-anchored-standard: Two-phase DeepSeek Harness preset: Minimal-aligned bootstrap, then full Standard tools (Project2 98/99) · GitHub

预览链接

初始思维:


4. DSH-Mac平台-RoutingSuite修复模式

使用流传的插件来优化思维链,
GitHub - yjh051108/dsh-routing-suite: dsh-routing-suite — injector + router-standard kit: install the runtime injector first, then the task-aware reasoning-mode router preset (measured P1-P23). · GitHub

该模式下,模型大量使用了chrome无头运行截图转字符画识别的方式来获取实际的视觉效果,通过视觉情况来修复存在的Bug,虽然耗费了大量的Token,但测试总体效果却是Deepseek V4 Pro模型中表现最好的。

且首轮思考了45分钟,再开始bash工具以及其他工具调用。

思维链不固定,这个插件的特点就是如此。

预览链接

初始思维:

12 个赞

我的天,偏差也太大了吧,特别是linux+极简模式那个很不错啊

1 个赞

linux+极简模式这版也存在问题,右键拖动方向反了。。。

弱弱的问题一句,和过拟合 这个是什么意思

近期部分佬友在讨论 dsh 和 过拟合 问题

过拟合就是模型学太多了以至于把噪点和无关紧要的细节学进去了

2 个赞

ds的方向搞反好像是老问题了,不知道其他模型有没有这个问题,之前灰测到的那个模型也偶尔会搞反

过犹不及,大概就这个意思,训练过度了

2 个赞

从我的测试结果看,似乎各种思维模式,并没有拉开很大的差距。

但是又有佬友说 benchmark分数增加了不少。

# 极简模式提示词 (你是一个乐于助人的软件工程师助手。)
You are a helpful software engineer assistant.

# 标准模式提示词 (你是一个由 DeepSeek Harness 提供支持的 AI 代理。)
You are an AI agent powered by DeepSeek Harness.

我的感觉是:

标准模式的提示词让模型误以为自己是一个AI,而非一个拟人化的助手。

标准模式在执行任务时,会忽略有用户监督和输入的存在,会以自说自话的形式输出思考。

极简模式因为系统提示词的assistant存在会更拟人些,以助理的身份来和Boss(用户)互动,更多的考虑两个人的视角去输出思考。

至于极简模式提高IQ的可能性,也许是因为极简模式能让AI产生有获取奖励/惩罚的机制存在,更积极些?

1 个赞

大多数人测的benchmark都没计算token usage吧

应该是 RL 的时候 蒸馏用的提示词就是极简的引导 ,并且没人发现全部都是极简, me 引导的思维链和 GPT 的思维链极其相似

然后再用这段引导的时候就切换到 GPT 大脑了

什么奖励惩罚机制都是整个模型共享的,不大可能出现说这么思考好这么思考不好的诡异情况


逆天

1 个赞

最骚的是,现在win用户只能去wsl中使用dsh,mac和lin用户可以直接复现极简

1 个赞

啊?:rofl: 这么逆天啊喂。这瓜保熟吗

更新了`DSH-Mac平台-提示词修复模式(we need命中)`,用来对照效果。

更新了`DSH-Mac平台-RoutingSuite修复模式`,用于对照

辛苦了,别测了,还是等下个模型吧

测到了涨价时刻。

不过后面就不测了,这两天跑雷达站的测试也跑了有几十轮,

综合来说,v4p不能用于生产。