DeepSeek Harness 的桌面安装包已经在社区里传开了。亲测可用这里有个挺有意思的细节我顺着社区流传的地址完成安装版本号为v0.1.7-rc.1刚打开没多久客户端就提示有新版本。本次体验版本号v0.1.7-rc.2截至这次体验时DeepSeek 还没有正式官宣。社区讨论很快分成了两个方向一边开始研究它能做什么另一边在追问这到底是不是官方客户端这里先回答第二个问题的确是官方版本下载地址我直接放到评论区需要体验的自取。目前还是带有 beta 字样的测试版本但是 GUI 和功能已经非常完善。安装完成之后它会提示你登录或者配置 API跳转到网页端完成登录就可以打开 Harness 桌面端使用了Image随后DeepSeek Harness 会询问用户的使用需求把场景分成办公科研、代码开发 2 个类别以及它会让你选择想要看到思维链的完整度这里我选择了完整过程这里我建议大家选完整过程在后期调整提示词和出了问题溯源的时候非常有用进入客户端后Harness 提供了四种工作方式标准模式、PTC 模式、极简模式和创造模式。此外一直如既往DeepSeek Harness 的 slogan 是万物皆可插件这次在工作目录栏的设置了插件功能有 7 个基础插件大家也可以根据自己的需求自行安装插件总体来看这已经很像一个面向普通人的 AI 产品引导了。这些问题看起来很日常但它们透露了产品在尝试服务谁。熟悉 Agent 的开发者往往知道自己需要什么工具、怎样配置。普通用户更容易回答的问题是我准备拿它做什么我们的判断是这套引导正在把 Harness 的入口从环境配置转向任务选择下面开启的体验/实测DeepSeekHarness对比 ChatGPT 桌面端/让 DeepSeek Harness 先来的完成一个简单的任务读取我本地的 macos 系统做的一个的模拟 macos 的演示网页选用这个任务原因有三个1.读取本地环境的能力2.拆解任务和执行能力3.模型能力这里我选择的是最常用的 DeepSeek V4.1 flash先用 flash 试试吧当我把这个任务丢给它之后我前面选择思维链完整过程的优势开始凸显出来。DeepSeek Harness 把整个任务规划得非常细腻并且还有简单的缩略图具体在响应哪一部分提示词是否在调用工具和模型一目了然但情况有点不对劲发现 Harness 正在大段读我本地文件这个赖我Prompt 是这么写的并且任务规划得越来越复杂。我紧急停止了任务重新追加了一条提示词这里要说一下DeepSeek Harness 还是没有像 GPT-6 一样在任务过程中随时追加提示词的能力。我只能停止追加重启任务。这次很快它完成了。输出给了我一个 index.html 和一个 readme看到效果之后非常震惊说实话我有点不敢给你们录屏因为电脑上有一些个人隐私这里截图给大家看一下桌面这是 DeepSeek Harness 做的这是我的真实桌面不能说和我本地非常相似简直是一模一样除了文件打不开几乎所有的图标都是可交互、可点击滑动非常丝滑涉及个人隐私全局演示我就不做了这里我做一下遮挡放一个有限演示大家可以看一下丝滑度和交互感之前 GPT-6 Astra 用习惯了觉得 flash 模型大概率一般这次真的有被震撼到真香。当前视频无法在平台播放请访问原文链接查看https://mp.weixin.qq.com/s/Opwf0uYwYsw8cFbk35O10Q这个项目测下来它对我本地的模拟真的非常像非常丝滑了同时它的弊端也非常明显很快我的电脑就收到了这个提醒前两天刚清理完的硬盘又满了做完之后我就在想用 CodexGPT-6 会做成什么样我清理了磁盘把同样的提示词给了 codex这里我没有用 Astra而是选用的和 V4.1 flash 同一定位的 Luna大家可以看一下效果当前视频无法在平台播放请访问原文链接查看https://mp.weixin.qq.com/s/Opwf0uYwYsw8cFbk35O10Q说实话跑完这一轮我坐在电脑前愣了一会儿。这个结果和我预想的完全是反的。我本来以为 GPT-6 会赢。它更贵推理更久平时干活也更聪明。结果它交出来的东西更像是它「理解」了 macOS 应该长什么样然后凭着这份理解重新给我画了一个。而 DeepSeek 那边用的是最便宜的 V4.1 flash它把我桌面和硬盘还原得非常真实甚至我在工作的时候会点错。总结一下作为一个长期在 Codex 里使用 GPT-6 的用户Deepseek Harness 这次给我最直接的感受就是快。在这个任务里从思维链推理到交付结果它的速度优势非常明显是那种肉眼可见的快好多。同时它的思维链非常细致每一步做了什么、调用了什么非常之清晰遇到问题回溯、调整提示词非常方便我愿称之为本次最大亮点。再说这次 GPT-6 的表现这个单次测试有点离谱有点像是学霸在考场上睡着了。猜测一下原因可能是第一Codex 对我提示词的拆解出了问题第二对于任务规划出了问题仅凭一个任务的交付结果还不足以判断模型能力毕竟它现在是大部分人的生产主力有实践为证。这个测试给我带来的感受是Harness。所以我最近有个越来越强的判断可能有点暴论。往后这一两年真正拉开差距的大概率不再是谁家模型分数高那零点几。模型这东西你追我赶很快就会挤在一条线上谁也甩不开谁。真正能分出高下的是Harness。Agent如何规划任务、拆解任务、执行任务才是核心。说得再大白话点是这个产品到底把你当成一个要伺候的甲方还是一个要一起干活的搭子。接下来想用DSH➕一个顶尖模型试试真实的工作流反正一上午折腾下来我删了两次硬盘看着那个几乎一模一样的假桌面有一种很奇妙的感觉。就好像有个东西第一次不是在猜我想要什么而是真的走进了我的电脑里看了我一眼。这大概就是 Harness 这个词最浪漫的地方。