同时装了 WorkBuddy 和 DeepSeek,试用 5 天之后,我卸载了其中一个
⭐ **WorkBuddy vs DeepSeek 5 天实测**(⭐ 每天 >6 小时 / 写稿 + 查资料 + 做表 + 写代码 + 会议纪要)。⭐ **Day 1**:WorkBuddy 功能丰富(10+ 工具一站搞定);⭐ DeepSeek 极简。⭐ **Day 3**:⭐ 80 页报告测试 —— ⭐ WorkBuddy 只读前 20 页 + ⭐ **自信地编造第 47 页数据**;⭐ DeepSeek 全读 + 指出第 12 页 vs 第 47 页数据矛盾。
一句话总结
⭐ WorkBuddy vs DeepSeek 5 天实测(⭐ 每天 >6 小时 / 写稿 + 查资料 + 做表 + 写代码 + 会议纪要)。⭐ Day 1:WorkBuddy 功能丰富(10+ 工具一站搞定);⭐ DeepSeek 极简。⭐ Day 3:⭐ 80 页报告测试 —— ⭐ WorkBuddy 只读前 20 页 + ⭐ 自信地编造第 47 页数据;⭐ DeepSeek 全读 + 指出第 12 页 vs 第 47 页数据矛盾。⭐ Day 4:改稿测试 —— ⭐ WorkBuddy 把观点磨平 + 修圆;⭐ DeepSeek 强化核心观点 + 加反问句 + 删正确废话 + 补”样本量不足请谨慎引用”提示。⭐ 作者卸载 WorkBuddy 留 DeepSeek。⭐ 核心洞察:“AI 工具正在分化成两类 —— 一类拼命做加法(WorkBuddy),一类做减法只把一件事做到极致(DeepSeek)”。
一、5 天实验设置 ⭐
| 维度 | 详情 |
|---|---|
| ⭐ 工具 | ⭐ WorkBuddy ⭐ vs ⭐ DeepSeek |
| ⭐ 时长 | ⭐ 5 天 |
| ⭐ 强度 | ⭐ 每天 >6 小时 |
| ⭐ 任务 | ⭐ 写稿 / 查资料 / 做表格 / 写代码 / 整理会议纪要 |
“这 5 天,我像做了一场极限对比实验。”
二、5 天实测经过 ⭐
Day 1:⭐ 新鲜感遮住了问题 ⭐
⭐ WorkBuddy 视觉印象:
“WorkBuddy 主打「全能办公助手」,功能列表拉下来能滚三屏:文档处理 / 日程管理 / 邮件起草 / PPT 生成 / 翻译 / OCR 识别……感觉装了一个它,等于装了十个工具。”
⭐ DeepSeek 视觉印象:
“DeepSeek 呢?界面极简,一个输入框,几个模式切换。乍一看甚至有点「寒酸」。”
⭐ 测试场景:⭐ 把 2 小时会议录音整理成纪要
| 工具 | 表现 |
|---|---|
| ⭐ WorkBuddy | ⭐ 5 分钟出稿 + 格式工整 + 待办事项自动提取 + 贴心地分”决议事项 / 跟进事项” |
| ⭐ DeepSeek | ⭐ 慢了半分钟 + 没 WorkBuddy 漂亮 + 但把”预算调整争论逻辑”理清 + 标注”此处存在分歧,建议二次确认” |
⭐ 作者结论:⭐ “WorkBuddy 的纪要像模板填空,DeepSeek 的纪要像真的听懂了这个会。”
Day 3:⭐ 问题开始暴露 ⭐
⭐ 测试场景:⭐ 80 页行业报告提炼 + 投资建议
⭐ WorkBuddy ⭐ 崩了:
“WorkBuddy 崩了。不是程序崩溃,是「智能崩溃」——它只读了前 20 页就开始输出,后面 60 页的内容完全没进上下文。”
“我追问「第 47 页那个数据怎么解释」,⭐ 它给我编了一个看起来很像真的但完全错误的答案。”
⭐ DeepSeek 表现:
“我分段喂了 80 页,它逐段分析,最后给出了一份带数据出处、带逻辑链条的总结。”
“我问它第 47 页,它准确引用了原文,还指出了那一页数据和第 12 页存在矛盾。”
⭐ 作者感受:⭐ “那一刻我后背发凉。”
⭐ 作者点评:
“WorkBuddy 的问题不是能力不行,而是它什么都会一点,但什么都不够深。它像一个什么都懂一点的实习生,你问他稍微专业点的问题,他就开始自信地胡说八道。”
“而 DeepSeek 像一个沉默的研究员,你给他足够的信息,他能给你真正有深度的输出。”
Day 4:⭐ 一个细节做了决定 ⭐
⭐ 测试场景:⭐ 改一篇稿子
| 工具 | 表现 |
|---|---|
| ⭐ WorkBuddy | ⭐ 改得快 + 用词更”高级” + 句子更”顺滑” + ⭐ 但 ⭐ 作者观点被磨平 + 棱角被修圆 + 正确但无趣 |
| ⭐ DeepSeek | ⭐ 核心观点不但没丢 + 被强化 + 加了一个作者没想到的反问句 + 删了两段正确的废话 + 结尾补了一刀:“以上结论建立在样本量不足的前提下,请谨慎引用” |
⭐ 作者金句:
“我当时就笑了。⭐ WorkBuddy 在帮我「包装」,DeepSeek 在帮我「思考」。”
“这是本质区别。”
Day 5:⭐ 卸载前的对比表 ⭐
| 维度 | WorkBuddy | DeepSeek |
|---|---|---|
| 功能多 / 一个 App 顶十个 | ⭐ ✅ 胜 | |
| 界面友好 / 上手零门槛 | ⭐ ✅ 胜 | |
| 模板丰富 / 标准化任务 | ⭐ ✅ 胜 | |
| 生成速度 / 适合赶时间 | ⭐ ✅ 胜 | |
| 深度理解 / 不是表面敷衍 | ⭐ ✅ 胜 | |
| 逻辑严谨 / 不瞎编乱造 | ⭐ ✅ 胜 | |
| ⭐ 长文本处理能力碾压 | ⭐ ✅ 胜 | |
| 能激发思考 / 不是替你思考 | ⭐ ✅ 胜 |
⭐ 作者总结:
“WorkBuddy 是「帮你做事」,DeepSeek 是「帮你做成事」。”
“帮你做事,你还需要自己判断对错。帮你做成事,它把判断依据都给你摆好了。”
三、⭐ 卸载决定 ⭐
⭐ 作者立场:
“我卸载 WorkBuddy,不是因为它不好。如果你每天需要处理大量格式化的办公任务——排日程 / 写邮件 / 做表格 / 生成 PPT——WorkBuddy 确实能省你很多时间。”
“但如果你需要的是深度思考 / 专业分析 / 长文处理 / 代码编写 / 复杂决策——DeepSeek 是唯一选择。”
⭐ 核心金句:
“我卸载 WorkBuddy,是因为我意识到:我真正缺的不是「什么都会」的助手,而是一个「真正懂我」的伙伴。”
“WorkBuddy 像那种饭局上什么话题都能接的人,热闹,但散场后你记不住他说了什么。”
“DeepSeek 像那种平时话不多,但你遇到难题第一个想打电话的人。他说的每句话,你都记得。”
四、⭐ 核心洞察 ⭐
“这 5 天我最大的感受是:AI 工具正在分化成两类。”
| 类型 | 策略 | 代表 |
|---|---|---|
| ⭐ 做加法 | “什么功能都往里塞,让你觉得「赚到了」” | ⭐ WorkBuddy |
| ⭐ 做减法 | “只把一件事做到极致,让你觉得「离不开了」” | ⭐ DeepSeek |
⭐ 作者最终选择:
“我选择把有限的时间和注意力,留给真正能让我变强的工具。”
“卸载 WorkBuddy 那一刻,手机轻了,脑子清楚了。”
五、⭐ 给读者的反思 ⭐
“你呢?你手机里装了几个 AI 工具?有几个是真的在用,有几个只是「装了等于会了」?”
六、⭐ 这个评测的”地雷点” ⭐
⚠️ 重要 caveat(站 Sam 角度):
| # | Caveat |
|---|---|
| ⭐ 1 | ⭐ 作者原文是一篇 opinion 软文(“侃故事的阿庆”是网易号自媒体),⭐ 不是中立评测 |
| ⭐ 2 | ⭐ 只测了 WorkBuddy 一个版本,没具体指明 DeepSeek 是 ⭐ V3 / R1 / V3.2-Exp |
| ⭐ 3 | ⭐ 测试场景有选择性(找 WorkBuddy 弱点,找 DeepSeek 优点) |
| ⭐ 4 | ⭐ “WorkBuddy 自信编造第 47 页数据” ⭐ = 任何 LLM 长上下文模型的已知缺陷,⭐ 不代表 WorkBuddy 独有 |
| ⭐ 5 | ⭐ DeepSeek 是否真在每场景都胜出?⭐ 存疑 —— 同样长上下文幻觉问题 DeepSeek 也会有 |
⭐ 结论:⭐ 作者的核心洞察”做加法 vs 做减法”有启发性,但 ⭐ 不要照搬对比结论。选 AI 工具要看自己需要什么(⭐ 大量标准化任务 vs 深度单一任务)。
配图
图 1:WorkBuddy vs DeepSeek 5 天实测 —— "帮你做事" vs "帮你做成事"(侃故事的阿庆 · 2026-10-05)
来源
- 网易新闻(侃故事的阿庆)· 原文
- 作者个人 5 天使用体验(opinion)