评测组小编
-
深度实测「豆包工作」+飞书:目前最接近企业Agent终局的答案
深度实测后,我们最直白的结论是: 它与飞书的深度打通,给出了目前Agent进入组织的一份最佳答案。 当主流办公Agent都会处理文件、调用工具、生成网页,基础能力越来越接近时,真正…
-
实测豆包工作:连上飞书后,Agent 终于像个同事了
刚刚,豆包正式发布了一款新产品——豆包工作。全新 Logo、独立的桌面客户端,它的定位很明确:一个面向生产力场景的全新 Agent 产品与品牌。 豆包工作 APP 说实话,第一反应…
-
大白话速通 WorkBuddy,普通人拥抱 AI,先从干中学开始
在 AI 时代,只要你学得足够慢,你就可以不用学。 年初 OpenClaw 最火的时候,为了养一只「龙虾」,有人专门买 Mac mini,有人从命令行开始补课,装环境、配模型、研究…
-
1分钱9张图!DeepSeek视觉模型连夜实测
家人们,鲸鱼开眼了! 等了四个月,DeepSeek的多模态模型:deepseek-v4-flash-vision-exp,终于发布。 我也是第一时间赶到现场,连夜开始实测。 相比V…
-
实测GLM-5.3: 在神仙打架的一周杀回国模顶流,还按下了重置键
神仙打架,这周的大模型圈,已经卷到了几乎一天一个新旗舰。 有 Cursor 数据加持的 Grok 4.6 突飞猛进,马斯克还说 4.7 马上就要来;DeepSeek V4 Pro …
-
深度体验DeepSeek Harness,我原谅它涨价了
DeepSeek Harness,终于发布,并且将源代码开源了。 为啥说「终于」呢?因为我已经内测了快半个月,现在也是终于能发了。。。 这段时间里,为了测试,我几乎把我所有Vibe…
-
首发体验 | DeepSeek Harness 来了,它不想做下一个Codex
就在刚刚,DeepSeek 正式发布了首款 Agent 产品,DeepSeek Harness。 早在 V4 Flash 正式版更新日志里,除了直接对标 Claude Opus 模…
-
DeepSeek V4 Pro 0813 测评
短的结论:君子藏器于身 基本情况: 7 月末的 Flash 斩杀风暴带来了过大的震撼,给了速胜论者一种 Pro 将要毁灭一切的幻觉。然而现实终究不是速胜或速败的,在波折中进步,在螺…
-
实测完DeepSeek V4 Pro正式版,我发现下一条「斩杀线」可能藏在它的Agent里
一夜之间,三款重磅模型罕见撞车。 Grok 4.6 纸面跑分逼近 Fable 5,大有成为海外御三家的势头。 看完 V4 Pro 正式版的跑分图,我只能说,这波提升还是肉眼可见的。…
-
Qwen3.8-Max 测评
短的结论:甲光向日金鳞开 基本情况: Qwen 半年来连续遭遇团队变故,多少会影响到研发节奏。前 4 个月几乎月更模型,但发布 Qwen3.7 之后,节奏却突然慢了下来,足足打磨了…
-
实测Qwen3.8-Max:国产模型开始从「会写代码」走向「能交付任务」
如果一个 AI 每 10 分钟就要你回来看一眼,它当然有用。但它还称不是上是真正的劳动力。 过去国产模型和海外顶级模型之间最明显的体验差距,其实不在“会不会写代码”。很多模型都能写…
-
给 Codex 和 Claude Code 接入 DeepSeek-V4-Flash,夯爆了!
大家好,我是程序员鱼皮。 这几天 DeepSeek-V4-Flash 正式发布 API 公测了,这个模型主打一个性价比高,输入 1 元 / 百万 token、输出 2 元 / 百万…