<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>工程实践 on Renxin's Blog</title><link>https://renxinblog.cn/tags/%E5%B7%A5%E7%A8%8B%E5%AE%9E%E8%B7%B5/</link><description>Recent content in 工程实践 on Renxin's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Fri, 17 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://renxinblog.cn/tags/%E5%B7%A5%E7%A8%8B%E5%AE%9E%E8%B7%B5/index.xml" rel="self" type="application/rss+xml"/><item><title>你其实不需要更强的模型</title><link>https://renxinblog.cn/post/you-dont-need-stronger-models/</link><pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate><guid>https://renxinblog.cn/post/you-dont-need-stronger-models/</guid><description>&lt;p&gt;你有没有这样一种感觉——&lt;/p&gt;
&lt;p&gt;2023 年用上 GPT-4 的时候，那种震撼是真实的：它居然能写代码、能推理、能理解上下文。每发布一个新版本，你会迫不及待去试。但现在呢？GPT-5.6 发布了、Claude Fable 5 来了、Kimi K3 也出来了——你的第一反应是不是变成了：「哦，又强了一点。」&lt;/p&gt;
&lt;p&gt;不是它们不够强。GPT-5.6 Sol 在复杂推理上确实甩开了上一代一大截。问题在于：&lt;strong&gt;你 90% 的日常任务，两三年前的模型就已经够用了。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这不是观点，是正在发生的现实。这篇不聊模型有多强，聊一个更实际的问题——为什么大部分 AI 项目依然在失败，以及真正该花精力在什么地方。&lt;/p&gt;
&lt;h2 id="2026-年的模型版图"&gt;2026 年的模型版图
&lt;/h2&gt;&lt;p&gt;先看看我们现在有什么。&lt;/p&gt;
&lt;p&gt;把今天的主流模型放在一张图里，按能力和价格两个维度看：&lt;/p&gt;
&lt;pre class="mermaid" style="visibility:hidden"&gt;%%{init: {'theme':'neutral', 'fontFamily':'monospace'}}%%
flowchart LR
 经济层["💰 经济层&lt;br/&gt;$0.10-0.50/1M 输入"] --&gt;|"80% 日常任务"| 日常["分类/提取/摘要&lt;br/&gt;客服/简单推理"]
 主力层["🔋 主力层&lt;br/&gt;$2-3/1M 输入"] --&gt;|"15% 复杂任务"| 复杂["多步推理&lt;br/&gt;长文档分析"]
 旗舰层["🚀 旗舰层&lt;br/&gt;$5-10/1M 输入"] --&gt;|"5% 特殊场景"| 特殊["高难度代码&lt;br/&gt;研究级分析"]
 style 经济层 fill:#d1fae5,stroke:#059669,color:#064e3b
 style 主力层 fill:#dbeafe,stroke:#2563eb,color:#1e3a5f
 style 旗舰层 fill:#fef3c7,stroke:#d97706,color:#78350f
 style 日常 fill:#d1fae5,stroke:#059669,color:#064e3b
 style 复杂 fill:#dbeafe,stroke:#2563eb,color:#1e3a5f
 style 特殊 fill:#fef3c7,stroke:#d97706,color:#78350f&lt;/pre&gt;&lt;p&gt;数据来源：OpenRouter API（2026-07 实时定价），涵盖 344 个模型。&lt;a class="link" href="https://openai.com/index/gpt-5-6/" target="_blank" rel="noopener"
 &gt;OpenAI GPT-5.6&lt;/a&gt; 于 2026 年 7 月 9 日发布，&lt;a class="link" href="https://www.anthropic.com/news/claude-fable-5-mythos-5" target="_blank" rel="noopener"
 &gt;Claude Fable 5&lt;/a&gt; 于 6 月 9 日发布。&lt;a class="link" href="https://api-docs.deepseek.com/news/news260424/" target="_blank" rel="noopener"
 &gt;DeepSeek V4 Pro&lt;/a&gt; 于 4 月开源，1.6T 参数/49B 活跃参数，1M 上下文。&lt;a class="link" href="https://apnews.com/article/kimi-k3-china-ai-0d8a5e268deb11a673f4d444fc597cc5" target="_blank" rel="noopener"
 &gt;Kimi K3&lt;/a&gt; 据称可媲美 OpenAI 和 Anthropic 的旗舰模型。&lt;/p&gt;
&lt;p&gt;这张图的信息量比看起来大。注意定价跨度——旗舰层和主力层之间是 5-10 倍的价格差，和 DeepSeek V4 Flash 比更是 100 倍的差距。更深层的信号是：&lt;strong&gt;经济层的模型能力线已经远远到了日常任务「够用」的基准线之上。&lt;/strong&gt; 日常任务不需要旗舰模型的原因不是「没钱」，是「没必要」。&lt;/p&gt;
&lt;h2 id="80155-的分层现实"&gt;80/15/5 的分层现实
&lt;/h2&gt;&lt;p&gt;那实际在用的时候是怎么选的？&lt;/p&gt;
&lt;p&gt;以我托管的 hermes-home 多 Agent 系统为例——它跑着 7 个 Agent，每天处理调研、写作、决策分析、知识管理等任务。实际用量比例：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;层级&lt;/th&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th style="text-align: center"&gt;用量&lt;/th&gt;
					&lt;th&gt;场景&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;经济层&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;DeepSeek V4 Pro（$0.44）&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;~80%&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;日常推理、内容生成、知识检索、决策辅助&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;主力层&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;GPT-5.6 Luna（$1.00）&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;~15%&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;需要更强推理能力的复杂任务&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;旗舰层&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;GPT-5.6 Sol / Claude Fable 5&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;~5%&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;高难度代码生成、架构设计、研究级分析&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这不是预算问题。换成 DeepSeek V4 Pro 每百万 token 只需 $0.44，全跑旗舰模型（Claude Fable 5 $10/1M）也就多花二十几倍。真正的原因是：&lt;strong&gt;对于 80% 的任务，换旗舰模型的提升用户感知不到。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;写一篇博客、整理一份调研、做一个决策分析——这些任务 DeepSeek V4 Pro 完成得很好。只有当你需要处理极其复杂的推理链条、或者生成需要深度理解上下文的高难度代码时，旗舰模型的优势才会显现。而且即便是这些时候，差距也在快速缩小：DeepSeek V4 Pro 的 Benchmark 已经追平了两年前的旗舰模型。&lt;/p&gt;
&lt;p&gt;现在，旗舰模型针对的是「不可能轻松做到的业务」，是「需要博士级的研究分析」，是「5% 的场景」。大部分公司的绝大部分业务和大部分个人的日常任务，处在那个 80% 的范围内。&lt;/p&gt;
&lt;h2 id="ai-项目真正的死因"&gt;AI 项目真正的死因
&lt;/h2&gt;&lt;p&gt;如果模型已经够用了，那为什么那么多 AI 项目还是失败了？&lt;/p&gt;
&lt;p&gt;RAND 公司对 65 个企业 AI 项目的元分析给出了一个发人深省的数字：&lt;strong&gt;80% 的企业 AI 项目以失败告终。&lt;/strong&gt; Gartner 的追踪数据给出了类似的结论，MIT 的研究甚至将这个比例推高到了 95%。这些项目不是用 DeepSeek V4 Pro 做的——很多花了大价钱上了最好的模型。&lt;/p&gt;
&lt;p&gt;导致项目失败的原因，排在最前面的从来不是「模型不够聪明」。&lt;/p&gt;
&lt;pre class="mermaid" style="visibility:hidden"&gt;%%{init: {'theme':'neutral', 'fontFamily':'monospace'}}%%
flowchart LR
 模型["📈 模型能力&lt;br/&gt;飞速提升"] --&gt;|"但……"| 失败["⚠️ 80-95% 项目失败"]
 失败 --&gt; 根因["为什么失败？"]
 根因 --&gt; 需求["❌ 需求没挖对&lt;br/&gt;解决了错误的问题"]
 根因 --&gt; 成本["❌ 成本跑飞了&lt;br/&gt;不分层 &gt; 预算超支"]
 根因 --&gt; 工程["❌ 工程不靠谱&lt;br/&gt;缺乏可观测性和错误处理"]
 style 模型 fill:#dbeafe,stroke:#2563eb,color:#1e3a5f
 style 失败 fill:#fecaca,stroke:#dc2626,color:#7f1d1d
 style 根因 fill:#fef3c7,stroke:#d97706,color:#78350f
 style 需求 fill:#fecaca,stroke:#dc2626,color:#7f1d1d
 style 成本 fill:#fecaca,stroke:#dc2626,color:#7f1d1d
 style 工程 fill:#fecaca,stroke:#dc2626,color:#7f1d1d&lt;/pre&gt;&lt;p&gt;数据来源：&lt;a class="link" href="https://mybusinessfuture.com/en/80-ai-failure-rate-2026-how-rand-and-gartner-expose-the-ai/" target="_blank" rel="noopener"
 &gt;RAND 企业 AI 元分析&lt;/a&gt;（65 个项目，80% 失败率）、&lt;a class="link" href="https://www.softwareseni.com/why-95-percent-of-enterprise-ai-projects-fail-mit-research-breakdown-and-implementation-reality-check/" target="_blank" rel="noopener"
 &gt;MIT 研究&lt;/a&gt;（95% 企业 AI 项目未交付价值）。&lt;/p&gt;
&lt;p&gt;我跑了几个月多 Agent 系统，最深的感受就是：&lt;strong&gt;模型从来不是瓶颈。&lt;/strong&gt; 出错最多的地方，永远是需求没对齐、成本估算偏差、以及系统工程的细节。&lt;/p&gt;
&lt;h2 id="真正卡脖子的三件事"&gt;真正卡脖子的三件事
&lt;/h2&gt;&lt;p&gt;如果瓶颈不是模型，那是什么？基于实战观察，我认为有三件事比模型选型重要得多。&lt;/p&gt;
&lt;pre class="mermaid" style="visibility:hidden"&gt;%%{init: {'theme':'neutral', 'fontFamily':'monospace'}}%%
flowchart LR
 旧认知["过去以为瓶颈&lt;br/&gt;是模型能力"] --&gt; 新认知["实际瓶颈&lt;br/&gt;（三件事）"]
 新认知 --&gt; 需求挖掘["🔍 需求挖掘&lt;br/&gt;解决对的问题"]
 新认知 --&gt; 成本控制["💰 成本控制&lt;br/&gt;分层选型不跑偏"]
 新认知 --&gt; Agent工程["⚙️ Agent 工程&lt;br/&gt;可靠系统需要 Engineering"]
 style 旧认知 fill:#fecaca,stroke:#dc2626,color:#7f1d1d
 style 新认知 fill:#fef3c7,stroke:#d97706,color:#78350f
 style 需求挖掘 fill:#dbeafe,stroke:#2563eb,color:#1e3a5f
 style 成本控制 fill:#dbeafe,stroke:#2563eb,color:#1e3a5f
 style Agent工程 fill:#dbeafe,stroke:#2563eb,color:#1e3a5f&lt;/pre&gt;&lt;h3 id="需求挖掘你确定你在解决对的问题"&gt;需求挖掘：你确定你在解决对的问题？
&lt;/h3&gt;&lt;p&gt;大部分 AI 项目死得冤枉。团队花了几周时间搭建一个完美的 RAG 流水线，上线后发现用户根本不需要这个功能。或者花了大价钱微调了一个模型，结果业务需求已经变了。&lt;/p&gt;
&lt;p&gt;这不是技术问题，这是需求挖掘问题。一个简单的判断标准：&lt;strong&gt;你能否一句话说清楚「这个 AI 系统做成了，用户的什么行为会改变？」&lt;/strong&gt; 如果你说不清楚，模型再强也没用。&lt;/p&gt;
&lt;p&gt;真实教训：hermes-home 里有一个 Agent 最早的设计是「帮我决定今天做什么」，上线后完全没人用。后来改成「帮我记录和管理待办事项」，用户每天在用。模型没换，Prompt 也没大幅改——换的是解决哪个问题。&lt;/p&gt;
&lt;h3 id="成本控制不分层的架构跑不远"&gt;成本控制：不分层的架构跑不远
&lt;/h3&gt;&lt;p&gt;很多团队的做法是：选一个最强的模型，全量流量都走它。结果第一个月账单出来，团队傻眼了。&lt;/p&gt;
&lt;p&gt;分层的逻辑很简单：&lt;strong&gt;不是所有请求都值得用最好的模型处理。&lt;/strong&gt; 80% 的请求可以用 DeepSeek V4 Pro 甚至 V4 Flash，15% 需要 GPT-5.6 Luna 级别，只有 5% 需要动用旗舰模型。&lt;/p&gt;
&lt;p&gt;实操层面，成本优化的手段远不止分层：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;语义缓存&lt;/strong&gt;：重复查询命中缓存，彻底省掉模型调用&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Prompt 压缩&lt;/strong&gt;：精简历史记录和上下文，减少 token 消耗&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Fallback 链&lt;/strong&gt;：小模型先处理，处理不了再升级到大模型&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;输出长度控制&lt;/strong&gt;：很多场景不需要完整输出，设置 max_tokens 能省一大半&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;2026 年的行业共识是：一个设计良好的分层架构，可以将 LLM 成本降低 30-50%，同时保持 95% 以上的用户体验不下降。&lt;/p&gt;
&lt;h3 id="agent-工程能力是-engineering-出来的不是模型送过来的"&gt;Agent 工程：能力是 Engineering 出来的，不是模型送过来的
&lt;/h3&gt;&lt;p&gt;这是最容易被忽视、但也是真正的壁垒所在。&lt;/p&gt;
&lt;p&gt;从 GPT-3.5 到 GPT-5.6，模型能力在涨。但把一个 LLM 从「能回答问题」变成「能可靠地完成一个任务」，需要的是一整套工程能力——&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Tool 设计&lt;/strong&gt;：模型需要知道自己有什么工具可用，每个工具的输入输出是什么，什么时候该用哪个&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Memory 管理&lt;/strong&gt;：会话历史、长期记忆、知识库检索——怎么存、怎么查、怎么不爆上下文&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;错误处理&lt;/strong&gt;：模型调用超时怎么办？工具返回异常怎么办？重试逻辑怎么写？&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;可观测性&lt;/strong&gt;：每次调用花了多少 token？哪个环节耗时最长？出错了怎么定位？&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;多 Agent 协作&lt;/strong&gt;：多个 Agent 之间怎么发现彼此的能力、怎么传递任务、怎么避免冲突&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些东西，换再强的模型也不会自动变好。它们需要工程投入。&lt;/p&gt;
&lt;h2 id="实战案例一个跑在-deepseek-上的多-agent-系统"&gt;实战案例：一个跑在 DeepSeek 上的多 Agent 系统
&lt;/h2&gt;&lt;p&gt;hermes-home 是一个真实运行的多 Agent 系统，7 个 Agent 分布在云服务器和本地 Docker 中，通过 MCP 协议通信。这个系统 80% 的请求由 DeepSeek V4 Pro 处理。&lt;/p&gt;
&lt;p&gt;它能做什么？&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;知识库 Agent 每天自动扫描 GitHub 新项目，整理入库&lt;/li&gt;
&lt;li&gt;博客 Agent 从知识库拉取素材，写成 Hugo 文章并部署&lt;/li&gt;
&lt;li&gt;待办 Agent 管理日常任务并定时提醒&lt;/li&gt;
&lt;li&gt;决策 Agent 综合分析多个来源，给出结构化建议&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;所有这些任务，没有一个需要用到 Claude Fable 5 的全能力量。系统的瓶颈从来不在模型能力上——而是在 Tool 设计得够不够好、Memory 管理得够不够稳定、错误处理得够不够健壮。&lt;/p&gt;
&lt;pre class="mermaid" style="visibility:hidden"&gt;%%{init: {'theme':'neutral', 'fontFamily':'monospace'}}%%
flowchart LR
 subgraph 模型层["模型层 (80% DeepSeek V4 Pro)"]
 A["LLM 推理"]
 end
 subgraph 工程层["工程层 (真正的壁垒)"]
 B["Tool 系统"]
 C["Memory 管理"]
 D["错误处理"]
 E["可观测性"]
 end
 subgraph 应用层["应用层"]
 F["7 个 Agent&lt;br/&gt;调研/写作/决策/待办"]
 end
 A --&gt; B --&gt; C --&gt; D --&gt; E --&gt; F
 style 模型层 fill:#dbeafe,stroke:#2563eb,color:#1e3a5f
 style 工程层 fill:#d1fae5,stroke:#059669,color:#064e3b
 style 应用层 fill:#fef3c7,stroke:#d97706,color:#78350f&lt;/pre&gt;&lt;p&gt;我花了大量时间优化的是中间这一层——Tool 的接口设计、Memory 的持久化策略、错误恢复逻辑、以及每次调用链路的可观测性。这些才是真正决定系统质量的因素。模型只要「够用」就行。&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;下次有新模型发布的时候，先问自己三个问题：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;我的瓶颈真的是模型能力吗？&lt;/strong&gt; ——还是需求没挖对、成本没控好、工程没做扎实？&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;换模型能解决我的什么问题？&lt;/strong&gt; ——它会让用户感知到显著提升吗？&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;我的系统有足够好的可观测性吗？&lt;/strong&gt; ——如果你不知道每次调用花在哪、错在哪，换模型就是盲人摸象。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;模型在飞速进步，这是好事。但 &lt;strong&gt;90% 的日常任务已经越过了「够用」的基准线。&lt;/strong&gt; 真正的差距，从来不在模型本身。&lt;/p&gt;
&lt;p&gt;&lt;em&gt;数据来源：OpenRouter API 实时定价、DeepSeek 官方发布公告（2026-04-24）、OpenAI GPT-5.6 官方公告（2026-07-09）、Anthropic Claude Fable 5 公告（2026-06-09）、RAND 企业 AI 项目元分析、AP News Kimi K3 报道。&lt;/em&gt;&lt;/p&gt;</description></item></channel></rss>