长按上方二维码3秒识别二维码

算力正在变贵,AI 应用必须重构

算力正在变贵,AI 应用必须重构

一、 硬件资产化:算力路径正在变窄
AI 应用的成本结构已经变了。过去两年的竞争逻辑建立在对 Scaling Law 的无条件信仰上:模型更大,参数更多,GPU 更多,上下文更长。GPT、Claude
3小时前 17

一、 硬件资产化:算力路径正在变窄

AI 应用的成本结构已经变了。过去两年的竞争逻辑建立在对 Scaling Law 的无条件信仰上:模型更大,参数更多,GPU 更多,上下文更长。GPTClaude 这类通用大模型证明了这条路径在确立智能底座时的有效性。

但这套逻辑进入应用层后,开始被硬件供给、推理成本和业务延迟卡住。

最明显的压力来自硬件的资产化。高端 GPU 已经不再是普通的计算资源,而演变成了稀缺资产。H100H200 以及最新的 B300 系列核心硬件,价格相比年初大幅上涨。目前市场报价涨幅接近 50%,部分型号甚至有价无市。这背后是复杂的供应链瓶颈:HBM 存储产能紧张、先进封装受限、以及单机柜功率对数据中心电力与散热基础设施的极端要求。算力瓶颈已经不是买不买得起 GPU 的问题,它变成了一个涉及能源布局和交付周期的供应链难题。

推理成本也在逼近应用层的盈利红线。模型越强,单次推理就越贵;上下文越长,Token 消耗就越大。在低频问答场景里,这种支出尚可接受,但在高频业务中,它会迅速吞掉利润。机器人每天执行数万次动作,客服系统处理海量请求,企业 Agent 反复调用工具——如果每一步判断都走长上下文的强模型推理,商业模型很快就会跑不通。

延迟则是另一个硬约束。仓储机器人要跟上拣选节奏,制造产线要跟上节拍,金融系统要实时处理风险。强模型可以在云端进行深度推理,但物理世界等不了。继续堆算力或许能提升模型的能力上限,但很多行业需要的并不是全面增强。仓库机器人需要抓得更稳,金融 AI 需要风险判断更准,企业 AI 需要流程执行更可靠。这些具体问题很少能靠再调用一次更大的模型来直接解决。

当算力路径变窄,应用层的问题已经从模型够不够强转向了强模型该放在哪里AI 应用必须重构。

二、 逻辑断层:通用模型无法直接替代行业系统

新一代通用大模型的能力很强,但它们天然不知道一个行业的动作成本、流程边界和失败后果。模型具备的是静态知识,而行业系统需要的是动态执行。

在仓储现场,机器人面对一堆形状不同、摆放混乱的物体时,真正的问题不是识别物体名称。任务逻辑在于:鞋盒是否被包装纸卡住?应该从上方抓还是从侧面抓?夹爪闭合后是否容易滑落?第一次失败后要不要换路径?通用模型知道抓取的定义,但它无法直接处理抓取过程中的实时物理反馈。

金融系统亦然。面对波动,复述新闻没有意义。系统需要判断:这条新闻是否已经被价格反映?风险敞口要不要实时调整?哪些波动只是算法产生的噪声?什么时候应该强制停止交易接口?

企业内部系统也是如此。模型可以生成完美的商务邮件,但它不理解企业内部的权限控制和流程衔接。如果一个 AI 工具不知道谁有权批准预算、哪个动作会触发后续财务流程,它就无法进入核心业务。在工业制造领域,如果模型动作不稳、节拍乱了、撞了设备,系统就是失效的。

行业 AI 的瓶颈在于缺少执行结构而非单纯缺少智能。很多失败的 AI 项目把大模型当作万能接口,寄希望于通过 Prompt 解决一切。这种做法在处理长任务、高风险场景时会迅速暴露其脆弱性:任务链条拉长会导致成本失控,步骤增多会导致延迟增加,且由于缺乏反馈机制,系统无法从执行失败中自愈。

三、 Sereact 样本:缩短感知到动作的链条

2026 4 月,这家德国机器人 AI 公司完成 1.1 亿美元 Series B 融资,由 Headline 领投,Bullhound CapitalFelix Capital 等机构跟投。Sereact 披露,这笔资金将用于其新一代机器人大脑 Cortex 2.0 的研发与北美市场扩张。目前,Sereact 已有 200 多套系统在欧洲运行,累计完成超过 10 亿次真实生产抓取,且每 5.3 万次抓取仅需一次远程人工干预。

这不仅是金额竞赛。Sereact 避开了聊天机器人的路径,直接切入物理执行:让机械臂在光线昏暗、包装变形、严重遮挡的工业现场实现稳定抓取。

其核心技术 VLAVision-Language-Action 将视觉输入、语言指令和机器人状态压进同一个执行结构,大幅缩短了从感知到动作的链条。

传统机器人系统通常是分模块工作的:先识别物体,再理解任务,最后规划路径。在这种链式结构里,视觉识别的一点偏差——比如深度判断偏了 1 厘米——都会导致后续规划失败。在复杂的仓库现场,每一步都靠独立模块传递结果,中间极易断裂。

Sereact 的做法是把现场画面、指令和机器人状态放进同一个框架训练。模型输出不再是文字解释,而是直接传递给控制栈的动作决策:

  • 机械臂移动的坐标;
  • 夹爪转动的角度与闭合时刻;
  • 动作失败后如何实时补救。

当机器人面对一个鞋盒,它并不会标记这是鞋盒,而是在决策任务:包装纸是否挡住了路径?侧向抓取是否比上方抓取更稳?这种短路径架构降低了信息传递过程中的损耗。

但动作具有物理后果,因此还需要 World Model(世界模型)。但这不意味着每一步都进行完整的物理模拟,而是一个针对关键动作的低成本预演层(Look-ahead Layer。系统会预判:这样抓会滑落吗?侧向切入会撞车吗?先拨开包装纸是否能提高成功率?

这种结构只关心与任务相关的变量变化,从而判断什么时候值得多花算力思考

  • 底层控制器: 处理高频、稳定的微调动作;
  • 中层模型: 处理抓取策略;
  • 高层规划: 只在风险高、动作成本大的节点,再调用预测模型多算几步。

通用 AI 进入行业后,必须被重新组织成这种分层的执行结构。

四、 可落地 AI 的五层结构

真实业务包含输入、理解、决策、执行和反馈。把所有步骤都交给一个大模型,系统会快速变重。可落地 AI 最后都会被拆成五层:

  1. 输入层: 负责接收外部信息。机器人看图像和位置,金融 AI 盯订单簿和链上数据,企业 AI 看文档权限。这一层不负责深度思考,只负责信息的标准化采集。
  2. 理解层: 负责意图解析与任务对齐。用户说处理订单,系统要翻译成具体的业务目标:是查库存、核对发票还是更新审批状态。这一层需要受到行业规则的硬性约束。
  3. 决策层: 处理不确定性与路径规划。这是最需要强模型参与的地方。信息不完整时先做什么?调用哪个工具?决策层需要处理冲突目标和执行风险。
  4. 执行层: 把判断变成确定性的动作。机械臂移动、调用 API、提交审批、执行调仓。执行层最重要的是稳定。很多动作更适合交给规则、控制器或固定 Workflow,以确保没有幻觉
  5. 反馈层: 记录执行结果并写回系统。动作成功了吗?预测命中了吗?有没有人工接管?反馈层的作用是将数据喂回系统。没有反馈,AI 只是工具;有了反馈,系统才知道哪些场景需要升级推理,哪些流程可以固化。

昂贵的强推理只用在真正的决策节点上。 普通动作直接执行,高风险任务加验证,重复成功的流程固化为规则。

五、 行业案例:任务重构的边界

各行业都在通过结构化设计来对冲算力成本。

  • 仓储与物流:从识别动作成功率重构 在物流现场,竞争已经不再只是看谁能识别出更多种类的货物。这种架构的目标,是让同样的算力覆盖更多有效动作,而不是把每一次抓取都交给强模型。系统将 AI 嵌入到驱动层,大模型只在遇到未见过的新包装或复杂遮挡时才介入。
  • 金融交易:从行情预测分层风控重构 金融 AI 不再每秒钟都通过大模型预测走势。重构后的系统分为三层:小模型处理信号过滤,规则引擎执行止损,只有在面临跨市场联动等复杂波动时,才激活大规模参数模型进行全局风险评估。
  • 企业 Agent:从文案生成权限流转重构 企业 AI 的重心是解决事务的完整性。大模型负责分析需求并拆解任务,但每一个写操作(如修改数据库或发送转账指令)必须经过状态机的硬性校验。这确保了 AI 的行为是可审计、可回滚、可追踪的。
  • 软件开发:从代码生成自动化工程重构 GPT 虽然能写出复杂的代码片段,但真正的效率瓶颈在于调试和部署。新一代开发工具将 AI 放进 CI/CD 流程中,模型不仅生成代码,还要分析运行日志并自动重写,减少人工 Debug 的频次。

六、 下一阶段:架构效率决定胜负

AI 还会继续变强,算力也会继续投入。但应用层的竞争重点已经变化:过去公司关一昧追求接入最强模型,现在则注重于用有限算力做出稳定的业务结果。

接入强模型只是获得了能力,把能力变成业务结果才是落地。从Sereact 的例子中我们可以得到启发:昂贵推理留给关键决策,高频动作交给快模块,低价值任务交给便宜系统,真实结果持续沉淀成反馈。

算力继续涨价后,粗放调用模型的空间会变小。应用层的竞争会回到架构效率:

  • 少调用一次强模型,就少付一次成本。
  • 把失败结果写回系统,就多一次改进机会。
  • 把规则和模型融合得更好,系统就更稳定。

行业 AI 的瓶颈不在于缺少智能,而在于缺少执行结构。大模型给出了能力的上限,而应用系统的分层设计、反馈回路和风险控制,决定了单位算力到底能产生多少真实的商业结果。未来模型需要被更聪明地组织。

文章来源:互联网

相关阅读