如题,看到这样一则爆料。
辛辛苦苦用 Agent 做座舱测试,项目确实有产出,结果领导来一句“我们不看项目结果,只看积极性”,这真的,就差一句雷佳音的我。。
说真心话,做门做技术的这群人,最怕的就是干完了才发现评价标准跟你的产出,压根不在同一个维度上。
你拼的是结果,领导却想要你多拍拍马屁。
不过反过来想,能在赛力斯做座舱 Agent 相关的工作,说明这位同学手上的技术是有东西的,换一家车企我认为没准能涨薪更多。
真正树挪死,人挪活。
有时候,职场就是你在的时候证明不了价值,跳槽了反而能打个漂亮的翻身仗。
说回赛力斯。
赛力斯的竞争力在于把华为的智能化、品牌和渠道势能,通过自己掌握的问界品牌资产、整车研发能力、超级工厂和供应链体系,稳定兑现成高端汽车销量。

我调查了一下。2025年赛力斯研发投入125亿,同比增长77.4%,研发人员9019人,占总员工41%(如有错误,都是Codex深度调研的锅😄。

据披露,工业 AI 模型已经覆盖赛力斯的36000多个质量点位。AI 视觉检测站通过十多套高速工业相机,100秒内就能完成整车全方位扫描,一站式完成60多个检测项,日均纠偏超200次。
座舱智能化方面,华为在2026年4月发布了 MoLA 2.0(Mixture of Large Model Agent)架构,参数规模突破720亿。五大垂直领域 Agent 分别负责导航、车控、娱乐、服务和安全,由 System Agent 统筹决策,鸿蒙座舱用户已经突破120万。
从产品层面看,汽车已经具备了 AGI 的几个关键要素。
摄像头和雷达做环境感知,座舱理解用户意图,导航引擎做路径规划,车辆控制系统相当于工具调用,传感器提供实时反馈,用户偏好就是长期记忆,OTA 让整个系统持续进化。
比通用的聊天 Agent 更接近“物理世界 Agent”。
销量、工厂和服务网络产生的真实场景数据,又持续为下一代产品和 AI Agent 的改进提供素材。
我去帮大家调研了华为 MoLA 架构、鸿蒙座舱、车规 OTA 这些方向的技术细节,如果你是一位愿意相信努力、相信过程、相信一步一个脚印、相信自己能在 AI 时代分一杯羹的人,那接下来的硬核内容,希望你能认真读一读。

(全文比较肝,保证大家能学到很多很多,系好安全带,我们粗粗发~)
content
01、座舱 Agent 应该放在车端还是云端?端云怎么切分?
“按实时性和安全性来分。对响应延迟敏感的、跟行车安全相关的功能,必须放端侧。”
需要大规模语义理解和联网知识的,走云端。
车控指令必须留在端侧。空调、车窗、座椅调节这些操作,用户说完就要响应,不能等网络往返。
语音端点检测(VAD)、基础的语音识别和 DMS(Driver Monitoring System,驾驶员状态监测)也跑在端侧,断网了这些功能不允许失效。
云端负责复杂的多轮语义理解和联网服务。比如说用户问“附近有什么好吃的日料,人均两百以内”,需要调 POI 搜索、做推荐排序,端侧的轻量模型处理不了,交给云端千亿参数的模型来做。

“拿 MoLA 架构来说,System Agent 负责全局任务调度,五大垂域 Agent 分别处理导航、车控、娱乐、服务和安全。垂域 Agent 在端侧跑轻量模型处理本领域的常见请求,搞不定的才上抛给 System Agent 走云端推理。”
端侧的算力预算差不多就是一颗麒麟9610A 的规格,NPU 30 TOPS,跑2到7B 参数的压缩模型做意图识别和车控指令解析。
02、车机算力有限,端侧模型怎么裁剪才不影响意图识别准确率?
第一,量化。把模型参数从 FP32 降到 INT8,体积直接压缩到四分之一。
如果用 QAT(Quantization-Aware Training,量化感知训练),在训练阶段就让模型适应低精度,精度损失比训练后量化小很多。
第二,知识蒸馏。用云端千亿参数的模型当老师,教端侧的小尺寸模型学。蒸馏后推理速度能提升3倍以上,推理延迟从大几百毫秒压到150毫秒以内。
第三,结构化剪枝。在 channel 或 layer 维度移除贡献小的神经元,不破坏模型整体结构,部署的时候不依赖特定硬件。

精度能不能保住,取决于微调阶段用什么数据。端侧需要用车载场景的专属数据做领域蒸馏。
比如说“打开空调”、“导航回家”这些在车里出现频率最高的指令,蒸馏的时候重点关注。线上运行之后持续收集 badcase 做增量微调,端侧模型的精度会越跑越高。
03、进隧道、进地库断网了,云端 Agent 调不通,怎么降级?
“端侧部署一个压缩模型做兜底,断网的时候自动切到本地推理。功能按优先级分级,安全相关的不允许降级。”
车控指令不受影响。空调、车窗、座椅这些操作在端侧完成,压根不需要网络。
离线语音识别、本地导航、通讯录拨号、DMS 也全部跑在端侧。
可以降级的是联网服务。复杂的多轮对话退化成命令式交互,在线音乐切到本地播放,POI 搜索和知识问答暂时不可用。
用户这时候问“附近有什么好吃的”,Agent 回一句“当前网络不可用,恢复后为您查找”就行。
“切换不是有网和没网两种状态。网络质量分级检测,从 5G 全连接到弱信号再到完全断连。”

弱网的时候可以只走文本的语音识别,停掉云端的语音合成,文字显示在屏幕上。
还有一个预缓存策略,信号好的时候预加载可能用到的资源,比如说导航已经规划好的路线数据、目的地附近的 POI 信息。
进了隧道也能撑一阵。
端侧推理的响应时间差不多200毫秒以内,语音识别准确率98%以上。用户体感上,常用功能几乎感觉不到断网了。
04、开车门、退出辅助驾驶这类不可逆操作,Agent 的安全边界怎么设计?
“按风险等级分级处理。读操作自动执行,低风险写操作通知确认,高风险操作阻塞等待用户二次确认。”
查天气、查导航 ETA 这些读操作,Agent 直接执行。调座椅、改音量这些低风险操作,执行后通知用户就行。
开车门、退出辅助驾驶、紧急呼叫(eCall)这些高风险操作,Agent 必须阻塞等待用户明确同意。确认请求超时未回复就自动取消。
“多模态交叉验证能降低误操作率。比如说‘开车门’这个指令,不能只靠语音识别,还要结合手势方向判断用户意图,语音加手势同时触发才执行。”

同一个操作的风险等级会随场景变化。开窗在低速停车场是低风险,在高速120码的时候就变成了高风险。
这个判断逻辑要写在工具的前置检查里,根据车速、档位、道路类型动态判断,不能写死成固定等级。
安全标准方面,ISO 26262 对功能安全做 ASIL(汽车安全完整性等级)分级,开车门、退出 ADAS 这类操作通常要求 ASIL B 以上。ISO 21448 SOTIF(预期功能安全)关注的是“没有故障但仍然危险”的场景,比如说 Agent 把“锁门”听成“开门”。
05、舱内多模态感知采集的数据怎么喂给 Agent?隐私边界在哪?
“多路传感器各自做特征提取,输出结构化标签喂给 Agent。比如说 DMS 输出‘疲劳等级3’,语音模块输出‘导航到公司’,手势模块输出‘向左指’。”
座舱里传感器种类不少。RGB 摄像头和红外摄像头做人脸识别和 DMS 疲劳检测。
麦克风阵列做语音采集和多音区识别,分清楚是主驾在说话还是副驾。座椅压力传感器做乘员检测,舱内毫米波雷达做活体检测和呼吸心率监测。
“拿华为最新的 AMS 多模态感知系统来说,800万像素 RGB 加200万像素红外加星闪传感器,三合一集成。支持‘指哪控哪’,语音说‘打开这个’的同时手指一指,Agent 就能把语音和手势融合起来理解用户意图。”

每路传感器在端侧完成特征提取后,输出的结构化数据统一送到 Agent 的上下文里。Agent 的 system prompt 里定义好各传感器的输入格式,每一轮推理的时候带上最新的感知状态。
隐私边界在哪?
“端侧处理,数据不出车。”
人脸特征提取和疲劳判断在端侧完成,只向云端上报判断结果,比如说“疲劳等级3”“注意力偏离”。原始图像不传不存。
声纹数据用于识别家庭成员,存储为不可逆的特征向量,不存原始音频。就算数据被拿走,也还原不出用户的声音。
法规层面,《人脸识别技术应用安全管理办法》2025年6月起施行,人脸识别的替代方案已经成了刚性需求。3D ToF 深度传感器是一个方向,不生成可识别的 2D 人脸图像,只采集深度信息来判断驾驶状态。

06、开车时用户说到一半被路况打断,多轮上下文怎么恢复?
“用 DST(Dialogue State Tracking,对话状态追踪)保存任务状态,检测到用户中断后自动存档,恢复时主动提示。”
用户说了一半“帮我导航到...”突然踩刹车,注意力回到路面。Agent 检测到用户超过10秒没说话,自动把当前对话状态存到本地,包括已识别的意图、已填充的参数槽位和任务进度。
用户重新开口的时候,Agent 主动接话。“刚才您想导航到哪里?”比让用户从头再说一遍友好得多。
“问界 M9 支持60秒不间断对话,一次唤醒可以连续说话。全双工技术让 Agent 在播报的时候用户可以随时打断,减少70%以上的重复唤醒操作。”

上下文的有效期按行程来定。本次行程内的对话上下文保持有效,下次开车重新开始。
避免上次去加油站的上下文干扰这次导航回家。
语音端点检测也在进步。以前判断用户说完了没有,靠固定的250毫秒静音超时。
现在用语义端点检测,能在100毫秒以内判断用户是说完了还是只是在想措辞。
07、座舱 Agent 的端到端延迟预算怎么拆?
“从用户开口到 Agent 开始出声,目标是 p50 控制在400毫秒以内。”
VAD 语音端点检测占10到30毫秒,ASR 语音识别占60到120毫秒,这两步是前端处理。
LLM 首 token 延迟占100到250毫秒,是整个处理流程里最大的一块。TTS 语音合成占40到100毫秒,网络传输20到60毫秒。
“加起来差不多230到560毫秒。串行跑完每个环节太慢了,实际会做流式并行。”
ASR 边听边转成文字,不用等用户说完。LLM 一收到 ASR 的部分文字就开始推理。
TTS 不用等 LLM 生成完整回复,拿到第一个 token 就开始合成音频播放。LLM 和 TTS 的重叠可以回收100到200毫秒的延迟。
实际体感上,用户刚说完,Agent 就开始回话了。

“人类对话的自然响应间隙差不多200毫秒。400毫秒以内用户感觉流畅,超过1.5秒用户可能就重新说一遍或者直接放弃了。”
端侧推理也能帮忙。
地平线征程6平台的座舱对话模型做到了语音交互延迟80毫秒以内。
简单的车控指令走端侧推理,连网络传输的20到60毫秒都省了。
08、鸿蒙生态下座舱 Agent 要调手机和家里的设备,跨设备调用怎么设计?
“基于分布式软总线做设备间通信,上层用原子化服务封装各设备的能力,Agent 通过统一接口调用。”
分布式软总线让不同设备之间的通信像在同一个设备上一样。设备发现和连接延迟压到20毫秒以内,手机、车机、平板、智能音箱自动组网,用户不需要手动配对。
超级终端把手机、车机和家里的智能设备组成一个虚拟终端,跨设备共享数据和能力。
原子化服务把设备能力封装成两种形态。FA(Feature Ability)提供有 UI 的完整交互,PA(Particle Ability)提供无 UI 的后台能力,服务可以在设备之间流转,免安装。

“举个实际场景。用户在手机上设好了导航,上车后导航任务自动流转到车机大屏,快到家的时候 Agent 根据通勤习惯给家里的空调和灯发开启指令。”
下车后手机上的通话自动从车载蓝牙切回手机听筒。整个过程用户不需要做任何操作。
MoLA 架构已经支持对接智能家居,Agent 在车里就能调家里的设备。
09、Agent 的提示词和模型版本要更新,车规环境下怎么灰度和回滚?
“A/B 双分区架构加灰度分批推送。Prompt 更新和模型更新分开管理,两者的体积和验证成本差很多。”
A/B 双分区是回滚的基础。更新包写入备用分区,验证通过后切换启动分区。
如果更新后出了问题,直接回退到原来的分区,整个过程不影响行车安全。
灰度发布按车辆比例推。先放10%的车辆观察各项指标,意图识别准确率、误触发率、用户投诉率没有异常再扩大范围,最后全量推送。
“Prompt 更新和模型更新要区别对待。Prompt 是 KB 级别的文本,改动频率高,可以走轻量级的配置下发通道。”
模型是 GB 级别的二进制包,改动频率低,每次更新都要走完整的车规验证流程。

还有车规验证。2026年1月起国家强制性标准生效,OTA 升级必须通过 MiL(模型在环)、SiL(软件在环)、HiL(硬件在环)三级验证,覆盖极端温湿度、电磁干扰、网络中断等工况。
Prompt 更新虽然轻量,也需要有版本注册中心做管理。每个版本的 Prompt 绑定对应的模型版本,A/B 路由可以让一部分用户跑新 Prompt、一部分跑旧 Prompt,对比效果。
10、智驾的世界模型和座舱 Agent 是两套系统,边界在哪?能不能共用?
“两套系统的安全等级和延迟要求完全不同,必须在计算平台和数据通道上做隔离。”
世界模型(World Model)做的是环境预测和轨迹规划,从摄像头、激光雷达、毫米波雷达拿到感知数据,在内部“脑海”里演练未来几秒的交通场景,输出轨迹坐标和控制信号。安全等级要求 ASIL D,延迟预算10到50毫秒,直接关系到生命安全。
座舱 Agent 做的是用户交互和服务调度,理解用户的意图后调用导航、车控、娱乐这些工具完成任务。容错性高,偶尔答错一个问题不会出人命,延迟预算在秒级。

“两套系统在计算资源上必须隔离。座舱 Agent 崩了、卡了,不能影响智驾的决策流程。”
就算座舱这边 OOM 了,智驾那边的世界模型也要照常运行。
能不能共用?
“部分数据可以共享,但计算隔离是底线。”
用户意图可以跨系统传递。用户在座舱里说“我赶时间”,这个意图可以传给智驾系统,让智驾在合规范围内调整驾驶策略。
用户说“靠边停车”,座舱 Agent 把指令转成结构化请求传给智驾执行。
部分传感器数据也可以共享。舱内摄像头的 DMS 数据对智驾有用,智驾判断驾驶员是否具备接管能力的时候需要这些信息。
共享的方式是通过消息接口传递结构化数据。座舱和智驾的推理进程跑在不同的算力域上,各自有独立的算力预算。

舱驾一体确实是趋势。数据通道可以互通,用户体验可以融合,但计算资源的隔离不会妥协。
11、一辆车一年的 Token 预算怎么控制?
“端侧优先。高频的简单指令在本地跑,只有端侧处理不了的复杂请求才上云。”
先估算一下消耗量。一个中度使用的车主,每天差不多跟座舱 Agent 交互8到20次,单次对话含系统提示词大概消耗250到630个 token。
算下来日均消耗8000到20000个 token,一年大约300到700万个 token。
如果全走云端,成本要看用什么模型。拿 DeepSeek V4 来说,缓存命中百万 token 差不多0.02元,未命中1元,中度用户一年的成本可能在几十到几百元之间。
百万辆车的规模,这就是一笔很大的经常性支出。
“端侧能做的尽量做,剩下的该省就省。”
高频的简单指令走端侧推理。“打开空调”“导航回家”这些指令端侧的小尺寸模型就能处理,Token 消耗为零,延迟还更低。
模型路由方面,简单任务用小尺寸模型跑,成本可能只有大尺寸模型的十分之一。只有多轮语义理解、知识问答这些复杂任务才上大尺寸模型。

Prompt 层面,车控类的指令不需要带历史上下文,每次只发当前指令和必要参数,system prompt 精简到最短。重复出现的 system prompt 用 KV 缓存,缓存命中的部分享受大幅折扣。
语义缓存也可以做。“明天北京天气怎么样”这种问题,第一次调 API 拿到结果后缓存起来,短时间内再有类似请求直接复用。
国产模型在处理中文的时候 token 效率高不少,同样一段中文分词之后 token 数量可能只有英文优先的模型的一半。换成国产模型,Token 消耗直接打对折。
端侧优先加上这些优化手段,单车年成本控制在几十元以内是可以做到的。
座舱 Agent 怎么写到简历上?
项目名称:PaiAgent——多Agent协同交互平台 2026.03 – 2026.06
项目简介:面向多设备多场景的 Agent 协作平台,支持多 Agent 分域调度、跨设备任务编排、端云协同推理和安全权限管控,集成多模态意图理解、上下文记忆管理和灰度发布能力,覆盖从意图识别到任务执行的完整交互流程。
技术栈:Java 21、Spring AI、LangGraph4j、Redis、Elasticsearch、MCP 协议

核心职责:
- 设计多 Agent 分域调度架构,System Agent 负责全局任务决策和路由分发,垂域 Agent 各自处理导航、车控、娱乐等领域请求;简单指令端侧小尺寸模型处理,复杂语义上抛云端推理,结合车速和场景动态切分端云算力
- 实现操作风险分级和安全权限管控机制,读操作自动执行,低风险写操作通知确认,高风险操作阻塞等待用户二次授权;引入语音加手势多模态交叉验证降低误触发率;每次工具调用记录完整审计日志,支撑延迟排查和安全回溯
- 构建端侧上下文管理和对话恢复机制,基于 DST 维护关键参数槽位,用户中断超时后自动保存任务状态至本地存储,恢复时主动提示续接;设置行程级对话过期策略,避免跨行程上下文污染
- 基于 MCP 协议封装跨设备服务调用能力,通过统一接口对接手机、智能家居和车载终端,支持导航和通话等任务在设备间自动流转
- 建立 Agent 提示词和模型版本灰度发布与回滚机制,通过版本注册中心管理 Prompt 和模型版本绑定,支持按比例灰度推送和 A/B 对比测试,异常指标触发自动回退至上一稳定版本
ending
以前面试聊的是八股文、并发、数据库索引。现在聊的是端云怎么切分、断网了 Agent 怎么降级、开车门的安全边界怎么设计、一辆车一年的 Token 预算怎么控制、鸿蒙跨设备怎么调用。
技术方向在变,但工程师的核心竞争力没变。谁能把系统做出来、做稳定、细节经得起追问,谁就是稀缺的。
加油吧,兄弟姐妹们。
下期见。
回复