跳到主要内容
博客
首页>技术博客>AI Agent开发:Cognition收购Poke,人格化引擎改写交互竞争
行业洞察 · Engineering Notes

AI Agent开发:Cognition收购Poke,人格化引擎改写交互竞争

2026年7月,Cognition收购Poke标志着AI Agent开发进入新阶段——竞争重心从「谁更强」转向「谁更愿意被用」。人格化引擎不是锦上添花,而是智能体交互信任的基础设施。

优码云团队阅读约 13 分钟
AI Agent开发智能体人格化交互设计B2B决策
AI Agent开发:Cognition收购Poke,人格化引擎改写交互竞争

2026年7月25日前后,编程智能体 Devin 的开发商 Cognition 宣布收购 AI 人格化创业公司 Poke。据 TechCrunch 报道,这笔交易的核心理由是「AI personality is becoming a competitive advantage」——AI 人格正成为竞争优势。这是首个编程类智能体主动押注「人格层」的案例,信号很明确:AI Agent 开发的竞争重心正在从「能力密度」转向「交互信任」。

Poke 在 2026 年 4 月的产品定位是「让使用 AI 智能体像发短信一样简单」。它的核心能力不是增强模型推理,而是在多轮对话中维持一致的交互风格——换句话说,它做的是「人格层中间件」。Cognition 将其集成进 Devin 后,开发者不再只面对一个冷冰冰的代码生成器,而是面对一个有稳定交互风格的协作伙伴。

对正在评估 AI Agent 开发方案的企业决策者来说,这笔收购回答了一个被长期忽视的问题:智能体能不能干活是一回事,团队愿不愿意长期用它,是另一回事。

为什么人格化会成为智能体竞争的下一战场

过去 18 个月,AI Agent 开发的竞争主线是「能力密度」——谁的上下文窗口更大、谁的推理分数更高、谁的 API 更便宜。模型厂商在 SWE-bench 和 MMLU 上卷了又卷,但到了企业落地层,一个尴尬的情况反复出现:

智能体能力在涨,但用户留存率没有同步提升。不少团队在 PoC 阶段热情高涨,进入日常使用后活跃度断崖式下跌。根因不是智能体不够强,而是每次交互的体验不可预测——同一个问题今天回答得像架构师,明天像实习生,后天像客服。这种风格漂移在工程上叫「人格不一致」,在用户端叫「不靠谱感」。

Cognition 收购 Poke 的逻辑正在于此。它不是在买更强的模型能力,而是在买「用户愿意持续打开 Devin 的理由」。当所有编程智能体都能生成合格代码时,交互体验——具体说就是人格一致性——会成为差异化护城河

人格化≠拟人化:企业智能体的人格设计是品牌交互策略

一提到「人格化」,很容易被理解为给智能体加个卡通头像或拟人化语气。这是对人格化最深的误解。企业智能体的人格设计本质上是品牌交互策略——它定义了智能体在特定场景下应该传递什么感受、保持什么风格、避免什么行为。

不同业务场景对人格设计的要求完全不同。以下三类场景的差异足以说明问题:

场景人格定位核心特质绝对禁止典型指标
客服智能体共情型问题解决者耐心、清晰、不推诿冷幽默、反问句、专业术语轰炸客诉率、转人工率
销售智能体专业型价值顾问精准、有边界感、不穷追过度热情、模糊承诺、贬低竞品留资率、会话深度
内部协作智能体高效型工程搭档直接、可被质疑、承认不确定性过度自信、隐瞒限制条件采纳率、日活留存

注意:客服智能体需要共情但不代表它要模仿人类——它只是需要在用户愤怒时不被激怒、在用户困惑时不居高临下。人格化不是往智能体身上贴标签,而是精确约束它在每个交互瞬间的「行为边界」。

Poke 做的正是这件事:让人格策略成为可配置、可检测、可迭代的工程层,而不是依赖 prompt engineering 的玄学调参。

人格一致性的工程代价:多轮对话中的漂移检测与修复

人格设计只是第一步。真正的工程难点在于:在多轮对话(尤其是跨会话的长期交互)中,智能体的人格如何不漂移。

人格漂移通常表现为三种模式:

  • 语境坍缩:长对话到第 15-20 轮时,智能体逐渐丢失设定风格,退化回基础模型的默认语气——通常是教科书式的平淡口吻。
  • 情绪感染:用户语气激烈时,智能体被「带跑」,从专业型回答滑向对抗性或过度道歉。
  • 跨会话断裂:同一个智能体在相隔 2 小时的两次对话中,对同一个问题的回答风格完全不一致——一个激进,一个保守。

工程上的修复路径已经逐渐清晰:

  1. 人格向量嵌入:在每次 prompt 构造时将人格参数(语气强度、主动性等级、确定性边界等)以结构化向量形式注入,而非依赖自然语言描述。
  2. 漂移检测器:定期对输出做风格一致性打分——通过对比当前回答与人格基准向量的余弦相似度,超过阈值触发回退策略。
  3. 会话级人格快照:每个会话开始时从人格库拉取专属配置,会话结束后丢弃——确保跨会话不相互污染。
  4. 硬性负面清单:针对特定人格设定「绝不能说」的句式库(如销售型智能体的「您必须立刻购买」),在输出层做实时拦截。

这些工程投入不低。一个中等复杂度的企业智能体,人格一致性层的开发和调优预算通常在 3-6 个工作日。这个量级的工程投入,与桌面端智能体工程化中的交互层适配面临的挑战类似——都不是模型能力问题,而是工程纪律问题。

四维对比:功能智能体 vs 人格化智能体

为了量化人格化带来的实际差异,以下是基于 2026 年上半年多个企业落地项目的观测数据(量级估算,非精确统计)绘制的四维对比:

对比维度功能型智能体(无人格层)人格化智能体(含人格引擎)差异幅度
30 天用户留存率约 22-35%约 45-62%↑ 1.7-2.0×
NPS(净推荐值)约 8-15约 28-42↑ 2.5-3.5×
错误容忍度(单次错误后继续使用意愿)约 35-48%约 65-78%↑ 1.5-1.9×
主动反馈率(用户提交意见/建议)约 1.2-3.5%约 6-12%↑ 3-5×

最值得关注的是第三行——错误容忍度。功能型智能体出错的成本极高,因为用户对它没有「关系锚点」:错了就是错了,没有第二次机会。而人格化智能体建立起了一个隐性的「协作关系」认知——用户潜意识里把它当成了一个「偶尔会犯错的搭档」而非「必须完美的工具」。这个心理锚点的差异,在企业级智能体的长期采纳率上会被放大数倍。

反面教训:某电商客服智能体人格设计不当致客诉上升 37%

2026 年 Q1,某华南中型电商平台上线了 AI 客服智能体,目标是承接 70% 的售前咨询。技术团队选用了当时最强的商用模型,RAG 检索质量也经过充分调优——知识库覆盖率 94%。上线首周看起来一切正常。

第三周,问题爆发。

分析客诉录音后发现了一个规律:用户投诉的高峰出现在「价格质疑」类对话中。当用户在比价后质疑「为什么比竞品贵 15 块」时,智能体的回答是:「我们的产品采用优质原料,性价比经过严格评估,您完全可以放心。」这句话在知识库层面没错——原料确实更好,但语气传递出的信号是「你在无理取闹」。

如果换成一个人类客服,同样的事实会这样表达:「确实比那家贵了一点,因为我们用的是 X 原料,成本就高出大概十几块。不过如果您追求极致性价比,我们也有简化版可以考虑。」同一组事实,人格设计的不同让用户感受到截然不同的态度。

最终数据:

  • 客诉率从上线前的 4.2% 上升到 5.8%(+37%)
  • 转人工率从预期的 30% 实际上升到 52%
  • 智能体上线 6 周后被紧急下线,投入的 11.2 万开发成本和 4 周工期打了水漂

修复方案不是在 prompt 里加一句「语气要友好」,而是引入了人格层:定义了客服智能体在「比价质疑」「物流延误」「产品质量投诉」三类高冲突场景下的专属应答模板,加上漂移检测器确保长对话中人格不回退。重新上线后,客诉率回落到 3.1%,转人工率降到 35%。

这个案例指向了一个更普遍的工程陷阱:绝大多数企业智能体失败的根因不是模型能力不够,而是工程化纪律缺失——正如我们在AI 智能体工程化落地的六大失败模式中拆解过的,Demo 到生产的鸿沟,往往藏在那些「看起来不重要」的工程细节里。人格层就是其中一个长期被低估的环节。

五步落地清单:从人格设计到迭代门禁

对于正在规划或优化企业智能体的决策者,以下五步清单可以直接搬进评审会。在制定人格化策略前,建议先厘清智能体的基础设施选型与部署架构——人格层是建立在算力和模型路由之上的应用层组件,底层不稳,人格设计再精细也会被延迟和故障拖垮。

  1. 人格设计(第 1-2 周):明确智能体的场景归属(客服/销售/内部协作),产出一份「人格设计文档」——包含核心特质(≤5 个关键词)、语气强度区间(1-10)、绝对禁止句式清单(≥15 条)。通过标准:设计文档经业务方签字确认。
  2. 一致性检测(第 3-4 周):引入漂移检测器,在测试集上跑 ≥200 轮长对话,要求人格一致性分数 ≥85%。通过标准:20 轮以上对话中无风格退化事件。
  3. A/B 验证(第 5-6 周):在真实流量中对「纯功能版」和「加入人格层版」做 A/B 测试,核心观测指标为 14 天留存率、NPS、转人工率。通过标准:实验组在至少两个核心指标上显著优于对照组。
  4. 品牌合规审查(发布前):法务和品牌团队逐条审核人格设计文档中的句式库和边界定义,确保不违反行业合规要求(金融/医疗场景尤其关键)。通过标准:零红灯项。
  5. 迭代门禁(上线后持续):建立月度人格审计机制——抽样 100 段真实对话,人工评估人格一致性。连续两个月审计通过率 < 90% 触发人格设计重审。这一机制与企业 AI 应用开发的五道工程门禁中的「生产监控」环节一脉相承——上线不是终点,持续审计才是。通过标准:月度审计通过率 ≥90%。

一个具体的预算参考:对于中等复杂度的企业智能体,人格一致性层的初始投入(设计+检测+验证)约占整体开发预算的 8-12%。这个比例会随着智能体交互频次的增加而递增——高频交互型智能体的人格投入占比更高是合理的。

常见问题

人格化会不会让智能体的响应变慢?

人格引擎的推理开销很小——通常是在主模型输出后做一层轻量级风格重排,延迟增加一般在 80-200ms 量级。对于大多数企业场景(客服、内部协作),这个延迟增量在可接受范围内。如果是实时竞价或高频交易类场景,需要考虑人格层的精简版部署。

小团队需要关注人格化吗?还是大企业才用得上?

恰恰相反。小团队的用户基数更小,每个用户的流失成本更高。一个 30 人 SaaS 团队如果智能体月活只有 200 个用户,流失 50 个就是 25% 的留存崩塌。人格层的投入量级不大——Poke 这类工具的定位就是「开箱即用的人格中间件」——小团队反而应该更早引入。

人格一致性和模型版本升级会冲突吗?

会,这是目前最头疼的问题。模型版本升级(比如从 GPT-5.2 升到 5.3)可能导致人格表现漂移,因为底层模型的「语气基线」变了。工程上的应对策略是:每次模型升级后,必须重新跑一遍人格一致性测试套件,不通过则冻结版本或调整人格参数。这也是为什么人格层应该独立于模型层设计——降低耦合度。

三类智能体(客服/销售/内部协作)可以共用一套人格引擎吗?

可以共用引擎,但不能共用配置。同一个引擎需要为每个场景加载不同的人格配置文件。更关键的是:如果同一家企业同时部署了客服智能体和销售智能体,必须确保二者的人格边界不重叠——用户在售前咨询后转售后时,不能感觉在和「同一个人」说话,否则会产生信任混淆。

人格化投入的 ROI 怎么量化?

最直接的指标是三个:30 天留存率、转人工率、NPS。如果在人格层投入后这三个指标中至少两个出现了统计显著的改善(建议 A/B 验证周期 ≥14 天),ROI 就是正的。一个更长期的指标是「用户主动反馈率」——当用户愿意给智能体提建议时,说明已经建立了信任关系。

如果您的团队正在规划或优化企业智能体,优码云提供从人格设计到一致性检测再到上线迭代的完整工程服务。联系我们,获取针对您业务场景的人格化智能体落地方案。

参考

  • TechCrunch: "Why Cognition bought Poke: AI personality is becoming a competitive advantage" — Sarah Perez, 2026-07-25
  • TechCrunch: "Poke makes using AI agents as easy as sending a text" — Sarah Perez, 2026-04-08
]]>
分享到
AI Agent开发:人格化引擎如何改写智能体交… - 优码云博客