🧊 前沿科技知识库
全部 / 人工智能(AI)

AI 产品与 UX

2026-09-26 · 人工智能(AI)
最后更新:2026-09-26 | 领域:AI·前沿方向与风险 | 说明:信息来源为公开网络资料,详见文末参考来源

概述

2025–2026 年,AI 产品的交互范式从「对话框」向「入口 + 智能体」演进:AI 助手不再只是插件,而成为承载任务执行、应用构建与持续工作的入口。与此同时,评测驱动迭代(Eval-Driven Development)成为产品工程的基本实践,定价模式也从按席位转向按用量与按结果。这一转变意味着 AI 助手开始覆盖从对话、写作到应用构建与后台任务的完整链路(微软把 Office 三件套塞进 Copilot)。

最新进展(2025–2026)

交互范式:chat / copilot / agent

微软于 2026 年 9 月 25 日发布新版 Copilot,新增 Home、Code、Autopilot 三项核心能力,意在把 AI 助手从对话工具扩展为可执行任务、构建应用和持续工作的智能代理。其中 Home 成为 Copilot 的新入口,整合 Chat 与 Cowork,并把 Word、Excel、PowerPoint 等 Office 能力直接融入;Code 采用与 GitHub Copilot 相同的技术,让用户用自然语言创建应用、仪表盘等;Autopilot 是此前 Scout AI 代理的升级版,被设计为持续运行的数字协作者,即使用户不在电脑前也能继续执行任务(微软发布新版 Copilot,引入 Home、Code 和 Autopilot 三大 AI 功能、微软把 Office 三件套塞进 Copilot)。

在官方 UX 指南中,微软明确 Copilot 的设计原则:对话优先(conversation-first)、渐进式复杂度(progressive complexity)、上下文保持(context preservation)、清晰而非重复(clarity over duplication),并要求应用支持 inline 模式(User experience guidelines for MCP apps in declarative agents for Microsoft 365 Copilot)。面向产品团队的 Copilot 设计模式总结则认为 2026 年最高杠杆的模式是:幽灵文本补全(ghost-text completion)、内联动作菜单(Cmd-K 或斜杠命令)与选区锚定操作(selection-anchored actions)(AI copilot UX design patterns for product teams in 2026)。从采纳数据看,AI 编码 agent 的竞争格局仍在变化:调查显示 Claude Code 在 9 个月内实现约 6 倍增长,Google Antigravity 早期采纳迅速,而 GitHub Copilot 与「用于编码的 ChatGPT」的采用趋于平稳(AI Coding Agent Adoption in 2026)。

信任与可控性

开发者对 AI 输出的信任出现下降:2026 年仅 29% 的开发者相信 AI 输出准确,低于 2024 年的 40%,46% 明确表示不信任(AI Coding Assistant Statistics 2026)。这要求产品在设计上强调可控性、可验证性与可回退,评测与红队也因此成为产品可控性的常规组成部分(Eval-Driven Development: Why Evals Are the New Unit Tests for AI)。

评测驱动迭代

Eval-Driven Development(EDD)指在设计提示词之前先写评测,用带标签数据集断言分数不低于阈值,并在 CI 中对每次变更做门禁;2026 年 EDD 已从前沿实践变为基线实践(Eval-Driven Development for LLMs: A 2026 Guide)。其成为基线的原因是:前沿模型每隔数周就会在你的提示之下发生变化,唯一能捕捉静默回归的机制,是在每个 PR 与每个抽样生产队列上运行的评测套件(What Is Eval-Driven Development?)。Anthropic 的指导是先用 eval 定义能力,再迭代直到 agent 通过(Eval-Driven Development: Why Evals Are the New Unit Tests for AI)。一个实践警告是「只评输出的评测会骗人」:仅按最终输出打分的 agent 通过率比全轨迹评测高 20–40%,会掩盖生产中最关键的失败;一个真实的评测闭环应包含来自生产失败的金标准数据集、可信的 grader 与 LLM judge 等部分(Eval-Driven Development: Why Evals Are the New Unit Tests for AI)。在更细的方法论中,评测驱动被概括为「定义—测试—诊断—修复」的可重复工程循环,用于替代「凭直觉逐条调提示」的做法(When "Better" Prompts Hurt: Evaluation-Driven Iteration for LLM Applications)。

定价模式

2026 年 AI agent 定价收敛为四种:按席位订阅、按用量、按结果、混合(AI Agent Development Cost in 2026: Pricing Models and Real Estimates)。据 Futurum Research 调查,不足五分之一的企业买家仍偏好传统按用户定价,43% 更偏好按消费量定价(AI Agent Development Cost in 2026)。按结果定价的代表是 Salesforce Agentforce Help Agent,于 2026 年 6 月 25 日上线,采用每解决一次 2 美元的模型;Intercom Fin、HubSpot、Sierra AI 也在向同一结构收敛(Outcome-Based AI Pricing Is Here)。按解决次数计价区间约 0.50–2.00 美元/次,失败尝试不收费(AI Pricing Models: Per-Seat vs Per-Use vs Outcome (2026))。也有观点认为按结果定价是 2026 年最受关注、最接近「按价值付费」的模式(AI Agent Pricing Models)。

核心技术与关键概念

代表性项目 / 公司 / 产品

关键数据与评测结果

事项数据来源
开发者使用/计划使用 AI 工具84%(Stack Overflow 2025 调查,2024 为 76%)AI Coding Statistics 2026
每日使用 AI 工具的专业开发者51%AI Coding Assistant Statistics 2026
常规使用 AI 工具的开发者(JetBrains 2025)85%AI Coding Statistics 2026
信任 AI 输出准确的开发者29%(2024 为 40%),46% 不信任AI Coding Assistant Statistics 2026
GitHub Copilot 用户数约 2000 万(2026 年 7 月)AI Coding Assistant Statistics 2026
Cursor ARR2026 年 2 月达 20 亿美元AI for Coding & Software Development
企业买家偏好按消费量定价43%;偏好按用户定价不足 1/5AI Agent Development Cost in 2026
Agentforce 结果定价2 美元/解决Outcome-Based AI Pricing

趋势与争议

  1. 入口之争:AI 助手从插件升级为操作系统级入口,可能重塑既有应用分发与用户关系(微软新版 Copilot)。
  2. 信任赤字:能力提升的同时开发者信任下降,产品需以可控性与证据弥补(AI Coding Assistant Statistics 2026)。
  3. 评测与产品耦合:EDD 成为门禁,但「只评输出」会产生虚假达标(Eval-Driven Development)。
  4. 定价不确定性:按结果定价把失败成本转移给厂商,其可持续性取决于解决率与单位成本(AI Pricing Models 2026)。
  5. 采纳成本与影子 AI:有统计称影子 AI 事件使数据泄露平均成本增加约 67 万美元,且 47% 员工在组织禁用后仍使用个人 AI 账号(AI for Coding & Software Development)。
  6. 持续运行代理的授权问题:随着 Autopilot 类「持续运行的数字协作者」出现,产品需要处理用户不在场时的授权、审计与回退问题(微软发布新版 Copilot)。

参考来源

← AI 基础设施与算力AI 安全与对齐(AI Safety and Alignment) →