AI 实时语音教练产品方案

产品形态:微信小程序 + Web 的实时语音一对一 AI 对话,首发场景为英语口语陪练。

核心链路:用户对着麦克风说话,AI 秒级听到、秒级开口回答,全程像真人对话一样自然,可以随时打断。

实时语音能力由自建服务承接,不使用微信自带的同声传译组件。

一、产品定位

一个长在语音里的私人外教。打开就能开口练,练得越多,它越了解你。

对标的是“打电话给真人外教”的体验,不是“点一下按钮、等三秒、听一段合成音”的传统语音助手。用户张嘴就能说,说到一半改主意,可以直接打断 AI 重新说。这条是整个产品体验的底线,任何功能迭代都不能破坏它。

首发场景是英语口语陪练。教练体系按场景展开:

场景 用户在做什么 AI 教练的角色
通用口语陪练 日常口语自由聊 陪聊伙伴,顺带纠错
面试模拟 练习英文面试问答 面试官,追问、给反馈
出行场景 机场、点餐、问路等情境演练 对手戏演员,扮演服务人员
发音纠正 逐句跟读、被纠正发音 严格的发音教练

后续场景复用同一套架构,只是教练的提示词和教学策略不同。

目标用户:有一定英语基础、缺真实开口机会的成年学习者,以及嫌约真人外教贵、嫌录播课没有互动的人。

核心价值有四条:

  • 随时随地,打开就能练,没有约课成本
  • 打断、改口、抢话都自然,像真人对话
  • AI 记得住你,上次总犯的错这次还会盯着你
  • 比真人外教便宜一个数量级

二、核心体验标准

实时语音产品的体验是毫秒堆出来的。给 MVP 定四条硬指标,达不到就不上线:

指标 目标值 怎么量
端到端响应延迟 用户停止说话到 AI 开始出声,90% 的对话不超过 1.5 秒 客户端打点
打断生效时间 用户开口到 AI 声音停止,不超过 0.5 秒 客户端打点
断线恢复 网络闪断重连后 3 秒内恢复对话 服务端日志
会话稳定性 单次 15 分钟对话无中断成功率不低于 99% 运维监控

体验红线:不允许 AI 声音和用户声音同时存在超过 1 秒。

一次语音往返的延迟预算,各段加起来等于 1.5 秒的总目标(具体分配可在摸底测试后调整):

三、用户旅程

3.1 首次使用

  1. 用户进入小程序,微信授权登录,复用现有账号体系
  2. 选择场景(MVP 只有通用陪练),音色先用默认款
  3. 首次弹窗请求麦克风权限。这里给一个“为什么需要麦克风”的解释页,拒绝率会明显降低
  4. 进入对话页,看到教练形象和声浪动画
  5. 按住说话,或者直接开口(推荐直接开口)
  6. 第一次对话完成后,展示本次练习报告:聊了多久、开口次数、被纠正的表达

界面设计稿(授权弹窗、选场景页、对话页、报告页)待 UI 出图后补充。

3.2 一次典型对话

1
2
3
4
5
6
用户点“开始练习”
→ 1 秒内教练先开口打招呼,避免用户不知道该不该说的尴尬
→ 用户自由说话,随时可打断教练
→ 教练回答;说错的地方,教练在回答中自然复述正确说法
→ 用户说 “that’s all for today” 或点结束按钮
→ 生成本次练习报告

一个重要的产品决策:纠错不打断对话流。教练不在用户说话中途插话纠错,而是在自己回应里自然带出正确表达。比如用户说 “I go to school yesterday”,教练回答时自然使用 “Oh, you went to school yesterday! What did you study?”。逐条严肃纠错放在对话结束后的报告里。这是口语陪练产品和语法批改工具的分界线。

3.3 练习报告

对话结束后自动生成,包含:

  • 本次时长、开口次数、开口占比
  • 对话全文,双方文字稿来自实时转写
  • 纠错清单:原文、建议表达、错误类型(时态、冠词、用词、发音)
  • 相比上次的变化

报告是留存的关键钩子。用户为了“下次报告好看一点”会回来。

四、产品功能范围

4.1 MVP(P0,必须有)

功能 说明
微信登录 复用现有账号体系
实时对话 语音自然对话,随时打断
场景选择 首发只有通用陪练单场景
对话转写 双方语音实时转文字,对话页展示
结束报告 时长、开口数据、纠错清单
麦克风权限引导 含拒绝后的恢复引导,去设置页开启
基础防护 单用户同时只能 1 路对话、每日免费时长上限
弱网处理 断线重连,恢复会话上下文

4.2 二期(P1,快速跟进)

功能 说明
Web 端 浏览器直接用,MVP 阶段先作为内测渠道,二期正式开放
教练音色选择 2~3 个音色
多场景 面试模拟、出行场景、发音纠正
长期记忆报告 “你的高频错误 Top 5”“本月进步曲线”
练习提醒 每日打卡提醒,走小程序订阅消息

4.3 三期(P2,商业化方向)

功能 说明
会员套餐 免费额度加订阅制会员,按月或按年
按量付费 单次购买时长包
课程化内容 把场景组织成课程,与青萍教育体系衔接
教练人格化 可选不同风格的教练人设

4.4 明确不做

  • 不做微信同声传译组件方案,兼容性、延迟、审核都不占优
  • 不做视频对话,语音是第一产品,视频稀释焦点且成本翻倍
  • MVP 不做录音回放,版权和存储成本先验证需求再说
  • MVP 不做多人对话,一对一先跑通

五、关键产品决策及理由

为什么自建语音服务,不让客户端直连模型?

模型的访问密钥一旦下发到客户端,等于把计费权交出去。更重要的是,场景配置、教学策略、用户记忆、计费扣费都长在服务端,直连模型等于放弃这些产品差异化能力。自建服务还带来一个好处:以后换模型,客户端不用动。

为什么场景和模型解耦?

场景是业务概念,模型是技术概念,两者分开管理。以后加“日语陪练”,不需要动模型;想换更便宜的模型,也不需要动场景。

为什么报告比对话页面重要?

对话做得好,只是拿到了入场资格;用户回不回来,靠的是报告。感知“进步”靠报告,感知“被记住”靠跨会话记忆。这两点才是和“用免费 ChatGPT 语音聊英语”拉开差距的地方。

六、非功能性要求

成本模型(直接影响定价)

  • 首版全链路统一用低延迟、低成本的模型档位,主对话和报告生成都用它,把单位成本压到最低
  • 这个档位对“1.5 秒内响应”的体验指标反而更友好
  • 产品定价等于模型成本乘以安全系数,再分摊服务器成本。低成本让免费额度可以给得更宽裕,转化漏斗验证更快
  • 高质量档位保留为升级选项:质量投诉集中时评估切换,或者作为会员专属权益,切换成本很低
  • 免费额度的设计目标:让用户完整体验 3~5 次对话后,自然触达付费墙

合规与隐私

  • 麦克风录音属于敏感个人信息,首次采集前需单独同意,这是小程序合规要求
  • 语音数据发送至模型服务商处理,隐私政策需明示
  • 转写文本和报告属于用户数据,支持删除;原始音频不落盘(MVP)
  • 未成年人:MVP 不做青少年模式,但隐私政策需覆盖

可用性

  • 核心依赖是模型服务商,上线前确认其服务状态的通知渠道。故障时小程序端给出友好提示,比如“教练休息一下,稍后再来”,不能白屏
  • 模型服务商对新账号提供免费额度,开发测试期够用

七、成功指标

北极星指标是周有效练习人数:一周内完成至少 1 次、每次不少于 5 分钟对话的用户数。

辅助指标(上线 3 个月目标):

指标 目标 说明
首次对话完成率 ≥ 60% 授权麦克风到完成首次对话
次周留存 ≥ 25% 语音产品早期核心指标
单次对话时长 中位数 ≥ 8 分钟 低于 5 分钟说明体验或内容有问题
打断使用率 ≥ 30% 的对话出现打断 打断是“当真人用”的信号
报告打开率 ≥ 40% 钩子是否成立
免费转付费 ≥ 5% 商业化验证

八、风险与预案

风险 影响 预案
1.5 秒延迟达标不了 核心体验不成立 MVP 前先做延迟摸底测试;不达标优先排查客户端缓冲和服务端转发;兜底是换高质量档实测对比后决策
低成本档教学质量不足 教学效果打折、差评 真人盲评前置,各 20 组对话;不达标切换档位并重算定价
模型服务商故障或限流 服务不可用 服务端保留切换供应商的能力;监控告警;客户端降级提示
微信审核(语音类目) 上线延期 提前确认类目资质;教育类目需备案则提前办
免费额度被薅 成本失控 设备识别、每日时长上限、异常并发封禁
隐私合规 下架风险 单独同意、隐私政策、数据不落盘三件事,上线前过一遍法务
用户期待错位(以为是翻译器) 差评 首页文案明确“陪练”定位;首次对话教练先开口引导

九、上线计划

与研发的 MVP 阶段计划对齐,详见技术文档。产品侧关注三个闸口:

  1. 体验闸口(研发前期):Web 端端到端延迟、打断实测达标,才进入小程序开发
  2. 合规闸口(研发中期并行):隐私政策、类目资质、麦克风权限文案定稿
  3. 商业闸口(研发末期):免费额度、计费、监控上线,灰度发布

灰度策略:先 Web 端小流量(不涉及审核),再提交小程序审核,通过后 10%、50%、全量逐步放开。