AI 实时语音教练产品方案

AI 实时语音教练产品方案
青萍叙事产品形态:微信小程序 + Web 的实时语音一对一 AI 对话,首发场景为英语口语陪练。
核心链路:用户对着麦克风说话,AI 秒级听到、秒级开口回答,全程像真人对话一样自然,可以随时打断。
实时语音能力由自建服务承接,不使用微信自带的同声传译组件。
一、产品定位
一个长在语音里的私人外教。打开就能开口练,练得越多,它越了解你。
对标的是“打电话给真人外教”的体验,不是“点一下按钮、等三秒、听一段合成音”的传统语音助手。用户张嘴就能说,说到一半改主意,可以直接打断 AI 重新说。这条是整个产品体验的底线,任何功能迭代都不能破坏它。
首发场景是英语口语陪练。教练体系按场景展开:
| 场景 | 用户在做什么 | AI 教练的角色 |
|---|---|---|
| 通用口语陪练 | 日常口语自由聊 | 陪聊伙伴,顺带纠错 |
| 面试模拟 | 练习英文面试问答 | 面试官,追问、给反馈 |
| 出行场景 | 机场、点餐、问路等情境演练 | 对手戏演员,扮演服务人员 |
| 发音纠正 | 逐句跟读、被纠正发音 | 严格的发音教练 |
后续场景复用同一套架构,只是教练的提示词和教学策略不同。
目标用户:有一定英语基础、缺真实开口机会的成年学习者,以及嫌约真人外教贵、嫌录播课没有互动的人。
核心价值有四条:
- 随时随地,打开就能练,没有约课成本
- 打断、改口、抢话都自然,像真人对话
- AI 记得住你,上次总犯的错这次还会盯着你
- 比真人外教便宜一个数量级
二、核心体验标准
实时语音产品的体验是毫秒堆出来的。给 MVP 定四条硬指标,达不到就不上线:
| 指标 | 目标值 | 怎么量 |
|---|---|---|
| 端到端响应延迟 | 用户停止说话到 AI 开始出声,90% 的对话不超过 1.5 秒 | 客户端打点 |
| 打断生效时间 | 用户开口到 AI 声音停止,不超过 0.5 秒 | 客户端打点 |
| 断线恢复 | 网络闪断重连后 3 秒内恢复对话 | 服务端日志 |
| 会话稳定性 | 单次 15 分钟对话无中断成功率不低于 99% | 运维监控 |
体验红线:不允许 AI 声音和用户声音同时存在超过 1 秒。
一次语音往返的延迟预算,各段加起来等于 1.5 秒的总目标(具体分配可在摸底测试后调整):
flowchart LR
A[用户说完话] -->|上行音频<br>≤ 0.3s| B[语音服务转发]
B -->|AI 处理<br>≤ 0.7s| C[生成首包音频]
C -->|下行音频<br>≤ 0.3s| D[客户端缓冲]
D -->|播放出声<br>≤ 0.2s| E[教练开口]
三、用户旅程
3.1 首次使用
- 用户进入小程序,微信授权登录,复用现有账号体系
- 选择场景(MVP 只有通用陪练),音色先用默认款
- 首次弹窗请求麦克风权限。这里给一个“为什么需要麦克风”的解释页,拒绝率会明显降低
- 进入对话页,看到教练形象和声浪动画
- 按住说话,或者直接开口(推荐直接开口)
- 第一次对话完成后,展示本次练习报告:聊了多久、开口次数、被纠正的表达
flowchart TD
A[进入小程序] --> B[微信授权登录]
B --> C[选择场景]
C --> D{授权麦克风}
D -->|同意| E[进入对话页]
D -->|拒绝| F[引导去设置页开启]
F --> D
E --> G[完成首次对话]
G --> H[查看练习报告]
界面设计稿(授权弹窗、选场景页、对话页、报告页)待 UI 出图后补充。
3.2 一次典型对话
1 | 用户点“开始练习” |
一个重要的产品决策:纠错不打断对话流。教练不在用户说话中途插话纠错,而是在自己回应里自然带出正确表达。比如用户说 “I go to school yesterday”,教练回答时自然使用 “Oh, you went to school yesterday! What did you study?”。逐条严肃纠错放在对话结束后的报告里。这是口语陪练产品和语法批改工具的分界线。
3.3 练习报告
对话结束后自动生成,包含:
- 本次时长、开口次数、开口占比
- 对话全文,双方文字稿来自实时转写
- 纠错清单:原文、建议表达、错误类型(时态、冠词、用词、发音)
- 相比上次的变化
报告是留存的关键钩子。用户为了“下次报告好看一点”会回来。
四、产品功能范围
4.1 MVP(P0,必须有)
| 功能 | 说明 |
|---|---|
| 微信登录 | 复用现有账号体系 |
| 实时对话 | 语音自然对话,随时打断 |
| 场景选择 | 首发只有通用陪练单场景 |
| 对话转写 | 双方语音实时转文字,对话页展示 |
| 结束报告 | 时长、开口数据、纠错清单 |
| 麦克风权限引导 | 含拒绝后的恢复引导,去设置页开启 |
| 基础防护 | 单用户同时只能 1 路对话、每日免费时长上限 |
| 弱网处理 | 断线重连,恢复会话上下文 |
4.2 二期(P1,快速跟进)
| 功能 | 说明 |
|---|---|
| Web 端 | 浏览器直接用,MVP 阶段先作为内测渠道,二期正式开放 |
| 教练音色选择 | 2~3 个音色 |
| 多场景 | 面试模拟、出行场景、发音纠正 |
| 长期记忆报告 | “你的高频错误 Top 5”“本月进步曲线” |
| 练习提醒 | 每日打卡提醒,走小程序订阅消息 |
4.3 三期(P2,商业化方向)
| 功能 | 说明 |
|---|---|
| 会员套餐 | 免费额度加订阅制会员,按月或按年 |
| 按量付费 | 单次购买时长包 |
| 课程化内容 | 把场景组织成课程,与青萍教育体系衔接 |
| 教练人格化 | 可选不同风格的教练人设 |
4.4 明确不做
- 不做微信同声传译组件方案,兼容性、延迟、审核都不占优
- 不做视频对话,语音是第一产品,视频稀释焦点且成本翻倍
- MVP 不做录音回放,版权和存储成本先验证需求再说
- MVP 不做多人对话,一对一先跑通
五、关键产品决策及理由
为什么自建语音服务,不让客户端直连模型?
模型的访问密钥一旦下发到客户端,等于把计费权交出去。更重要的是,场景配置、教学策略、用户记忆、计费扣费都长在服务端,直连模型等于放弃这些产品差异化能力。自建服务还带来一个好处:以后换模型,客户端不用动。
为什么场景和模型解耦?
场景是业务概念,模型是技术概念,两者分开管理。以后加“日语陪练”,不需要动模型;想换更便宜的模型,也不需要动场景。
为什么报告比对话页面重要?
对话做得好,只是拿到了入场资格;用户回不回来,靠的是报告。感知“进步”靠报告,感知“被记住”靠跨会话记忆。这两点才是和“用免费 ChatGPT 语音聊英语”拉开差距的地方。
六、非功能性要求
成本模型(直接影响定价)
- 首版全链路统一用低延迟、低成本的模型档位,主对话和报告生成都用它,把单位成本压到最低
- 这个档位对“1.5 秒内响应”的体验指标反而更友好
- 产品定价等于模型成本乘以安全系数,再分摊服务器成本。低成本让免费额度可以给得更宽裕,转化漏斗验证更快
- 高质量档位保留为升级选项:质量投诉集中时评估切换,或者作为会员专属权益,切换成本很低
- 免费额度的设计目标:让用户完整体验 3~5 次对话后,自然触达付费墙
合规与隐私
- 麦克风录音属于敏感个人信息,首次采集前需单独同意,这是小程序合规要求
- 语音数据发送至模型服务商处理,隐私政策需明示
- 转写文本和报告属于用户数据,支持删除;原始音频不落盘(MVP)
- 未成年人:MVP 不做青少年模式,但隐私政策需覆盖
可用性
- 核心依赖是模型服务商,上线前确认其服务状态的通知渠道。故障时小程序端给出友好提示,比如“教练休息一下,稍后再来”,不能白屏
- 模型服务商对新账号提供免费额度,开发测试期够用
七、成功指标
北极星指标是周有效练习人数:一周内完成至少 1 次、每次不少于 5 分钟对话的用户数。
辅助指标(上线 3 个月目标):
| 指标 | 目标 | 说明 |
|---|---|---|
| 首次对话完成率 | ≥ 60% | 授权麦克风到完成首次对话 |
| 次周留存 | ≥ 25% | 语音产品早期核心指标 |
| 单次对话时长 | 中位数 ≥ 8 分钟 | 低于 5 分钟说明体验或内容有问题 |
| 打断使用率 | ≥ 30% 的对话出现打断 | 打断是“当真人用”的信号 |
| 报告打开率 | ≥ 40% | 钩子是否成立 |
| 免费转付费 | ≥ 5% | 商业化验证 |
八、风险与预案
| 风险 | 影响 | 预案 |
|---|---|---|
| 1.5 秒延迟达标不了 | 核心体验不成立 | MVP 前先做延迟摸底测试;不达标优先排查客户端缓冲和服务端转发;兜底是换高质量档实测对比后决策 |
| 低成本档教学质量不足 | 教学效果打折、差评 | 真人盲评前置,各 20 组对话;不达标切换档位并重算定价 |
| 模型服务商故障或限流 | 服务不可用 | 服务端保留切换供应商的能力;监控告警;客户端降级提示 |
| 微信审核(语音类目) | 上线延期 | 提前确认类目资质;教育类目需备案则提前办 |
| 免费额度被薅 | 成本失控 | 设备识别、每日时长上限、异常并发封禁 |
| 隐私合规 | 下架风险 | 单独同意、隐私政策、数据不落盘三件事,上线前过一遍法务 |
| 用户期待错位(以为是翻译器) | 差评 | 首页文案明确“陪练”定位;首次对话教练先开口引导 |
九、上线计划
与研发的 MVP 阶段计划对齐,详见技术文档。产品侧关注三个闸口:
- 体验闸口(研发前期):Web 端端到端延迟、打断实测达标,才进入小程序开发
- 合规闸口(研发中期并行):隐私政策、类目资质、麦克风权限文案定稿
- 商业闸口(研发末期):免费额度、计费、监控上线,灰度发布
灰度策略:先 Web 端小流量(不涉及审核),再提交小程序审核,通过后 10%、50%、全量逐步放开。










