# 智能预约助手:模型与语音供应商选型 > 日期:2026-08-02
> 状态:**Recommendation / M0 推荐基线,待账号开通、合规复核与语料实测**
> 影响范围:智能预约 M0,不影响 `phase2-pilot-rc6`
> Architecture Review Required:`Yes`
> Access / Privacy Review Required:`Yes`
> 官方资料查阅日期:2026-08-02 **关联文档** - [智能预约助手产品与技术方案 v0.1](./宠小它智能预约助手-产品与技术方案-v0.1.md) - [智能预约助手 M0 编码任务 brief](./智能预约助手-M0编码任务brief-2026-08-02.md) ## 1. 推荐结论 M0 的默认技术基线建议为: | 能力 | 推荐供应商与模型 | 调用边界 | |---|---|---| | 语音转写 | 阿里云百炼华北2(北京)`qwen3-asr-flash-2026-02-10` | OpenAI 兼容 HTTP 同步调用,Base64/Data URL 直传,不中转 OSS,不持久化原始录音 | | 预约意图提取 | 阿里云百炼华北2(北京)`qwen-plus-2025-12-01` | 非思考模式 + `response_format=json_object` + 服务端 JSON Schema 二次校验 | | ASR 对照候选 | 腾讯云 `SentenceRecognition` | 仅在同一批脱敏/已授权语音语料上对照,不直接进生产 | | LLM 备选 | 腾讯云 TokenHub 的国内文本模型 | 供应商适配层预留,M0 不同时维护两条生产路径 | 不建议把 OpenAI API 作为当前 Petstore 中国大陆生产默认。OpenAI 官方说明仅支持列表中的国家和地区,中国大陆不在当前列表中;未列出地区不受支持,且可能导致账号被停用。 这个结论是 **M0 工程默认**,不是长期供应商锁定。所有外部能力必须通过 Petstore 自有适配接口调用。 ## 2. 选型前提 智能预约不是知识问答或通用 Agent。它的模型任务只有: 1. 把当次文字和已验证草稿转换成结构化 `draftPatch`; 2. 识别 `book / modify / end / fallback` 等有限意图; 3. 标记歧义和建议下一个状态机动作。 它不需要联网检索、知识库、长上下文、平台托管 Agent 或模型直接工具调用。宠物、服务和号源必须由 Petstore 后端确定性解析。 因此选型优先级为: 1. 中国大陆可达与明确数据部署范围; 2. 中文口语、时间表达、宠物名称和门店服务识别; 3. 非思考模式下稳定输出 JSON; 4. 可固定模型快照,避免别名自动升级导致行为漂移; 5. 明确的密钥、区域、超时、限流、费用和数据保留口径; 6. 最终才是模型绝对能力和单次价格。 ## 3. 候选方案评估 ### 3.1 阿里云百炼全链路(推荐 M0 默认) **区域和网络** - 百炼官方提供华北2(北京)`cn-beijing` 地域和中国内地服务部署范围; - 官方地域说明称推理过程数据不持久化、传输加密,静态数据位于所选地域; - 生产建议使用业务空间专属域名,不使用试用域名。 **语音转写** - `qwen3-asr-flash-2026-02-10` 支持普通话、四川话、闽南语、吴语、粤语等中文语音类型及多语种; - 官方 OpenAI 兼容接口支持公网 URL 或 Base64 Data URL,可在录音结束后同步转写,无需把用户录音中转到公网 OSS; - 官方允许以 system message 提供背景文本和实体词表,M0 只传当前门店服务名和当前 customer 的宠物展示名,不传手机号或其他客户数据; - 官方限制是 5 分钟/10 MB,M0 继续使用更小的 60 秒/3 MB 业务门禁; - 当前官方列价为 `0.00022 元/秒`,不包含活动优惠。 **结构化意图提取** - `qwen-plus-2025-12-01` 在华北2(北京)官方标注支持 Function Calling 和结构化输出; - 百炼 OpenAI 兼容接口支持 `response_format={"type":"json_object"}`; - M0 使用固定快照 `qwen-plus-2025-12-01`,不使用可自动升级的 `latest` 别名; - M0 关闭思考模式,不开启联网或平台内置工具; - JSON mode 只保证可解析 JSON,Petstore 服务端仍必须校验字段、枚举、长度和状态转换。 **风险** - Petstore 当前服务器在腾讯云,调用百炼需经过公网 HTTPS,必须做真实延迟和可用性实测; - 需新开阿里云百炼业务空间、独立 API Key 和费用告警; - 语音及文本的合同保留、删除和工单口径需在生产开通前再做一次 Access / Privacy Review。 ### 3.2 腾讯云全链路(对照/备选) **语音转写优势** - `SentenceRecognition` 适合 60 秒内短音频,支持音频数据或 URL,大小不超过 3 MB; - 官方文档列出普通话、粤语、上海话、四川话等多种方言,默认频率限制 30 次/秒; - 可直接在现有腾讯云账号与服务器体系中配置,运维链路较短。 **隐私注意点** - 腾讯云 ASR SDK 隐私规则要求开发者在收集和上传音频前完成告知和合法授权; - 官方 FAQ 说明上传音视频文件不会保存,但识别后的文本文件会在服务器上保存 7 天; - 腾讯云语音优化用户数据授权是自愿授权,Petstore 不应开启该额外授权。 因为 Petstore 方案的默认原则是不持久化完整对话原文,「识别文本保留 7 天」必须在隐私告知和供应商数据处理评审中明确,不能只依赖我们自己不落库。 **文本模型平台变化** - 腾讯云官方已说明原混元/DeepSeek API 售卖入口逐步迁移到 TokenHub; - 新项目应使用 TokenHub 而非旧混元平台,OpenAI SDK 兼容 `base_url` 为 `https://tokenhub.tencentmaas.com/v1`; - TokenHub 可选模型变化较快,正式纳入前需按具体模型快照验证 JSON 遵循、时间表达和延迟。 ### 3.3 腾讯 ASR + 阿里 Qwen(仅当实测显著更好) 混合方案可在不改模型的情况下使用腾讯 ASR,但会引入: - 两套云账号、密钥、费用告警和故障域; - 两份数据处理和隐私告知边界; - 更长的排障链路。 只有当腾讯 ASR 在 Petstore 脱敏语音语料的关键槽位准确率显著高于 `qwen3-asr-flash-2026-02-10`,且 7 天识别文本保留已通过隐私评审时,才采用混合方案。 ### 3.4 OpenAI(非当前生产候选) OpenAI 官方提供语音转写和结构化模型能力,但当前官方 API 支持国家与地区列表不包含中国大陆。官方同时说明,从未列出地区访问或提供访问可能导致账号被阻止或暂停。 因此本项目不使用绕过地区支持范围的网络或账号方案,也不将其写入当前生产 Runbook。 ## 4. M0 固定配置建议 ### 4.1 模型调用 - Model:`qwen-plus-2025-12-01` - Region:`cn-beijing` - Mode:非思考 - Streaming:关闭,M0 使用完整 JSON 响应 - Response format:`json_object` - Function Calling:关闭,模型不拥有 Petstore 工具 - Web search / built-in tools:关闭 - Temperature:低随机性,编码前经 30 条语料实测后冻结 - Timeout:建议 3 秒超时、不进行多次自动重试,最终值以腾讯云服务器实测为准 ### 4.2 语音调用 - Model:`qwen3-asr-flash-2026-02-10` - Region:`cn-beijing` - Input:服务端从短期上传流读取字节,转 Base64 Data URL - Business limit:单段不超过 60 秒、3 MB - Language hint:中文,结果仍由用户编辑确认 - Context glossary:宠小它、当前门店实际服务名、当前 customer 的宠物展示名;不上传手机号、其他客户宠物名或全量客户名单 - Raw audio persistence:禁止 ### 4.3 密钥与环境变量 为了允许分别轮换和后续切换供应商,即使 M0 同用阿里云,也保留独立逻辑配置: ```dotenv PETSTORE_BOOKING_AGENT_ENABLED=false PETSTORE_BOOKING_AGENT_LLM_PROVIDER=aliyun PETSTORE_BOOKING_AGENT_LLM_BASE_URL=https://.cn-beijing.maas.aliyuncs.com/compatible-mode/v1 PETSTORE_BOOKING_AGENT_LLM_MODEL=qwen-plus-2025-12-01 PETSTORE_BOOKING_AGENT_LLM_API_KEY= PETSTORE_BOOKING_AGENT_LLM_TIMEOUT_MS=3000 PETSTORE_BOOKING_AGENT_ASR_PROVIDER=aliyun PETSTORE_BOOKING_AGENT_ASR_BASE_URL=https://.cn-beijing.maas.aliyuncs.com/compatible-mode/v1 PETSTORE_BOOKING_AGENT_ASR_MODEL=qwen3-asr-flash-2026-02-10 PETSTORE_BOOKING_AGENT_ASR_API_KEY= PETSTORE_BOOKING_AGENT_ASR_TIMEOUT_MS=5000 ``` 上述只是变量名与占位,不是可用密钥。真实 Workspace ID 和 API Key 不进 Git、聊天、日志、截图或测试 fixture。 ## 5. 脱敏语料对照方案 ### 5.1 文字意图集 建立 30 条合成/脱敏中文预约用例: - 8 条标准预约; - 5 条相对日期与时间段; - 4 条多宠物/同名歧义; - 4 条服务同义表达; - 3 条无号、过去日期或非营业时间; - 3 条修改上一轮草稿; - 3 条越界请求(价格编造、任意宠物 ID、绕过确认)。 每条用例只保存预期结构化字段和下一状态,不保存真实客户资料。 ### 5.2 语音对照集 - 从文字集选 20 条,由已知情并同意的测试人员录制; - 覆盖普通话、轻微口音、室内背景声和宠物名/服务名; - 不使用门店客户的真实录音,不在 Git 保存可识别真人的音频; - 本地音频仅用于一次性对照,结果只归档脱敏文本、槽位判定和延迟。 ### 5.3 判定指标 | 类型 | 指标 | M0 建议门槛 | |---|---|---| | LLM | 输出可解析 JSON | 30/30 | | LLM | 意图、宠物查询词、服务查询词、日期表达、时间窗口槽位准确率 | ≥ 90% | | LLM | 越权请求进入写路径或产生伪造业务事实 | 0 | | ASR | 宠物名、服务名、日期/时间等关键槽位识别准确率 | ≥ 90% | | ASR | 转写延迟 p95 | ≤ 3 秒,以腾讯云当前服务器实测 | | LLM | 意图提取延迟 p95 | ≤ 2 秒 | | 链路 | 语音结束到确定性回复 p95 | ≤ 5 秒 | ASR 供应商的最终选择以「关键槽位准确率 + p95 延迟 + 数据保留可接受性」为准,不以通用宣传的全局字错率代替 Petstore 业务语料。 ## 6. 试点成本量级 以 50 个试点 session 、每个 session 2 段 10 秒语音、4 次模型调用为示例: - ASR:`50 * 2 * 10 * 0.00022 元 = 0.22 元`; - LLM:假设每次 1000 输入 token + 200 输出 token,按当前华北2列价 `0.8 元/百万输入 token` 与 `2 元/百万输出 token`,约 `0.24 元`; - 示例总模型调用费约 `0.46 元`,不包含公网流量、账号优惠、日志和人工评测成本。 该数字只说明 M0 小样本的 API 费用不是核心矛盾,不是生产预算承诺。实际决策优先看准确性、数据边界、稳定性和降级。 ## 7. 生产前必须完成 - [ ] 开通华北2(北京)百炼业务空间,确认 Workspace 专属域名可用。 - [ ] 为 LLM 和 ASR 创建可独立轮换的服务端密钥,不共享个人开发密钥。 - [ ] 确认数据处理、保留、删除、不用于训练和工单响应口径。 - [ ] 在小程序隐私声明和首次语音使用前完成明确告知,只在用户主动按住录音时收集。 - [ ] 在腾讯云实际后端服务器完成 DNS、TLS、p50/p95 延迟、超时和失败降级实测。 - [ ] 开启预算与异常用量告警,限制单用户和单门店频率。 - [ ] 模型快照、提示词版本、schema 版本和供应商请求 ID 可追溯,但日志不保存完整对话。 ## 8. 官方资料 ### 阿里云 - [选择地域、服务部署范围和接入域名](https://help.aliyun.com/zh/model-studio/regions/) - [语音识别模型选型](https://help.aliyun.com/zh/model-studio/asr-model/) - [qwen3-asr-flash 模型信息](https://help.aliyun.com/zh/model-studio/qwen3-asr-flash) - [Qwen-ASR API 参考](https://help.aliyun.com/zh/model-studio/qwen-asr-api-reference) - [非实时语音识别](https://help.aliyun.com/zh/model-studio/non-realtime-speech-recognition-user-guide) - [qwen-plus 模型信息](https://help.aliyun.com/zh/model-studio/qwen-plus) - [结构化输出](https://help.aliyun.com/en/model-studio/qwen-structured-output) - [百炼产品与数据说明](https://help.aliyun.com/zh/model-studio/what-is-model-studio) ### 腾讯云 - [一句话识别 API](https://cloud.tencent.com/document/api/1093/35646) - [语音识别请求结构与地域接入](https://cloud.tencent.com/document/product/1093/35639) - [语音识别 SDK 个人信息保护规则](https://cloud.tencent.com/document/product/1093/73072) - [语音识别功能 FAQ(含音频/识别文本保留口径)](https://cloud.tencent.com/document/faq/1093/35802) - [语音识别用户数据授权协议](https://cloud.tencent.com/document/product/1093/115535) - [TokenHub 迁移指南](https://cloud.tencent.com/document/product/1823/131382) ### OpenAI - [OpenAI API 支持的国家和地区](https://help.openai.com/en/articles/5347006-openai-api-supported-countries-and-territories)