印度农村和半城市化地区,合格医生和基层医疗中心(PHC)的匮乏始终是尖锐难题。以瓦拉纳西Shivpur的农民Ramesh Kumar为例,他若想获得基础医疗指导或一张门诊(OPD)号,需要长途跋涉数公里,再经历漫长排队,换来的却是延误的治疗和沉重的焦虑。 传统的医疗类数字应用,依赖繁杂的文本下拉菜单和复杂的导航逻辑。对于识字率有限、不熟悉英语或印地语技术术语的农村用户来说,这些应用形同虚设。语言障碍与区域性方言差异,让本应普惠的工具变成了新的数字鸿沟。 语音,是唯一无需任何数字技能就能操作的交互界面。 当一个人可以用自己的母语(印地语或口语化的Hinglish)自由表达,并立即获得符合文化习惯且医学上安全的回应时,技术才算真正触达了生命。正是基于这一信念,SwasthyaSathi AI(स्वास्थ्यसाथी)应运而生。它诞生于Murf AI主办的10 Days of Voice Agents(#VoiceForBharat)挑战赛“健康可及”赛道。 一、端到端语音管线:让延迟低到“像在打电话” 一个合格的语音代理,必须让用户感觉自己在与电话那头真实的人类对话。为了在对话中实现亚秒级延迟,系统集成了全实时流式组件: - 语音捕获层:用户可以通过浏览器WebRTC或Linphone SIP电话接入。 - 语音转文字(STT):Deepgram Nova-2负责实时处理印度印地语与Hinglish的混合语音流,将音频转成文字。 - 临床大脑:OpenAI GPT-4o-mini作为核心决策引擎,承担四项关键任务:临床分诊与安全护栏、老用户持久化记忆(识别回头客并调用病史)、多专科意图分类(判断用户需要全科、妇科还是儿科指导),以及人工升级的知情同意协议(当模型无法确保安全时,引导用户同意转接给真人医生)。 - 语音合成(TTS):由Murf Falcon 2完成印地语女声回复,并通过WebRTC实时传回用户端。 在架构流程上,每一句话都按以下路径流转:用户麦克风拾音 → Deepgram识别 → GPT-4o-mini推理 → Murf Falcon 2合成应答 → 用户听筒播放。所有环节均采用流式传输,无需等待完整句读完再处理,这是实现自然对话节奏的关键。 二、安全护栏:医疗场景的底线 医疗场景不能容忍幻觉。因此系统在临床大脑层设有多重防护: 其一,分诊第一,诊断第二。GPT-4o-mini被明确要求优先判断病情紧急程度,而不是直接下诊断书。对于胸痛、严重外伤、呼吸困难等危险信号,系统会立即停止自行应答,转而启动人工升级协议,征得病人同意后转接给合作诊所的执业医师。 其二,记忆既是温度也是风险。系统会记住Ramesh Kumar上次咨询时的血压数值和用药记录,让复诊对话更连贯、更有人情味;但当记忆与当前症状描述产生矛盾时,安全护栏会要求模型主动向用户复核,而不是默默修正。 其三,药名与剂量必须走白名单。涉及具体药物推荐时,模型只允许使用预置的、经印度药剂师审核通过的标准药名和剂量范围;任何超出白名单的内容都会被强制拦截并要求重新表述。 三、为什么选择这4个组件? 在#VoiceForBharat挑战赛的极限时间内,技术选型完全以“够快、够稳、够懂印度口音”为唯一标准。Deepgram Nova-2在印地语口语识别上的准确率远超通用引擎,尤其是对Hinglish中的英文单词混说场景做了专门优化;GPT-4o-mini在保证推理质量的前提下,延迟和成本都显著低于大杯型号;Murf Falcon 2则让印地语TTS真正拥有温和而镇定的情绪质感——这恰恰与农村患者对“医生语气”的心理期待贴合;LiveKit 则负责解决WebRTC连接中棘手的网络穿透和丢包问题,即使在农村移动网络环境下也能维持稳定通话。 这套系统没有使用任何重型本地模型,全部依赖云端API组合。在10天的开发周期内,作者完成了从概念验证到可拨打通话的全流程落地。目前该项目已开源在GitHub,并附有完整的部署指南和成本估算表,供印度各地社区医疗中心自行搭建。

打开网易新闻 查看精彩图片