Gemini 3.8 Live 语音模型与浏览器实时对话界面
Simon Willison1 天前
Google 发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,这是两款新的语音到语音模型,形态上接近 OpenAI 的 GPT-Live 系列。
围绕这两款模型,有开发者基于官方文档制作了一个浏览器端 Web UI,用于快速试用 Gemini Live 的实时语音能力。
这个界面能做什么
该 Web UI 支持以下功能:
- 选择不同的 Gemini Live 模型
- 选择语音预设
- 输入可选的系统提示词
- 通过浏览器开启语音对话
- 在模型说话时直接打断回复
- 查看对话转录文本
- 下载或清空转录记录
- 通过文本输入发送消息,并中断当前语音回复
界面示例中,用户可以先开始会话,浏览器会请求麦克风权限。会话状态会显示为正在监听,并提供麦克风音量指示与计时器。
转录内容中也会标记被打断的模型回复。例如,当模型正在介绍加州褐鹈鹕时,用户可以中途要求“换一些不同的事实”,模型会停止当前回复并继续新的回答。
技术实现
这个实现没有使用额外库,主要依赖浏览器原生能力:
- 使用 WebSocket 连接 Gemini Live 的双向生成接口
- 使用 Web Audio API 的
AudioContext处理音频采集与播放
其连接的 WebSocket 端点形如:
wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent?key=...
也就是说,浏览器端可以直接通过 WebSocket 与 Gemini Live API 建立双向音频通信,同时用 Web Audio API 管理麦克风输入和模型语音输出。
值得关注的点
这类工具展示了实时语音模型在浏览器中的一种轻量集成方式:不依赖复杂前端框架,也不需要专门的原生应用,就可以完成实时语音对话、播放、录音、打断和转录展示。
对于想实验语音代理、浏览器 AI 助手或实时客服原型的开发者来说,这种实现方式有参考价值。
