Google 为 Pixel 11 引入的 Gboard 语音转文字功能 Rambler,凭借 Gemini 大型语言模型的运算能力,可以将口语中的停顿与赘词整理成条理清晰的文字,并自动加入项目符号、分段等格式。使用体验方面,Rambler 对语义判断的准确度极高,即使发言者中途修正或重复语句,最终输出仍能保留原意。对于驾驶期间需要回复信息的使用情境而言,这项功能省却了等待红灯时逐字核对录音结果的麻烦。
整体而言,Rambler 采用“整段输入、整段输出”的模式,系统必须取得完整上下文后,方能删除口头禅并产出最终文本。
缺乏即时预览成为 Rambler 主要缺陷
Rambler 目前最明显的不足,在于录音期间完全没有视觉反馈。用户按下角落的麦克风按钮开始说话,说毕须自行按下勾号确认,系统方会在短暂处理后显示完整文本。由于过程中无法即时监测语音识别的进度,不少用户曾忘记按下确认键,最终只见空白画面而无任何输出。更棘手的是,语音转文字的工作模式倾向“输入指令”,即用户必须在录音结束后才能编辑或转换结果,过程中难以中途修改或补充内容。
另一层限制在于技术架构本身。Rambler 必须取得用户全部话语后,方能判断语义并过滤冗词,因此无法像传统语音输入般逐字即时显示。这种“延迟输出”的特性,虽然有助于提升最终文本的流畅度,却令用户失去中途修正的机会,也令整体录音时间无可避免地延长。
Nothing OS 5.0 展示可行解决方案
针对上述痛点,Nothing 在即将推出的 Nothing OS 5.0 Essential Voice 更新中展示了截然不同的做法。该系统会在用户说话期间,于画面上即时显示语音转文字的“预览版本”,待处理完成后,预览内容会自动删除,并由经过 Gemini 处理、删去赘词的“最终版本”取代。这种“先预览、后取代”的模式,既保留了逐字即时反馈的视觉线索,又兼顾了 Rambler 原有以大型语言模型整理文本的优势。
对 Google 而言,只要将类似机制移植至 Gboard,即使预览内容并非最终结果,亦足以让用户确认系统是否听对内容。
若 Google 进一步在录音期间于 Gboard 顶部的发光横条显示文字预览,便可大幅改善 Rambler 的日常使用体验。即时视觉反馈能让用户即时察觉语音识别的准确度,减少因忘记按确认键而衍生的操作失误。这项改动技术难度不高,也无需改动 Rambler 倚重的后端处理流程,理论上可通过软件更新方式推送至 Pixel 11 系列设备。
| 项目 | 规格 |
|---|---|
| 功能名称 | Rambler (Gboard 语音转文字) |
| 底层模型 | Gemini Intelligence 套件 / Gemini 大型语言模型 |
| 支持设备 | Pixel 11 系列 |
| 输入方式 | 按下麦克风键 → 说话 → 按下勾号确认 |
| 即时预览 | 不支持(录音期间无文字反馈) |
| 输出格式 | 自动加入项目符号、分段等格式 |
| 编辑模式 | 录音结束后方可编辑或转换 |
| 参考解决方案 | Nothing OS 5.0 Essential Voice(支持即时预览) |
利益声明:本文包含合作商户产品链接,如你通过链接购买,TechRitual 可能获得佣金收入,但不影响产品评价及推荐。详情请参阅隐私政策。

