语音转文字

语音转文字使用 Web Speech API 将口语音频转换为书面文本。输入:麦克风音频(实时)。输出:文字记录。处理:浏览器端配合 Google 语音识别服务器。需要:网络连接、麦克风权限。用途:听写、会议记录、无障碍访问。

工具界面在此加载 — 基于浏览器的交互式处理。

语音转文字是什么?

语音转文字使用 Web Speech API 将口语音频转换为书面文本。输入:麦克风音频(实时)。输出:文字记录。处理:浏览器端配合 Google 语音识别服务器。需要:网络连接、麦克风权限。用途:听写、会议记录、无障碍访问。

使用场景

  • 会议记录 — 实时转录会议和访谈
  • 听写 — 通过语音撰写邮件、文档和消息
  • 无障碍访问 — 帮助行动障碍用户与计算机交互
  • 内容创作 — 通过说话起草博客文章、脚本和社交媒体内容
  • 语言学习 — 练习发音并获得即时文本反馈

功能特点

  • 实时转录
  • 连续识别
  • 中间结果显示
  • 95%+ 准确率(清晰语音)
  • 免费,无需注册
  • 移动和桌面端可用
  • 复制到剪贴板
  • 无时间限制

常见问题

语音转文字是什么?

语音转文字使用 Web Speech API 将口语音频转换为书面文本。输入:麦克风音频(实时)。输出:文字记录。处理:浏览器端配合 Google 语音识别服务器。需要:网络连接、麦克风权限。用途:听写、会议记录、无障碍访问。

支持哪些语言?

当前版本:仅 en-US(硬编码)。Web Speech API 支持 50+ 语言,但本工具未暴露语言选择。其他语言:修改源代码或使用替代工具。准确率:清晰英语语音 95%+。

转录准确率如何?

准确率:安静环境下清晰语音 95%+。以下情况降至 80-85%:背景噪音、口音、快速语音、专业术语。最佳效果:清晰正常语速说话、使用外接麦克风、最小化背景噪音。

能离线使用吗?

不能。Web Speech API 需要网络连接将音频发送到 Google 语音识别服务器。离线模式:不支持。离线替代方案:使用 Vosk、Mozilla DeepSpeech 或内置操作系统听写(macOS/Windows)。

能录制多长时间?

无固定时间限制。支持连续识别。实际限制:浏览器内存(通常 1-2 小时)、网络稳定性。长时间录制:每 30 分钟停止、复制记录、重新开始。自动停止:静音 60 秒后可能触发。

能上传音频文件吗?

不能上传文件。仅实时麦克风输入。音频文件:通过扬声器播放文件同时工具录制(准确率低),或使用专用转录服务(Rev、Otter.ai、Google Cloud Speech-to-Text API)。

哪些浏览器支持语音识别?

完全支持:Chrome、Edge、Safari(桌面和移动)。有限支持:Firefox(需启用标志)。不支持:Internet Explorer、旧版浏览器。检查:如果看到警告消息,浏览器缺少 Web Speech API 支持。

我的音频数据安全吗?

音频发送到 Google 服务器进行处理(Web Speech API 要求)。本工具不存储。Google 可能用于服务改进。敏感内容:使用离线替代方案(Vosk、DeepSpeech)或本地转录软件。

专业提示

💡 提示:为获得最佳准确率,使用外接 USB 麦克风而非内置笔记本麦克风。以正常对话语速说话(不要太快)。句子之间短暂停顿。避免背景噪音(音乐、电视、其他对话)。