当前位置：首页 > 文章列表 > 文章 > python教程 > Python语音转文字教程：SpeechRecognition库使用详解

Python语音转文字教程：SpeechRecognition库使用详解

2025-09-28 18:12:46 0浏览收藏

想要用Python实现实时语音转文字？本文将为你详细介绍如何使用SpeechRecognition库，配合pyaudio进行音频捕获和识别，轻松将语音转换为文本。首先，我们将指导你安装SpeechRecognition和pyaudio，解决可能遇到的安装问题。接着，通过简单示例，展示如何调用Google语音识别API进行语音识别，并提供其他API的选择，如recognize_sphinx。更进一步，我们将深入探讨如何实现持续的实时语音识别，通过设置`pause_threshold`和`phrase_time_limit`等参数，控制录音结束条件，并利用`adjust_for_ambient_noise`减少背景噪音，提升识别准确率。最后，还将分析如何选择合适的语音识别API，以及处理语音识别过程中可能遇到的常见错误，助你打造高效、准确的Python实时语音转文字应用。

要实现实时语音转文字，可使用Python的SpeechRecognition库配合pyaudio进行音频捕获和识别。首先安装SpeechRecognition和pyaudio（可通过下载wheel文件解决安装问题），然后使用Google语音识别API或其他API如recognize_sphinx进行识别。为实现持续实时识别，需在循环中分段录音并处理，通过pause_threshold和phrase_time_limit控制录音结束条件，并使用adjust_for_ambient_noise减少背景噪音。选择API时需考虑准确率、延迟、价格及是否支持离线使用；提高识别准确率的方法包括降噪、优化音频质量、选择合适语言模型、分段处理及后处理；常见错误如网络连接、API限制、无法识别语音等，可通过更换API、调整麦克风设置、增加超时时间等方式处理。

Python如何实现实时语音转文字？SpeechRecognition库详细教程

Python实现实时语音转文字，核心在于利用语音识别库捕获音频流并将其转换为文本。SpeechRecognition库是一个不错的选择，它简化了与各种语音识别API的交互。

解决方案

安装SpeechRecognition库和pyaudio:
```
pip install SpeechRecognition
pip install pyaudio
```
pyaudio 是一个跨平台音频 I/O 库，用于录制和播放音频。安装 pyaudio 可能会遇到问题，尤其是在 Windows 上。如果 pip install pyaudio 失败，可以尝试下载预编译的 wheel 文件。搜索 "pyaudio wheel" 找到与你的 Python 版本和操作系统相匹配的版本，然后使用 pip install 文件名.whl 安装。

简单语音识别示例:

import speech_recognition as sr

r = sr.Recognizer()
with sr.Microphone() as source:
    print("请说话...")
    audio = r.listen(source)

try:
    text = r.recognize_google(audio, language='zh-CN') # 指定中文
    print("你说的是: {}".format(text))
except sr.UnknownValueError:
    print("无法识别您的语音")
except sr.RequestError as e:
    print("无法连接到 Google 语音识别服务; {0}".format(e))

这段代码使用默认麦克风录制音频，然后使用 Google 语音识别 API 将其转换为文本。language='zh-CN' 指定了中文识别。如果不想使用Google，可以使用其他的API，比如recognize_sphinx，recognize_wit等等，但是这些API可能需要额外的配置。

实时语音转文字:

要实现实时语音转文字，需要持续录制音频并将其分段识别。这可以通过循环实现。

import speech_recognition as sr
import time

r = sr.Recognizer()
mic = sr.Microphone()

with mic as source:
    r.adjust_for_ambient_noise(source)  # 可选: 消除环境噪音

def recognize_worker():
    while True:
        try:
            with mic as source:
                r.pause_threshold = 0.8 # 停顿0.8秒后结束录音
                audio = r.listen(source, phrase_time_limit=5) # 每次录制5秒
            try:
                text = r.recognize_google(audio, language='zh-CN')
                print("你说的是: {}".format(text))
            except sr.UnknownValueError:
                print("无法识别")
            except sr.RequestError as e:
                print("请求错误; {0}".format(e))
        except Exception as e:
            print(f"发生错误: {e}")
        time.sleep(0.1)

recognize_worker()

这个例子中，pause_threshold 控制静音多久后结束录音，phrase_time_limit 限制每次录音的最大时长。 adjust_for_ambient_noise 可以消除一些背景噪音，提高识别准确率。注意，实时性受网络延迟和语音识别 API 处理速度的影响。

如何选择合适的语音识别API？

选择语音识别 API 取决于你的需求。Google Speech Recognition API 易于使用，但依赖网络连接。CMU Sphinx 是一个开源的离线语音识别引擎，但准确率可能不如在线 API。其他选择包括 Wit.ai、Microsoft Bing Voice Recognition API 等。考虑因素包括：