真快!几分钟就把视频语音识别为文本了,不到10行代码
本篇文章向大家介绍《真快!几分钟就把视频语音识别为文本了,不到10行代码》,主要包括,具有一定的参考价值,需要的朋友可以参考一下。
大家好,我是风筝
两年前,将音视频文件转换为文字内容的需求难以实现,但是如今只需几分钟便可轻松解决。
据说一些公司为了获取训练数据,已经对抖音、快手等短视频平台上的视频进行了全面爬取,然后将视频中的音频提取出来转换成文本形式,用作大数据模型的训练语料。
如果您需要将视频或音频文件转换为文字,可以尝试今天提供的这个开源解决方案。例如,可以搜索影视节目的对话出现的具体时间点。
话不多说,进入正题。
Whisper
这个方案就是 OpenAI 开源的 Whisper,当然是用 Python 写的了,只需要简单安装几个包,然后几行代码一写,稍等片刻(根据你的机器性能和音视频长度不一),最终的文本内容就出来了,就是这么简单。
GitHub 仓库地址:https://github.com/openai/whisper
Fast-Whisper
尽管已经相当简化,但对于程序员而言仍不够精简。毕竟,程序员们往往偏爱简洁高效。虽然安装和调用Whisper已经相对容易,但仍需要单独安装PyTorch、ffmpeg,甚至Rust。
因此,Fast-Whisper应运而生,它比Whisper更快速、更简洁。Fast-Whisper并非仅仅是对Whisper进行简单封装,而是通过采用CTranslate2重新构建了OpenAI的Whisper模型。CTranslate2是Transformer模型的一种高效推理引擎。
总结一下,也就是比 Whisper 更快,官方的说法是比 Whisper 快了 4-8 倍。不仅能支持 GPU ,还能支持 CPU,连我这台破 Mac 也能用。
GitHub 仓库地址:https://github.com/SYSTRAN/faster-whisper
使用起来就两步。
- 安装依赖包
pip install faster-whisper
- 写代码,
from faster_whisper import WhisperModelmodel_size = "large-v3"# Run on GPU with FP16model = WhisperModel(model_size, device="cuda", compute_type="float16")# or run on GPU with INT8# model = WhisperModel(model_size, device="cuda", compute_type="int8_float16")# or run on CPU with INT8# model = WhisperModel(model_size, device="cpu", compute_type="int8")segments, info = model.transcribe("audio.mp3", beam_size=5)print("Detected language '%s' with probability %f" % (info.language, info.language_probability))for segment in segments:print("[%.2fs -> %.2fs] %s" % (segment.start, segment.end, segment.text))
没错,就是这么简单。
能做什么呢
正好有个朋友想做短视频,发一些鸡汤文学的视频,鸡汤就来自于一些名家访谈的视频。但是,他又不想把完整的视频看一遍,就想用最快的方式把文本内容弄下来,然后读文字,因为读文字要比看一篇视频快的多,而且还可以搜索。
我就说,连完整的看一篇视频的虔诚之心都没有,能经营好账号吗。
于是我给他做了一个,就是用的 Fast-Whisper。
客户端
客户端用 Swift ,只支持 Mac 端。
- 选则一个视频;
- 然后点击「提取文本」,这时会调用 Python 接口,需要等待一段时间;
- 加载解析出的文本以及出现的开始、截止时间;
- 选了一个开始时间和一个结束事件;
- 点击「导出」按钮,视频片段就导出了;
,时长00:10
服务端
服务端当然就是 Python ,然后用 Flask 包装一下,对外放开接口。
from flask import Flask, request, jsonifyfrom faster_whisper import WhisperModelapp = Flask(__name__)model_size = "large-v2"model = WhisperModel(model_size, device="cpu", compute_type="int8")@app.route('/transcribe', methods=['POST'])def transcribe():# Get the file path from the requestfile_path = request.json.get('filePath')# Transcribe the filesegments, info = model.transcribe(file_path, beam_size=5, initial_prompt="简体")segments_copy = []with open('segments.txt', 'w') as file:for segment in segments:line = "%.2fs|%.2fs|[%.2fs -> %.2fs]|%s" % (segment.start, segment.end, segment.start, segment.end, segment.text)segments_copy.append(line)file.write(line + '\n')# Prepare the responseresponse_data = {"language": info.language,"language_probability": info.language_probability,"segments": []}for segment in segments_copy:response_data["segments"].append(segment)return jsonify(response_data)if __name__ == '__main__':app.run(debug=False)
今天带大家了解了的相关知识,希望对你有所帮助;关于科技周边的技术知识我们会一点点深入介绍,欢迎大家关注golang学习网公众号,一起学习编程~

- 上一篇
- 将 mongo-go-driver 与 Azure Cosmos DB 结合使用的事务出现意外行为

- 下一篇
- PHP 函数的参数传递方式在可变参数中的运用?
-
- 科技周边 · 人工智能 | 10分钟前 | 代码规范 豆包AI
- 豆包AI三招教你快速检查代码规范,简单又高效!
- 236浏览 收藏
-
- 科技周边 · 人工智能 | 49分钟前 | 豆包AI 日记写作
- 豆包AI日记写作超详细教程,手把手教你轻松上手
- 109浏览 收藏
-
- 科技周边 · 人工智能 | 50分钟前 |
- 豆包AI手把手教你用Python写数据库连接代码
- 251浏览 收藏
-
- 科技周边 · 人工智能 | 53分钟前 | java 编程
- 豆包AI手把手教你SpringSecurity安全配置,超详细教程曝光!
- 309浏览 收藏
-
- 科技周边 · 人工智能 | 53分钟前 |
- AI生成证件照通关秘籍,签证照片标准全知道
- 442浏览 收藏
-
- 科技周边 · 人工智能 | 55分钟前 | 通义千问 学习计划
- 通义千问个性化学习计划这样制定才高效
- 224浏览 收藏
-
- 科技周边 · 人工智能 | 1小时前 | Firefly 人物皮肤渲染
- Firefly超写实人物皮肤绘制全攻略!附详细教程
- 212浏览 收藏
-
- 科技周边 · 人工智能 | 1小时前 |
- 苹果亲们集合!DeepSeek安装启用保姆级教程
- 241浏览 收藏
-
- 科技周边 · 人工智能 | 1小时前 | 视频制作 知识科普
- 一帧秒创玩转知识科普视频,手把手教你剧本创作+画面搭配秘籍!
- 211浏览 收藏
-
- 科技周边 · 人工智能 | 1小时前 |
- 豆包AI这样优化短视频脚本,分镜提示词超详细攻略
- 163浏览 收藏
-
- 科技周边 · 人工智能 | 1小时前 |
- DeepSeek赋能OneNote手写识别,效率起飞不是梦!
- 444浏览 收藏
-
- 科技周边 · 人工智能 | 1小时前 | 编程语言 选择
- 豆包AI手把手教你设计Python项目结构模板,超easy!
- 209浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 542次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 508次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 497次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 484次学习
-
- 茅茅虫AIGC检测
- 茅茅虫AIGC检测,湖南茅茅虫科技有限公司倾力打造,运用NLP技术精准识别AI生成文本,提供论文、专著等学术文本的AIGC检测服务。支持多种格式,生成可视化报告,保障您的学术诚信和内容质量。
- 96次使用
-
- 赛林匹克平台(Challympics)
- 探索赛林匹克平台Challympics,一个聚焦人工智能、算力算法、量子计算等前沿技术的赛事聚合平台。连接产学研用,助力科技创新与产业升级。
- 100次使用
-
- 笔格AIPPT
- SEO 笔格AIPPT是135编辑器推出的AI智能PPT制作平台,依托DeepSeek大模型,实现智能大纲生成、一键PPT生成、AI文字优化、图像生成等功能。免费试用,提升PPT制作效率,适用于商务演示、教育培训等多种场景。
- 106次使用
-
- 稿定PPT
- 告别PPT制作难题!稿定PPT提供海量模板、AI智能生成、在线协作,助您轻松制作专业演示文稿。职场办公、教育学习、企业服务全覆盖,降本增效,释放创意!
- 101次使用
-
- Suno苏诺中文版
- 探索Suno苏诺中文版,一款颠覆传统音乐创作的AI平台。无需专业技能,轻松创作个性化音乐。智能词曲生成、风格迁移、海量音效,释放您的音乐灵感!
- 99次使用
-
- GPT-4王者加冕!读图做题性能炸天,凭自己就能考上斯坦福
- 2023-04-25 501浏览
-
- 单块V100训练模型提速72倍!尤洋团队新成果获AAAI 2023杰出论文奖
- 2023-04-24 501浏览
-
- ChatGPT 真的会接管世界吗?
- 2023-04-13 501浏览
-
- VR的终极形态是「假眼」?Neuralink前联合创始人掏出新产品:科学之眼!
- 2023-04-30 501浏览
-
- 实现实时制造可视性优势有哪些?
- 2023-04-15 501浏览