当前位置: 首页 > news >正文

CrisperWhisper2.0_large实战教程:3分钟上手专业级语音识别,支持多语言与实时时间戳

CrisperWhisper2.0_large实战教程:3分钟上手专业级语音识别,支持多语言与实时时间戳

【免费下载链接】CrisperWhisper2.0_large项目地址: https://ai.gitcode.com/hf_mirrors/nyralabs/CrisperWhisper2.0_large

CrisperWhisper2.0_large是一款专业级语音识别工具,能够提供精准的逐字记录和预期内容转录,支持多语言识别与实时时间戳功能,让你轻松应对各种语音转文本需求。

🌟 CrisperWhisper2.0_large核心优势

CrisperWhisper2.0_large作为一款先进的语音识别模型,具有以下突出特点:

✅ 双重转录模式,满足不同需求

  • 逐字模式:精确记录说话内容,包括填充词、重复、口吃和 vocal 事件,例如:[um] so we we need to, to reschedule the th- thursday meeting to [uh] march third at nine thirty [laughter]
  • 预期模式:生成清晰易读的版本,自动格式化数字、日期和电子邮件等内容,例如:So we need to reschedule the Thursday meeting to March 3 at 9:30.

⏱️ 精准的词级时间戳

提供平均约30毫秒的词边界误差(朗读语音)和41毫秒(会话语音),是目前基准测试中最精确的词级时间戳系统。

🌍 多语言支持

支持多种语言的逐字和预期模式转录,在Nyra Verbatim Speech Benchmark基准测试中,跨十种语言的不流畅F1得分领先于所有测试的闭源替代方案。

🚀 生产级推理

采用CTranslate2运行时,结合推测解码技术,并内置缓解Whisper循环幻觉故障模式的机制,确保稳定高效的语音识别体验。

📊 性能对比

在Nyra Verbatim Speech Benchmark基准测试中,CrisperWhisper2.0_large表现出色:

#SystemDisfluency F1
1CrisperWhisper 2.0 Pro93.5
2CrisperWhisper 2.087.8
3ElevenLabs Scribe v279.2
4Microsoft MAI-Transcribe-1.577.5
5CrisperWhisper 1.0*64.8

*CrisperWhisper 1.0仅支持英语/德语;其平均值涵盖这两种语言。英语和德语使用人工标记的评估集;其他八种语言使用合成逐字集。

在词定时准确性方面,CrisperWhisper2.0_large同样领先:

#SystemBoundary error
1CrisperWhisper 2.029.6 ms
2xAI Grok Speech-to-Text37.1 ms
3CTC-seg49.3 ms
4ElevenLabs Scribe v251.3 ms
5NeMo-FA60.0 ms

📥 快速安装步骤

NVIDIA GPU(Linux)安装

这是最快的安装方式,包含推测解码功能。只需安装NVIDIA驱动,CUDA库将通过pip自动安装:

pip install "crisperwhisper[ct2]"

纯PyTorch安装

可在任何支持torch的环境(macOS、Windows、CPU)上运行:

pip install "crisperwhisper[transformers]"

🚀 3分钟快速上手

基本转录

from crisperwhisper import CrisperWhisperModel # 加载模型(默认加载nyralabs/CrisperWhisper2.0_large) model = CrisperWhisperModel() # 也可选择不同大小的模型:CrisperWhisperModel("turbo") # turbo / medium / small # 逐字转录(默认模式):包含所有填充词、重复、口吃和vocal事件 result = model.transcribe("meeting.wav", language="en") print(result.text) # 预期模式:生成清晰易读的版本 clean = model.transcribe("meeting.wav", language="en", mode="intended")

获取词级时间戳

# 获取词级时间戳 result = model.transcribe("meeting.wav", language="en", word_timestamps=True) for w in result.words: print(f"{w.start:6.2f}-{w.end:6.2f} {w.word}")

升级现有转录文本

# Verbatimize:将现有干净转录文本升级,添加音频中实际存在的不流畅表达 result = model.verbatimize("clip.wav", "I think we should ship it Friday.")

更快的推理:推测解码(ct2)

使用小型草稿模型提出标记,主模型进行验证,输出相同但速度提升1.3至1.4倍:

model = CrisperWhisperModel("large", draft_model="turbo") result = model.transcribe("meeting.wav", language="en", speculative_decoding=True)

🧩 可用模型

ShorthandHuggingFace IDNotes
"large" (default)nyralabs/CrisperWhisper2.0_large最佳开放质量
"turbo"nyralabs/CrisperWhisper2.0_turbo最快,质量略有下降;推荐作为推测草稿
"medium"nyralabs/CrisperWhisper2.0_medium接近large质量;尺寸和质量之间的最佳权衡
"small"nyralabs/CrisperWhisper2.0_small最小型
"large_pro" / "turbo_pro" / "medium_pro" / "small_pro"nyralabs/CrisperWhisper2.0_ _proPro:我们最好的模型,性能提升,热词增强,在额外专有数据上训练

标准模型根据非商业研究许可证发布,可用于商业许可。Pro模型仅可通过商业许可获得。

📦 其他功能

CrisperWhisper2.0_large还提供以下实用功能:

OptionWhat it does
mode="verbatim" / "intended"每次调用选择"所说内容"与"所指内容"
word_timestamps=True通过监督交叉注意力对齐获得每个词的开始/结束时间
hotwords=[...]偏向识别名称和罕见术语(仅Pro模型)
model.transcribe_dual(...)一次传递中获得逐字和预期版本(ct2)
model.verbatimize(audio, transcript)将真实的不流畅表达插入可信的干净转录文本
model.forced_align(audio, text)为已有转录文本生成时间戳
Longform超过30秒的音频通过条件延续无缝转录,无块边界重复、丢失或拼接问题
Hallucination mitigation默认开启:在解码过程中检测并抑制Whisper的循环重复故障模式
compute_type="float16" / "int8_float16"量化

📜 许可证信息

CrisperWhisper 2.0根据组件的不同分布在两个单独的许可证下:

ComponentLicense
Software— 推理代码、预处理和后处理代码以及脚本MIT License— 宽松,包括商业使用
Model— 模型权重、检查点、参数、配置文件、分词器/词汇表 —以及模型生成的任何输出nyra health Non-Commercial Research License— 仅非商业使用

简而言之:推理代码和其他软件采用MIT许可,可用于任何目的,包括商业用途。只有模型权重及其生成的输出被许可用于非商业用途;任何商业使用模型权重或输出都需要获得nyra health GmbH的单独商业许可。

📚 相关资源

  • 完整文档
  • 发布文章
  • 论文
  • 模型
  • 基准测试
  • 基准测试仓库

【免费下载链接】CrisperWhisper2.0_large项目地址: https://ai.gitcode.com/hf_mirrors/nyralabs/CrisperWhisper2.0_large

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.jsqmd.com/news/1302881/

相关文章:

  • 广州民营企业主经济犯罪律师推荐:【法纳刑辩】胜诉保障 - 秋山寄远
  • Windows防撤回神器:RevokeMsgPatcher让微信QQ消息永不消失
  • 别只打印 content:蓝耘元生代 MaaS 流式输出、思维链与 Token 陷阱实战
  • 电商场景:商品文案、导购、评论分析
  • 终极指南:如何用OpCore-Simplify轻松打造完美Hackintosh配置
  • 从 B 站视频到 Obsidian 知识库,这套工作流帮我总结全网视频
  • 文件伪装工具apate:3分钟学会如何快速绕过格式限制
  • Jenkins容器部署微服务时出现daemon socket、permission denied等问题(天机学堂)
  • 3步掌握Umi-OCR:免费离线文字识别软件的完整使用指南
  • 3分钟上手LLaMA-Factory:从模型微调优化到高效推理部署
  • 蓝耘 MaaS 的「思考成本」怎么样?我写了个剖析器,把 6 个模型扒了个底朝天
  • 电子课本一键离线化:tchMaterial-parser智能解析工具使用指南
  • hekate USB传输功能:告别SD卡拔插的终极文件管理方案
  • cppm题库怎么领取? - 众智商学院官方
  • AI教材写作:低查重率实战技巧与工具链优化
  • # 贴标机送标轴为什么常用 PLF060-5 配 400W 伺服:从辊速、惯量到同步误差分析
  • Mermaid Live Editor:免费在线图表工具终极指南,5分钟创建专业流程图
  • WinSetView:Windows文件夹视图全局设置的终极解决方案
  • 怎么有效降低英文AI率?别硬改!这样做才能降成功
  • 如何5分钟掌握付费墙突破神器:13ft Ladder完整使用指南
  • 蓝耘 MaaS:我把推理层重构成多模型路由,本以为能省 70%,实测只省了 9%——但学到了更值钱的三件事
  • 10分钟掌握LLaMA-Factory批量处理:大规模数据集并行加载全攻略
  • BilibiliDown完整指南:3步轻松下载B站视频和音频
  • PrimeVue-Tailwind与Nuxt项目集成教程:构建现代化Vue应用的最佳实践
  • 英文AI率居高不下?吃透Turnitin检测逻辑!实测有效降AI方法+工具分享
  • 广州大型企业高管经济犯罪辩护律师哪个专业:【法纳刑辩】实力强 - 晚香时候
  • Termux:Float新手入门:3分钟学会移动和调整悬浮终端窗口大小
  • LLaMA-Factory数据集处理指南:从JSON到高效微调数据
  • 2026年全国路沿石厂家售后水平排行榜单一览 - 起跑123
  • 日记第21天——好友相聚