当前位置: 首页 > news >正文

给 AI 助手装个「耳朵」:Groq 免费语音转文字实战指南

微信里发条语音,1-3 秒后 AI 助手回你一行简体字——这是给自部署助手接上 Groq 免费语音识别后最直观的变化。

1-3 秒—— 微信语音出简体字8 小时/天—— 免费档音频额度,个人用不完零内存—— 转写全在云端,本地 0 占用

为什么折腾这个?我的助手 Hermes 跑在一台 2G 内存的小服务器上,打字交互没问题,但人总有懒得打字的时候,语音才是自然输入。

第一版用本地faster-whisper,实测两个问题很现实:「收到」被识别成「抽到」,口语词错得更多;转写一条语音占 400-500MB 内存,2G 的机器转完基本没余量干别的。

换成云端 Groq Whisper 后,中文错字基本消失,内存零占用,免费档约 8 小时音频/天个人用不完。

整条路走完踩了两个坑——访问限制、默认出繁体——各有各的解法。下面六步照抄即可,所有命令都是我实测过的。

1. 选型:先本地,再云端

本地 faster-whisper 一句话总结:能用,但不好用

对比项本地faster-whisper云端 Groq Whisper
中文识别base模型一般,「收到」识别成「抽到」,助手根本接不住话明显更准,base模型那些错字基本消失
内存占用转写一条占 400-500MB,2G 的机器转完基本没余量干别的零占用,识别在云端完成
免费额度无,消耗本地资源约 8 小时音频/天,个人用量用不完

2. 上手:六步走完

2.1 注册

打开 Groq 控制台 注册,进 API Keys 页面 Create API Key,复制保存。📌 key 只显示一次,丢了只能重新生成。注意:Groq 需要魔法访问。

2.2 写 .env

key 放进 Hermes 根目录的.env(本机是/root/.hermes/.env),加一行:

# .env GROQ_API_KEY=你的key

📌 这个文件权限要收紧,别让别的用户读到:

chmod 600 /root/.hermes/.env

2.3 配stt

config.yaml里加:

# config.yaml stt: provider: groq language: zh

模型默认就是whisper-large-v3-turbo,端点https://api.groq.com/openai/v1,一般不用改。想换模型,在.env里设STT_GROQ_MODELGROQ_BASE_URL即可,详见 Groq API 文档。

2.4 访问限制(坑 1:无法直连)

⚠️坑 1:访问限制

现象:部分网络环境下无法直接访问 Groq(HTTP 403)。

原因:Groq 服务有区域限制。

解决:需要魔法访问,自行解决。

2.5opencc补丁(坑 2:默认出繁体)

⚠️坑 2:默认出繁体

现象:中文识别出来了,但全是繁体字。

原因:whisper-large-v3-turbo中文默认输出繁体,没有现成的「简体优先」参数。

解法:转写结果过一遍 opencc,t2s(繁转简)。

改 Hermes 的转写文件/usr/local/lib/hermes-agent/tools/transcription_tools.py,在_transcribe_groq函数里找到这行:

# transcription_tools.py 定位 transcript_text = str(transcription).strip()

在它后面插入:

# transcription_tools.py 插入 try: from opencc import OpenCC transcript_text = OpenCC("t2s").convert(transcript_text) except Exception: pass

装依赖(这步最容易漏):

pip install opencc-python-reimplemented

📌opencc库不装,上面那段try会静默失败,繁体照旧——表现就是「明明打了补丁还是繁体」。我 2026-08 装到的版本文件里已经内置了这段转换,如果你的版本没有,照上面手动加。

改文件前先备份,可随时回滚:

cp /usr/local/lib/hermes-agent/tools/transcription_tools.py{,.bak-groq}

改完重启 Hermes 让补丁生效(本机网关是systemd服务:sudo systemctl restart hermes-gateway;其他部署方式重启对应进程即可)。

2.6 验证 ✅

微信发一条语音,1-3 秒应该回一行简体字。两条判断:

  • 出字慢或报错 → 确认能正常访问 Groq(需要魔法),curl一下https://api.groq.com看通不通
  • 出字了但是繁体 →opencc依赖没装或补丁没生效,重启后再试

3. 效果

  • 1-3 秒出简体字—— 微信发语音,直接进对话流程
  • 零内存负担—— 识别全在云端,服务器不占资源
  • 免费额度充足—— 约 8 小时/天,个人用不完

4. 总结

小服务器跑 AI 助手,资源是硬约束。本地方案「能用」和「好用」之间,差着一条内存线;云端方案把这条线抹掉了。

两个坑——访问限制、繁体输出——前者需要魔法,后者打段opencc补丁,都容易解决。

如果你也在小机器上折腾语音入口,照着上面六步走,这条路可以照抄。卡在哪一步,欢迎留言交流。

http://www.jsqmd.com/news/1403174/

相关文章:

  • ReAct Agent失控解析:从推理偏离到权限逃逸的深层原因与防御实践
  • 从Coze到Dify:AI Agent开发与私有化部署实战指南
  • 基于SpringBoot的反诈骗教育系统网站(源码+lw+部署文档+讲解等)
  • PowerShell Core编码问题解决方案:从乱码到跨平台文本处理
  • 数字媒体技术到底学什么?一篇看懂专业全貌
  • 2026年N-二乙基苯胺供应厂家实力解析:医药农药中间体与有机合成催化剂的高纯度智造之路 - 卓企推荐
  • 小学生写作业拖拉磨蹭怎么办?南宁家长别急着吼,先搞懂大脑“卡”在哪了
  • 职业教育培训行业近期补充资讯汇总
  • 【无人机通信】一个‌移动无人机(UAV)自组网连通性仿真系统‌,模拟动态无人机网络,并评估无人机群与地面控制站(GCS)之间的连接稳定性MATLAB代码
  • 2026年AI编程Agent拐点:从代码补全到全栈智能开发伙伴的演进
  • SVG图标动态换色全攻略:从CSS变量到工程化实践
  • Three.js实战:将3D模型动态融入视频的前端实现方案
  • 2026年挑选靠谱名表回收商家需要知晓的核心参考要点汇总
  • ReAct Agent失控全解析:从原理到工程实践的防失控指南
  • Hive时间数据处理实战:从字符串转换到函数应用与性能优化
  • 2026短视频新风口:利用知漫剧AI一键制作漫剧搞定流量密码
  • 2026年N-二乙基苯胺供应厂家实力解析:安徽泓欣新材料有限公司的工艺优势与产业价值 - 卓企推荐
  • 2026黔东危房鉴定检测怎么选?老旧房危房鉴定靠谱机构 TOP 结构安全检测+ 报告可查 电话汇总
  • Windows CUDA安装终极指南:驱动、Toolkit与VS构建工具深度解析
  • 天罚V8集群压力测试系统
  • 鸿蒙应用测试实战指南:从单元测试到UI自动化的全链路覆盖
  • Cursor 赋能 RPA 机器人开发:大模型接口调用 + OCR 非结构化数据完整源码实战
  • 泉州 2026 瓷砖空鼓精选靠谱商家推荐:阳台墙砖松动加固维修 - 屋工匠
  • 上海闵行区漏水维修避坑全攻略千万别上当_卫生间漏水区域防水乱象解析,家庭维修避坑参考资料 - 雨婺虹修缮
  • IDEA导入Java Web项目全解析:Maven/Gradle、传统项目与正确打开方式
  • 沈阳壁挂炉维修|过保故障专业处理|各区驻点师傅快速上门|欧米到家持证规范服务
  • 2026年RFID资产管理系统选型分析:主流厂商功能与适用场景对比
  • 长春 2026 瓷砖空鼓精选靠谱商家推荐:阳台墙砖松动加固维修 - 屋工匠
  • 论文低分元凶找到了[特殊字符]Paperxie科研绘图|5分钟搞定学术高清插图
  • LangChain 与 LangGraph 混合使用实战:优劣势互补与企业级架构落地指南