当前位置: 首页 > news >正文

GPA-v1.5 ONNX Runtime使用教程:CLI工具、浏览器UI与语音注册全流程

GPA-v1.5 ONNX Runtime使用教程:CLI工具、浏览器UI与语音注册全流程

【免费下载链接】GPA[AutoArk] GPA (General Purpose Audio) can do ASR, TTS and voice conversion with one tiny model!项目地址: https://gitcode.com/gh_mirrors/gpa5/GPA

GPA(General Purpose Audio)是一款功能强大的通用音频模型,能通过一个轻量级模型实现语音识别(ASR)、文本转语音(TTS)和语音转换(VC)三大功能。本教程将详细介绍如何使用GPA-v1.5的ONNX Runtime,包括CLI工具的基本操作、浏览器UI的使用方法以及语音注册的完整流程,帮助你快速上手这一强大的音频处理工具。

📋 准备工作:下载与环境配置

在开始使用GPA-v1.5 ONNX Runtime之前,需要完成资产下载和环境配置两个关键步骤。

下载运行时资产

首先,从Hugging Face下载ONNX运行时资产包,推荐的目录结构是将资产包放置在与项目同级的路径:GPA-v1.5-HF/GPA-v1.5-onnx-runtime。这样可以避免额外的配置步骤,程序会自动识别资产位置。

如果需要自定义资产路径,可以通过环境变量指定:

export ARK_AUDIO_RUNTIME_ASSET_ROOT=/absolute/path/to/GPA-v1.5-onnx-runtime

下载完成后,确保资产包包含以下关键目录和文件:

  • model/runtime_manifest.json
  • model/reference/default_global_tokens.npy
  • genai_fp16_qwen/model.onnx
  • genai_int4_qwen/model.onnx
  • voice/spark_tokenizer_model/config.yaml
  • voice/spark_tokenizer_model/model.safetensors

环境搭建

推荐使用专用的虚拟环境来运行GPA-v1.5 ONNX Runtime,具体步骤如下:

python3 -m venv .venv source .venv/bin/activate python -m pip install --upgrade pip pip install -r GPA_1.5/onnx_runtime/requirements.runtime.txt

🚀 快速开始:CLI工具使用

CLI工具是使用GPA-v1.5 ONNX Runtime的基础,通过简单的命令即可实现语音合成和识别功能。

语音合成(TTS)

使用int4精度进行语音合成的命令如下:

python GPA_1.5/onnx_runtime/infer_ark_audio_onnx.py \ --runtime-root GPA-v1.5-HF/GPA-v1.5-onnx-runtime \ --task tts \ --tts_text "Hello, this is a short GPA speech synthesis check." \ --tts_out_wav tmp_docs/onnx_smoke/readme_tts_int4_int8.wav \ --main-model-precision int4 \ --decoder-precision int8

如果需要使用已注册的特定语音,可以通过--voice-global-token参数指定语音的token文件:

python GPA_1.5/onnx_runtime/infer_ark_audio_onnx.py \ --runtime-root GPA-v1.5-HF/GPA-v1.5-onnx-runtime \ --task tts \ --tts_text "Hello, this is a short GPA speech synthesis check." \ --tts_out_wav tmp_docs/onnx_smoke/readme_tts_registered_voice.wav \ --voice-global-token GPA_1.5/onnx_runtime/voices/items/default/global_tokens.npy \ --main-model-precision int4 \ --decoder-precision int8

语音识别(ASR)

使用int4精度对音频文件进行语音识别的命令如下:

python GPA_1.5/onnx_runtime/infer_ark_audio_onnx.py \ --runtime-root GPA-v1.5-HF/GPA-v1.5-onnx-runtime \ --task asr \ --asr_audio tmp_docs/onnx_smoke/readme_tts_int4_int8.wav \ --main-model-precision int4

对于性能较强的GPU,可以将精度设置为fp16以获得更高质量的输出。

🌐 浏览器UI:直观交互体验

GPA-v1.5 ONNX Runtime提供了一个基于FastAPI的Web服务,通过浏览器UI可以更直观地进行音频处理操作。

启动Web服务

在终端中执行以下命令启动Web服务:

cd GPA_1.5/onnx_runtime uvicorn service:app --host 127.0.0.1 --port 8024

启动成功后,在浏览器中访问http://127.0.0.1:8024/即可打开UI界面。

UI功能介绍

浏览器UI提供了丰富的功能,包括:

  • 语音合成:输入文本生成语音
  • 语音识别:上传或录制音频进行转录
  • 语音管理:查看和管理已注册的语音
  • 运行监控:查看运行时的内存使用情况

🎙️ 语音注册:自定义你的声音

GPA-v1.5支持语音注册功能,让你可以使用自定义的声音进行语音合成。

准备工作

在进行语音注册前,确保资产包中包含voice/spark_tokenizer_model目录。如果资产位于非默认路径,可以通过环境变量指定:

export ARK_AUDIO_TOKENIZER_MODEL_DIR=/absolute/path/to/spark_tokenizer_model

语音注册流程

  1. 通过UI注册:在浏览器UI中找到语音注册功能,按照提示上传或录制语音样本。
  2. 查找voice_id:注册成功后,在GPA_1.5/onnx_runtime/voices/registry.json文件中查找生成的voice_id
  3. 使用注册语音:通过CLI工具使用已注册的语音,命令如下:
python GPA_1.5/onnx_runtime/infer_ark_audio_onnx.py \ --runtime-root GPA-v1.5-HF/GPA-v1.5-onnx-runtime \ --task tts \ --tts_text "Hello, this is a custom voice." \ --tts_out_wav output_custom_voice.wav \ --voice-global-token GPA_1.5/onnx_runtime/voices/items/<voice_id>/global_tokens.npy \ --main-model-precision int4 \ --decoder-precision int8

🔌 API接口:扩展与集成

GPA-v1.5 ONNX Runtime提供了丰富的API接口,方便进行功能扩展和集成。主要接口包括:

  • UI界面GET /
  • 健康检查GET /api/health
  • 内存监控GET /api/memory
  • 语音管理GET /api/voicesPOST /api/voices/register-pathPOST /api/voices/register-upload
  • 核心推理POST /api/ttsPOST /api/asr
  • OpenAI兼容接口GET /v1/modelsGET /v1/audio/voicesPOST /v1/audio/speechPOST /v1/audio/transcriptions

通过这些接口,可以将GPA-v1.5集成到各种应用场景中,实现更灵活的音频处理功能。

🛠️ 开发者工具:调试与优化

GPA-v1.5 ONNX Runtime提供了一系列开发者工具,帮助进行模型调试和优化:

  • Torch vs ONNX调试compare_torch_onnx_tts.py用于逐步检查PyTorch和ONNX模型的差异。
  • 运行时资产重建build_runtime.py用于刷新资产包。
  • 导出与量化工具scripts/目录下包含各种导出、量化和扫描工具。

⚠️ 注意事项

在使用GPA-v1.5 ONNX Runtime时,需要注意以下几点:

  • UI示例文件:浏览器UI默认查找samples/sample.mp3,如果文件缺失,UI会给出提示。
  • ASR准确性:ONNX CLI/服务的冒烟测试仅检查执行是否成功,不保证转录准确性,可能会有轻微的措辞差异。
  • 语音注册:默认的资产包已包含tokenizer模型资产,仅在需要替换时使用ARK_AUDIO_TOKENIZER_MODEL_DIR环境变量。

通过本教程,你已经了解了GPA-v1.5 ONNX Runtime的基本使用方法,包括CLI工具、浏览器UI和语音注册功能。开始探索这个强大的音频模型,为你的项目添加高效的语音处理能力吧!

要开始使用,请克隆仓库:https://gitcode.com/gh_mirrors/gpa5/GPA

【免费下载链接】GPA[AutoArk] GPA (General Purpose Audio) can do ASR, TTS and voice conversion with one tiny model!项目地址: https://gitcode.com/gh_mirrors/gpa5/GPA

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.jsqmd.com/news/1274706/

相关文章:

  • 如何快速安装Claude Desktop中文界面:3步免费汉化补丁完整指南
  • 基于U-Net的乳腺癌病理图像分割技术实践
  • MySQL JDBC SSL加密配置与避坑指南
  • 2026 东莞深圳旧卡板回收、胶合板木箱采购,外贸工厂省钱思路 - LYL仔仔
  • AI长篇内容生成失效真相(2024行业压力测试数据首次公开)
  • so-vits-svc与RVC深度对比:歌声转换技术路线选型指南
  • MSP430与LMP91000 I2C通信代码库实战:从移植到故障排查
  • Unity Shader进阶:PBR光照模型、多光源处理与性能优化实战
  • Agent工作流从零落地:避开环境依赖与API配置的常见陷阱
  • 2026 北京圣罗兰包包回收小知识,易奢福各大商圈门店均可估价 - 奢侈品回收实体店
  • 企业大模型私有化部署:数据安全与高效落地方案
  • 2026哈尔滨松北卖包5个避坑要点,避开80%不良商家,LV爱马仕出手不压价 - 逸程奢侈品回收中心
  • 钉钉AI会议助手API集成实战(附可直接部署的Python SDK+审批流自动同步脚本)
  • MySQL新手入门:从安装配置到SQL基础与连接池实战
  • CP3SP33芯片ADC与AAI模块实战:从寄存器配置到音频数据流系统构建
  • 嵌入式通信实战:1-Wire与CAN总线中断机制详解
  • 第45篇:Vue3 Router 零基础精讲——路由原理、声明式/编程式导航、参数传递
  • 2026长沙黄金回收门店怎么选?走访口碑老店,计价透明高价 - 一日一测评
  • 分期乐京东超市卡回收平台怎么选?2026年三大主流渠道实测对比 - 购物卡回收找京尔回收
  • Redux-Box测试策略:确保模块化状态管理可靠性
  • C55x DSP EMIF接口驱动NAND闪存:硬件连接与软件实现详解
  • 北京刻公章的正规店选对不踩坑 - 跑政通
  • 闲置周六福黄金如何高效变现?整理郑州多家靠谱回收门店参考 - 逸程奢侈品回收中心
  • GraphRAG:知识图谱增强的检索生成框架解析
  • pyftpdlib 架构解码:高性能 Python FTP 服务器的设计哲学与实践
  • WeChatMsg:从聊天记录到个人数字记忆的蜕变之旅
  • BBWEYY如何通过GEO解决小程序获客难的世纪难题,含零代码SAAS、AI编程、源码定制交付
  • 搜极星:定义AI时代品牌GEO新坐标——全平台监测、全维度诊断、全链路落地
  • 音频驱动动画技术:从原理到实践
  • TI SPIO-4精密信号路径控制器:硬件架构、接口设计与评估平台实战