WorkBuddy从0创建Agent保姆级教程
2026/8/6 21:20:01
Qwen3-ASR-0.6B是基于阿里云通义千问团队开源的轻量级语音识别模型开发的本地智能语音转文字工具。这个6亿参数量的模型针对GPU进行了FP16半精度推理优化,支持自动语种检测(中文/英文)和中英文混合识别,能够处理多种音频格式(WAV/MP3/M4A/OGG)。
# 创建并激活虚拟环境 python -m venv qwen-asr-env source qwen-asr-env/bin/activate # Linux/Mac qwen-asr-env\Scripts\activate # Windows # 安装依赖包 pip install torch torchaudio transformers streamlit pip install qwen-asr-sdkqwen-asr-cli --input audio.wav --output result.txt| 参数 | 说明 | 默认值 |
|---|---|---|
| --input | 输入音频文件路径 | 必填 |
| --output | 输出文本文件路径 | 可选 |
| --device | 指定运行设备(cpu/cuda) | auto |
| --language | 强制指定语言(zh/en/auto) | auto |
| --verbose | 显示详细日志 | False |
# 使用GPU进行识别 qwen-asr-cli --input meeting.mp3 --output transcript.txt --device cuda # 强制识别为中文 qwen-asr-cli --input chinese.wav --language zhqwen-asr-api --port 8000 --workers 2POST /api/transcribe
请求参数:
响应示例:
{ "text": "识别出的文本内容", "language": "检测到的语言", "duration": 12.34, "status": "success" }import requests url = "http://localhost:8000/api/transcribe" files = {'file': open('audio.wav', 'rb')} response = requests.post(url, files=files) print(response.json())from qwen_asr import ASRPipeline # 初始化模型 asr = ASRPipeline(device="cuda") # 识别音频文件 result = asr.transcribe("audio.wav") print(result.text)# 批量处理多个文件 results = asr.batch_transcribe(["file1.wav", "file2.mp3"]) # 直接处理音频数据 import soundfile as sf audio, sr = sf.read("audio.wav") result = asr.transcribe_raw(audio, sample_rate=sr) # 获取时间戳信息 result = asr.transcribe("audio.wav", return_timestamps=True) for seg in result.segments: print(f"[{seg.start:.2f}s-{seg.end:.2f}s] {seg.text}")# 使用FP16半精度推理 asr = ASRPipeline(device="cuda", torch_dtype="float16") # 自动设备映射 asr = ASRPipeline(device_map="auto")# 批量处理提高吞吐量 asr = ASRPipeline(batch_size=4) # 根据显存调整 # 异步处理 import asyncio from qwen_asr import AsyncASRPipeline async def process_audio(): asr = AsyncASRPipeline() tasks = [asr.transcribe(f) for f in audio_files] results = await asyncio.gather(*tasks)Qwen3-ASR-0.6B提供了完整的开发者工具链,从简单的CLI命令行到灵活的SDK调用,满足不同场景下的语音识别需求。其本地化运行特性特别适合对隐私要求高的场景,而多种调用方式则为开发者提供了极大的便利。
通过本文介绍的CLI、REST API和SDK三种方式,开发者可以轻松将语音识别能力集成到自己的应用中。无论是简单的脚本调用,还是复杂的系统集成,Qwen3-ASR-0.6B都能提供高效、准确的语音转文字服务。
获取更多AI镜像
想探索更多AI镜像和应用场景?访问 CSDN星图镜像广场,提供丰富的预置镜像,覆盖大模型推理、图像生成、视频生成、模型微调等多个领域,支持一键部署。