 Sakura-RanChenandGitHub
|
4f61d21d17
|
Merge branch 'py_test_typing' into feature/python-typing
|
2026-02-05 17:14:47 +08:00 |
|
Sakura-RanChen
|
9fd3501605
|
fix: 讯飞自动设备适应,阿里云等待时机过短
|
2026-02-04 10:28:27 +08:00 |
|
 wengzhandGitHub
|
f0b176768d
|
Merge branch 'main' into py_test_AudioArtifacts
|
2026-02-02 14:23:01 +08:00 |
|
Sakura-RanChen
|
f5b4bae927
|
fix: 模式切换时音频残余,优化相关状态管理
|
2026-02-02 11:29:47 +08:00 |
|
huozaimengli
|
614b662e3d
|
refactor(asr): 重构speech_to_text方法以接收artifacts参数
移除各ASR提供者中重复的get_current_artifacts调用,改为通过参数传递artifacts
修改base类中process_audio方法,根据combined_pcm_data长度决定是否创建artifacts
更新所有speech_to_text方法签名,添加artifacts可选参数并更新文档字符串
|
2026-01-29 16:39:35 +08:00 |
|
huozaimengli
|
4b573fb4e2
|
feat: 为多个模块添加类型注解以增强代码可读性
为 ConnectionHandler 相关的函数参数添加类型注解,使用 TYPE_CHECKING 避免循环导入。主要修改包括:
- 在 abortHandle、textHandle 等处理模块中为 conn 参数添加 ConnectionHandler 类型注解
- 在 websocket_server、connection 等核心模块中为方法参数添加类型注解
- 在 plugins_func 下的多个功能模块中为函数参数添加类型注解
- 在 providers 相关模块中为工具执行器和方法添加类型注解
- 统一代码格式,如将单引号字符串改为双引号
Fixes #2034
|
2026-01-25 17:47:52 +08:00 |
|
huozaimengli
|
15650e1a6c
|
refactor(asr): 统一音频预处理逻辑并引入AudioArtifacts
重构所有ASR提供商的speech_to_text方法,将重复的音频解码、合并和文件保存逻辑提取到基类的speech_to_text_wrapper中。引入AudioArtifacts数据类封装PCM帧、字节数据、文件路径和临时路径,简化各提供商实现。移除各提供商中的冗余文件清理代码,由基类统一处理。
新增requires_file()和prefers_temp_file()方法允许提供商声明文件需求,优化内存和磁盘使用。保持接口兼容性的同时提高代码复用性和可维护性。
|
2026-01-25 11:27:34 +08:00 |
|
Sakura-RanChen
|
e6108ccbbd
|
增加ASR情绪和语种返回
|
2026-01-05 11:17:04 +08:00 |
|
 Sakura-RanChenandGitHub
|
85919e800e
|
Merge pull request #2552 from Packeting1/multi_lang_tts
feat: 为阿里百炼流式TTS支持多语言音色
|
2026-01-04 15:02:24 +08:00 |
|
Sakura-RanChen
|
c511766e9d
|
update: 增加豆包流式多语种识别
|
2025-12-29 16:38:23 +08:00 |
|
FAN-yeB
|
46abb1009a
|
update:初始化阿里云百炼asr供应器 手动模式待更改
|
2025-12-26 16:13:14 +08:00 |
|
Sakura-RanChen
|
33c5893d32
|
豆包ASR流式自定义语句停止时长
|
2025-12-22 15:23:55 +08:00 |
|
Packeting1
|
6cdbe45313
|
feat: 为阿里百炼流式TTS添加多语言音色支持、相关 音色配置;
|
2025-12-16 11:35:58 +08:00 |
|
Sakura-RanChen
|
20f601e607
|
fix: 同步方法使用线程池避免阻塞
|
2025-12-12 15:39:30 +08:00 |
|
Sakura-RanChen
|
c8d2d2255d
|
fix: 音频影响线程问题
|
2025-12-12 15:08:40 +08:00 |
|
Sakura-RanChen
|
f88abd7638
|
fix: 聆听设备误触发
|
2025-12-12 09:46:15 +08:00 |
|
Sakura-RanChen
|
fbfc408e94
|
update: 长按设备ASR适配
|
2025-12-11 17:12:56 +08:00 |
|
FAN-yeB
|
3a74b30a0e
|
更新 qwen3_asr_flash.py
|
2025-12-10 17:57:26 +08:00 |
|
FAN-yeB
|
60521b0a7e
|
update:长按说话不走VAD直接触发ASR识别
|
2025-12-09 14:42:50 +08:00 |
|
hrz
|
4645c50f6d
|
update:将垃圾回收放置ws关闭处,避免频繁操作
|
2025-11-25 16:11:48 +08:00 |
|
hrz
|
83a3d0eabe
|
update:优化代码
|
2025-11-23 15:11:35 +08:00 |
|
3030332422
|
5d439a4168
|
update:内存泄漏
|
2025-11-23 11:55:38 +08:00 |
|
Sakura-RanChen
|
38d50f4275
|
fix: 长按设备过于灵敏
|
2025-11-21 10:11:50 +08:00 |
|
Chingfeng Li
|
833f379aa1
|
优化日志级别,生产环境中INFO避免打印过多日志
|
2025-11-11 18:52:14 +08:00 |
|
hrz
|
a035ed525a
|
修复:讯飞asr最后一个字丢失的bug
|
2025-10-23 17:04:33 +08:00 |
|
Chingfeng Li
|
2beeb825cf
|
阿里云NLS协议中message_id每次发送都必须唯一;task_id是会话id,整个请求中需要保持一致。
|
2025-10-22 18:21:34 +08:00 |
|
Sakura-RanChen
|
c06a7b1db6
|
update: 优化vad判断逻辑
|
2025-10-20 11:45:50 +08:00 |
|
FAN-yeB
|
966d8a8a84
|
update:xunfei asr
|
2025-09-19 17:54:52 +08:00 |
|
FAN-yeB
|
77f0bdc4ca
|
update:更新Qwen-asr-flash语音识别
|
2025-09-09 17:56:05 +08:00 |
|
3030332422
|
755c81286c
|
update:修改vosk
|
2025-09-08 17:35:18 +08:00 |
|
3030332422
|
257e365299
|
Merge remote-tracking branch 'origin/main' into py_test
|
2025-09-05 14:56:08 +08:00 |
|
Sakura-RanChen
|
c428a9ddee
|
fix: 唤醒机制
|
2025-09-02 11:18:04 +08:00 |
|
Sakura-RanChen
|
41b8fac3aa
|
update: 增加唤醒时声纹处理 ,1秒内发送至大模型 【需优化唤醒锁机制,中途会遭受打断(偶发),考虑忽略检测】
|
2025-08-28 17:58:23 +08:00 |
|
3030332422
|
cc7ba0872c
|
update:添加vosk
|
2025-08-27 14:39:05 +08:00 |
|
Sakura-RanChen
|
0ea18d87a3
|
fix: asr识别缺字现象,去除无用的变量
|
2025-08-20 16:22:32 +08:00 |
|
yaotutu
|
9edd083411
|
feat: 添加 Sherpa-ONNX Paraformer 模型支持
- 在 sherpa_onnx_local.py 中添加 model_type 参数,支持 paraformer 和 sense_voice 两种模型类型
- 在 config.yaml 中添加 SherpaParaformerASR 配置示例
- 添加详细的 Paraformer 使用文档 (docs/sherpa-paraformer-guide.md)
- 保持向后兼容,默认使用 sense_voice 模型
这个改动允许用户在低性能设备(如 RK3566)上使用更轻量的 Paraformer 模型,
相比 SenseVoice (894MB),Paraformer-small (78MB) 可以提供 4-6 倍的识别速度提升。
|
2025-07-30 10:41:27 +08:00 |
|
Chingfeng Li
|
b07a8796ff
|
阿里云ECS内网访问协议设置
|
2025-07-28 17:06:53 +08:00 |
|
3030332422
|
b8136ac1dc
|
fix:修复阿里云流式ASR音频传递问题
|
2025-07-19 18:17:21 +08:00 |
|
3030332422
|
6d5b53fcd5
|
fix: 修复阿里云流式ASR终止协议缺失问题
|
2025-07-19 12:16:12 +08:00 |
|
hrz
|
5cf8eb5e71
|
update:优化OpenaiASR、GroqASR配置
|
2025-07-19 01:03:36 +08:00 |
|
hrz
|
7fb028205f
|
Merge branch 'main' into py_test_tts
# Conflicts:
# main/manager-api/src/main/resources/db/changelog/db.changelog-master.yaml
|
2025-07-17 14:32:50 +08:00 |
|
 hrzandGitHub
|
f70652f165
|
Merge branch 'py_test_tts' into openai-asr
|
2025-07-17 11:31:44 +08:00 |
|
3030332422
|
8831ea22b7
|
update:删去一些重复、不用的代码
|
2025-07-16 16:43:49 +08:00 |
|
3030332422
|
1a411da133
|
fix:修复FunASR多设备连接时声纹识别配置相互覆盖的问题
|
2025-07-16 15:42:21 +08:00 |
|
3030332422
|
953a232654
|
fix: 修复使用豆包流式ASR时,不能使用声纹识别功能的问题。
|
2025-07-15 18:13:01 +08:00 |
|
luruxian
|
fbd4a22e3e
|
feat(asr): 添加OpenAI和Groq语音识别支持
新增GPT语音识别模型供应器和配置,实现语音转文本功能
更新相关文档说明,包含API申请步骤和使用注意事项
|
2025-07-10 11:41:20 +08:00 |
|
3030332422
|
d13fb73c67
|
update:优化
|
2025-07-09 14:23:47 +08:00 |
|
CGD
|
5c83d63fe2
|
update:声纹识别对接的优化
|
2025-07-08 11:25:54 +08:00 |
|
CGD
|
155ba92ba6
|
update:增加了智控台的sql语句,优化了部分配置
|
2025-07-07 15:29:13 +08:00 |
|
CGD
|
3d64152dba
|
update:python单模块部署声纹识别对接
|
2025-07-04 17:11:44 +08:00 |
|