上游贡献 · #365
接入 mlx-audio:新增 STT / TTS / STS 三类引擎
服务端此前没有语音这一层。这个 PR 新建了三类引擎,并改动了模型分类、加载与淘汰的核心路径,不只是加端点。
服务端原本只认识语言模型和视觉语言模型。这个 PR 加进来的不是几个端点,而是一类新的引擎:语音的三种引擎都是单次前向、没有 KV cache,因此显存策略与 LLM 不同,需要改动模型分类、加载与淘汰这条核心路径。
上游的语音库对不同模型家族的加载与输出约定并不统一,所以其中一层是家族适配。mlx-audio 作为可选依赖惰性导入,不影响不用语音的部署。
这是这批贡献里最大的一个,也是唯一改动服务端核心的一个。代码至今仍在主干上,之后有其他贡献者在其上继续开发。