Replies: 2 comments
|
不支持。 如果你想在 FunASR 里用 CAM++ 做说话人分离,应走 FunASR 的语音 pipeline,而不是 from funasr import AutoModel
model = AutoModel(
model="paraformer-zh",
vad_model="fsmn-vad",
punc_model="ct-punc",
spk_model=" |
0 replies
|
补充一个更准确的说明:当前 FunASR 的 standalone llama.cpp / GGUF runtime 暂不支持 CAM++ 说话人分离,但原因不是它“只做 LLM 文本推理”。这套 runtime 已经在 C++/ggml 中实现了音频前端、Fun-ASR-Nano / SenseVoiceSmall / Paraformer ASR,以及可选的 FSMN-VAD;目前缺少的是 CAM++ speaker embedding 和后续 speaker clustering。 需要说话人分离时,请使用 Python pipeline: from funasr import AutoModel
model = AutoModel(
model="paraformer-zh",
vad_model="fsmn-vad",
punc_model="ct-punc",
spk_model="cam++",
)Fun-ASR-Nano 的 vLLM 服务也可通过请求参数 |
0 replies
Answer selected by
LauraGPT
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
补充一个更准确的说明:当前 FunASR 的 standalone llama.cpp / GGUF runtime 暂不支持 CAM++ 说话人分离,但原因不是它“只做 LLM 文本推理”。这套 runtime 已经在 C++/ggml 中实现了音频前端、Fun-ASR-Nano / SenseVoiceSmall / Paraformer ASR,以及可选的 FSMN-VAD;目前缺少的是 CAM++ speaker embedding 和后续 speaker clustering。
--vad只负责长音频分段,不会输出说话人标签。需要说话人分离时,请使用 Python pipeline:
Fun-ASR-Nano 的 vLLM 服务也可通过请求参数
spk=true调用独立说话人模型。已提交 #3491,把这条支持边界和替代路径补进 llama.cpp runtime 文档。