haoku123/dsh-voice

插件 ⭐ 0 MIT other

DeepSeek Harness 全双工语音插件:麦克风 → SenseVoice 语音识别(sherpa-onnx)→ 大语言模型 → 支持真正语音打断的 Edge TTS。全双工语音插件:麦克风语音输入,SenseVoice 本地识别(简体中文+标点+ITN),流式 TTS 朗读,支持语音打断。零 API 密钥。

catalog 简介:Full-duplex voice plugin for DeepSeek Harness: mic → SenseVoice ASR (sherpa-onnx) → LLM → Edge TTS with true barge-in. 全双工语音插件:麦克风语音输入,SenseVoice 本地识别(简体中文+标点+ITN),流式 TTS 朗读,支持语音打断。Zero API key.

安装

input:  mic ──RMS endpoint detection──▶ POST /asr (raw f32 PCM)
                                           │ text (SenseVoice)
                                           ▼
        composer draft ──submit──▶ model stream ──llm/stream tap──▶ SentenceSegmenter
                                                                     │
        browser ◀── SSE /dsh-voice-api/stream ── TtsQueue (msedge-tts) ◀──┘
                  (base64 MP3 frames + caption text)

barge-in: speech edge ──▶ engine.skip() + POST /cancel (epoch bump)
                         + session.cancel() when a turn is running

haoku123/dsh-voice 加入你的 DSH 配置(web profile)即可启用。

README

展开完整 README 收起

README 内容为空。