实时语音对话
你说话 → VAD 断句 → SenseVoice ONNX 识别(约 60ms)→ LLM 推理 → TTS 合成 → 播放。全程流式,首 token 百毫秒级。
一条全链路跑在本地 GPU 上的实时语音交互引擎。
没有一行推理跑在云端,没有一个对话片段离开你的网卡。你说话 → VAD 断句 → SenseVoice ONNX 识别(约 60ms)→ LLM 推理 → TTS 合成 → 播放。全程流式,首 token 百毫秒级。
提取事件 → 评估长期记忆候选 → 写主观日记 → 更新印象 → 进化角色画像。五层筛选各有独立的 LLM prompt 和判据。
不是简单打分,而是粘滞、惯性和半衰期三个定律。每轮对话后独立评估,再将结果注入下一轮。
本地 Qwen3.5-4B GGUF 与云端 DeepSeek V4 API 使用同一套配置切换,性能监控按 provider 分层。
ASR、LLM、TTS 延迟,token 计数与 GPU 显存都在 WebUI 实时可见;诊断工具可完成环境检查、显存标定与配置推荐。