← 所有项目

NekoSoul

一条全链路跑在本地 GPU 上的实时语音交互引擎。

没有一行推理跑在云端,没有一个对话片段离开你的网卡。
01

实时语音对话

你说话 → VAD 断句 → SenseVoice ONNX 识别(约 60ms)→ LLM 推理 → TTS 合成 → 播放。全程流式,首 token 百毫秒级。

02

五阶段记忆管线

提取事件 → 评估长期记忆候选 → 写主观日记 → 更新印象 → 进化角色画像。五层筛选各有独立的 LLM prompt 和判据。

03

带物理模型的情感系统

不是简单打分,而是粘滞、惯性和半衰期三个定律。每轮对话后独立评估,再将结果注入下一轮。

04

可拔插后端架构

本地 Qwen3.5-4B GGUF 与云端 DeepSeek V4 API 使用同一套配置切换,性能监控按 provider 分层。

05

全链路可观测

ASR、LLM、TTS 延迟,token 计数与 GPU 显存都在 WebUI 实时可见;诊断工具可完成环境检查、显存标定与配置推荐。

PythonONNX Runtime GPUllama-cpp-pythonFastAPIReactTailwind

活跃开发中,计划开源