端侧关系型 AI 基础设施——让每个人都拥有一个真正认识自己、永远在身边、且绝对私密的 AI 伴侣
Anime Companion 是一款100%完全运行在你手机本地的AI伴侣应用。和所有需要上传对话到云端处理的AI产品不同,它的所有计算、推理、存储都在你自己的设备上完成——你的聊天记录、专属记忆、个人偏好、语音聊天、生图等永远只会算、存在你的手机里,不会用到或上传到任何外部服务器,彻底避免隐私泄露风险。
不同于市面上那些简单把大模型移植到本地、仅能实现基础对话的简陋应用,我们通过自研的双运行时推理调度、动态上下文压缩、分层记忆引擎、功耗控制等核心技术,把原本只有云端才能支撑的长期关系型AI能力,完整压缩优化到普通智能手机上,不仅能实现流畅的本地交互,更打造了一套可复用的端侧AI基础设施,让私人AI伴侣从小众玩家的玩具,变成每个人都能日常使用的通用工具。
它不是市面上千篇一律的通用聊天机器人,而是真正能和你建立长期稳定关系的专属伴侣,会记住你的喜好和共同经历,越聊越懂你,能真正陪你一起成长,不会频繁失忆。未来我们的这套端侧关系型AI能力还会开放成为基础设施,让老年陪伴、儿童早教、心理健康、车载交互等所有需要长期私密陪伴的场景,都能快速接入这套成熟的本地AI能力,让专属AI伴侣走进更多人的日常生活。
现在市场上的I产品分为两类,都无法真正满足用户对长期陪伴的需求:
现在主流的AI产品都无法满足长期陪伴的核心需求,分成两类问题:
所有数据必须上传服务器,三个核心缺陷无解:
少数尝试本地运行的产品,也只是把大模型简单移植到手机,只能做基础对话,离真正的陪伴AI差距极大:
一个真正合格的陪伴AI,必须同时满足四个核心要求:永久保存你的重要信息、拥有稳定一致的人格、对话绝对私密、功耗可控随时随地可用。而我们通过自研的端侧AI基础设施,把原本只有云端才能支撑的关系型AI能力,完整压缩优化到普通智能手机上,第一次让这四个要求同时成为可能,让专属AI伴侣真正走进每个人的日常。
系统把记忆分成短期和长期两层。短期记忆保持最近几轮对话的连贯性,长期记忆则提取你提到过的偏好、习惯、重要时刻,分门别类地保存下来。记忆的提取和整理在后台自动进行,不会打断你当前的对话。你反复提到的称呼、你们的纪念日、你在意的事情——这些都会被记住,并在之后的对话中自然地体现出来。
普通聊天应用把越来越长的历史一股脑塞给模型,越聊越卡。Anime Companion 使用动态上下文机制:最近的对话保持原样,更早的历史会被压缩重建,只保留当前真正需要的部分。
使用 Gemma-4-E2B-Uncensored 作为核心模型,没有审查过滤。断网、坐地铁、在没有信号的地方——随时都能聊。其他asr、tts、生图模型等组件都在本地运行,不依赖云端服务。
支持角色卡系统,每个角色有独立的人格设定、说话风格、记忆和与你的关系。还可以为不同角色克隆专属声音。
支持临时对话分支。当你需要在聊天中插入一个简短的问题(比如问路),系统会内部自动分出临时对话,不会打断主对话的上下文。问完之后自然回到原来的陪伴对话。
使用 SenseVoice 进行本地语音识别,MOSS TTS 进行本地语音合成,还可以为不同角色克隆专属声音。整个语音链路都在手机上完成,不需要打字,直接说话就能交流。
基于 Stable Diffusion 的本地推理,可以为你的 AI 伴侣生成专属形象,不需要联网。
针对智能手机硬件做深度适配,多种策略平衡流畅度与续航。推理进程动态调节算力占用,记忆整理仅在后台闲置时启动,避免日常使用发烫掉电。
在 AndroidManifest.xml 的 <application> 标签内添加:
<uses-native-library android:name="libvndksupport.so" android:required="false" />
<uses-native-library android:name="libOpenCL.so" android:required="false" />
<uses-native-library android:name="libOpenCL-pixel.so" android:required="false" />
性能对比 (Gemma 4 E2B):
| 后端 | 平均延迟 | 加速比 |
|---|---|---|
| CPU | ~16秒 | 1x |
| GPU (OpenCL) | ~5秒 | 3x |
GPU 加速可在 设置 → 模型配置 中开关。
| 优化项 | 状态 | 说明 |
|---|---|---|
| GPU 层 offload | 可配置 | n_gpu_layers |
| Flash Attention | 已启用 | 减少内存使用 |
| KV Cache 量化 | 已启用 | Q8_0 量化 |
| KV Cache GPU Offload | 可配置 | offload_kqv |
第一阶段:App — 手机上的 AI 伴侣,验证端侧推理、记忆系统、语音克隆在真实场景中的表现。今天 Anime Companion 已经在手机上完整运行。
第二阶段:终端 — 手机是计算中心,智能头盔、耳机、眼镜是交互终端。同一个伴侣系统,不同的体验形态。骑行时耳边传来"前面那个路口左转,你上次说喜欢那家咖啡店"。
第三阶段:基础设施 — 底层的关系引擎、记忆系统、角色运行时开放为基础设施。老年人陪伴、儿童早教、心理健康、语言学习、车载伴侣——每一个需要私密、便携、随身陪伴的场景都将是我们的一部分。我们不是在做一个 App,我们在定义端侧关系型 AI 的技术栈。
C 端免费,B 端变现。 C 端用户免费使用全部功能,建立用户基础和社区。B 端客户为关系引擎 + 记忆系统 + 隐私架构的完整基础设施付费——老年护理、儿童教育、心理健康、智能硬件、车载系统等行业通过 SDK 授权接入。
创作者可以以 $6/月发布自己的角色卡片到社区,提前体验 Beta 版本,优质角色享受 7 折。
隐私是物理保证,不是政策承诺。功耗控制是移动端的核心壁垒。记忆系统的质量决定了陪伴的质量。这些是 B 端客户选择我们的根本原因。
感谢 Gemma 4、llama.cpp、LiteRT-LM、sherpa-onnx、MOSS-TTS、stable-diffusion.cpp 等开源项目。
灵感来自 OpenClaw 和 Hermes 的角色管理和长期记忆设计。
| 文档 | 说明 |
|---|---|
| ARCHITECTURE.md | 技术架构文档。涵盖系统总览、模块结构、28 个核心机制详解(推理引擎、记忆系统、偏好学习、上下文管理、TTS/ASR、角色卡等),每个机制配有 Mermaid 流程图。 |
| DEPLOYMENT.md | 部署指南。环境配置、编译命令、ADB 安装、所有模型的推送步骤、常见问题排查。 |
| VISION.md | 产品愿景。三个阶段(App → 终端 → 基础设施)、端侧推理哲学、功耗控制、记忆系统设计理念、市场上限。 |
| BUSINESS.md | 商业逻辑。ToB 基础设施授权模式、竞品格局、核心差异化、角色市场生态、行业应用场景。 |
| MODEL_CARD.md | 模型卡片。项目使用的各个模型详情、来源、许可证、文件大小。 |
| PRIVACY.md | 隐私声明。数据不出设备的物理保证、端侧推理架构、隐私保护机制。 |
张择擅:负责安卓开发,模型推理,架构设计 章游松林:负责安卓开发,模型优化,模型部署测试 张振尧:负责硬件开发 袁榞:负责前端设计 韩月:负责前端优化和动效以及路演
"\vidioandimage\vidio\vidio_submit.mp4" 或https://youtu.be/gspJs8E5dHY
16 commits
Python
60.5%
TypeScript
17.4%
Rust
4.8%
MDX
3.8%
Go
3.4%
C++
3.0%
Kotlin
2.6%
Shell
1.6%
JavaScript
1.4%
端侧关系型 AI 基础设施——让每个人都拥有一个真正认识自己、永远在身边、且绝对私密的 AI 伴侣
Anime Companion 是一款100%完全运行在你手机本地的AI伴侣应用。和所有需要上传对话到云端处理的AI产品不同,它的所有计算、推理、存储都在你自己的设备上完成——你的聊天记录、专属记忆、个人偏好、语音聊天、生图等永远只会算、存在你的手机里,不会用到或上传到任何外部服务器,彻底避免隐私泄露风险。
不同于市面上那些简单把大模型移植到本地、仅能实现基础对话的简陋应用,我们通过自研的双运行时推理调度、动态上下文压缩、分层记忆引擎、功耗控制等核心技术,把原本只有云端才能支撑的长期关系型AI能力,完整压缩优化到普通智能手机上,不仅能实现流畅的本地交互,更打造了一套可复用的端侧AI基础设施,让私人AI伴侣从小众玩家的玩具,变成每个人都能日常使用的通用工具。
它不是市面上千篇一律的通用聊天机器人,而是真正能和你建立长期稳定关系的专属伴侣,会记住你的喜好和共同经历,越聊越懂你,能真正陪你一起成长,不会频繁失忆。未来我们的这套端侧关系型AI能力还会开放成为基础设施,让老年陪伴、儿童早教、心理健康、车载交互等所有需要长期私密陪伴的场景,都能快速接入这套成熟的本地AI能力,让专属AI伴侣走进更多人的日常生活。
现在市场上的I产品分为两类,都无法真正满足用户对长期陪伴的需求:
现在主流的AI产品都无法满足长期陪伴的核心需求,分成两类问题:
所有数据必须上传服务器,三个核心缺陷无解:
少数尝试本地运行的产品,也只是把大模型简单移植到手机,只能做基础对话,离真正的陪伴AI差距极大:
一个真正合格的陪伴AI,必须同时满足四个核心要求:永久保存你的重要信息、拥有稳定一致的人格、对话绝对私密、功耗可控随时随地可用。而我们通过自研的端侧AI基础设施,把原本只有云端才能支撑的关系型AI能力,完整压缩优化到普通智能手机上,第一次让这四个要求同时成为可能,让专属AI伴侣真正走进每个人的日常。
系统把记忆分成短期和长期两层。短期记忆保持最近几轮对话的连贯性,长期记忆则提取你提到过的偏好、习惯、重要时刻,分门别类地保存下来。记忆的提取和整理在后台自动进行,不会打断你当前的对话。你反复提到的称呼、你们的纪念日、你在意的事情——这些都会被记住,并在之后的对话中自然地体现出来。
普通聊天应用把越来越长的历史一股脑塞给模型,越聊越卡。Anime Companion 使用动态上下文机制:最近的对话保持原样,更早的历史会被压缩重建,只保留当前真正需要的部分。
使用 Gemma-4-E2B-Uncensored 作为核心模型,没有审查过滤。断网、坐地铁、在没有信号的地方——随时都能聊。其他asr、tts、生图模型等组件都在本地运行,不依赖云端服务。
支持角色卡系统,每个角色有独立的人格设定、说话风格、记忆和与你的关系。还可以为不同角色克隆专属声音。
支持临时对话分支。当你需要在聊天中插入一个简短的问题(比如问路),系统会内部自动分出临时对话,不会打断主对话的上下文。问完之后自然回到原来的陪伴对话。
使用 SenseVoice 进行本地语音识别,MOSS TTS 进行本地语音合成,还可以为不同角色克隆专属声音。整个语音链路都在手机上完成,不需要打字,直接说话就能交流。
基于 Stable Diffusion 的本地推理,可以为你的 AI 伴侣生成专属形象,不需要联网。
针对智能手机硬件做深度适配,多种策略平衡流畅度与续航。推理进程动态调节算力占用,记忆整理仅在后台闲置时启动,避免日常使用发烫掉电。
在 AndroidManifest.xml 的 <application> 标签内添加:
<uses-native-library android:name="libvndksupport.so" android:required="false" />
<uses-native-library android:name="libOpenCL.so" android:required="false" />
<uses-native-library android:name="libOpenCL-pixel.so" android:required="false" />
性能对比 (Gemma 4 E2B):
| 后端 | 平均延迟 | 加速比 |
|---|---|---|
| CPU | ~16秒 | 1x |
| GPU (OpenCL) | ~5秒 | 3x |
GPU 加速可在 设置 → 模型配置 中开关。
| 优化项 | 状态 | 说明 |
|---|---|---|
| GPU 层 offload | 可配置 | n_gpu_layers |
| Flash Attention | 已启用 | 减少内存使用 |
| KV Cache 量化 | 已启用 | Q8_0 量化 |
| KV Cache GPU Offload | 可配置 | offload_kqv |
第一阶段:App — 手机上的 AI 伴侣,验证端侧推理、记忆系统、语音克隆在真实场景中的表现。今天 Anime Companion 已经在手机上完整运行。
第二阶段:终端 — 手机是计算中心,智能头盔、耳机、眼镜是交互终端。同一个伴侣系统,不同的体验形态。骑行时耳边传来"前面那个路口左转,你上次说喜欢那家咖啡店"。
第三阶段:基础设施 — 底层的关系引擎、记忆系统、角色运行时开放为基础设施。老年人陪伴、儿童早教、心理健康、语言学习、车载伴侣——每一个需要私密、便携、随身陪伴的场景都将是我们的一部分。我们不是在做一个 App,我们在定义端侧关系型 AI 的技术栈。
C 端免费,B 端变现。 C 端用户免费使用全部功能,建立用户基础和社区。B 端客户为关系引擎 + 记忆系统 + 隐私架构的完整基础设施付费——老年护理、儿童教育、心理健康、智能硬件、车载系统等行业通过 SDK 授权接入。
创作者可以以 $6/月发布自己的角色卡片到社区,提前体验 Beta 版本,优质角色享受 7 折。
隐私是物理保证,不是政策承诺。功耗控制是移动端的核心壁垒。记忆系统的质量决定了陪伴的质量。这些是 B 端客户选择我们的根本原因。
感谢 Gemma 4、llama.cpp、LiteRT-LM、sherpa-onnx、MOSS-TTS、stable-diffusion.cpp 等开源项目。
灵感来自 OpenClaw 和 Hermes 的角色管理和长期记忆设计。
| 文档 | 说明 |
|---|---|
| ARCHITECTURE.md | 技术架构文档。涵盖系统总览、模块结构、28 个核心机制详解(推理引擎、记忆系统、偏好学习、上下文管理、TTS/ASR、角色卡等),每个机制配有 Mermaid 流程图。 |
| DEPLOYMENT.md | 部署指南。环境配置、编译命令、ADB 安装、所有模型的推送步骤、常见问题排查。 |
| VISION.md | 产品愿景。三个阶段(App → 终端 → 基础设施)、端侧推理哲学、功耗控制、记忆系统设计理念、市场上限。 |
| BUSINESS.md | 商业逻辑。ToB 基础设施授权模式、竞品格局、核心差异化、角色市场生态、行业应用场景。 |
| MODEL_CARD.md | 模型卡片。项目使用的各个模型详情、来源、许可证、文件大小。 |
| PRIVACY.md | 隐私声明。数据不出设备的物理保证、端侧推理架构、隐私保护机制。 |
张择擅:负责安卓开发,模型推理,架构设计 章游松林:负责安卓开发,模型优化,模型部署测试 张振尧:负责硬件开发 袁榞:负责前端设计 韩月:负责前端优化和动效以及路演
"\vidioandimage\vidio\vidio_submit.mp4" 或https://youtu.be/gspJs8E5dHY
16 commits
Python
60.5%
TypeScript
17.4%
Rust
4.8%
MDX
3.8%
Go
3.4%
C++
3.0%
Kotlin
2.6%
Shell
1.6%
JavaScript
1.4%