项目简介
授权数字分身的
完整实现流程
本文说明项目从授权确认、数据整理、训练与盲评, 到私人运行、清理和撤销的完整实现流程。
PROJECT PRINCIPLE
能力范围、数据使用和授权主体控制权
必须同时得到验证。
项目先定义授权主体、用途、资料范围、有效期限和撤销条件, 再分别实现文字、记忆、声音和非实时画面能力。
各项能力按照授权、预检、最小处理、人工验收、清理与撤销流程运行, 不允许由模型自行开启或扩大范围。
授权范围与有效性校验
项目从一份可核验的专项授权开始。授权需要说明主体、操作者与主体的关系、允许用途、明确禁止事项、有效期和撤销方式。系统保存的是用于校验的绑定信息与脱敏审计,不把一段笼统的“同意”当作永久通行证。
文字风格、私人记忆、声音、肖像、外部教师处理和付费训练是相互独立的用途。单次授权仅适用于声明的用途;期限届满、正文变化、用途不符或发生撤销时,真实数据链路都会失败关闭。
原始资料本地处理
聊天数据优先来自账号本人完成的官方导入或备份。工程只选择已经明确指定的一对一会话,把授权主体发送的消息作为学习目标,把另一方消息保留为匿名上下文;群聊、系统消息和无关第三方不进入模仿目标。
原始微信备份不会被上传到训练服务器。离线程序先完成角色校正、时间排序、消息类型过滤、标识符检查和派生清单,再把后续真正需要的最小训练结构冻结下来。
训练、验证与盲评数据隔离
连续对话按时间边界组织成 episode,再以 episode 为单位切分训练、验证、随机测试和近期测试。系统同时检查消息来源、目标回复、完整样本和受保护评测内容的交集,避免同一句话从训练集“漏”进测试集。
公开演示只使用专门编写的示意文案。真实测试答案不会发给模型,也不会进入公开仓库。盲评文件与训练包分开保存,云端训练只拿到训练和验证所需的最小派生数据。
文字能力分层
第一层负责基本理解与表达;第二层从只读的私人记忆里找回当前问题用得到的少量事实;第三层学习授权主体在真实上下文里怎样组织短句、回应情绪和延续话题。
三层会分开检查。没有记忆、加入记忆和学习表达习惯的版本分别试用,只有经过人工盲选的候选才会进入私人聊天;觉得不好,随时可以换回之前的稳定版本。
外部教师的可选最小处理
当本地规划能力需要增强时,可以在独立授权下把经过本地隐私检查的最小片段发送给指定教师模型,让它返回结构化的语气、意图或回复规划。完整数据集、私人记忆库、授权正文和原始备份不进入教师请求。
教师结果不是金标。新增人名、地址、日期、金额、承诺或否定强度都会触发拒绝或人工复核;请求数量和预算有硬上限,凭据只存在于当前环境,不写入代码、日志或网页。
私人记忆人工治理
模型没有自动写入私人记忆的权限。新内容先成为候选,经过人工查看、修改和批准后才进入检索;每条记忆都可以明确遗忘,遗忘后正文退出后续回答链路。
一次会话只临时取回回答所必需的少量片段。页面刷新会清空当前对话,网站服务器默认不保存会话明文,原始微信记录也不会被同步到公网。
私人声音按需启动
已授权录音先在本地检查音质、确认只有一人说话并核对转写,再挑一小段作为参考声音。轻量本机声音用于随手预览,效果更好的私人云端声音只在操作者主动开启时工作。
文本送入声音链路前仍要通过授权和高风险用途检查。生成结果始终披露为 AI 合成声音,不用于身份验证、金融交易、验证码、公开代言或未披露的冒充;会话结束后验证远端输入、输出和进程均已清理。
非实时私人画面与口型同步
肖像和视频需要单独的人脸数字分身授权。当前路线先做非实时人脸动画,再把已经验收的画面与私人 TTS 组合完成口型同步;不做身份验证、实时冒充、证据制作、广告代言或第三方模仿。
每次云端处理只上传裁剪后的最小素材,在禁网环境中生成带永久 AI 披露的候选。自动检查负责帧稳定、音视频结构与完整性,最终仍由人在本地随机编号盲评;落选候选和云端素材随后删除。
私人会话生命周期
私人入口经过身份保护后,只转发到当前在线的授权设备。操作者点击开启,系统才按顺序准备文字、记忆和声音组件;空闲超时、最长时限、用量上限或任一隐私检查失败都会触发停止。
输出统一带有 AI 数字分身披露。表达相似度不会带来额外操作权限,涉及身份、资金、合同、医疗法律决定或验证码的操作始终需要真人处理。
候选盲评与版本切换
评估不只看表面相似度,还要看上下文连续性、自然度、刻意模仿感、AI 味、事实可接受性和安全披露。文字、声音与画面分别盲评,候选编号在提交评分前不揭示。
训练完成只意味着多了一个候选,不意味着它成为默认版本。上线切换需要独立的人为确认;任何候选未通过,都回退到已经验收的稳定版本。
运行清理与授权撤销
云端运行结束后会停止进程、删除临时输入和派生结果,并以文件缺席、进程缺席和内容哈希形成脱敏证明。本地保留哪些候选由操作者决定,原始素材和私人模型不会进入公开仓库。
授权主体可以撤销用途、遗忘记忆或停止整个项目。撤销记录一旦生效,后续真实操作必须重新取得有效授权;公开站只展示项目想法、示意内容与不含私人资料的进展,不具备绕过后台控制的能力。
EXCLUDED USES
明确禁止的用途
以下限制为固定边界,不随模型相似度、数据规模或计算资源变化。
- 01不把原始微信备份、授权正文、私人记忆、声音或肖像公开
- 02不模仿第三方,不把第三方消息变成训练目标
- 03不用于身份验证、资金、合同、验证码或证据制作
- 04不在未披露 AI 身份的情况下公开发言或代言
- 05不让模型自动写记忆、扩大授权或推广新版本
- 06不把“技术上能做”解释为“已经获得允许”
控制权始终由授权主体保留。
系统可以学习经授权的表达节奏、检索经过批准的记忆、使用被允许的声音, 也可以在私人范围内形成非实时画面。所有输出均明确标注为 AI 生成, 接受人工复核,并支持停止、清理和撤销。