Project Snow 的目标并不是直接做出一个会聊天的页面,而是先建立一条可验证、可恢复、可持续更新的数据链路。对于世界观问答来说,模型回答之前的数据质量决定了它是否值得相信。
第一阶段:保留来源,而不是只保留结果
当前阶段从《尘白禁区》BWiki 发现并采集剧情、角色资料、角色皮肤、语音、心意内容、家具与物品背景。采集器保存原始 HTML 或维基文本,同时记录页面地址、哈希、抓取状态和分类信息。
这样做的意义是:后续无论是进行清洗、结构化还是检索,都可以回到来源页面复核,而不是把不可解释的文本直接送进模型。
增量更新与可恢复运行
网站资料会变化,也会出现限流和临时失败。因此采集流程保留状态文件与运行报告,支持仅处理新增页面、分批恢复和目录校验。面对反爬响应时,流程会停止当前批次,而不是尝试绕过站点规则。
这类约束看似保守,但它让数据链路更适合长期维护:失败有记录、来源可追溯、每次运行都有边界。
下一步:从资料到可引用的回答
后续路线包括剧情结构化、关系索引、向量检索与角色一致性控制。在线 RAG 服务会独立部署,并在每次回答中提供可访问的来源引用;公开体验还需要限流、滥用防护和成本控制。
在那之前,Project Snow 会继续把重点放在数据治理和本地可复现的能力上。项目源码、运行说明和后续部署方式会持续在 GitHub 更新。
数据来源为尘白禁区 BWiki;默认许可证为 CC BY-NC-SA 4.0,页面特殊声明优先。游戏及原始内容版权归其权利人所有。
留下你的想法
评论区将在站点部署配置完成后启用。
前往 GitHub Discussions 参与讨论 ↗