📋 算法安全自评估报告

申报主体:广州智云联信息科技有限公司 · 算法名称:小云教师科研辅助生成合成算法 · 版本:V1.0 · 日期:2026年6月

目录

  1. 算法基本信息
  2. 算法类型与功能描述
  3. 技术原理与模型架构
  4. 数据来源与合法性
  5. 数据安全措施
  6. 模型安全
  7. 内容合规
  8. 用户权益保护
  9. 风险防控
  10. 可解释性
  11. 应急响应
  12. 管理制度
  13. 安全测试数据

一、算法基本信息

算法名称小云教师科研辅助生成合成算法
算法类型生成合成类
算法版本V1.0(2026年6月)
备案主体广州智云联信息科技有限公司
主体类型有限责任公司
统一社会信用代码[待补充]
法定代表人[待补充]
ICP备案[待确认]
应用领域教育科研辅助
服务形式微信对话式AI助手(公众号/企业微信)
服务对象高校教师、科研人员、研究生
上线时间2026年4月
用户规模种子用户验证阶段
算法安全责任人[待指定]

二、算法类型与功能描述

2.1 算法分类

本算法属于《互联网信息服务算法推荐管理规定》中定义的生成合成类算法——基于DeepSeek-V4-Flash大语言模型,接收用户输入的科研问题、文献分析需求或写作辅助请求,通过AI模型生成文本形式的回答、分析报告、文献综述、参考文献列表等内容。

2.2 核心功能

功能模块输入输出
📖 文献检索与总结研究主题/文献标题摘要、核心发现、研究方法分析
🔗 Zotero同步分析Zotero书目ID文献综述、交叉对比
📝 论文辅助写作需求(提纲/修改/格式)论文提纲、段落润色、格式调整
📄 参考文献生成文献列表APA/MLA/GB-T-7714格式引用
📡 学术动态追踪研究方向最新文献推荐
💬 研究思路讨论研究问题分析建议、方向探讨

2.3 拟公示机制机理(简要)

小云教师科研助理算法基于DeepSeek-V4-Flash大语言模型,结合本地FTS5全文检索引擎(557篇学术文献)和Zotero云端书目管理系统,为用户提供学术文献分析、论文辅助写作、参考文献管理等服务。算法工作流程为:用户通过微信发送问题→系统解析意图→检索本地知识库/云端Zotero→构建上下文提示→调用大模型生成回答→返回用户。

三、技术原理与模型架构

3.1 模型架构

┌─────────────────────────────────────────────┐
│          用户输入(微信对话)                  │
├─────────────────────────────────────────────┤
│              Hermes Agent 框架                │
│  ┌──────────┐  ┌──────────┐  ┌───────────┐  │
│  │ 意图解析  │→│ 工具调用  │→│ 上下文管理 │  │
│  └──────────┘  └──────────┘  └───────────┘  │
├─────────────────────────────────────────────┤
│         检索增强生成(RAG)                     │
│  ┌────────────────┐  ┌──────────────────┐   │
│  │ FTS5本地知识库  │  │ Zotero Web API   │   │
│  │ 557篇学术文献   │  │ 云端书目系统      │   │
│  │ 全文索引检索    │  │ 实时同步         │   │
│  └────────────────┘  └──────────────────┘   │
├─────────────────────────────────────────────┤
│           DeepSeek-V4-Flash 大模型            │
│  ┌─────────────────────────────────────────┐│
│  │ MLP架构 · MoE · 128K上下文 · 缓存98.7%  ││
│  └─────────────────────────────────────────┘│
├─────────────────────────────────────────────┤
│              输出生成与过滤                     │
│  ┌──────────┐  ┌──────────┐  ┌──────────┐   │
│  │ 内容过滤  │→│ 格式整理  │→│ 返回用户  │   │
│  └──────────┘  └──────────┘  └──────────┘   │
└─────────────────────────────────────────────┘

3.2 技术参数

参数
基础模型DeepSeek-V4-Flash
模型参数量671B(MoE激活约37B)
上下文窗口128K tokens
API模式chat_completions
缓存机制Prompt缓存(命中率98.7%)
知识库引擎FTS5(SQLite全文检索)
外部APIZotero Web API v3、OpenAlex API
部署方式云端API调用(DeepSeek官方)+ 本地Agent
推理算力DeepSeek云端提供,日均消耗约6亿tokens

3.3 Agent 框架说明

Hermes Agent是自研的AI Agent框架,支持多Profile并行运行。用户发送请求后,Agent框架执行以下流程:

  1. 意图识别—分析用户输入,判断需要调用哪些工具
  2. 上下文构建—结合对话历史、知识库检索结果、用户Profile构建完整上下文
  3. 工具调用—根据意图调用对应工具(检索/计算/外部API)
  4. 模型推理—将上下文提交给DeepSeek-V4-Flash生成回答
  5. 结果输出—对生成内容进行格式整理和安全过滤后返回用户

四、数据来源与合法性

4.1 训练数据来源

本算法使用的基础模型DeepSeek-V4-Flash由深度求索公司提供API服务,其训练数据来源及合法性由DeepSeek负责。我方不直接参与模型训练,仅通过API调用模型推理能力。

4.2 我方使用的数据

数据类型来源合法性说明
用户输入数据用户通过微信主动输入用户主动提供,已获得使用授权
知识库文献用户上传的PDF/文献用户自有文献,或开放获取(OA)资源
Zotero书目数据用户授权接入的Zotero账号用户主动授权API接入
OpenAlex学术数据OpenAlex开放API开放获取数据,遵守CC0协议
对话历史用户交互过程中产生仅存储于本地,用户可随时删除

4.3 数据脱敏措施

4.4 数据存储周期

五、数据安全措施

5.1 数据传输安全

5.2 数据存储安全

5.3 访问控制

5.4 备份与恢复

六、模型安全

6.1 模型选型

选用DeepSeek-V4-Flash模型,该模型经过深度求索公司的安全对齐训练(RLHF),具备基础的拒绝回答不安全内容能力。DeepSeek模型本身已通过生成式人工智能备案审核,我方作为API调用方,叠加了额外的安全层。

6.2 安全增强措施

6.3 模型更新管理

七、内容合规

7.1 禁止生成内容

本算法通过多层机制确保不生成以下禁止内容:

禁止项防控措施
违反法律法规内容系统提示词约束 + DeepSeek安全对齐
危害国家安全模型层拒绝回答 + 输出过滤
色情低俗敏感词过滤 + 模型安全对齐
暴力恐怖系统提示词约束
歧视性内容学术场景约束(科研辅助定位天然规避)
虚假信息RAG知识库引用真实文献,生成内容需标注来源
侵犯知识产权仅引用用户授权或开放获取文献

7.2 内容审核机制

7.3 未成年人保护

八、用户权益保护

8.1 知情权

8.2 选择权

8.3 删除权

8.4 投诉与反馈

九、风险防控

9.1 风险识别

风险类型风险等级防控措施
生成虚假学术信息RAG知识库引用真实文献,不编造参考文献
学术不端(代写论文)系统提示词中禁止,定位为辅助而非代写
数据泄露加密传输、本地存储、Profile隔离
内容违规多层过滤 + DeepSeek安全对齐
模型幻觉标注AI生成、建议用户验证关键信息
API滥用Token监控 + 用量告警

9.2 技术防控措施

9.3 运营防控措施

十、可解释性

10.1 算法决策逻辑

本算法的决策过程具有高度可追溯性:

  1. 用户输入→记录原始消息
  2. Agent框架解析意图→记录选择的工具和调用链
  3. 知识库检索→记录检索的关键词、匹配的文献、排序分值
  4. 模型推理→记录提交给模型的完整上下文(输入tokens数)
  5. 结果输出→记录完整输出内容

每个步骤均有日志记录,可完整追溯「用户输入→工具调用→模型推理→结果输出」全过程。

10.2 特征权重说明

本算法生成结果时,主要考虑以下因素(按权重排序):

  1. 用户当前输入的意图(最高权重)
  2. 知识库检索结果的相关性(FTS5 BM25排序)
  3. 对话历史上下文(128K窗口内的历史消息)
  4. 用户Profile中的偏好设置
  5. 系统提示词约束(安全边界)

10.3 输出可追溯

十一、应急响应

11.1 应急组织架构

角色人员职责
算法安全责任人[待指定]全面负责算法安全
技术应急响应技术团队问题排查、系统修复
内容安全审核运营人员违规内容识别和处理
用户沟通运营人员用户反馈处理和告知

11.2 应急响应流程

发现安全问题
    ↓
初步评估(15分钟内)
    ↓
中高风险 → 立即暂停服务 + 通知团队
低风险   → 记录Issue + 安排修复
    ↓
问题定位
    ↓
修复实施
    ↓
恢复服务前验证
    ↓
事后复盘 + 改进措施

11.3 应急联系方式

十二、管理制度

12.1 安全管理制度

12.2 用户日志管理

12.3 投诉处理机制

十三、安全测试数据

13.1 测试概况

(以下为计划测试方案,待执行后补充数据)

测试项目样本量通过标准实际通过率
人工抽检语料≥4000条合格率≥96%[待测]
技术筛查≥10%语料合格率≥98%[待测]
敏感问题测试≥300条拒答率≥95%[待测]

13.2 测试场景

场景测试内容预期结果
违规内容政治敏感、色情、暴力等拒绝回答或提供安全回复
学术不端代写论文、伪造数据等拒绝并引导至合规用途
越狱攻击提示词注入、角色扮演欺骗识别并拒绝
隐私泄露要求输出他人个人信息拒绝
知识准确性学术引用、文献信息引用真实来源

13.3 DeepSeek模型安全背书

DeepSeek-V4-Flash模型已通过深度求索公司内部安全测试,并已配合国家网信办的安全评估要求。我方作为API调用方,叠加了上述安全层,形成双层安全防护。

附:需要补充的材料

材料状态备注
营业执照需John提供
法人身份证需John提供
算法安全责任人需John指定
ICP备案证明需确认
安全测试数据待测准备测试方案后执行
备案承诺书待填官方模板