先把知识来源和权限边界梳理清楚
企业知识库项目不应从模型调用开始,而应先确认哪些文档可以入库、文档归属部门、访问权限、更新频率和是否包含敏感数据。S3 适合作为原始文档和清洗后文本的分层存储入口。
如果知识库面向多个团队,索引、元数据和检索过滤条件必须能表达部门、项目、客户和保密级别。否则模型回答可能正确,但会把不该看的内容暴露给错误用户。
典型首版链路
常见链路是文档上传到 S3,触发清洗和切分任务,生成 embedding 后写入 OpenSearch Serverless 或其他向量库。查询时先做权限过滤和语义检索,再把片段、引用来源和用户问题交给 Claude 生成答案。
首版不必一次加入复杂 Agent。更稳妥的做法是先让用户看见引用来源、更新时间和置信边界,确认检索质量后再引入多步骤任务执行。
生产化关注审计、延迟和成本
生产环境需要记录用户、问题、检索片段、模型版本、输出和反馈,但日志中要避免保存不必要的敏感原文。对高频场景,可以通过缓存、批量 embedding、分层索引和提示词压缩控制延迟与成本。
私网访问、KMS 加密、VPC 端点和 CloudWatch 指标通常会在上线前纳入架构评审,确保知识库既能回答业务问题,也满足企业安全要求。
要点
- 先治理文档权限,再接入模型。
- RAG 首版应显示引用来源和更新时间。
- 审计、延迟和成本要在上线前纳入设计。