数字化转型洞察
发布于 2026-03-07 / 0 阅读
0
0

人工智能时代,企业数据架构为什么需要重新设计

人工智能应用需要的不只是更多数据,还需要把结构化数据、文档知识、实时上下文和反馈记录组织成可持续的数据供给体系。

传统数据架构主要围绕业务系统、数据仓库和分析报表展开。数据经过采集、清洗和汇总后,为统计分析与经营管理提供支持。人工智能进入企业应用后,这套架构仍然重要,但已经不能覆盖全部数据需求。

图 人工智能时代的数据供给体系

模型不仅需要表格中的字段,还要使用制度文档、业务知识、历史对话、工具说明、实时状态和用户反馈。企业数据架构的管理对象因此从“业务数据”扩展为“数据、知识与上下文”。
         

一、人工智能改变了数据的使用方式

传统报表通常按照预先定义的指标和查询逻辑使用数据,输入与输出相对确定。人工智能应用则会根据不同问题动态检索信息、组合上下文并生成结果。
         

这要求数据架构不仅说明数据存放在哪里,还要说明哪些信息适合进入模型、在什么条件下可以使用,以及结果如何追溯到原始依据。
         

二、非结构化知识成为重要数据资产

企业大量知识存在于制度、方案、合同、操作手册和会议材料中。过去这些内容主要依靠人工查阅,现在逐渐成为知识问答和智能体的重要输入。
         

文档进入知识库后,需要管理版本、有效期、适用范围和访问权限。内容被检索到并不代表它仍然有效,也不代表当前用户有权使用。
         

三、上下文需要被单独设计

同一个问题在不同用户、时间和业务状态下可能需要不同答案。身份、组织、当前任务、历史操作和实时数据共同构成上下文。
         

上下文并不是越多越好。数据架构需要定义信息的来源、更新频率、优先级和保留期限,避免过期或无关信息干扰模型判断。
         

四、数据权限必须延伸到模型使用过程

传统权限通常控制用户能否进入系统、查看页面或查询字段。人工智能应用通过自然语言整合多个来源后,可能在输出中间接暴露受限信息。
         

因此,权限控制要覆盖检索、上下文组装、模型调用和结果展示全过程。知识库、向量检索和工具调用都应继承企业原有的数据权限,而不是形成新的权限盲区。
         

五、反馈数据成为持续优化的基础

人工智能应用上线后,会产生回答评价、人工修改、任务失败和异常接管等新数据。这些反馈不仅用于改进模型,也能帮助企业识别知识缺口和流程问题。
         

新的数据架构应把反馈采集、效果评测和版本关联纳入设计,使企业能够判断某次改进来自模型、知识、提示规则还是业务流程变化。
         

六、重新设计不等于推翻重建

现有主数据、数据仓库和治理机制仍是人工智能应用的重要基础。重新设计的重点,是在既有架构上补充知识管理、上下文服务、语义体系和反馈闭环。
         

企业数据架构由此从面向报表的数据供给,进一步演进为面向分析、生成与行动的综合信息支撑体系。
       
     

新的数据架构可以按四层组织

底层仍是结构化数据、文档、图像和实时事件等信息资源;其上是质量、权限、版本和生命周期治理;再上是语义检索、知识组织、上下文组装和反馈评测等信息服务;最上层才是问答、分析、生成和智能体执行等应用场景。分层后,企业可以避免每个场景重复处理文档和权限。
     

建设顺序应从高价值问题反推

先选择一个知识边界明确、使用频率较高的场景,梳理它需要的数据、文档和实时上下文;再补齐权限、版本和质量机制;随后把可复用的检索与上下文能力沉淀下来。这样形成的数据架构来自真实需求,也更容易验证。
     

数据治理的评价标准也要变化

除了完整性、准确性和及时性,还要关注知识是否可检索、回答能否回到依据、权限是否在生成过程中保持有效,以及用户反馈能否推动内容更新。面向人工智能的数据治理,最终要对使用效果负责。
     

重新设计数据架构,不是增加一个向量数据库,而是让数据、知识、上下文和反馈形成可以持续运营的供给体系。

 

参考资料

1.     刘易斯等:《面向知识密集型自然语言处理任务的检索增强生成》(二〇二〇年)


评论