数据质量这层「地基」,正在被多数科室忽视
临床营养信息系统上线到今天,行业关注的焦点已经从「有没有系统」转向了「系统有没有用起来」。筛查覆盖率、评估完成率、处方闭环率——这些指标被反复提及,成为衡量信息化成效的核心标尺。
但有一个更底层的问题被跳过了:系统里的数据,质量到底行不行?
如果一个营养评估记录中,患者的体重数据是估算的、评分项有遗漏、干预目标填的是模糊数值,那么基于这些数据算出来的筛查覆盖率再高、评估完成率再好,都缺乏可信度。数据质量是信息系统的地基——地基不牢,上面盖的楼越高,风险越大。
中国营养学会临床营养分会2025年发布的《临床营养信息系统功能评估与数据质量分析报告》中,对87家已部署营养信息系统的三级医院进行了一次数据质量抽检。结果显示,在随机抽取的营养评估记录样本中,关键字段完整率超过90%的医院占比约为41%;存在明显数据异常值(如体重记录与实际偏离超过20%、能量目标填写格式不统一)的医院占比约为56%;能够实现筛查、评估、处方三个模块数据一致关联的医院占比约为28%。[1]
数据质量不是「有」和「没有」的问题,而是「可信」和「不可信」的问题。系统上线只是第一步,数据质量管控体系的建立,是第二步——而这一步,多数科室还没有迈出去。
为什么说数据质量问题的根源在录入环节
数据质量问题的排查,通常从分析环节发现端倪,但追根溯源,问题大多发生在录入环节。这不是偶然,而是由临床营养评估的工作方式决定的。
评估场景的天然复杂性
营养评估不同于检验检查——血常规的结果是机器自动输出的,数值精确、格式统一、单位标准。营养评估的大量数据来源于人工采集:体重是护士测量的,进食情况是患者自述的,实验室指标是从HIS系统复制的,评分项是营养师逐条勾选的。每一个人工参与的环节,都是数据质量风险的引入点。
以一个典型的NRS 2002筛查为例,需要录入的数据包括:身高、体重、体重变化、进食量变化、疾病严重程度评分、营养状态受损评分。六个数据项中,体重和体重变化依赖测量和询问,进食量变化依赖患者回忆,疾病严重程度评分依赖评估者的临床判断。六个数据项的准确度,取决于评估者的操作规范性和信息获取的完整性。
结构化约束的缺失
录入环节数据质量问题的直接原因,是系统在录入界面缺乏足够的结构化约束。多数系统提供了评估表单的数字输入框和下拉选项,但约束的颗粒度远远不够。
数值型字段的边界校验缺失是典型问题。体重字段允许输入25kg,也允许输入250kg——前者对于一个成年患者明显异常,后者对于任何患者都不合理。但系统不会拦截,因为字段没有设定合理范围。能量目标的填写更是重灾区:有的填「1500kcal」,有的填「1500」,有的填「1.5L EN」,三种格式在系统里都能保存,但在统计分析时,后两种格式的数据无法被直接计算。
《中国卫生信息管理杂志》2024年发表的一项针对医院信息系统数据质量的研究中,研究人员对6家医院营养评估模块的数据进行了字段级分析,发现约34%的数值型字段存在异常值或格式不一致问题,这些问题中约72%可以通过录入界面的校验规则自动拦截,但实际被拦截的比例不足15%。[2]
操作习惯与效率的博弈
录入环节数据质量问题的深层原因,是操作效率和数据质量之间的张力。营养师在临床工作中面临时间压力,一个上午可能需要完成10-15个患者的评估。在效率优先的驱动下,体重数据「估一个数先填上」、评分项「先保存后面再补」、备注信息「写个大概」——这些操作在短期内提高了工作效率,但长期来看,它们侵蚀了数据的可信度。
这不是营养师的责任问题,而是系统设计的问题。一个好的系统应该让「录入准确数据」比「录入模糊数据」更便捷,而不是反过来。当系统提供的录入体验促使营养师走捷径时,数据质量的下滑是系统设计缺陷的必然结果,而不是操作人员的态度问题。
数据质量衰减在流转过程中是如何被放大的
录入环节的问题只是起点。数据在系统内部流转的过程中,质量衰减会被逐级放大。一个评估记录从创建到进入分析报表,经历多个处理环节,每个环节都有可能引入新的质量问题或加剧已有的问题。
数据复制与二次录入
营养评估数据在临床工作中经常需要被复用。筛查结果被复制到评估记录中,评估结果被引用到处方方案中,执行数据被回传用于对比分析。每一次数据复制,都是一次质量风险的传递。
最典型的场景是转科患者的营养数据衔接。患者从外科转入ICU,原有的营养评估数据需要在新科室的系统中可见。如果两个系统之间的数据交换采用手工录入方式——ICU的营养师根据外科病历中的评估记录重新录入——那么录入过程中可能出现的错误包括:数字抄错(如将「65kg」误录为「56kg」)、单位转换错误(如将「lb」当作「kg」)、评分项遗漏(如只录入了总分未录分量表得分)。
系统间的数据接口可以解决部分问题,但接口本身也有质量风险。数据字段映射不一致、时间戳格式差异、编码对照表版本不同——这些技术层面的问题会导致数据在接口传输过程中出现丢失或错位。
数据聚合与汇总损失
当个体评估数据被聚合成科室级报表时,数据质量的衰减以另一种形式出现。统计数据依赖于原始数据的准确性,但汇总过程本身会掩盖原始数据的质量问题。
一个典型的例子:科室月报显示「营养评估完成率92%」,看起来是一个不错的数据。但这个92%是基于「系统中已完成的评估记录数/应完成的评估记录数」计算的。如果系统中存在大量「已保存但未真正完成」的评估记录——评分项不全、关键字段缺失——那么这些记录在统计时被计入「已完成」类别,导致完成率虚高。报表上的数字看起来很漂亮,但反映的不是真实情况。
数据聚合过程中的另外一个常见问题是口径不一致。同样一个「评估完成率」指标,在不同科室、不同时间段可能采用不同的计算口径。有的科室用「完成评估的患者数/入院患者数」,有的用「完成评估的患者数/应筛查患者数」,有的用「评估记录数/筛查阳性患者数」。口径不同,数字不可比,汇总后的数据无法用于跨科室或跨时间段的对比分析。
数据沉淀与版本混乱
临床营养评估的一个特点是:评估不是一次性的,而是需要根据患者病情变化进行动态更新。一个住院患者可能经历2-3次营养评估,每次评估结果可能不同。系统需要妥善管理这些不同版本的评估数据,确保在任何时间点都能查到正确的版本。
但在实际运行中,版本管理的问题远没有解决。有的系统对评估记录的修改直接覆盖——患者体重从65kg修改为62kg后,旧值消失,无法追溯体重变化轨迹。有的系统允许多次创建评估记录,但不标注版本号和时间戳——营养师在月末做质控统计时,不知道该用哪条记录作为分析依据。
版本混乱的直接后果是:当需要做纵向数据分析时——比如评估某类患者住院期间营养状况的变化趋势——数据的基础不可靠,分析结果的可信度自然存疑。
全链路数据质量管控需要在三个环节同时发力
数据质量衰减的链条贯穿录入、流转、分析三个环节,单一环节的改进无法解决整体问题。全链路管控的思路是:在数据产生的每个环节设置质量控制节点,让数据质量在每一道工序上都得到保障。
录入环节:从「能录进去」到「只能录对的」
录入环节的质量管控,核心是让系统在数据录入时具备足够的智能校验能力。
第一层是字段级校验。数值型字段设定合理范围——体重字段的输入范围限定为20-200kg,能量目标字段限定为800-3500kcal,超出范围直接拦截录入。日期型字段校验逻辑一致性——评估日期不能早于入院日期,随访日期不能早于评估日期。枚举型字段使用下拉选择而非自由文本——营养制剂名称、给药途径、输注方式等有标准分类的字段,不允许自由文本输入。
第二层是跨字段逻辑校验。当患者的体重下降超过10%时,营养状态受损评分不能为0——这是临床逻辑的必然要求,系统应在录入时自动检查并提示。当NRS 2002总分≥3分时,系统应自动触发评估任务创建,而非等待营养师手动操作。当患者年龄超过65岁且诊断为特定疾病时,系统应自动推荐适用的评估工具而非让营养师自行选择。
第三层是录入完成度检查。评估记录在保存时,系统应检查关键字段的完整率。如果关键字段完整率低于预设阈值(如80%),系统应提示营养师补充后再保存。这不是强制拦截——临床场景中确实存在信息暂时无法获取的情况——但系统应明确标记哪些字段是「已确认」、哪些是「待补充」,避免后续使用时混淆。
流转环节:数据在接口之间不能「裸奔」
数据在系统内部流转时,质量管控的核心是确保数据在每次传输中都保持完整性和一致性。
接口传输的数据校验是第一步。当营养评估系统从HIS获取患者基本信息时,应对接收到的数据进行基本校验——患者ID格式是否正确、入院时间是否在合理范围内、科室编码是否在对照表中存在。校验不通过的数据应进入异常队列,而非直接写入业务表。
数据映射的标准化是第二步。不同系统之间的数据字段映射需要建立明确的对照表,并定期维护更新。ICD编码的版本变更、科室编码的调整、制剂目录的更新——这些变化都需要在数据映射表中同步修改,否则就会出现「系统A发送的数据在系统B中无法识别」的问题。
数据流转的审计追踪是第三步。每一次数据在系统间传输,都应有日志记录传输的时间、数据量、校验结果。当数据质量出现异常时,审计日志可以帮助快速定位问题环节——是源系统数据有问题,还是传输过程出现问题,还是目标系统解析有误。
2025年中国医院协会信息管理专业委员会发布的《医院信息系统数据互联互通质量评估报告》中,对参与测评的142家医院的数据接口质量进行了分析。结果显示,在数据接口层面建立了完备的数据校验和异常处理机制的医院占比约为19%,能够实现数据接口传输质量自动监控的医院占比约为11%。多数医院的数据接口处于「通了就行」的状态,缺乏对接口传输质量的主动管理。[3]
分析环节:报表的数字不能「看起来很美」
数据进入分析环节后,质量管控的重点从「数据是否正确」转向「分析是否可靠」。
分析口径的明确定义是第一要求。每一个输出到报表中的指标,都应有清晰的定义文档,说明分子分母分别是什么、数据来源是哪个模块、统计周期如何界定。当科室主任看到「评估完成率92%」时,应该能够在一分钟内查到这个数字的计算逻辑,而不是需要猜测。
数据质量的标注机制是第二要求。当报表中的某个指标因为数据质量问题存在偏差时,系统应主动标注而非沉默呈现。例如,如果某个月份的评估完成率数据因为系统接口故障导致数据缺失,报表中应标注「该月数据完整率为XX%,统计结果仅供参考」,而非让管理者误以为完成率真实下降。
数据质量基线的持续监控是第三要求。科室应建立数据质量的定期评估机制——每月抽取一定比例的评估记录进行数据质量检查,评估关键字段完整率、异常值比例、数据一致率等指标。基线数据累积后,可以设定数据质量的目标值,并将数据质量指标纳入科室的日常管理考核。
当数据质量基线建立起来,科室的管理模式会发生什么变化
讨论完技术层面的管控策略,有必要回到一个更根本的问题:数据质量基线建立起来之后,科室的日常管理会有什么不同?
从「数据有没有」到「数据能不能用」的跨越
在数据质量管控体系建立之前,科室主任面对的数据环境是「有数据但不确定能不能用」。月报上的数字可能准确,也可能不准确——因为没有系统的校验机制来验证。当数据质量基线建立之后,科室主任对系统数据的信任度会显著提升,因为知道每一个数字都是经过校验的、每一个指标都有明确的定义、每一个异常值都有对应的处理机制。
这种信任度的提升,带来的是管理决策方式的变化。从「凭经验判断」到「用数据说话」,从「大概知道」到「确切知道」。数据质量基线越扎实,数据驱动的管理决策就越有底气。
从「事后补救」到「事前预防」的转变
数据质量管控体系建立之前,数据质量问题的发现通常是事后——在质控评审、数据上报、科研分析时发现数据有问题,然后倒查原因。这种「事后补救」模式的问题在于:发现问题的时机太晚,修正成本高,有些问题甚至无法修正(如已经覆盖的旧版本数据)。
当录入环节、流转环节、分析环节都设置了质量控制节点之后,数据质量问题的发现从「事后」提前到了「事中」甚至「事前」。录入时的字段校验在数据产生的那一刻就拦截了格式错误,接口传输时的数据校验在数据到达的那一刻就发现了异常,分析环节的基线监控在数据偏差出现的第一时间就发出了预警。问题发现得越早,修正成本越低,对数据使用的影响越小。
从「数据责任分散」到「数据责任明确」的进化
在缺乏数据质量管控体系的环境中,数据质量问题的责任归属是模糊的。一条评估记录中的异常数据,是录入者的错误、接口传输的丢失还是数据库的异常,没有明确的追踪机制。
当全链路管控体系建立之后,数据的责任归属变得清晰。录入环节的数据质量由录入者负责——系统自动记录每个字段的录入时间和录入人。流转环节的数据质量由接口管理者负责——系统自动记录每次传输的校验结果。分析环节的数据质量由数据管理员负责——系统自动记录每次报表生成的数据来源和计算逻辑。责任明确之后,数据质量问题的发现和解决变得有章可循。
数据质量不是一次性的工程,而是持续性的管理
回到本文开篇的问题:数据质量这层「地基」,正在被多少科室忽视?
从行业调研数据来看,答案是多数。系统上线了,功能用起来了,报表生成了——但数据质量是否经得起推敲,没有几个科室能给出肯定的回答。这不是某个科室的问题,而是整个行业在信息化建设快速推进阶段必然会遇到的结构性短板。
数据质量管控体系的建设,不是一次性的工程项目,而是持续性的管理过程。录入环节的校验规则需要根据临床反馈不断优化,流转环节的数据映射需要随着系统升级定期更新,分析环节的基线标准需要随着业务发展动态调整。没有「建完就完」的数据质量,只有「持续在管」的数据质量。
对于正在建设或升级营养评估与干预系统的科室来说,一个值得投入的方向是:从数据质量基线评估入手,梳理当前系统数据的关键字段完整率、异常值比例、跨模块一致率,设定改进目标,在录入、流转、分析三个环节逐步建立管控机制。数据质量每提升一步,系统输出的每一个数字的可信度就提高一分——而数据可信度,才是临床营养信息化从「有」走向「有用」的真正转折点。
[1] 中国营养学会临床营养分会. 临床营养信息系统功能评估与数据质量分析报告[R]. 2025.
[2] 医院信息系统数据质量评估方法与实证研究[J]. 中国卫生信息管理杂志, 2024, 21(4): 345-352.
[3] 中国医院协会信息管理专业委员会. 医院信息系统数据互联互通质量评估报告[R]. 2025.