유의(有意·留意)
概述
유의(有意)在统计学中指观测到的差异或关系因偶然发生的可能性很低而被判定为存在的状态,通过显著性水平(significance level)和显著性概率(p值)来判定。另一方面,写作汉字“留意”的유의也广泛用于“仔细观察、注意”这一日常含义,常以“注意事项”的形式出现在法令、合同、药品说明书等中。两种含义的发音和书写相近,但在学术语境中大多指统计显著性,在实务语境中则指注意与警惕。
主要内容
词源与语言含义
유의的含义随汉字写法而不同。留意(유의)由“留”和“意”组合而成,意为把心思留住并加以关注。“注意事项”“注意点”“请特别留意”等表达即属此类,在公共机构告示、产品说明书、法律文书中被用作限定责任范围或提醒使用者注意义务的手段。有意(유의)由“有”和“意”组合而成,具有“有意”“有意义”之意,与由此派生的“有意味(有意味)”一同成为学术、统计语境中的核心术语。此外,流议指流传的议论或世间评论,是罕见的用法,在现代韩语中几乎不再使用。
统计学中的显著性
统计假设检验是计算样本中观测到的结果仅由偶然波动出现的概率的程序。研究者首先设立“没有差异”的原假设与“存在差异”的备择假设,计算检验统计量后得出p值。若p值小于事先设定的显著性水平α,则拒绝原假设,并称“具有统计学显著性”。按惯例,α最常取0.05(5%);在需要严格标准的药品临床试验中,也会采用0.01或0.025(单侧、双侧检验)。
显著性判定会带来两类错误。第一类错误是实际上没有差异却误判为显著,其概率即显著性水平α。第二类错误是实际存在差异却未能发现,用1减去第二类错误概率所得的值称为检验效能(power)。检验效能由样本量、效应量和显著性水平决定,因此在研究设计阶段预先计算样本量已成为标准程序。
显著性水平与置信区间
与显著性水平α相对应的概念是置信区间。95%置信区间具有频率主义含义,即按同样方式反复抽样时,所计算出的区间中有95%包含真值。若置信区间不包含表示“无效应”的值(例如差异为0、相关系数为0、风险比为1),则在5%显著性水平下具有统计学显著性。因此,近年来人们建议不要只给出一个p值,而应同时报告效应量和置信区间。
实务与行政中的유의
在行政实务中,“유의”起到明确注意义务的表达作用。合同中的注意事项条款告知对方容易忽略的条件,以预防纠纷;药品附件的注意事项则说明合并用药禁忌、不良反应和用法用量。建筑、制造现场的安全指南中也反复出现“注意对象”“注意事项”等表述,这些已超越单纯的建议,有时还会成为判断法律责任的依据。
医学与临床中的유의
在临床研究中,关于必须区分“统计显著性”与“临床显著性”的讨论十分活跃。因为样本量足够大时,连患者实际感受不到的微小差异也可能在统计上显著。为弥补这一点,人们使用最小临床重要差异(MCID)概念,并同时评估生活质量、生存率、再入院率等患者能直接感受到的指标。
误解与局限
p值既不是“原假设为真的概率”,也不是“结果出于偶然的概率”。此外,统计显著性并不自动保证结果的重要性或实务上的有用性。若不校正多重比较而反复检验多个假设,仅凭偶然也会得到显著结果;而隐瞒不显著结果、只报告显著结果的发表偏倚,会损害整个文献的可信度。
最新动态
2016年,美国统计学会(ASA)发表声明,要求不要将p值用作二分法标准;此后随着可重复性危机讨论的扩散,研究惯例正在迅速改变。以2024—2025年为基准,预注册(pre-registration)、公开分析计划、共享数据和代码已成为主要期刊的标准要求,以效应量和置信区间为中心的报告方式也已普及。贝叶斯方法、等效性检验、基于FDR(错误发现率)的多重比较校正也广泛应用于生命科学与组学研究。此外,随着机器学习和大规模数据分析的普及,人们越来越认识到仅凭“统计显著性”难以保证解释力,同时给出预测性能、交叉验证和外部验证的做法已逐渐确立。韩国国内也在强化临床试验统计指南与研究伦理规定,要求明确报告显著性水平的设定依据和样本量计算过程。
相关主题
- [[统计学]]
- [[假设检验]]
- [[p值]]
- [[显著性水平]]
- [[可重复性危机]]
- [[置信区间]]
- [[错误]]
- [[注意义务]]