从 Excel 到模型:科研数据整理避坑指南
【摘要】 很多机器学习项目失败,不是因为模型不够强,而是因为数据表从一开始就不规范。科研数据常常来自 Excel、文献表格、实验记录和人工整理,如果字段、单位、缺失值和样本编号没有统一,后续模型结果很容易失真。本文总结科研数据整理中最常见的问题,并给出可执行的整理建议。
1. 一张表只做一件事
科研中常见的 Excel 问题是:一个工作表里既有原始记录,又有计算结果,还有备注、颜色标记和合并单元格。
这种表适合人看,但不适合机器学习。
建议拆成几类表:
raw_data.xlsx:原始数据
cleaned_dataset.csv:清洗后的建模数据
source_reference.csv:数据来源说明
experiment_log.xlsx:实验过程记录
建模时只读取结构化的 cleaned_dataset.csv。
2. 不要使用合并单元格
合并单元格在视觉上清楚,但程序读取时很麻烦。机器学习数据表应该满足:
第一行是字段名
每一列是一个变量
每一行是一个样本
每个单元格只放一个值
不要在同一个单元格里写:
28d,标准养护,强度 95MPa
应该拆成:
curing_age_d = 28
curing_method = standard
compressive_strength_mpa = 95
3. 单位必须统一
单位不统一是科研建模中最隐蔽的错误。
例如:
kg/m3 和 g/cm3 混用
MPa 和 kPa 混用
百分数和小数混用
天和小时混用
建议在字段名中直接写单位:
compressive_strength_mpa
curing_age_d
fiber_length_mm
density_kg_m3
这样写虽然字段名长一点,但能显著降低后续错误。
4. 缺失值不要乱填
文献没有报告的数据,不应该随手填 0。
推荐规则:
确认不存在:填 0
文献未报告:留空
无法确定:留空并在 notes 中说明
由图中读取:填数值并备注 extracted_from_figure
例如某篇文献没有使用粉煤灰,可以填 fly_ash_kg_m3 = 0。
但如果文献没有说明减水剂用量,就应该留空,而不是填 0。
5. 保留数据来源
每一行数据都应该能追溯到来源。
建议字段:
sample_id
source_type
source_id
paper_title
doi
year
notes
这样后面发现异常值时,可以快速回到原文或实验记录核对。
6. 数据清洗比建模更花时间
一个真实科研项目中,时间分配可能是:
数据收集:30%
数据清洗:30%
模型训练:20%
结果分析:20%
所以不要低估数据整理。数据表做得越规范,后面的模型实验越轻松。
总结
从 Excel 到机器学习模型,中间最重要的一步是把“人能看懂的表”变成“程序能稳定读取的表”。字段清楚、单位统一、来源可追溯、缺失值规则明确,这些基础工作决定了后续模型结果是否可信。
【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱:
cloudbbs@huaweicloud.com
- 点赞
- 收藏
- 关注作者
评论(0)