从 Excel 到模型:科研数据整理避坑指南

举报
一个漂流瓶 发表于 2026/07/30 18:01:32 2026/07/30
【摘要】 很多机器学习项目失败,不是因为模型不够强,而是因为数据表从一开始就不规范。科研数据常常来自 Excel、文献表格、实验记录和人工整理,如果字段、单位、缺失值和样本编号没有统一,后续模型结果很容易失真。本文总结科研数据整理中最常见的问题,并给出可执行的整理建议。

1. 一张表只做一件事

科研中常见的 Excel 问题是:一个工作表里既有原始记录,又有计算结果,还有备注、颜色标记和合并单元格。

这种表适合人看,但不适合机器学习。

建议拆成几类表:

raw_data.xlsx:原始数据
cleaned_dataset.csv:清洗后的建模数据
source_reference.csv:数据来源说明
experiment_log.xlsx:实验过程记录

建模时只读取结构化的 cleaned_dataset.csv

2. 不要使用合并单元格

合并单元格在视觉上清楚,但程序读取时很麻烦。机器学习数据表应该满足:

第一行是字段名
每一列是一个变量
每一行是一个样本
每个单元格只放一个值

不要在同一个单元格里写:

28d,标准养护,强度 95MPa

应该拆成:

curing_age_d = 28
curing_method = standard
compressive_strength_mpa = 95

3. 单位必须统一

单位不统一是科研建模中最隐蔽的错误。

例如:

kg/m3 和 g/cm3 混用
MPa 和 kPa 混用
百分数和小数混用
天和小时混用

建议在字段名中直接写单位:

compressive_strength_mpa
curing_age_d
fiber_length_mm
density_kg_m3

这样写虽然字段名长一点,但能显著降低后续错误。

4. 缺失值不要乱填

文献没有报告的数据,不应该随手填 0。

推荐规则:

确认不存在:填 0
文献未报告:留空
无法确定:留空并在 notes 中说明
由图中读取:填数值并备注 extracted_from_figure

例如某篇文献没有使用粉煤灰,可以填 fly_ash_kg_m3 = 0
但如果文献没有说明减水剂用量,就应该留空,而不是填 0。

5. 保留数据来源

每一行数据都应该能追溯到来源。

建议字段:

sample_id
source_type
source_id
paper_title
doi
year
notes

这样后面发现异常值时,可以快速回到原文或实验记录核对。

6. 数据清洗比建模更花时间

一个真实科研项目中,时间分配可能是:

数据收集:30%
数据清洗:30%
模型训练:20%
结果分析:20%

所以不要低估数据整理。数据表做得越规范,后面的模型实验越轻松。

总结

从 Excel 到机器学习模型,中间最重要的一步是把“人能看懂的表”变成“程序能稳定读取的表”。字段清楚、单位统一、来源可追溯、缺失值规则明确,这些基础工作决定了后续模型结果是否可信。

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。