
CGM 第6期:基于版本控制的数据分析及流程管理
从科研数据丢失、参数难以追溯和脚本版本混乱等真实问题出发,介绍数据备份、版本控制、分析流程管理与可重复报告的实践方法。
活动回放
子曰:“By three methods we may learn wisdom: first, by reflection, which is noblest; second, by imitation, which is easiest; and third by experience, which is the bitterest.”
子说的当然是中文, 原文为“生而知之者,上也;学而知之者,次也;困而学之者,又其次也;困而不学,民斯为下矣!”。
之所以引孔老夫子的这句话,着实是因为,多年研究经历了一些苦头,痛定思痛,学习总结了一套自认为行之有效的方法。所以,因困而学,我觉得不算太差。
什么样的苦头呢(“困”)呢?
第一:PhD毕业之前半年存了你多年工作脚本的硬盘坏了,你指望着写论文呢,你说你困不困?
第二:文章修改的过程中,让你报告多年前一个数据分析的参数,鬼还记得那个数是几,你说你困不困?
第三:多年来,积累了几十个大大小小的分析,几百个修修补补的图表,几千个改来改去的脚本。这些文件管理起来,困不困!我就问你,困不困!
好了,今天,我们因困而学之,因困而讨论之,不算最差吧。 我们将从四个方面展开讨论(参见我的相关博客文章。 大家要积极参与哦,结合自身经验,推荐一些好用的工具或可行的方案,最好准备一两张slides。
实验大数据的 (Tb级别)的存储和备份
基于Github的文件版本管理系统
数据分析流程管理
数据的可视化与报告
评论(0)
登录后即可发表评论。
登录暂无评论,来发表第一条评论吧!