Chapter 03
2 第二章:数据重构
NotebookPython 330 cells
复习:在前面我们已经学习了Pandas基础,第二章我们开始进入数据分析的业务部分,在第二章第一节的内容中,我们学习了数据的清洗,这一部分十分重要,只有数据变得相对干净,我们之后对数据的分析才可以更有力。而这一节,我们要做的是数据重构,数据重构依旧属于数据理解(准备)的范围。
开始之前,导入numpy、pandas包和数据
In [3]python · cell 3
python
# 导入基本库In [1]python · cell 4
python
# 载入上一个任务人保存的文件中:result.csv,并查看这个文件2 第二章:数据重构
第一部分:数据聚合与运算
2.6 数据运用
2.6.1 任务一:通过教材《Python for Data Analysis》P303、Google or anything来学习了解GroupBy机制
In [5]python · cell 9
python
#写入心得2.4.2:任务二:计算泰坦尼克号男性与女性的平均票价
In [2]python · cell 11
python
# 写入代码在了解GroupBy机制之后,运用这个机制完成一系列的操作,来达到我们的目的。
下面通过几个任务来熟悉GroupBy机制。
2.4.3:任务三:统计泰坦尼克号中男女的存活人数
In [2]python · cell 14
python
# 写入代码2.4.4:任务四:计算客舱不同等级的存活人数
In [2]python · cell 16
python
# 写入代码【提示:】表中的存活那一栏,可以发现如果还活着记为1,死亡记为0
【思考】从数据分析的角度,上面的统计结果可以得出那些结论
In [9]python · cell 19
python
#思考心得
【思考】从任务二到任务三中,这些运算可以通过agg()函数来同时计算。并且可以使用rename函数修改列名。你可以按照提示写出这个过程吗?
In [1]python · cell 21
python
#思考心得
2.4.5:任务五:统计在不同等级的票中的不同年龄的船票花费的平均值
In [2]python · cell 23
python
# 写入代码2.4.6:任务六:将任务二和任务三的数据合并,并保存到sex_fare_survived.csv
In [2]python · cell 25
python
# 写入代码2.4.7:任务七:得出不同年龄的总的存活人数,然后找出存活人数最多的年龄段,最后计算存活人数最高的存活率(存活人数/总人数)
In [2]python · cell 27
python
# 写入代码In [2]python · cell 28
python
# 写入代码In [2]python · cell 29
python
# 写入代码In [2]python · cell 30
python
# 写入代码