博客
关于我
利用pandas做数据分析统计应用---统计二胎年龄差距
阅读量:376 次
发布时间:2019-03-05

本文共 918 字,大约阅读时间需要 3 分钟。

源码和数据文件见上述链接。

本文数据提取自深圳市2019年某次公租房申请公示名单,移除了非身份证的数据。

import pandas as pdimport matplotlib.pyplot as plt '''粗略统计二胎年龄差距se 为1 主申请人,多数为爸爸se为2共同申请人,多为妈妈和孩子se为0,others'''#difage = []class family:	def __init__(self):		self.mainpyear= None		self.comPyear=[]		self.diff = []	def diff_age(self):		if len(self.comPyear)>2:			self.comPyear = sorted(self.comPyear, reverse = True)			#print(self.comPyear)			if( self.comPyear[0]-self.comPyear[1]<18):				self.diff.append( self.comPyear[0]-self.comPyear[1])		self.comPyear=[]if __name__ == '__main__':				b= pd.read_csv('a.csv', sep=',', dtype = {'id':str})	b['year']=pd.to_numeric(b['id'].str[6:10])	myf = family()	for key,row in b.iterrows():		if( row['se']==1):			myf.mainpyear = row['year']			myf.diff_age()		elif( row['se']==2):			myf.comPyear.append(row['year'])			#myf.diff_age()		#print(myf.diff)	a = pd.Series(myf.diff)	a.plot.hist(bins =19 )	plt.show()

 

结论:二胎年龄差距,2,3岁的家庭最多。

转载地址:http://tfpg.baihongyu.com/

你可能感兴趣的文章
mysql sum 没返回,如果没有找到任何值,我如何在MySQL中获得SUM函数以返回'0'?
查看>>
mysql Timestamp时间隔了8小时
查看>>
Mysql tinyint(1)与tinyint(4)的区别
查看>>
mysql union orderby 无效
查看>>
mysql v$session_Oracle 进程查看v$session
查看>>
mysql where中如何判断不为空
查看>>
MySQL Workbench 使用手册:从入门到精通
查看>>
mysql workbench6.3.5_MySQL Workbench
查看>>
MySQL Workbench安装教程以及菜单汉化
查看>>
MySQL Xtrabackup 安装、备份、恢复
查看>>
mysql [Err] 1436 - Thread stack overrun: 129464 bytes used of a 286720 byte stack, and 160000 bytes
查看>>
MySQL _ MySQL常用操作
查看>>
MySQL – 导出数据成csv
查看>>
MySQL —— 在CentOS9下安装MySQL
查看>>
MySQL —— 视图
查看>>
mysql 不区分大小写
查看>>
mysql 两列互转
查看>>
MySQL 中开启二进制日志(Binlog)
查看>>
MySQL 中文问题
查看>>
MySQL 中日志的面试题总结
查看>>