DataFrame里经常会出现重复行,DataFrame提供一个duplicated()方法检测各行是否重复,另一个drop_duplicates()方法用于丢弃重复行:
duplicated()和drop_duplicates()方法默认判断全部列,如果不想这样,传入列的集合作为参数可以指定按列判断,例如:
duplicated()和drop_duplicates()方法默认保留第一个出现的值,传入take_last=True保留最后一个值:
虽然这种存储格式对于关系型数据库是好的,不仅保持了关系完整性还提供了方便的查询支持。但是对于数据操作可能就不那么方便了,DataFrame的数据格式才更加方便。DataFrame的pivot方法提供了这个转换,例如:
使用函数也能达到同样的效果:
replace()方法用于替换:
一次替换多个值:
对不同的值进行不同的替换:
重命名列:
重命名索引:
假设你有一组数据:
找出绝对值大于2的值:
找出绝对值大于2的行:
将异常值设置为0: