先创建一个excel文件
import pandas as pd
data = {'city': ['北京', '上海', '广州', '深圳'],
'2018': [33105, 36011, 22859, 24221]}
data = pd.DataFrame(data)
data.to_excel('excel练习.xlsx', index=False)
去重drop_duplicates()
data.drop_duplicates(['city']) data.drop_duplicates(['city', '2018'], keep='last')
对指定列(这个列可以包含多个元素如:[‘city’, ‘2018’])去重,默认保留第一次出现的数据,但是添加参数**keep=‘last’**可以保留最后一次出现的数据。



