- 19
- 0
- 约5.21千字
- 约 29页
- 2021-11-15 发布于湖南
- 举报
一看就会的Pandas文本数据处理
在pandas中存储文本数据有两种方式:object 和 string。在pandas 1.0版本之前,object是独一的文本类型,在一列数据中假如包含数值和文本等混合类型则一般也会默认为object。在pandas 1.0 版本之后,新增了string文本类型,可以更好的支持字符串的处理。
1.1. 类型简介
默认情况下,object仍旧是文本数据默认的类型。
假如要接受string类型,我们可以通过dtype进行指定
在Series 或 Dataframe被创建后,我们还可以通过astype进行类型强制转换
当然,我们还有个df.convert_dtypes()方法可以进行智能数据类型选择
1.2. 类型差异
string和object在操作上有所不同。
对于sting来说,前往数字输出的字符串访问器方法将一直前往可为空的整数类型;对于object来说,是 int 或 float,具体取决于 NA 值的存在
对于string类型来说,前往布尔输出的方法将前往一个可为空的布尔数据类型
2. 字符串方法
Series 和 Index 都有一些字符串处理方法,可以便利进行操作,最重要的是,这些方法会自动排解缺失/NA 值,我们可以通过str属性访问这些方法。
2.1. 文本格式
文本格式是对字符串文本进行格式操作,比如转换大小写之类的
?s?=?
原创力文档

文档评论(0)