当前位置：主页 > 查看内容

带你一起盘点，Pandas1.0的主要功能

发布时间：2021-07-01 00:00| 有位朋友查看

简介：注意：Pandas 1.0.0rc已于1月9日发布，先前的版本为0.25。 Pandas首个全新主要发行版本包含许多重要功能：更完善的数据框自动汇总、更全面的输出格式、全新的数据类型以及文档站点。在全新的文档站点上，可以找到完整的发行说明，但小芯认为，技术含量较低……

注意：Pandas 1.0.0rc已于1月9日发布，先前的版本为0.25。

Pandas首个全新主要发行版本包含许多重要功能：更完善的数据框自动汇总、更全面的输出格式、全新的数据类型以及文档站点。

在全新的文档站点上，可以找到完整的发行说明，但小芯认为，技术含量较低的概述也会有所帮助。

用户可以使用 pip升级Pandas，以便使用其新版本。在撰写本文时，Pandas1.0仍然是候选版本，这意味着要安装Pandas1.0需要明确指定其版本。

pip install --upgradepandas==1.0.0rc0

当然，更新可能会破坏某些代码，因为这是主要版本的发布，因此请务必小心! 此版本的Pandas不再支持Python 2。运行Pandas 1.0+至少需要Python 3.6+，因此请确保使用合适版本的pip 和python。

$ pip --version 
pip 19.3.1 from /usr/local/lib/python3.7/site-packages/pip (python 3.7)$ python--version 
Python 3.7.5

用户可以确认一切正常，并且Pandas使用的是正确版本。

>>> import pandas as pd 
>>> pd.__version__ 
1.0.0rc0

使用DataFrame.info更好的自动汇总

笔者最喜欢的新功能是优化之后的DataFrame.info法。现在，它使用了更具可读性的格式，从而使数据探索过程更加容易。

>>> df = pd.DataFrame({ 
...:   'A': [1,2,3],  
...:   'B': ["goodbye","cruel", "world"],  
...:   'C': [False, True, False] 
...:}) 
>>> df.info() 
<class 'pandas.core.frame.DataFrame'> 
RangeIndex: 3 entries, 0 to 2 
Data columns (total 3 columns): 
 #  Column  Non-Null Count  Dtype 
---  ------  --------------  ----- 
 0  A       3 non-null      int64 
 1  B       3 non-null      object 
 2  C       3 non-null      object 
dtypes: int64(1), object(2) 
memory usage: 200.0+ bytes

Markdown表的输出格式

其次，笔者最喜欢的功能是使用新的 DataFrame.to_markdown 法将数据帧导出到Markdown表中。

>>> df.to_markdown() 
|    |  A | B       | C     | 
|---:|----:|:--------|:------| 
|  0 |  1 | goodbye | False | 
|  1 |  2 | cruel   | True  | 
|  2 |  3 | world   | False |

这样一来，通过github gists在Medium等地方显示表格更加便捷。

booleans and strings的新数据类型

来源：Pexels

Pandas1.0还为booleans and strings引入了实验数据类型。

由于这些更改是实验性的，数据类型的API可能会稍有更改，因此应谨慎使用。但是Pandas建议在合理的地方使用这些数据类型，将来的版本将完善诸如regex匹配之类的特定于类型的操作性能。

默认情况下，Pandas不会自动将数据强制转换为这些类型。但是，如果明确指示Pandas，仍然可以使用它们。

>>> B =pd.Series(["goodbye", "cruel", "world"],dtype="string") 
>>> C = pd.Series([False, True, False], dtype="bool") 
>>> df.B = B, df.C = C 
>>> df.info() 
<class 'pandas.core.frame.DataFrame'> 
RangeIndex: 3 entries, 0 to 2 
Data columns (total 3 columns): 
 #  Column  Non-Null Count  Dtype 
---  ------  --------------  ----- 
 0  A       3 non-null      int64 
 1  B       3 non-null      string 
 2  C       3 non-null      bool 
dtypes: int64(1), object(1), string(1) 
memory usage: 200.0+ bytes

注意Dtype列现在如何反应新类型的string和bool。

新字符串dtype最实用的优势在于，可以从DataFrame中选择string列。这样可以更快地仅对数据集的文本成分进行分析。

df.select_dtypes("string")

以前，只能通过显式使用其名称来选择string类型列。

从今天开始，掌握Pandas 1.0的主要功能，全新优化开启使用吧~

本文转载自网络，原文链接：http://mp.weixin.qq.com/s?__biz=MzI2NjkyNDQ3Mw==&mid=2247492465&idx=2&sn=9008a699b7fd836c7c95da4b26022d7a&chksm=ea841ba7ddf392b15087d55981b97522168c810807e9f20d346bca6e7fc6560b2f7f0d810886&mpshare=1&s
本站部分内容转载于网络，版权归原作者所有，转载之目的在于传播更多优秀技术内容，如有侵权请联系QQ/微信：153890879删除，谢谢！

上一篇：凯哥讲数据中台[009]2020数据中台的七个趋势 下一篇：没有了

随机推荐

像专业人士一样使用Google搜索

谷歌搜索是每个开发人员最重要的技能之一。让我告诉你如何在Google更好使用搜寻...
SLS新版告警入门-监控主机CPU异常

背景随着用户量的增加后台服务经常需要部署在多台服务器或者集群中来提高性能...
2021年优秀日志可视化工具

新的一年，您的Devops团队是否有新日志可视化工具? 无论您的答案如何，现在是您...
Javascript 中的解构赋值语法

首先在 ES6中引入的解构赋值语法允许把数组和对象中的值插入到不同的变量中。虽...
浅谈Mysql原理与优化（六）—— 主从复制

MySQL最简单的部署是单机部署，即在一个服务器上部署一个MySQL实例，简单方便。...
Pandas数据合并与拼接的5种方法

Pandas数据处理功能强大，可以方便的实现数据的合并与拼接，具体是如何实现的呢?...
缓存系统稳定性 - 架构师峰会演讲实录

前言大家好！我是万俊峰，go-zero 作者。感谢 ArchSummit 提供这么好的机会来跟...
大数据基础：Spark工作原理及基础概念

一、Spark 介绍及生态 Spark是UC Berkeley AMP Lab开源的通用分布式并行计算框架...
微服务架构之雪崩效应

一、概述二、原因三、解决方案四、总结概述在密码学中，雪崩效应（ avala...
域名认证和备案区别

域名认证和备案区别？域名实名认证和域名备案的确是有区别的，前者是对域名所...

带你一起盘点，Pandas1.0的主要功能

推荐图文

好笑的QQ说说：你脑袋装的全都是屎么？我脑袋装的全

摊牌了！策略模式在项目设计中用的多吗？

工商局宣布企业可用数字作商号数字域名好日子来了

一篇文章，搞明白异步和多线程

对于Python编程者最有用和最常见的模块

Java基础入门之Object类、匿名内部类、构造方法的继

随机推荐

像专业人士一样使用Google搜索

SLS新版告警入门-监控主机CPU异常

2021年优秀日志可视化工具

Javascript 中的解构赋值语法

浅谈Mysql原理与优化（六）—— 主从复制

Pandas数据合并与拼接的5种方法

缓存系统稳定性 - 架构师峰会演讲实录

大数据基础：Spark工作原理及基础概念

微服务架构之雪崩效应

域名认证和备案区别

关于我们