你好,我是悦创。
pandas 是一款开放源码的 bsd 许可的 python 库,为 python 编程语言提供了高性能,易于使用的数据结构和数据分析工具。pandas 用于广泛的领域,包括金融,经济,统计,分析等学术和商业领域。在本教程中,我们将学习 python pandas 的各种功能以及如何在实践中使用它们。
python pandas的官方网站是: http://pandas.pydata.org/ ,打开后如下所示 -
pandas 是一个开放源码的 python 库,它使用强大的数据结构提供高性能的数据操作和分析工具。它的名字:pandas 是从 panel data - 多维数据的计量经济学( an econometrics from multidimensional data)。
2008 年,为满足需要高性能,灵活的数据分析工具,开发商 wes mckinney 开始开发 pandas。
在 pandas 之前,python 主要用于数据迁移和准备。它对数据分析的贡献更小。 pandas 解决了这个问题。 使用 pandas 可以完成数据处理和分析的五个典型步骤,而不管数据的来源 - 加载,准备,操作,模型和分析。
python pandas用于广泛的领域,包括金融,经济,统计,分析等学术和商业领域。
快速高效的 dataframe 对象,具有默认和自定义的索引。
将数据从不同文件格式加载到内存中的数据对象的工具。
丢失数据的数据对齐和综合处理。
重组和摆动日期集。
基于标签的切片,索引和大数据集的子集。
可以删除或插入来自数据结构的列。
按数据分组进行聚合和转换。
高性能合并和数据加入。
时间序列功能。
本教程为准备学习 pandas 基础知识和各种功能的人员而做准备的。它对数据清理和分析的人员特别有用。 完成本教程之后,将发现自己处于适度的专业知识水平,可以从中获得更高水平的专业知识。
要求对计算机编程术语有一个基本的了解。 对任何编程语言的基本了解是一个加分。pandas库使用numpy的大部分功能。建议在继续本教程之前,先阅读 numpy 的教程( python科学计算:用numpy快速处理数据 )。之后也会出 numpy 系列专栏。