Pandas 练习集:开源数据集免费练,边做边学数据分析

学 pandas 离不开真实数据集。这套开源练习把泰坦尼克号、苹果股价、广告投放等真实表格拆成一道道小任务,从筛选、分组到合并循序渐进。仓库免费、克隆即练、无需注册,英文指引但数据即语境,照着做就能上手数据分析。它适合想从“会语法”过渡到“会干活”的学习者。
它解决什么问题
语法背了一堆,遇到真实表格还是不会下第一刀。
缺带答案的数据集练手,自己造数据太费劲。
想做分组聚合、透视却不知从哪道题开始。
核心能力
| 能力 | 具体能做到什么 |
|---|---|
| 真实数据 | 泰坦尼克、股价等真实表格,语境比玩具数据强 |
| 分层任务 | 从基础筛选到高级合并,难度自然递进 |
| 带答案 | 每题有参考解法,做完可对照更优写法 |
| 即克隆 | git clone 后本地 Jupyter 直接跑,零门槛 |
| 覆盖广 | 分组、透视、时间序列、字符串处理都涉及 |
| 可扩展 | 开源允许你往里加自己的数据集和题 |

它把“数据清洗”拆成可一口一口吃的小任务
这套练习的巧思在于用真实又不太大的数据集降低畏难感。比如泰坦尼克号那组,先让你筛出某舱位乘客,再让你按性别分组算存活率,最后做透视——每一步都是真实分析里会遇到的动作。学习者不必先懂整套方法论,跟着任务走就能把 filter、groupby、pivot 用熟,形成“看到表格就知道该调哪个函数”的反应。
建议先做基础篇建立手感,再回头专攻自己薄弱的合并与透视。要注意部分数据集需联网或随仓库附带,克隆后先确认文件齐了再开跑。离线方面,整套仓库下载后无网也能练,但首次运行依赖本地装好 pandas。它和 NumPy 百题是搭档:数组打底,表格实战,两条线合起来才算真正入门数据分析。

同类工具怎么选
| 工具 | 授权 | 差别在哪 |
|---|---|---|
| 100 NumPy Exercises | 开源免费 | 主攻数组层,适合在 pandas 之前打基础。 |
| Kaggle 数据集 | 免费闭源 | 真实数据更多更大,但需自己设计题目。 |
| Python Data Science Handbook | 开源免费 | 理论更系统,可作为边练边查的参考书。 |
谁适合用
- 学完 pandas 语法、急需真实数据集练手的自学者
- 做数据分析岗前准备、想积累实战题感的求职者
- 开设数据分析实训课、需要现成作业素材的老师
怎么开始
- git clone 仓库到本地,确认 datasets 文件夹齐全。
- 从 01_Read_Data 开始,按顺序打开每个 notebook。
- 先自己写解法,再展开答案对比思路差异。
- 把分组、合并、透视这几类题目标记重点练。
- 本地装好 pandas 后跑答案,验证运行环境。
常见问题
要付费吗?
不要。整套开源免费,克隆和打印都不收费。
要注册吗?
不用。GitHub 匿名即可克隆,无需登录账号。
有中文吗?
指引为英文,但任务直白、数据自解释;可配中文教程辅助。
需要先学 NumPy 吗?
建议先。pandas 建在 NumPy 之上,数组基础牢了学起来更顺。
授权与合规
Pandas 练习集以 MIT 协议开源,题目与数据集都在 GitHub,可自由下载使用。 官网:github.com/guipsamora/pandas_exercises。
继续找同类资源
这条属于「学习资料」栏目,同栏目还有更多可直接使用的免费资源,可以在 学习资料全部资源 里按需翻阅。
相关资源
同栏目下这几条也常被一起翻到:
↓ 获取资源
点击按钮直接前往资源页面。