用 Planetary Computer Explorer 探索地球观测数据:Data Science for Beginners 可持续性实战任务全解析
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
本篇技术指南围绕 Data-Science-For-Beginners 课程第 20 课《Data Science in the Real World》的课后实战任务展开,任务核心是引导学习者使用 Microsoft Planetary Computer 平台的 Explorer 无代码界面,对地球观测(Earth Observation)数据集进行选取、查询与可视化,并围绕可持续性目标完成一组结构化的数据洞察分析。读完本文,你将掌握 Explorer 界面三大操作(选数据集、预设查询、渲染选项)的完整用法,学会用五个维度评估一张地理数据可视化(特征、洞察、影响、局限、替代方案),并了解通过 Launch Hub 进入 Notebook 进行交互式原始数据分析的进阶路径。
任务背景:数据科学与可持续性
本任务对应的课程正文(见 英文 README 与 捷克语 README)讨论了数据科学在工业、研究、数字人文与可持续性四大领域的落地场景。其中"可持续性"部分指出:2015 年联合国全体成员国通过的《2030 年可持续发展议程》列出了 17 项发展目标,其中包含保护地球免受退化与气候变化影响的主题;Microsoft Sustainability 倡议则围绕 2030 年实现"碳负排放、水正效益、零废弃、保护生物多样性"四个目标展开。
要在规模化与及时性的前提下应对这些挑战,需要云规模的计算思维与海量数据支撑。这正是 Planetary Computer 项目存在的意义——课程将该项目定位为帮助数据科学家与开发者参与可持续性解决方案的开放平台。任务文档(捷克语任务原文、英文任务原文)指出:Planetary Computer 提供数据集与 API,通常需要申请账户才能访问;但其 Explorer 功能无需创建账户即可直接使用,因此成为本任务的主要工具。
理解 Planetary Computer 的四件套
在动手使用 Explorer 之前,先建立对 Planetary Computer 整体架构的认知。根据课程正文,该平台由四个相互配合的组件构成:
| 组件 | 定位与作用 |
|---|---|
| Data Catalog(数据目录) | 托管 PB 级(petabytes)地球系统数据,免费且由 Azure 托管,是数据集的统一入口 |
| Planetary API | 基于 STAC(SpatioTemporal Asset Catalog)规范的检索接口,帮助用户按空间与时间维度搜索相关数据 |
| Hub | 面向科学家的托管环境,用于处理大规模地理空间数据集,对应任务中的 Launch Hub 选项 |
| Applications(应用) | 展示可持续性洞察的用例与工具,可提供应用灵感 |
本任务聚焦的是第一个组件的数据浏览入口——Explorer。需要注意的是,课程文档撰写时(README 中标注截至 2021 年 9 月)Planetary Computer 项目尚处于预览阶段,功能与数据目录可能随平台迭代而变化,实操时以平台当前界面为准。
Explorer 界面三大操作:选择、查询、渲染
任务文档明确描述了 Explorer 界面(如下图所示)的核心交互方式:它由左侧控制面板与右侧交互式地图两大部分组成,控制面板提供三个下拉菜单,分别对应数据探索的三个环节:
- 选择数据集(Select a dataset to visualize):从平台提供的候选数据集中挑选一个感兴趣的对象,例如植被指数、地表覆盖、人口分布、气候再分析等地球观测产品。
- 选择预设查询(Select a preset query to find data):在选定数据集后,用预设查询对数据进行过滤,例如按时间范围、地理区域或特定波段条件缩小数据范围。
- 选择渲染选项(Select a rendering option):决定数据在地图上的呈现方式,例如彩色合成、单波段灰度、分类着色等,以生成与研究问题匹配的可视化。
界面右侧是带缩放(+/-)、全屏、搜索与设置等交互控件的地图视窗,用于展示渲染结果;底部还有 Reset(重置)按钮,可一键清空当前选择回到初始状态。
下面这张界面截图正是任务文档中所引用的 Explorer 实拍(捷克语版本界面)。左侧面板自上而下依次是数据集选择、预设查询选择与渲染选项选择三个下拉框,右侧地图默认展示欧亚非与两大洋区域,右上角为地图交互控件——这直观地说明了 Explorer"三步出图"的极简工作流:不写一行代码,也能完成从数据到可视化的完整链路。
任务三步走:从文档到目录再到实操
任务文档给出了循序渐进的三个步骤,建议严格按此顺序执行,先建立认知再动手操作:
- 阅读 Explorer 文档:先通读平台的 Explorer 使用说明,理解各选项的确切含义与行为,避免在界面上盲目试探。重点是弄清三个下拉菜单之间的联动关系——数据集决定可用的查询与渲染选项集合,查询决定渲染数据的范围与内容。
- 浏览数据集目录:进入数据集 Catalog,逐一了解每个数据集的用途、覆盖区域、时间跨度与更新频率。这一步的价值在于建立"数据选型"意识:面对可持续性研究问题,应当选择什么样的数据集作为分析基础。
- 使用 Explorer 实操:结合前两步的认知,挑选一个真正感兴趣的数据集,选择与你的研究问题相关的预设查询和渲染选项,在地图中生成第一张可视化,然后进入下一节的分析环节。
五个核心分析问题:把可视化读成结论
任务的关键产出不是一张图,而是对这张图的深度解读。生成可视化后,需要逐一回答以下五个问题——它们共同构成了一套可复用的"地理数据可视化评估框架":
① 数据集有哪些特征(features)?描述数据集本身的属性:包含哪些波段或字段、空间分辨率与覆盖范围、时间粒度、数据来源与处理级别等。这是后续所有解读的事实基础。
② 可视化提供了哪些洞察或结果?聚焦图本身传递的信息:观察到的空间分布模式、区域差异、异常值、时间趋势等。回答时尽量具体,例如"某个区域的植被指数明显偏低"而非笼统的"数据看起来有差异"。
③ 这些洞察对项目的可持续性目标有何影响?把洞察与可持续性议题建立显式联系:如果观察到森林覆盖变化,它如何关联碳减排或生物多样性保护目标;如果看到水体分布异常,它如何影响水正效益目标。这是任务区别于一般可视化练习的核心——数据必须服务于可持续性叙事。
④ 可视化的局限是什么(即你没能获得哪些洞察)?主动反思当前呈现方式的盲区:可能是分辨率不足以识别小尺度变化,可能是预设查询过滤掉了关键时间段,可能是渲染方式掩盖了数值分布,也可能是缺少对比数据而无法判断趋势方向。承认局限是数据分析成熟度的体现。
⑤ 如果拿到原始数据,你会设计哪些替代可视化,为什么?提出改进方案并给出理由:例如用直方图或密度图揭示数值分布、用时间序列折线图展示变化趋势、用散点图探索两个变量(如温度与植被)的关系、用分类对比图(按行政区域或生物群落分面)揭示组间差异。这一步将 Explorer 的无代码体验与课程此前各课学到的 matplotlib、pandas 等可视化技能(见 3-Data-Visualization 与 07-python)衔接起来。
加分任务:从 Explorer 到 Hub 的完整数据科学闭环
无账户的 Explorer 只能完成"看图"环节;如果想要真正动手分析原始数据,任务文档提供了加分路径——这同时也是从"可视化消费者"升级为"数据分析师"的关键一步:
- 申请账户:在平台提交访问申请,审核通过后登录。
- 使用 Launch Hub 打开原始数据:在 Explorer 中通过 Launch Hub 选项,将当前选定的数据集直接加载进托管 Notebook 环境(即平台四组件中的 Hub),原始数据将以可编程对象的形式就绪。
- 交互式探索并实现替代可视化:在 Notebook 中利用 Python 生态(pandas 做数据整理、numpy 做数值计算、matplotlib 做绘图,参见 examples 中的基础示例)复现你在第五问中设想的替代可视化。
- 对比复盘:分析你自己的可视化结果——此前在 Explorer 中缺失的洞察,是否通过自定义可视化被成功补回?如果没有,原因是什么?这个"假设—验证—复盘"的循环,正是数据科学真实工作流的微缩模型。
评分标准:怎样算高质量完成
任务文档末尾给出了三档评价标准,可作为自检清单:
| 等级 | 标准 |
|---|---|
| 优秀(Exemplary) | 五个核心问题全部作答,且清晰说明当前可视化与替代可视化如何共同服务于可持续性目标或结果的洞察 |
| 合格(Adequate) | 至少前三个问题有详细回答,能证明对 Explorer 有实际使用经验 |
| 需改进(Needs Improvement) | 多个问题未作答,或回答缺乏细节——表明未对任务进行有意义的投入 |
由此可以看出,评分的天平明显偏向"深度"而非"数量":与其面面俱到地浅谈,不如围绕一个数据集把五个问题层层推进,并始终让讨论回到可持续性这个主题锚点。
任务关联资源速查
本任务在仓库中的全部关联材料整理如下,便于按需取用:
- 任务原文(英文):6-Data-Science-In-Wild/20-Real-World-Examples/assignment.md
- 任务原文(捷克语,即本文依据的文档):translations/cs/6-Data-Science-In-Wild/20-Real-World-Examples/assignment.md
- 课程正文(英文):6-Data-Science-In-Wild/20-Real-World-Examples/README.md
- 课程正文(捷克语):translations/cs/6-Data-Science-In-Wild/20-Real-World-Examples/README.md
- 课程小结图:可持续性主题见 sketchnotes/20-DataScience-Sustainability.png,课程总览见 sketchnotes/20-DataScience-RealWorld.png
- 可视化基础知识支撑:本任务第五问所需的 Python 可视化技能可回看 3-Data-Visualization 各课的 notebook,基础代码范式见 examples
完成本任务后,你就完整走过了"平台选数 → 无代码可视化 → 结构化解读 → 数据驱动验证"这一可持续性数据科学的入门闭环——这正是课程把 Planetary Computer 选作最后一课实战对象的原因:它用真实的地球系统数据,把此前所有课程的知识点收束到一个真实可感的场景里。
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考