1. 研究背景
系外行星是太阳系之外环绕恒星运行的行星。由于行星本身相对暗弱,研究者通常通过恒星亮度周期性下降、恒星光谱的往复位移、引力透镜增亮或直接成像等间接证据确认它们。不同方法对行星半径、质量、轨道周期、宿主亮度与观测几何的敏感度不同,因此任何确认目录都同时反映银河系中的行星总体与人类的观测策略。NASA Exoplanet Archive持续更新确认记录,本案例采用Kaggle于2025年6月整理的快照,便于得到可重复的固定样本。
Kaggle同类分析通常展示发现年份、方法数量和行星尺寸分布。本报告在复现这些常见内容的基础上,进一步比较方法偏差、宿主恒星结构、天球观测足迹与多行星系统,并用聚类刻画测量完整子样本、用时间留出分类检验两种主流发现方法的差异是否在后期样本中仍然稳定。
2. 研究意义
科学传播意义|用数据解释“确认数量”不等于“真实丰度”,避免把望远镜任务留下的观测足迹误读为宇宙空间差异。
方法训练意义|完整展示高缺失科学目录的字段选择、单位换算、对数尺度、聚类选择、时间切分和不平衡评估。
3. 研究问题与实证路径
研究依次回答五个问题:确认数量如何随时间和任务变化;发现方法对应怎样的尺寸、质量、周期和距离偏差;宿主恒星及天球位置呈现何种观测结构;哪些记录落在温和小尺寸参数区间;聚类与分类能否用可解释方式概括测量完整子样本。实证过程遵循“质量审计—描述统计—观测偏差—候选筛选—无监督画像—时间留出分类—边界解释”的顺序。
4. 数据覆盖与缺失结构
raw = pd.read_csv('系外行星确认目录_2025.csv', low_memory=False) missing = raw.isna().mean().mul(100).sort_values(ascending=False) annual = raw.groupby('discovered').size() print(raw.shape, missing.head(12))目录包含5,986颗已确认行星,发现年份从1992年延伸至2025年,2014与2016年的批量确认峰值非常突出;2025年只有截至6月的69条记录,不能与完整年份直接比较。98个字段的可用程度差异巨大:恒星距离、轨道周期、恒星质量和有效温度的缺失率约为4%—9%,可以支持主体比较;质量缺失约65%,温度估算缺失约67%;反照率、几何参数和精细误差字段多在90%以上。
5.发现历史与累计确认
度曲线表明确认速度并非平滑增长,而是由任务周期和目录发布节奏共同驱动。1990年代以少量地面径向速度发现为主,2009年Kepler发射后凌星候选大量积累,并在2014年和2016年出现868与1,513颗的批量确认峰值;累计数量因此呈阶梯式跨越1,000、3,000和5,000颗。
6.发现方法如何随时代更替
annual_method = (df.groupby(['discovered','method_group']) .size().unstack(fill_value=0)) annual_method.plot.area(stacked=True) plt.xlabel('发现年份'); plt.ylabel('确认数量'); plt.show()7. 不同发现方法对应不同的可观测行星
图4发现方法的数量、半径、周期与距离比较
凌星法共有4,479颗,数量远高于其他方法,半径中位数约2.42R⊕、周期中位数约8.26天,说明反复穿过恒星盘面的短周期小行星更容易积累多次信号。径向速度法样本的半径中位数约11.94R⊕、周期中位数约269天、宿主距离中位数约42pc,更偏向近邻和大质量对象;直接成像与微引力透镜覆盖更长周期或更远距离,但样本较少且半径字段不完整。
8. 行星半径与教学尺寸类型
df['radius_earth'] = df['radius'] * 11.209 bins = [0, 1.5, 2, 6, 15, np.inf] labels = ['地球尺寸','超级地球','海王星型','气态巨行星','超大/异常值'] df['size_group'] = pd.cut(df.radius_earth, bins=bins, labels=labels) df['size_group'].value_counts().plot.barh(); plt.show()半径可用的4,568颗行星中,2—6R⊕的海王星型教学组约1,916颗,是最大的可测半径子群;地球尺寸和超级地球组分别约929与734颗,6—15R⊕气态巨行星约773颗,另有216颗超过15R⊕的超大值或异常记录。
9. 轨道周期揭示方法灵敏度
10. 半径—周期平面中的观测足迹
11. 质量—半径关系与密度暗示
在质量和半径均为正的约1,400条完整记录中,质量—半径总体呈正相关,但不同半径区间的离散程度很大:小尺寸区域更接近高密度岩石行星尺度,海王星和木星尺度对象的半径增长相对饱和,质量却可跨越多个数量级;右图显示相对密度代理随半径增大总体下降。
12. 宿主恒星温度与光谱类型
13. 恒星—行星关系中的方法差异
14. 全天分布显示望远镜看向哪里
sky = df.dropna(subset=['ra','dec']).copy() sky['ra_centered'] = np.deg2rad(((sky.ra + 180) % 360) - 180) sky['dec_rad'] = np.deg2rad(sky.dec) ax = plt.figure(figsize=(11, 5.7)).add_subplot(111, projection='aitoff') ax.scatter(-sky.ra_centered, sky.dec_rad, s=5, alpha=.4); ax.grid(True)Aitoff投影显示确认行星在天球上高度不均匀:Kepler长期凝视的小天区形成紧密高密度斑块,银河系中心方向聚集微引力透镜事件,TESS及地面巡天则带来更广的全天覆盖。不同颜色对应发现方法,使同一片天空中的任务足迹更容易识别。
15. 宿主距离进一步揭示方法偏差
16. 温和小尺寸候选:规则筛选而非宜居确认
17. 多行星系统的确认结构
18. K-Means行星画像
X = df[['radius_earth','orbital_period','semi_major_axis','mass']] X = X.apply(lambda s: np.log10(s.where(s > 0))).dropna() Z = StandardScaler().fit_transform(X) labels = KMeans(4, n_init=100, random_state=42).fit_predict(Z) xy = PCA(2, random_state=42).fit_transform(Z)聚类仅使用质量、半径、轨道周期和半长轴均为正的1,432颗行星,对四个变量先取log10并标准化。轮廓系数在k=3时约0.506最高,但k=4仍为0.485,并能得到更清晰的短周期热木星、温暖亚海王星、较长周期气态巨行星和紧凑小质量行星四类:对应样本数分别为697、403、81和251。
19. 时间留出分类、结论与研究边界
20. 结论
本案例证明,系外行星确认目录最鲜明的结构来自观测技术、任务年代和目标选择:凌星法塑造了短周期小行星主体,径向速度法强化了近邻大质量样本,Kepler、TESS和微透镜巡天在时间与天空中留下清晰足迹。26颗温和小尺寸对象是透明、可复现的教学筛选;四类聚类画像与高性能分类进一步量化了样本结构,但都不能越过观测偏差推断真实丰度或宜居性。
局限与改进:量和温度缺失严重,2025年为部分年度,目录缺少统一探测效率、目标恒星母体和测量不确定性。后续可接入NASA最新档案、按巡天建立完备性权重,并以概率模型处理参数误差。
具体细节见原文
创造不易,谢谢各位多多点赞收藏!