news 2026/9/2 22:06:10

系外行星发现方式与类地候选分析(基于2025年更新的5,986颗确认行星:可视化、无监督聚类与时间留出分类)

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
系外行星发现方式与类地候选分析(基于2025年更新的5,986颗确认行星:可视化、无监督聚类与时间留出分类)

1. 研究背景

系外行星是太阳系之外环绕恒星运行的行星。由于行星本身相对暗弱,研究者通常通过恒星亮度周期性下降、恒星光谱的往复位移、引力透镜增亮或直接成像等间接证据确认它们。不同方法对行星半径、质量、轨道周期、宿主亮度与观测几何的敏感度不同,因此任何确认目录都同时反映银河系中的行星总体与人类的观测策略。NASA Exoplanet Archive持续更新确认记录,本案例采用Kaggle于2025年6月整理的快照,便于得到可重复的固定样本。

Kaggle同类分析通常展示发现年份、方法数量和行星尺寸分布。本报告在复现这些常见内容的基础上,进一步比较方法偏差、宿主恒星结构、天球观测足迹与多行星系统,并用聚类刻画测量完整子样本、用时间留出分类检验两种主流发现方法的差异是否在后期样本中仍然稳定。

2. 研究意义

科学传播意义|用数据解释“确认数量”不等于“真实丰度”,避免把望远镜任务留下的观测足迹误读为宇宙空间差异。

方法训练意义|完整展示高缺失科学目录的字段选择、单位换算、对数尺度、聚类选择、时间切分和不平衡评估。

3. 研究问题与实证路径

研究依次回答五个问题:确认数量如何随时间和任务变化;发现方法对应怎样的尺寸、质量、周期和距离偏差;宿主恒星及天球位置呈现何种观测结构;哪些记录落在温和小尺寸参数区间;聚类与分类能否用可解释方式概括测量完整子样本。实证过程遵循“质量审计—描述统计—观测偏差—候选筛选—无监督画像—时间留出分类—边界解释”的顺序。

4. 数据覆盖与缺失结构

raw = pd.read_csv('系外行星确认目录_2025.csv', low_memory=False) missing = raw.isna().mean().mul(100).sort_values(ascending=False) annual = raw.groupby('discovered').size() print(raw.shape, missing.head(12))

目录包含5,986颗已确认行星,发现年份从1992年延伸至2025年,20142016年的批量确认峰值非常突出;2025年只有截至6月的69条记录,不能与完整年份直接比较。98个字段的可用程度差异巨大:恒星距离、轨道周期、恒星质量和有效温度的缺失率约为4%—9%,可以支持主体比较;质量缺失约65%,温度估算缺失约67%;反照率、几何参数和精细误差字段多在90%以上。

5.发现历史与累计确认

度曲线表明确认速度并非平滑增长,而是由任务周期和目录发布节奏共同驱动。1990年代以少量地面径向速度发现为主,2009Kepler发射后凌星候选大量积累,并在2014年和2016年出现8681,513颗的批量确认峰值;累计数量因此呈阶梯式跨越1,0003,0005,000颗。

6.发现方法如何随时代更替

annual_method = (df.groupby(['discovered','method_group']) .size().unstack(fill_value=0)) annual_method.plot.area(stacked=True) plt.xlabel('发现年份'); plt.ylabel('确认数量'); plt.show()

7. 不同发现方法对应不同的可观测行星

4发现方法的数量、半径、周期与距离比较

凌星法共有4,479颗,数量远高于其他方法,半径中位数约2.42R⊕、周期中位数约8.26天,说明反复穿过恒星盘面的短周期小行星更容易积累多次信号。径向速度法样本的半径中位数约11.94R⊕、周期中位数约269天、宿主距离中位数约42pc,更偏向近邻和大质量对象;直接成像与微引力透镜覆盖更长周期或更远距离,但样本较少且半径字段不完整。

8. 行星半径与教学尺寸类型

df['radius_earth'] = df['radius'] * 11.209 bins = [0, 1.5, 2, 6, 15, np.inf] labels = ['地球尺寸','超级地球','海王星型','气态巨行星','超大/异常值'] df['size_group'] = pd.cut(df.radius_earth, bins=bins, labels=labels) df['size_group'].value_counts().plot.barh(); plt.show()

半径可用的4,568颗行星中,2—6R⊕的海王星型教学组约1,916颗,是最大的可测半径子群;地球尺寸和超级地球组分别约929734颗,6—15R⊕气态巨行星约773颗,另有216颗超过15R⊕的超大值或异常记录。

9. 轨道周期揭示方法灵敏度

10. 半径—周期平面中的观测足迹

11. 质量—半径关系与密度暗示

在质量和半径均为正的约1,400条完整记录中,质量半径总体呈正相关,但不同半径区间的离散程度很大:小尺寸区域更接近高密度岩石行星尺度,海王星和木星尺度对象的半径增长相对饱和,质量却可跨越多个数量级;右图显示相对密度代理随半径增大总体下降。

12. 宿主恒星温度与光谱类型

13. 恒星—行星关系中的方法差异

14. 全天分布显示望远镜看向哪里

sky = df.dropna(subset=['ra','dec']).copy() sky['ra_centered'] = np.deg2rad(((sky.ra + 180) % 360) - 180) sky['dec_rad'] = np.deg2rad(sky.dec) ax = plt.figure(figsize=(11, 5.7)).add_subplot(111, projection='aitoff') ax.scatter(-sky.ra_centered, sky.dec_rad, s=5, alpha=.4); ax.grid(True)

Aitoff投影显示确认行星在天球上高度不均匀:Kepler长期凝视的小天区形成紧密高密度斑块,银河系中心方向聚集微引力透镜事件,TESS及地面巡天则带来更广的全天覆盖。不同颜色对应发现方法,使同一片天空中的任务足迹更容易识别。

15. 宿主距离进一步揭示方法偏差

16. 温和小尺寸候选:规则筛选而非宜居确认

17. 多行星系统的确认结构

18. K-Means行星画像

X = df[['radius_earth','orbital_period','semi_major_axis','mass']] X = X.apply(lambda s: np.log10(s.where(s > 0))).dropna() Z = StandardScaler().fit_transform(X) labels = KMeans(4, n_init=100, random_state=42).fit_predict(Z) xy = PCA(2, random_state=42).fit_transform(Z)

聚类仅使用质量、半径、轨道周期和半长轴均为正的1,432颗行星,对四个变量先取log10并标准化。轮廓系数在k=3时约0.506最高,但k=4仍为0.485,并能得到更清晰的短周期热木星、温暖亚海王星、较长周期气态巨行星和紧凑小质量行星四类:对应样本数分别为69740381251

19. 时间留出分类、结论与研究边界

20. 结论

本案例证明,系外行星确认目录最鲜明的结构来自观测技术、任务年代和目标选择:凌星法塑造了短周期小行星主体,径向速度法强化了近邻大质量样本,Kepler、TESS和微透镜巡天在时间与天空中留下清晰足迹。26颗温和小尺寸对象是透明、可复现的教学筛选;四类聚类画像与高性能分类进一步量化了样本结构,但都不能越过观测偏差推断真实丰度或宜居性。

局限与改进:量和温度缺失严重,2025年为部分年度,目录缺少统一探测效率、目标恒星母体和测量不确定性。后续可接入NASA最新档案、按巡天建立完备性权重,并以概率模型处理参数误差。

具体细节见原文

创造不易,谢谢各位多多点赞收藏!

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/2 22:05:07

用DeepSeek API构建字幕翻译工作流:从SRT解析到批量翻译

字幕翻译是个很典型的场景:人工翻译整集速度太慢,直接丢给通用翻译工具又容易翻译腔。这次我们以《恶魔君 1989》第28集为例,讲一条可以直接落地的英转中字幕流水线,核心工具是 DeepSeek 的 API。这个需求的本质不复杂&#xff1a…

作者头像 李华
网站建设 2026/9/2 22:04:28

软件测试转岗嵌入式机器人芯片测试:15天实战路线

开头先说明一下:这不是一篇职业鸡汤,也不是教你“躺平 15 天翻身”的速成神话。而是想结合一个很现实的场景——软件测试岗位收缩、部分测试同学面临转岗或重新择业——来聊聊嵌入式、机器人、芯片测试方向到底需要什么基础,以及如何在短时间…

作者头像 李华
网站建设 2026/9/2 22:02:52

在网上买的流量卡靠谱吗?

网上买流量卡的话,不要只贪图低月租、大流量的这类套餐了,例如9块或19块 流量300G之类的,这类几乎就是假的。保号8块,9块的卡就是1块买300G流量,你觉得可能吗?即使有19块的一般时间也不会长,29块…

作者头像 李华
网站建设 2026/9/2 22:02:41

用天气数据与Python构建防蚊预警提醒工具

看到“因天气恶劣,蚊虫滋生,各位猎人们出门记得防蚊”这句话时,我所在的玩家社群里,正被连续几天的暴雨和高温轮流折腾。大家前一秒还在讨论配装和任务路线,下一秒就开始抱怨小区楼下的蚊子多得有点夸张。两件事在夏天…

作者头像 李华
网站建设 2026/9/2 22:02:04

用Java给天猫精灵开发智能音箱技能:从鹦鹉爱上音箱到场景定制

前两天刷到一个帖子,标题叫“牡丹鹦鹉找回了真爱:会唱歌的天猫精灵”。一开始我以为又是什么搞笑段子,但点进去看,这居然是真事:一只落了单的牡丹鹦鹉,在主人把天猫精灵打开之后,像是突然找到了…

作者头像 李华
网站建设 2026/9/2 21:59:22

别再踩坑,DDR全新、拆机、翻新颗粒,90%采购都分不清

随着DDR3、DDR4再度成为市场紧俏货,价格持续上行,市场上流通的颗粒品类也变得鱼龙混杂。全新原装、拆机料、翻新料混杂在货源里,不少工控厂商、设备维修商、外贸采购踩坑:批量到货才发现死机、蓝屏、高温报错,到生产阶…

作者头像 李华