news 2026/9/26 0:07:33

如何用这份免费预测市场数据集做学术研究?6篇引用prediction-market-analysis的论文导读

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
如何用这份免费预测市场数据集做学术研究?6篇引用prediction-market-analysis的论文导读

如何用这份免费预测市场数据集做学术研究?6篇引用prediction-market-analysis的论文导读

【免费下载链接】prediction-market-analysisA framework for collecting and analyzing prediction market data, including the largest publicly available dataset of Polymarket and Kalshi market and trade data.项目地址: https://gitcode.com/gh_mirrors/pr/prediction-market-analysis

prediction-market-analysis 是一个免费的预测市场数据分析框架,内置目前公开规模最大的 Polymarket 与 Kalshi 预测市场数据集(压缩后 36 GiB),并提供数据采集、Parquet 存储与开箱即用的分析脚本。本文带你快速了解:这份免费预测市场数据集里有什么、3 步跑通第一个分析,以及 6 篇已引用它的学术论文各自研究了什么问题 📊

免费预测市场数据集:数据里到底有什么

数据以Parquet格式存放在data/目录,用 DuckDB 直接写 SQL 就能查询,覆盖两大预测市场平台:

平台数据内容存储位置关键特点
Kalshi市场元数据 + 逐笔成交data/kalshi/markets、data/kalshi/trades价格为美分(1–99),含taker_side(吃单方向)与市场最终结果
Polymarket市场元数据 + 链上成交data/polymarket/markets、data/polymarket/trades来自 Polygon 链OrderFilled事件,含 maker/taker 地址、手续费;另有 2020–2022 年早期 FPMM 交易

完整字段定义(如yes_price、result、taker、block_number)都在 docs/SCHEMAS.md 里,建议下载数据前先读一遍。

快速上手:3 步下载预测市场数据集并跑通分析

第 1 步:获取项目代码

git clone https://gitcode.com/gh_mirrors/pr/prediction-market-analysis

第 2 步:安装依赖(需 Python 3.9+)

uv sync

第 3 步:下载数据集并运行分析

make setup # 一键下载并解压 36 GiB 数据集到 data/ make analyze # 打开交互式菜单,选择要跑的分析

make setup由 scripts/download.sh 完成下载解压、scripts/install-tools.sh 安装依赖工具(aria2c/zstd 等);所有命令定义在 Makefile 中。分析结果(PNG、PDF、CSV、JSON)统一输出到output/目录,论文级 300 DPI 图表开箱即得 📈

6 篇引用 prediction-market-analysis 的预测市场论文导读

以下 6 篇论文收录于 README.md 的 "Research & Citations" 章节,展示了这份数据集在学术研究中的真实用法:

#论文作者来源核心研究问题
1The Microstructure of Wealth Transfer in Prediction MarketsBecker独立研究财富如何在市场参与者之间转移(市场微观结构)
2Who Profits from Prediction Markets? Execution, not InformationVedovaSSRN盈利来自交易执行能力还是信息优势?
3Who Wins and Who Loses In Prediction Markets? Evidence from PolymarketAkey, Gregoire, Harvie, MartineauSSRNPolymarket 上赢家和输家分别是谁?
4Cassandra Or the Boy Who Cried Wolf?BrownSSRN预测市场价格/量能能否作为"预警信号"?
5Decomposing Crowd Wisdom: Domain-Specific Calibration DynamicsLearXiv"集体智慧"在不同领域中的校准表现差异
6Exploring Decentralized Prediction Markets: Accuracy, Skill, and Bias on PolymarketReichenbach, WaltherSSRN去中心化预测市场的准确性、技巧与偏差

1️⃣ 市场微观结构与财富转移(Becker, 2026)

这是项目作者本人的研究,也是这份数据集的"原始论文",适合作为新手入门的第一篇。它研究在预测市场微观层面,财富如何在挂单方(maker)与吃单方(taker)之间转移。仓库里甚至保留了支撑论文论断的完整统计检验脚本 src/analysis/kalshi/statistical_tests.py,包括"maker 单笔成交是否大于 taker""NO 是否系统性跑赢 YES"等命题——跟着它读,你能学到一份预测市场实证研究的标准姿势。

2️⃣ 谁在预测市场里赚钱:执行,而非信息(Vedova, 2026)

论文标题直接给出结论倾向:在预测市场赚到钱的,靠的是执行(下单时机、挂单策略)而不是私有信息。数据集的逐笔成交记录(价格、方向、maker/taker 角色)恰好支持这类检验,仓库内置的 src/analysis/kalshi/maker_vs_taker_returns.py 就对比了被动挂单方与主动吃单方在各价格档的收益,可作为复现起点。

3️⃣ Polymarket 的赢家与输家(Akey 等, 2026)

从 Polymarket 的链上交易出发,刻画盈利分布:哪些地址在赢、哪些在输。由于 Polymarket 交易数据保留了maker/taker钱包地址与成交金额,按账户聚合收益是可行的,这也是链上数据相对传统交易所 API 的独特优势。

4️⃣ 预测市场是有效的预警系统吗?(Brown, 2026)

标题借用"卡珊德拉"与"狼来了"的典故,探讨预测市场能否提前预警重大事件:价格是"真信号"还是"狼来了"?研究切入口是价格与成交量的时间序列,仓库内置的成交量随时间变化、VWAP 分小时等分析(如 src/analysis/kalshi/volume_over_time.py、src/analysis/kalshi/vwap_by_hour.py)与这类问题的数据处理高度相关。

5️⃣ 拆解集体智慧:分领域的校准动态(Le, 2026)

"群体智慧"在不同领域里究竟有多准?这篇论文按领域拆解市场**校准(calibration)**动态——即报价概率与最终兑现率的偏差如何随领域、时间变化。数据集支持按市场类别分组(如体育、政治、加密),src/analysis/kalshi/util/categories.py 提供了现成的分类工具;校准曲线则对应 src/analysis/kalshi/win_rate_by_price.py(按价格档位)与 src/analysis/polymarket/polymarket_calibration_by_bucket.py(按概率十分位桶,标准校准曲线格式)。

6️⃣ 去中心化预测市场的准确性、技巧与偏差(Reichenbach & Walther, 2025)

聚焦 Polymarket 这一去中心化平台:报价是否准确、交易者是否具备"技巧"、系统性偏差(如长尾偏差)有多大。切入口同样是校准检验与价格-胜率分析,仓库中 Polymarket 侧的胜率与校准脚本可直接作为数据分析起点。

如何扩展自己的分析:内置脚本与自定义指南

make analyze打开交互式菜单,可运行全部或单个分析,主要内置分析包括:

  • Kalshi:价格胜率/校准(win_rate_by_price.py)、YES/NO 期望价值对比(ev_yes_vs_no.py)、maker 与 taker 收益(maker_vs_taker_returns.py)、长尾盘成交量占比、成交规模与角色、分时段收益、统计检验(statistical_tests.py)等
  • Polymarket:价格胜率(polymarket_win_rate_by_price.py)、校准分桶(polymarket_calibration_by_bucket.py)、成交量与交易笔数时间序列等

要写自己的研究分析,只需继承 src/common/analysis.py 中的Analysis基类,模板、常用 SQL 查询模式(成交与结果关联、maker/taker 双视角)都在 docs/ANALYSIS.md 中。框架还通过make index提供持续采集能力:交互式选择 indexer 增量抓取 Kalshi API 与 Polygon 链上的新数据,进度自动保存、可中断续跑。

如何引用这份预测市场数据集 & 常见问题

引用建议:若你的研究使用了这份数据,可引用数据集论文Becker, J. (2026). The Microstructure of Wealth Transfer in Prediction Markets。作者欢迎邮件联系交流研究用途,也欢迎通过 Pull Request 把你的论文补充进 README 的引用列表——贡献指南见 CONTRIBUTING.md。

常见问题

  • ❓数据集收费吗?完全免费,make setup一键公开下载(压缩 36 GiB)。
  • ❓环境要求?Python 3.9+,依赖用uv管理(duckdb、pandas、matplotlib、scipy 等,见 pyproject.toml)。
  • ❓数据会过时吗?用make index即可从平台 API/链上增量补采最新市场与成交。

🎓小结:免费下载这份 Polymarket + Kalshi 预测市场数据集,配合内置分析脚本与 6 篇论文的研究框架,从校准、微观结构到赢家画像,你的第一篇预测市场研究论文已经万事俱备。

【免费下载链接】prediction-market-analysisA framework for collecting and analyzing prediction market data, including the largest publicly available dataset of Polymarket and Kalshi market and trade data.项目地址: https://gitcode.com/gh_mirrors/pr/prediction-market-analysis

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/26 0:07:25

无人茶室系统实战:Java Spring Boot预约与设备联动设计

把无人茶室这套系统从零到一落地,前后大概用了三周。项目本身不复杂,但“无人”两个字把所有压力都压在了后台——预约排期、订单计费、门锁联动、异常告警,哪一个环节断了,客人都会被关在门外。技术底座选了 Java,原因…

作者头像 李华
网站建设 2026/9/26 0:06:29

HTTP协议与www子域名的分层原理及工程避坑指南

1. 别再把“http://”和“www.”当成一回事了:一个被所有人忽略的底层认知断层你有没有点开过这样的链接:http://www.example.com,然后下意识觉得“哦,这是个网站”;接着又看到https://example.com,心想“这…

作者头像 李华
网站建设 2026/9/26 0:03:43

超低能耗建筑K值要求能否满足?浙东铝业建筑型材解析

核心摘要浙东铝业的超低能耗系统门窗产品,资料显示保温性能可达 K≤1.4W/(㎡K),能够对应上海地区超低能耗住宅对门窗保温性能的应用需求。判断建筑是否满足超低能耗要求,不能只看铝型材本身,还需要结合玻璃、隔热条、密封系统、开…

作者头像 李华
网站建设 2026/9/25 23:59:45

学校官网模拟全流程实践:从页面布局到后端接口与部署

如果你正在找一门 Web 大作业的题目,或者刚开始接触 Web 前端开发想做点能拿来展示的东西,“学校官网模拟”几乎是最稳的选择。题目看着简单,但要把导航、新闻列表、轮播 Banner、二级页面、后台数据都串起来,其实已经把前端布局、…

作者头像 李华