news 2026/5/11 6:15:49

【开题答辩全过程】以 基于Python的豆瓣图书聚类分析为例,包含答辩的问题和答案

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【开题答辩全过程】以 基于Python的豆瓣图书聚类分析为例,包含答辩的问题和答案

个人简介

一名14年经验的资深毕设内行人,语言擅长Javaphp、微信小程序、PythonGolang、安卓Android

开发项目包括大数据、深度学习、网站、小程序、安卓、算法。平常会做一些项目定制化开发、代码讲解、答辩教学、文档编写、也懂一些降重方面的技巧。

感谢大家的关注与支持!

答辩学生:各位老师好,我的课题是“基于Python的豆瓣图书聚类分析系统”。系统采用B/S架构,管理员可一键爬取豆瓣图书数据、做K-means聚类、生成Echarts可视化大屏;用户可按书名查询、查看聚类结果并导出Excel。后端用Python3.7+Django+Scrapy,大数据部分用Hadoop MapReduce,数据库用MySQL,前端用Vue.js,开发工具是PyCharm和Navicat。


评委老师:为什么选“豆瓣图书”做数据源?
答辩学生:豆瓣图书页面结构规范、字段完整,评分、评论数等区间标度变量丰富,方便做聚类,而且不用登录就能爬,技术门槛低。


评委老师:系统到底能给普通读者带来什么实际好处?
答辩学生:读者输入一本喜欢的书,系统会把同类书聚成一类,相当于免费“猜你喜欢”,减少挑书时间。


评委老师:用K-means算法需要提前指定聚类个数k,你准备怎么选?
答辩学生:先用“手肘法”画SSE曲线,找到拐点当k值,如果拐点不明显就再让管理员多试几个k,看哪组结果更容易解释。


评委老师:爬取数据量大时,如何避免被豆瓣封IP?
答辩学生:在Scrapy里加下载延迟、随机User-Agent、用IP代理池,控制每天总量不超过5000条,同时尊重robots协议。


评委老师:Hadoop在本项目里具体做什么?
答辩学生:当图书超过20万条时,用MapReduce并行计算每个标签的平均评分、评论数,加快统计速度,不然单机跑得太慢。


评委老师:可视化大屏主要展示哪些图?
答辩学生:聚类散点图、各簇平均评分柱状图、标签词云、评分分布饼图,四个图一页,管理员截屏就能放论文。


评委老师:如果某本书信息缺失评分,你怎么处理?
答辩学生:先补零会拉低均值,所以我用同标签下的平均分填补,如果同标签也不够,就直接删掉这条记录。


评委老师:系统测试打算怎么做?
答辩学生:分两步:功能测试用黑盒,管理员爬50条数据跑通聚类;性能测试用JMeter模拟100个用户同时查书,看页面能否在3秒内返回。


评委老师:进度安排里,哪一周最可能延期?
答辩学生:第6-8周做可视化,如果Echarts图表调样式卡壳,可能拖一周,我提前把代码模板找好,尽量不掉链子。


评委老师评价:xx同学选题贴近生活,技术路线清晰,能意识到数据缺失、性能等实际问题并给出简单可行对策,符合本科毕业设计难度。下一步按计划推进,注意及时备份数据和代码,预祝你顺利完成。


以上是某同学的毕业设计答辩的过程,如果你现在还没有参加答辩,还是开题阶段,已经选好了题目不知道怎么写开题报告,可以下面找找有没有自己符合自己题目的开题报告内容,列表中的开题报告都是往届真实的开题报告,可发送使用或参考。文末或底部来联xi可免费获取

最后

有时间和有基础的同学,建议自己多花时间找一下资料(开题报告、源码)自己独立完成毕设,需要开题报告内容、源码参考的,可以联xi博主,没有选题的也可以联系我们进行帮你选题定功能和建议

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/5/9 13:34:11

Jupyter中嵌入HTML实现交互式模型可视化操作

Jupyter中嵌入HTML实现交互式模型可视化操作 在现代AI研发实践中,一个常见的痛点是:模型跑得很快,但“看不清”它到底做了什么。研究人员和工程师们经常面对满屏的张量形状、损失曲线和准确率数字,却难以直观理解模型在处理一张图…

作者头像 李华
网站建设 2026/5/7 6:50:48

diskinfo监控NVMe健康状态预警TensorFlow故障

diskinfo监控NVMe健康状态预警TensorFlow故障 在深度学习项目中,一次完整的模型训练往往需要数小时甚至数天时间。当ResNet-50训练到第90个epoch时,进程突然崩溃——日志显示CheckPoint写入失败,而根本原因竟是底层NVMe磁盘因寿命耗尽导致的I…

作者头像 李华
网站建设 2026/5/10 20:04:21

如何监控TensorFlow-v2.9训练过程中的GPU利用率

如何监控TensorFlow-v2.9训练过程中的GPU利用率 在深度学习项目中,模型训练往往耗时数小时甚至数天。你有没有遇到过这样的情况:明明启用了GPU,但训练速度却迟迟上不去?任务提交后,只能干等着,不知道GPU到底…

作者头像 李华
网站建设 2026/5/10 9:08:46

重塑贝叶斯建模体验:Bambi——Python统计分析的智能革新者

重塑贝叶斯建模体验:Bambi——Python统计分析的智能革新者 【免费下载链接】bambi BAyesian Model-Building Interface (Bambi) in Python. 项目地址: https://gitcode.com/gh_mirrors/ba/bambi Bambi(BAyesian Model-Building Interface in Pyth…

作者头像 李华
网站建设 2026/5/8 10:15:41

RuoYi-App多端开发实战:从零到一的快速部署指南

RuoYi-App多端开发实战:从零到一的快速部署指南 【免费下载链接】RuoYi-App 🎉 RuoYi APP 移动端框架,基于uniappuniui封装的一套基础模版,支持H5、APP、微信小程序、支付宝小程序等,实现了与RuoYi-Vue、RuoYi-Cloud后…

作者头像 李华