news 2026/8/8 12:52:48

大模型在数据分析领域的应用——怎么让模型生成更准确的SQL语句实操

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
大模型在数据分析领域的应用——怎么让模型生成更准确的SQL语句实操

一个好的大模型数据分析智能体,需要的是让模型更好的理解你的数据结构,而这应该怎么做呢?。

数据分析是大模型的一个重点应用方向,但怎么使用大模型进行数据分析,以及怎么才能让大模型完整强大的可靠的数据分析;毕竟如果数据分析的结果不可靠,那将毫无意义。

使用大模型做数据分析的本质,是让大模型扮演一个数据分析员的角色,它会编写SQL,脚本代码等,具备基本的数据分析员的能力。

怎么让大模型更好地进行数据分析

怎么让大模型更好地进行分析?

我们都知道与大模型的交互都是通过提示词实现的,因此这个问题可以换个问法,怎么让大模型更好的编写数据分析代码(包括SQL,shell,python等脚本代码)?并且可以根据执行结果进行下一步的处理。

我们先以SQL为例,从一个实际案例出来,让模型对一张表进行数据分析。

既然大模型做数据分析就是要写好提示词,那什么样的提示词才算是一个好的数据分析师的提示词呢?

最近两年,大家都可以看到AI的发展有多快,我国超10亿参数的大模型,在短短一年之内,已经超过了100个,现在还在不断的发掘中,时代在瞬息万变,我们又为何不给自己多一个选择,多一个出路,多一个可能呢?

与其在传统行业里停滞不前,不如尝试一下新兴行业,而AI大模型恰恰是这两年的大风口,整体AI领域2025年预计缺口1000万人,其中算法、工程应用类人才需求最为紧迫!

学习AI大模型是一项系统工程,需要时间和持续的努力。但随着技术的发展和在线资源的丰富,零基础的小白也有很好的机会逐步学习和掌握。【点击蓝字获取】

【2025最新】AI大模型全套学习籽料(可白嫖):LLM面试题+AI大模型学习路线+大模型PDF书籍+640套AI大模型报告等等,从入门到进阶再到精通,超全面存下吧!

首先除了要指定模型的角色和基础功能之外,还要告诉模型我们的要求,比如说需要做什么,不能做什么,有什么规则,需要输出什么样的格式等。

如下是一个简单的数据分析师提示词,其中dialect是我们需要传入的参数,用来告诉模型,我们使用的是什么数据,如mysql,pgsql,oracle等,这样模型才能更好理解我们的需求。

你是一个专门与SQL数据库交互的智能代理。 根据用户输入的问题,生成符合{dialect}语法的正确查询语句。 注意事项: - 只能使用表结构描述中可见的列名 - 确保不查询不存在的列 - 注意列所属的表 - 严格按照表字段备注的含义理解每个参数的作用 - 理解用户问题,并根据表字段的含义,生成SQL语句

但其中还有很重要的一步,就是把数据库信息告诉模型,而这些我们可以通过获取数据库元数据的方式得到。

如下查询数据表元数据,如果需要查多张表,也可以把table_name的条件给去掉。

sql = text(f""" SELECT column_name as 字段名, data_type as 数据类型, character_maximum_length as 字符长度, is_nullable as 是否可为空, column_default as 默认值, ( SELECT description FROM pg_catalog.pg_description WHERE pg_description.objsubid = information_schema.columns.ordinal_position AND pg_description.objoid = ( SELECT oid FROM pg_catalog.pg_class WHERE relname = information_schema.columns.table_name AND relnamespace = ( SELECT oid FROM pg_catalog.pg_namespace WHERE nspname = information_schema.columns.table_schema ) ) ) as 字段注释 FROM information_schema.columns WHERE table_schema = 'public' AND table_name = '{table_name}' ORDER BY ordinal_position; """ )

在查询到表结构之后,我们需要解析出表中的字段,类型等属性。

result = await db_session.execute(sql, {"table_name": table_name, "schema": schema}) columns = result.fetchall() if not columns: return "No tables found in the database." output_lines = [] comment_suffix = f"\nTable comment: *表备注*" # --- Schema Table --- output_lines.append(f"### Table name: `{table_name}`{comment_suffix}\n") output_lines.append("| column_name | data_type | is_nullable | column_default | column_comment |") output_lines.append("|---|---|---|---|---|") for i, column in enumerate(columns): col_name, data_type, is_nullable, col_default, col_comment = column[0], column[1], column[3], column[4], column[5] col_default = str(col_default) if col_default is not None else '' col_comment = str(col_comment) if col_comment is not None else '' is_nullable = is_nullable if is_nullable in ('YES', 'NO') else 'NO' output_lines.append( f"| {col_name} | {data_type} | {is_nullable} | {col_default} | {col_comment} |" ) output_lines.append("")

当然,作者这里使用的是pgsql数据库,读者可以根据自己的数据库类型进行适当的调整。

但还有一个关键的步骤是,我们可以从数据表中随机查询一些示例数据出来,比如三到五条,并拼接到数据表结构后面,这样就可以让模型更好地理解我们的表结构和表数据。

如下所示:

quoted_cols = [f'{c[0]}' for c in columns] sample_sql = text(f'SELECT {", ".join(quoted_cols)} FROM "{table_name}" ORDER BY random() LIMIT 10;') print(f"sample sql: {sample_sql}") result = await db_session.execute(sample_sql) sample_rows = result.fetchall()

这样,大模型就可以很好的根据我们的需求生成相应的SQL语句;但从安全性的角度考虑,我们最好是对生成的SQL进行基本的安全验证,如drop database;drop table name,delete等语句,否则可能会造成严重的生成事故。

最近两年,大家都可以看到AI的发展有多快,我国超10亿参数的大模型,在短短一年之内,已经超过了100个,现在还在不断的发掘中,时代在瞬息万变,我们又为何不给自己多一个选择,多一个出路,多一个可能呢?

与其在传统行业里停滞不前,不如尝试一下新兴行业,而AI大模型恰恰是这两年的大风口,整体AI领域2025年预计缺口1000万人,其中算法、工程应用类人才需求最为紧迫!

学习AI大模型是一项系统工程,需要时间和持续的努力。但随着技术的发展和在线资源的丰富,零基础的小白也有很好的机会逐步学习和掌握。【点击蓝字获取】

【2025最新】AI大模型全套学习籽料(可白嫖):LLM面试题+AI大模型学习路线+大模型PDF书籍+640套AI大模型报告等等,从入门到进阶再到精通,超全面存下吧!

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/2 7:59:47

GetQzonehistory终极指南:5步掌握QQ空间数据备份

GetQzonehistory终极指南:5步掌握QQ空间数据备份 【免费下载链接】GetQzonehistory 获取QQ空间发布的历史说说 项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory 你是否曾经翻看多年前的QQ空间,想要重温那些青涩时光&#xff0…

作者头像 李华
网站建设 2026/8/1 18:03:06

如何高效批量下载B站视频:完整实用指南

如何高效批量下载B站视频:完整实用指南 【免费下载链接】douyinhelper 抖音批量下载助手 项目地址: https://gitcode.com/gh_mirrors/do/douyinhelper 还在为喜欢的B站UP主视频无法批量保存而烦恼吗?B站视频批量下载工具正是你需要的完美解决方案…

作者头像 李华
网站建设 2026/8/1 23:38:14

2025年AI大模型发展趋势深度解析:从百模大战到应用革命

文章分析了2025年AI发展的四大核心趋势:从"百模大战"向头部大模型集中;从"对话AI"向"干活AI"转变;硬件AI多点开花;算力与数据成为发展基石。大模型领域"六小虎"崛起,后训练成…

作者头像 李华
网站建设 2026/8/5 14:08:23

城通网盘高速下载解析工具:免费直连获取的完整指南

城通网盘高速下载解析工具:免费直连获取的完整指南 【免费下载链接】ctfileGet 获取城通网盘一次性直连地址 项目地址: https://gitcode.com/gh_mirrors/ct/ctfileGet 还在为城通网盘的下载限速而烦恼?想要轻松获得高速直连下载地址?这…

作者头像 李华
网站建设 2026/7/30 13:50:29

零成本解锁WeMod专业版:完整功能免费获取指南

零成本解锁WeMod专业版:完整功能免费获取指南 【免费下载链接】Wemod-Patcher WeMod patcher allows you to get some WeMod Pro features absolutely free 项目地址: https://gitcode.com/gh_mirrors/we/Wemod-Patcher 还在为WeMod免费版的功能限制而烦恼吗…

作者头像 李华
网站建设 2026/7/30 21:06:30

SMUDebugTool:AMD平台硬件调试的智能助手

SMUDebugTool:AMD平台硬件调试的智能助手 【免费下载链接】SMUDebugTool A dedicated tool to help write/read various parameters of Ryzen-based systems, such as manual overclock, SMU, PCI, CPUID, MSR and Power Table. 项目地址: https://gitcode.com/gh…

作者头像 李华