CodeGeeX提供五种生成Python数据统计代码的方式:一、VS Code插件自然语言指令;二、网页版结构化模板输入;三、基于列名反向提示;四、命令行工具批量生成;五、Jupyter Notebook内联注释生成。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望快速生成用于Python数据统计的代码,但缺乏编写汇总计算脚本的经验或时间,则可能是由于对pandas、numpy等库的函数调用不熟悉或不确定统计维度与聚合逻辑。以下是使用CodeGeeX生成Python数据统计代码的多种具体操作方式:
一、通过自然语言指令在CodeGeeX插件中直接生成
该方法适用于已安装VS Code并配置CodeGeeX插件的用户,利用上下文感知能力解析统计需求并输出可运行脚本。
1、在VS Code中打开一个空白.py文件,光标置于首行。
2、输入提示词:“生成Python代码:读取名为‘sales.csv’的CSV文件,按‘region’分组,计算每组的销售额总和、平均值、最大值和记录数,并将结果保存为‘summary.xlsx’”。
立即学习“Python免费学习笔记(深入)”;
3、按下快捷键Ctrl+Enter(Windows/Linux)或Cmd+Enter(macOS)触发CodeGeeX补全。
4、检查生成代码是否包含pandas.read_csv()、groupby()、agg()及to_excel()调用,确认无语法错误。
二、在CodeGeeX网页版中使用结构化模板输入
该方法适用于未安装本地插件的用户,通过预设字段降低歧义,提升生成结果的准确性与可执行性。
1、访问CodeGeeX官网并进入“代码生成”页面。
2、在“任务类型”下拉框中选择“数据统计脚本”。
3、在“输入格式”栏填写:CSV;在“输出目标”栏填写:Excel表格。
4、在“统计要求”文本框中逐行输入:按category列分组;计算quantity列的sum、mean;计算price列的max;统计每组行数。
5、点击“生成代码”,复制返回的完整Python脚本到本地环境运行。
三、基于已有数据文件路径与列名反向提示生成
该方法适用于已有明确数据结构但不确定如何表达统计逻辑的用户,利用文件实际信息增强生成相关性。
1、在Python交互环境中运行pd.read_csv("data.csv").columns.tolist(),获取列名列表。
2、将输出结果如['date', 'product', 'sales', 'region']作为上下文,粘贴至CodeGeeX提示框。
3、追加自然语言指令:“对上述列,按region和product联合分组,汇总sales的总和与均值,结果按sales总和降序排列”。
4、提交请求后,验证生成代码中是否包含sort_values(ascending=False)及multiindex groupby语句。
四、使用CodeGeeX命令行工具批量生成多维度统计脚本
该方法适用于需为多个数据表或不同统计口径生成脚本的场景,支持参数化指令输入与脚本导出。
1、在终端执行codegeex-cli init完成初始化配置。
2、创建prompt.yaml文件,写入以下内容:input_file: "user_logs.csv", group_by: ["device_type"], metrics: {duration: ["sum", "avg"], action_count: ["count"]}。
3、运行命令:codegeex-cli generate --config prompt.yaml --output stats_script.py。
4、检查生成的stats_script.py是否包含read_csv、set_index、agg字典及reset_index调用。
五、在Jupyter Notebook中结合CodeGeeX Cell注释生成内联统计代码
该方法适用于探索性数据分析场景,支持以Markdown Cell描述需求,自动注入对应Python Cell代码。
1、在Jupyter中新建Cell,切换为Markdown模式,输入:“计算df中age列的分布:最小值、Q1、中位数、Q3、最大值,并绘制箱线图”。
2、选中该Cell,右键选择“CodeGeeX → Generate Code Below”。
3、新生成的Code Cell应包含df.age.describe()调用及sns.boxplot()语句。
4、确认生成代码中是否引入了import seaborn as sns与import matplotlib.pyplot as plt。


















