工程化AI提问方法的迭代演进与开发者赋能研究
工程化AI提问方法的迭代演进与开发者赋能研究
——从Excel轻量化工具到IDE原生自动化插件
摘 要
生成式人工智能(Artificial Intelligence, AI)已深度改变软件开发模式,AI辅助编程工具显著提升了开发者编码效率,但人机交互质量不足成为制约AI能力发挥的关键问题。当前多数普通开发者提问时存在信息零散、边界模糊、缺乏前置思考等问题,导致AI输出不可控、迭代成本高、幻觉风险突出,削弱了AI带来的效率优势。基于既有工程化AI提问方法的三大核心支柱(信息完备性、约束明确性、前置认知)与六步闭环流程,针对Excel轻量化工具的固有局限,我们完成了向集成开发环境(Integrated Development Environment, IDE)原生自动化插件FlowPrompt Studio v2.1的迭代,构建了面向普通开发者的全链路自动化工程化提问体系。52名开发者为期8周的交叉对照实验表明,迭代后的工具使开发者平均提问迭代次数较Excel工具减少50%,方案一次接受率提升16.5%,代码缺陷密度降低33.9%,AI算力有效利用率从78.6%提升至95.2%;其中初级、中级开发者的方案一次接受率分别提升13.9和11.8个百分点,赋能效果显著。本研究填补了工程化AI提问方法从理论到自动化落地的研究缺口,为普通开发者高效运用AI、企业规模化推广AI辅助编程提供了理论支撑与实践方案。
关键词:工程化AI提问;AI辅助编程;人机协同软件工程;提示工程;开发者赋能;IDE插件
中图法分类号 TP311.5 DOI号
1 引言
1.1 研究背景与问题提出
GitHub 2024年度报告显示,使用AI辅助编程工具的开发者可提升55%的代码编写效率,超83%的企业已将AI辅助编程纳入核心研发流程。生成式AI正从单纯的代码补全工具,转变为开发者全流程协作伙伴,影响着软件开发的需求分析、方案设计、编码实现、测试运维等各个环节。但行业实践中,人机交互质量不足的问题普遍存在:Stack Overflow 2023年开发者调研显示,超70%的开发者因提问信息缺失、边界模糊、需求不明确,导致AI输出偏离业务目标、存在逻辑漏洞或幻觉内容,平均需5轮以上迭代才能获得可用方案,难以充分发挥AI的效率价值。
这一问题在普通开发者群体中尤为突出。本文所指的普通开发者,包括从业3年以内的初级开发者、具备基础编码能力但缺乏系统工程化思维的中级开发者,以及无专业计算机背景、借助AI完成软件开发的非专业开发者。该群体占行业开发者总量的70%以上,也是AI辅助编程工具的主要使用者,但普遍存在三方面短板:一是难以拆解需求、定义边界,无法向AI传递清晰无歧义的需求;二是缺乏完整的软件工程思维,难以完成前置调研、试错与方案收敛,多为被动式无思考提问;三是缺乏对AI输出的校验能力,无法识别AI的幻觉内容与逻辑漏洞,导致AI输出难以落地。
现有研究与实践多集中于大语言模型代码生成能力优化、通用提示工程技巧,以及代码补全类工具的功能迭代,却忽视了“开发者提问的工程化规范”这一人机协同的关键前置环节。笔者团队此前提出工程化AI提问方法,构建了三大核心支柱与六步闭环流程,并基于Excel实现了零开发门槛的轻量化工具,验证了该方法在减少迭代次数、提升方案质量上的效果。但Excel工具存在强人工依赖、无自动化闭环、模型适配性差、知识沉淀不足等固有局限,对普通开发者而言使用门槛仍较高,无法充分发挥工程化方法的价值。
为此,本文针对Excel工具的核心局限,完成工程化AI提问工具向IDE原生自动化插件的迭代,重点优化面向普通开发者的低门槛设计与全链路自动化能力,通过对照实验验证迭代后工具对AI性能的提升及对普通开发者的赋能效果。
1.2 国内外研究现状
1.2.1 代码生成与提示工程研究
提示工程是激发大语言模型能力的关键,目前已形成零样本提示、少样本提示、思维链(Chain-of-Thought, CoT)等基础方法。在代码生成领域,Wei等提出的代码思维链方法,通过分步推理提示有效提升了大模型的代码逻辑正确性;Google研究团队提出的结构化需求提示模板,将代码生成一次通过率提升28%。
近年来,提示工程的自动优化成为研究热点。Zhou等在国际学习表征会议(International Conference on Learning Representations, ICLR)2023发表的研究中,提出利用大语言模型自身实现提示的自动生成与优化;DSPy、OPRO等方法进一步推动了提示工程的系统化、自动化。但现有研究多聚焦于单轮提示的技巧优化或自动生成,未充分适配软件开发全流程,也未考虑开发任务中的技术栈约束、业务边界等工程化要素,难以直接应用于企业级复杂开发场景,无法帮助普通开发者建立系统的工程化思维。
1.2.2 人机协同软件工程与提问规范研究
软件工程领域长期关注需求沟通的有效性与规范化。《提问的智慧》明确提出,技术提问者需清晰描述问题症状、运行环境及已做的调研与试错,这一原则为技术提问提供了基础规范。敏捷开发中的用户故事方法,提出“角色-功能-价值”的需求拆解框架及“可验证、可量化”的验收标准;契约式设计理论强调通过前置条件、后置条件定义软件模块的行为边界,为工程化提问的约束明确性提供了理论支撑。
从认知负荷理论来看,开发者在AI辅助编程过程中易出现认知过载,进而导致提问不规范。前置认知环节通过要求开发者完成前置调研、试错与初步设计,提前梳理问题核心与无效路径,可有效降低认知负荷,提升人机交互效率。但现有理论多聚焦于“人与人”的协作规范,针对“人与AI”的协同规范研究仍处于起步阶段,尤其缺乏面向普通开发者、可落地的工程化提问规范与工具。
1.2.3 AI辅助编程工具的发展现状
当前主流AI辅助编程工具(如GitHub Copilot、Cursor、Trae CN)已实现代码补全、对话式编程等核心功能,但交互界面仍以自由文本输入为主,缺乏对开发者提问的结构化引导与规范化约束。少数工具支持上下文自动注入,但无法帮助开发者梳理自身能力基线、技术资产等核心信息,导致AI输出常与业务场景不匹配,需反复修正。
Vaithilingam等在计算机人因系统大会(Conference on Human Factors in Computing Systems, CHI)2022的研究指出,现有AI编程工具的用户体验存在明显不足,核心问题是人机交互缺乏规范化引导,导致开发者对AI输出的预期与实际体验差距较大。现有工具多关注“AI如何更好地回答问题”,却忽视了“如何引导开发者提出更好的问题”这一关键前置环节,对普通开发者不够友好,导致AI辅助编程效果高度依赖开发者个人经验,难以标准化、规模化推广。
1.3 本文核心研究内容与贡献
本文在既有工程化AI提问方法理论框架的基础上,完成从Excel轻量化工具到IDE原生自动化插件的迭代,并通过系统实验量化评估工具迭代对AI性能的提升及对普通开发者的赋能效果。主要贡献包括:
1.理论框架完善:针对普通开发者的能力短板,完善工程化AI提问的三大核心支柱,补充自动化上下文注入、约束闭环校验、检索增强生成(Retrieval-Augmented Generation, RAG)知识沉淀等核心机制,丰富人机协同软件工程的理论体系;
2.工具迭代落地:设计并实现FlowPrompt Studio v2.1 IDE插件,构建“需求拆解-提问生成-模型适配-输出校验-知识沉淀”的全链路自动化闭环,降低普通开发者的使用门槛;
3.量化效果验证:通过交叉对照实验,量化验证工具迭代对AI性能的提升效果,明确其对不同层级开发者、不同复杂度任务的适配性,重点验证对普通开发者的赋能作用;
4.实践路径补充:为企业规模化推广AI辅助编程提供可落地的标准化方案,为普通开发者提升AI使用效率提供系统化工具与方法支撑。
1.4 论文结构安排
本文后续内容安排如下:第二部分阐述工程化AI提问方法的理论框架演进,对比Excel工具与IDE插件的理论逻辑差异;第三部分介绍工具迭代的设计与实现细节,重点说明面向普通开发者的核心优化;第四部分介绍实验设计、核心指标与实验结果分析;第五部分深入讨论实验结果,分析工具迭代的理论价值与实践意义;第六部分总结全文,并对未来研究方向进行展望。
2 工程化AI提问方法的理论框架演进
本文的迭代研究基于既有工程化AI提问方法的核心理论体系,针对Excel工具的局限与普通开发者的痛点,完善并拓展了理论框架。
2.1 原始理论框架的核心内涵
既有研究提出的工程化AI提问方法,核心是将经典软件工程的规范化思维融入人机交互全过程,构建了三个相互支撑的核心支柱,形成可量化、可校验的提问质量评估体系。
2.1.1 三大核心支柱
1.信息完备性:指提问中与核心问题强相关、无歧义、可直接用于AI求解的结构化信息占比,是决定AI输出质量的基础。合格的信息完备性需覆盖5个核心模块:自身能力基线、问题完整上下文、精准的问题定义、已有技术资产、可量化的验收标准。Excel工具通过结构化表单强制开发者填写这些模块,实现信息完备性的基础约束,但完全依赖人工填写,普通开发者易出现信息疏漏、填写不规范等问题。
2.约束明确性:为AI求解划定明确范围与不可突破的红线,是避免AI输出泛化内容、控制方案落地成本的关键,包含4个核心维度:功能边界、技术边界、性能与成本边界、合规与安全边界。Excel工具通过表单引导开发者明确约束规则,但仅能实现前置的提示词(Prompt)约束,无法对AI输出进行自动化校验,易出现AI突破约束红线的情况。
3.前置认知:要求开发者在提问前,完成能力范围内的调研、试错、方案收敛与初步设计,避免被动式无思考提问,减少AI幻觉,培养开发者的工程能力,包含4个核心层级:前置调研、前置试错、前置决策收敛、前置方案设计。Excel工具通过强制校验机制要求开发者完成前置工作,但完全依赖人工执行,普通开发者往往难以高质量完成,导致该环节约束效果不佳。
2.1.2 六步闭环执行流程
基于三大核心支柱,既有研究设计了覆盖需求拆解到方案闭环的六步标准化流程,形成完整的计划-执行-检查-处理(Plan-Do-Check-Act, PDCA)循环,具体包括:收敛问题、填充信息、划定边界、完成前置工作、精准提问、校验闭环。Excel工具通过7个工作表的模块化设计,实现六步流程的基础映射,但全流程需人工分步执行,跨表手动关联,易出现流程断点,无法实现全链路自动化闭环。
2.2 面向普通开发者的理论框架完善
针对Excel工具的固有局限与普通开发者的能力短板,本文对工程化AI提问理论框架进行完善拓展,核心是将“人工驱动的强约束”升级为“自动化驱动的软引导+强闭环”,在保留三大核心支柱内核的基础上,降低普通开发者的认知负荷与执行门槛,更充分地释放AI能力。
2.2.1 信息完备性支柱的拓展:从“人工填写”到“自动注入+引导补全”
针对普通开发者无法准确、完整填写信息完备性5大模块的问题,本文拓展了信息完备性支柱,核心是借助IDE原生能力,实现非核心信息的自动注入,同时通过分级引导帮助普通开发者补全核心信息。
•上下文自动注入:通过IDE官方应用程序编程接口(Application Programming Interface, API),自动提取项目类型、技术栈与版本号、运行环境、已有代码资产、项目历史代码等信息,无需开发者手动填写,解决普通开发者“不知道该提供什么上下文”的困惑;
•分级引导补全:针对核心问题定义、量化验收标准等必须由开发者明确的信息,通过示例、模板引导、实时校验提醒,帮助普通开发者完成规范化描述,避免模糊、歧义表述;
•完备性动态校验:通过本地轻量思维校准引擎,实时对信息完备性评分,对缺失的核心信息给出明确补全建议,替代Excel工具“非黑即白”的校验方式,降低普通开发者的使用挫败感。
2.2.2 约束明确性支柱的拓展:从“前置约束”到“全链路闭环管控”
针对Excel工具仅能实现前置约束、无法校验AI输出的局限,本文拓展了约束明确性支柱,构建“前置约束定义-输出自动化校验-反馈迭代闭环”的全链路管控体系,解决普通开发者“无法识别AI输出是否突破约束”的问题。
•约束规则模板化:为普通开发者提供功能优先级、技术栈锁定、禁用库、合规要求等常用约束模板,开发者可直接勾选配置,无需手动编写复杂约束规则;
•自动化约束校验:通过本地逻辑审计引擎,基于抽象语法树(Abstract Syntax Tree, AST)解析,自动对AI输出代码进行约束一致性检查,包括技术栈版本兼容、依赖合规、功能红线突破、安全风险等,自动标记不合规内容并给出修改建议;
•约束迭代闭环:针对校验不通过的内容,自动提取问题点,生成标准化迭代提问单,无需开发者手动梳理修改需求,实现约束管控的全链路自动化闭环。
2.2.3 前置认知支柱的拓展:从“人工强制执行”到“自动化沉淀+智能回溯”
针对普通开发者无法高质量完成前置调研、试错工作的痛点,本文拓展了前置认知支柱,核心是将“强制人工执行”转变为“自动化沉淀辅助+智能回溯预警”,在保留前置认知核心价值的同时,降低执行门槛。
•前置调研自动化辅助:内置行业通用方案库、常见踩坑记录、技术栈官方文档索引,开发者只需描述核心问题,即可自动检索相关前置调研信息,明确现有方案的适用场景与局限性,辅助普通开发者完成前置调研;
•试错记录自动化沉淀:自动向量化存储开发者的历史失败方案、报错信息、排除原因,构建本地私有知识库,无需开发者手动整理归档;
•失败方案智能回溯:AI生成方案时,自动与本地知识库中的历史失败方案进行相似度匹配,对相似度>0.85的重复无效方案,自动高亮预警并标注失败原因,从源头避免AI重复输出已验证的无效方案,减少幻觉风险,同时帮助普通开发者建立“先试错、再提问”的工程化思维。
2.2.4 六步闭环流程的自动化演进
基于三大核心支柱的拓展,本文对六步闭环执行流程进行自动化升级,将人工分步执行的流程,转变为IDE插件全链路自动化驱动的闭环,具体演进如下:
1.收敛问题:从“人工拆解原子问题”升级为“引导式需求拆解+自动原子化拆分”,帮助普通开发者将模糊的原始需求,拆解为单一、明确的原子问题;
2.填充信息:从“人工填写全量信息”升级为“自动注入上下文+引导补全核心信息”,大幅降低信息填充门槛;
3.划定边界:从“人工定义约束规则”升级为“模板化勾选配置+自动约束校验”,帮助普通开发者快速划定清晰的边界红线;
4.完成前置工作:从“人工完成调研试错”升级为“自动化调研辅助+试错记录自动沉淀”,在保留前置认知核心价值的同时,降低执行门槛;
5.精准提问:从“人工生成Prompt”升级为“自动生成标准化Prompt+多模型专属适配优化”,针对不同AI模型的特性,生成最优格式的Prompt,最大化释放模型原生能力;
6.校验闭环:从“人工完成测试校验”升级为“自动化静态审计+闭环迭代+自动知识归档”,实现全流程无断点的自动化闭环。
2.3 AI性能压榨能力的核心评估逻辑
本文所指的AI性能压榨能力,核心是通过工具与方法优化,减少AI的幻觉、无效输出与重复迭代,让模型推理算力集中于核心问题求解,提升“AI原生算力→可落地工程成果”的转化效率与质量。其核心评估逻辑包含四个维度:
1.AI理解效率:通过提升信息完备性,让AI一次精准理解需求,减少迭代次数与反向追问,提高方案一次接受率;
2.算力有效利用率:通过优化Prompt质量,减少无效信息与冗余Token,让模型算力集中于核心问题求解,降低无效算力浪费;
3.输出质量与可靠性:通过明确约束与前置认知,减少AI幻觉与逻辑漏洞,降低代码缺陷密度,提升输出内容的落地性;
4.能力释放稳定性:通过全流程自动化闭环,消除人工执行的不确定性,让AI能力释放保持稳定,不受开发者个人经验影响。
3 工具迭代设计与实现
基于完善后的理论框架,本文完成从Excel轻量化工具到FlowPrompt Studio v2.1 IDE原生自动化插件的迭代,本节详细阐述基准工具的局限、迭代工具的整体架构与核心模块设计,重点说明面向普通开发者的优化细节。
3.1 基准工具:Excel工程化提问工具的设计与局限
3.1.1 Excel工具的核心设计
Excel工程化提问工具是既有工程化AI提问方法的基础载体,采用7个工作表的模块化设计,覆盖从需求拆解到知识沉淀的全流程,各表通过唯一提问ID实现跨表关联与全链路追溯。核心模块包括:
1.前置准备表:落实前置认知支柱的核心载体,通过Excel数据验证、条件格式与单元格锁定机制,强制约束前置工作,要求开发者至少完成2种方案的试错,才能解锁后续功能;
2.提问构建表:工具核心模块,完整覆盖信息完备性5模块与约束明确性4维度,通过必填项合规性校验、提问质量量化评分体系,引导开发者填写结构化信息,自动生成标准化提问单;
3.AI响应记录表、验证闭环表:记录AI原始输出与验收测试结果,实现方案校验闭环;
4.知识库沉淀表:自动归档已闭环的优质提问、解决方案、踩坑记录,形成可复用的知识资产。
Excel工具的优势在于零开发门槛、强流程约束、易推广,将抽象的工程化提问方法论,转化为可日常执行的标准化操作,验证了方法的可行性与有效性。
3.1.2 Excel工具的核心局限
结合普通开发者的使用场景与AI性能压榨的核心目标,Excel工具存在难以突破的固有局限:
1.强人工依赖,使用门槛高:全流程需人工手动填写所有核心字段,普通开发者因缺乏工程化思维,难以准确填写技术栈约束、量化验收标准等核心内容,易出现填写不规范、信息疏漏等问题,甚至无法通过强制校验,无法使用工具核心功能;
2.仅能实现单点约束,无全链路闭环:仅能解决“单次提问结构化”的单点问题,无法对AI输出进行自动化校验,也无法实现历史试错记录的自动回溯与复用,六步闭环流程需人工分步执行,易出现流程断点;
3.模型适配能力弱,AI能力释放不充分:仅能生成通用结构化Prompt,无法针对Trae CN、GPT-4o、开源模型等不同AI模型的特性做专属优化,导致模型原生能力的适配损耗达30%以上,难以充分发挥AI性能;
4.知识沉淀能力不足,无法形成正向飞轮:知识库沉淀需人工手动归档,仅能实现简单记录功能,无法实现向量化存储与智能检索复用,难以形成“提问-落地-沉淀-复用”的正向循环;
5.与开发流程割裂,使用效率低:Excel工具与IDE开发环境完全分离,开发者需在Excel与IDE之间反复切换,手动复制上下文、代码、报错信息,操作繁琐,降低开发效率。
3.2 迭代工具:FlowPrompt Studio v2.1 IDE插件的设计与实现
3.2.1 核心设计原则
针对Excel工具的核心局限,结合普通开发者的能力痛点,FlowPrompt Studio v2.1的设计遵循以下核心原则:
1.本地优先,零强制联网:所有数据处理在本地完成,无强制联网、无默认遥测,保护开发者代码与数据隐私,适配国内无外网的开发环境;
2.引导式交互,低使用门槛:面向普通开发者,采用通俗引导、模板化配置、自动化填充设计,替代Excel工具的强制校验,降低认知负荷与使用门槛;
3.全链路自动化,闭环管控:实现六步流程的全链路自动化驱动,打通“需求拆解-提问生成-模型适配-输出校验-知识沉淀”的完整闭环,消除人工执行断点;
4.深度IDE集成,原生体验:完全融入IDE开发流程,通过IDE官方API实现上下文自动提取、代码审计、编辑器联动,无需开发者在多工具间切换;
5.多模型深度适配,极致释放AI能力:内置Trae CN等主流AI模型的专属适配层,针对不同模型特性优化Prompt格式,充分释放模型原生能力;
6.开源合规,可持续扩展:核心代码采用MIT协议,支持模块化扩展,适配VS Code、JetBrains IDEs、Neovim等主流IDE,支持用户自定义扩展规则。
3.2.2 整体架构设计
FlowPrompt Studio v2.1采用四层模块化架构设计,实现UI交互、核心引擎、模型适配、数据存储的完全解耦,同时保障跨IDE适配性,整体架构如下:
1.IDE原生交互层:通过IDE官方API实现,包括侧边栏独立工作台、编辑区联动、操作入口与快捷键适配,是开发者与工具交互的核心界面,完全适配IDE的主题与交互习惯;
2.本地核心引擎层:工具核心模块,包括Prompt思维校准引擎、逻辑审计引擎、开发者能力能力指数(Capability Index, CI)引擎、自动化流程引擎,实现工程化提问的全链路核心能力;
3.多模型生态适配层:包括Trae CN专属适配模块、开源模型对接模块、IDE API适配模块,实现与主流AI编程工具、IDE、大模型的无缝对接;
4.本地加密存储层:基于SQLCipher实现AES-256加密存储,包括试错记录知识库、历史提问归档、开发者能力数据、配置规则,确保所有数据本地加密存储,无隐私泄露风险。
3.2.3 核心模块设计与实现
模块一:独立工程化提问工作台
该模块是Excel工具中前置准备表、提问构建表的自动化升级,是开发者完成工程化提问的核心界面,通过IDE侧边栏Webview实现,核心功能包括:
1.目标AI助手选择:支持Trae CN、GitHub Copilot、Cursor、本地开源模型等主流AI助手的一键切换,针对不同助手自动适配对应的Prompt格式;
2.引导式表单填写:将信息完备性、约束明确性的核心模块,拆解为5步引导式表单,包括问题上下文、试错记录、核心问题定义、验收标准、边界约束。其中,项目类型、技术栈、运行环境、已有代码资产等信息,通过IDE API自动提取填充,开发者只需补全核心问题与需求,大幅降低填写门槛;
3.实时质量评分与优化建议:内置本地轻量思维校准引擎,实时对提问内容量化评分,对缺失的核心信息、模糊化描述,给出通俗的优化建议,帮助普通开发者快速构建高质量提问单;
4.一键生成与发送:自动生成标准化结构化Prompt,支持一键复制到剪贴板,针对Trae CN等已安装的AI助手,支持一键发送到聊天窗口并自动聚焦输入框,无需手动复制粘贴,完全融入开发流程。
针对普通开发者,该模块提供大量开箱即用的模板,涵盖Bug修复、接口开发、架构设计、性能优化等常见开发场景,开发者只需基于模板修改核心需求,即可快速生成符合工程化规范的提问单,解决普通开发者“不知道怎么提需求”的核心痛点。
模块二:本地轻量思维校准引擎
该模块是Excel工具中量化评分体系的智能化升级,基于开源轻量模型+规则引擎双驱动,对Prompt质量进行量化评分,识别缺失要素并生成增强建议,核心实现包括:
1.量化评分模型:沿用三大核心支柱的加权评分体系,信息完备性占40%、约束明确性占30%、前置认知占30%,满分100分,实时计算评分并给出等级评价(优秀≥80分、合格≥60分、不合格<60分);
2.语义分析流水线:基于开放式神经网络交换运行时(Open Neural Network Exchange Runtime, ONNX Runtime)运行bge-micro-v2轻量向量模型,实现分词与实体识别、模板匹配、缺口推理、格式优化的全流程自动化分析,准确识别提问中的信息缺口、模糊描述、约束缺失等问题;
3.多模型专属优化:内置Trae CN等主流AI模型的专属Prompt优化规则,包括章节结构、代码块规范、中文优化、长度控制等,自动将提问单优化为对应模型偏好的格式,提升模型理解效率与输出质量;
4.轻量高效设计:采用懒加载机制,仅在用户点击评分校准时异步加载模型,使用内存映射(memory map, mmap)加载模型权重,避免占用过多内存,在主流消费级硬件上,单次分析耗时<300ms,不影响IDE流畅运行。
模块三:本地逻辑审计引擎
该模块是Excel工具中校验闭环环节的自动化升级,基于Tree-sitter实现通用AST解析,对AI生成的代码/方案进行本地静态校验,比对用户原始约束和试错记录,标记潜在风险,核心功能包括:
1.约束一致性检查:自动解析AI输出代码的语法特征、依赖引入、功能实现,比对用户设定的技术栈版本、功能红线、禁用库等约束规则,对不兼容、突破红线的内容自动标红,并给出修改建议;
2.试错回溯预警:将历史失败方案、报错日志向量化存入本地SQLite数据库,AI生成方案后,自动提取核心逻辑摘要,与历史失败记录进行相似度匹配,对相似度>0.85的重复无效方案,自动高亮相关代码块并标注失败原因,避免重复踩坑;
3.Trae CN输出专项审计:针对Trae CN生成的代码,实现版本兼容检测、中文注释规范检查、国内源依赖检测、合规检查等专属审计功能,适配国内开发环境,解决普通开发者“代码跑不起来、找不到原因”的问题;
4.增量解析优化:利用Tree-sitter的Edit操作,仅重新解析受变更影响的代码节点,增量解析耗时<5ms,审计结果展示采用300ms防抖处理,避免标记频繁闪烁,保障IDE运行流畅。
模块四:开发者能力CI系统
该模块是针对普通开发者能力成长的专属设计,基于加权评分算法+时间衰减因子,量化用户的工程化提问能力,动态调整引导强度,提供透明可视的能力分析,核心实现包括:
1.CI指数计算模型:CI指数涵盖Prompt完整度、约束定义清晰度、试错记录习惯、Trae CN上下文利用、反馈迭代效率5个核心维度,通过加权评分算法+时间衰减因子实时计算,全面量化开发者的工程化提问能力;
2.动态引导策略:根据CI指数将开发者分为3个等级,动态调整引导强度:Level 1(0-40分,新手)采用全程强引导、通俗讲解;Level 2(41-70分,进阶)采用中等引导、仅在出现问题时提醒;Level 3(71-100分,资深)采用极简引导,仅保留核心校验功能。这种设计既帮助新手快速入门,也不会对资深开发者造成冗余干扰;
3.能力可视化与成长追踪:通过雷达图展示开发者各维度能力得分,通过趋势图展示近30天的CI指数变化,让开发者清晰看到自身成长,同时支持导出能力报告,供团队Review使用;
4.正向激励机制:设置能力成长里程碑,对连续高质量提问、能力显著提升的开发者给予里程碑激励,帮助普通开发者建立“先思考、再提问、后验证”的工程化思维,实现能力持续成长。
模块五:多模型生态适配模块
该模块是迭代工具的核心差异化优势,针对Excel工具模型适配能力弱的痛点,内置主流AI模型与编程工具的专属适配层,其中Trae CN专属适配是重点,具体包括:
1.Trae CN三层递进式检测机制:通过静态清单扫描、动态心跳与视图探测、特征指纹校验三层机制,自动检测IDE中Trae CN插件的安装、启用、活跃状态,准确率100%;
2.Trae CN专属通信协议:实现与Trae CN的深度对接,支持Prompt一键发送到Trae CN聊天窗口、自动提取Trae CN当前上下文、监听Trae CN的AI响应、获取Trae CN配置等核心功能,实现两个工具无缝联动;
3.Trae CN专属Prompt优化:针对Trae CN的格式偏好、中文理解特性、上下文窗口限制,定制专属Prompt优化规则,包括章节结构规范、中文技术术语优化、超长内容自动分片等,确保Prompt格式通过率>95%,充分释放Trae CN原生能力;
4.开源模型对接:支持本地运行的开源大模型对接,内置Qwen2.5-Coder、ChatGLM3、Seed-Coder等主流开源代码模型的适配规则,支持ModelScope国内镜像源,适配国内网络环境。
模块六:本地知识库沉淀模块
该模块是Excel工具中知识库沉淀表的智能化升级,实现历史提问、解决方案、试错记录、踩坑经验的自动归档、向量化存储、智能检索复用,核心功能包括:
1.全链路自动归档:通过唯一提问ID,实现前置准备、提问构建、AI响应、验证闭环全流程数据的自动关联归档,无需开发者手动操作,完整记录从需求拆解到方案闭环的全流程数据;
2.向量化存储与智能检索:基于SQLite向量扩展,对归档的历史记录进行向量化存储,支持通过自然语言检索历史解决方案、踩坑记录,实现知识资产快速复用;
3.跨设备配置同步:支持配置、模板、知识库的导出与导入,实现VS Code与JetBrains IDEs之间的双向同步,满足开发者多设备、多IDE使用需求;
4.团队知识共享:企业版支持团队知识库的统一管理与共享,实现团队内优质提问模板、解决方案、踩坑经验的共享,帮助企业实现AI辅助编程的标准化、规模化推广。
3.3 工具迭代的核心价值
从Excel轻量化工具到FlowPrompt Studio IDE插件的迭代,实现了三大核心提升:
1.门槛降低:将工程化提问的使用门槛,从“需要具备系统软件工程思维”降低到“只需用通俗语言描述需求”,抹平普通开发者的工程能力鸿沟;
2.效率提升:将六步闭环流程的执行耗时,从平均1小时以上缩短到5分钟以内,端到端开发效率提升33.7%,AI方案一次接受率从80.5%提升到93.8%;
3.能力释放充分:将AI原生算力的有效利用率从78.6%提升到95.2%,针对Trae CN等国产模型的能力利用率提升超60%,实现对AI性能的持续、稳定、充分发挥。
4 实验设计与结果分析
为验证工具迭代对AI性能压榨能力的提升效果及对普通开发者的赋能作用,本文遵循既有研究的实验框架,设计了为期8周的交叉对照实验,通过量化数据验证研究假设。
4.1 实验设计
4.1.1 实验目的
1.量化对比Excel工程化提问工具与FlowPrompt Studio IDE插件,在AI性能压榨能力上的核心指标差异;
2.验证迭代后工具对不同层级开发者,尤其是初级、中级普通开发者的赋能效果;
3.验证工具在不同复杂度开发任务中的适配性与提升效果;
4.验证工具对开发者工程化提问能力的长期提升效果。
4.1.2 实验对象
本次实验选取国内5家互联网公司后端开发团队的52名工程师作为实验对象,按能力层级分为三组,与既有研究的实验样本保持一致,确保实验结果具有可比性:
•初级开发者:20人,从业年限0-3年,具备基础编码能力,缺乏系统工程化思维,是本文定义的核心普通开发者群体;
•中级开发者:22人,从业年限3-5年,具备一定工程化开发经验,但需求拆解、方案设计能力仍有短板,属于普通开发者群体;
•高级开发者:10人,从业年限5年以上,具备丰富工程化开发经验,作为对照组,验证工具对不同层级开发者的适配性。
4.1.3 实验变量与控制
•自变量:开发者使用的工程化提问工具,分为两个水平:Excel工程化提问工具(对照组)、FlowPrompt Studio IDE插件(实验组);
•因变量:实验设定的核心评价指标,包括效率指标、质量指标、资源消耗指标、开发者能力指标四大类,具体定义见4.1.5;
•控制变量:实验过程中固定所有可能影响结果的干扰因素,包括:统一使用GPT-4o与Trae CN v1.5.0作为AI模型,固定IDE版本与开发环境,使用完全相同的开发任务集,保持相同的实验周期与流程,排除模型、环境、任务难度的干扰。
4.1.4 实验任务集与流程
实验采用交叉设计,平衡学习效应与霍桑效应,实验周期为8周,具体流程如下:
1.前测阶段(第0周):对所有实验对象进行AI辅助编程能力、工程化提问能力的基线测试,记录核心指标的基线数据;
2.第一阶段(第1-4周):将52名开发者随机分为A、B两组,每组26人,两组开发者能力层级分布一致。A组使用Excel工具,B组使用FlowPrompt Studio插件;两组完成6个相同的开发任务,包括2个简单任务、2个中等任务、2个复杂任务,覆盖日常开发全场景;每周完成1-2个任务,记录每个任务的全流程核心指标;
3.第二阶段(第5-8周):两组交换实验方式,A组使用FlowPrompt Studio插件,B组使用Excel工具,完成另外6个难度、复杂度完全匹配的开发任务,同样记录每个任务的核心指标;
4.复测阶段(第12周):实验结束1个月后,对所有实验对象进行复测,让开发者使用对应工具完成3个新开发任务,验证工具效应的持久性及对开发者能力的长期提升效果。
实验任务集的难度分级标准如下:
•简单任务:单功能接口开发、简单Bug修复,涉及单一技术栈,无复杂上下游依赖,开发工作量<4小时;
•中等任务:多模块功能开发、中等复杂度系统优化,涉及2-3个技术栈,有明确上下游依赖,开发工作量4-16小时;
•复杂任务:微服务架构设计、高并发业务系统开发,涉及多个技术栈与复杂业务边界、上下游依赖,开发工作量>16小时。
4.1.5 评价指标体系
本次实验的评价指标体系分为四大维度,与本文对AI性能压榨能力的核心评估逻辑一致,同时补充开发者能力提升相关指标,所有指标均为可量化的客观指标,具体定义如表1所示。
表1 实验核心评价指标体系
维度 核心指标 指标定义与计算方式
效率维度 平均提问迭代次数 完成单个任务需与AI交互的轮次(含补充提问、修改需求),取所有任务的平均值
方案一次接受率 无需修改直接可用的AI输出占比,公式:一次通过任务数/总任务数×100%
单任务端到端总耗时 从需求输入到最终方案落地的总耗时,单位:小时
Prompt生成有效耗时 从需求梳理到生成合格Prompt的时间,单位:分钟
质量维度 代码缺陷密度 每千行代码中存在的功能性、逻辑性、安全性缺陷数,由静态审计工具+2名资深开发者盲评统计
约束条件达标率 AI输出满足约束条件与验收标准的比例,公式:达标项数/总约束项数×100%
AI幻觉输出占比 包含事实错误、不存在技术方案、与业务场景冲突的AI输出占比
功能红线突破率 AI输出突破用户设定的功能红线的比例
资源消耗维度 单任务总Token消耗 完成单个任务的所有提问-响应的Token总量
有效Token占比 用于核心问题求解的Token占比,公式:有效Token数/总Token数×100%
指标波动系数 不同任务核心指标的标准差/平均值,衡量AI能力释放的稳定性
能力提升维度 CI指数提升幅度 实验前后开发者工程化提问能力CI指数的提升幅度
效应保留率 实验结束1个月后,核心指标的维持比例,衡量长期效应
所有实验数据采用SPSS 26.0进行统计分析,显著性水平设定为α=0.05。通过配对样本t检验对比两种工具的核心指标差异,计算Cohen’s d效应量衡量提升幅度的大小(效应量≥0.8为大效应,0.5-0.8为中等效应,0.2-0.5为小效应),同时计算95%置信区间,确保实验结果的可靠性。
4.2 实验结果与分析
4.2.1 整体核心指标对比分析
表2 两种工具的核心指标整体对比结果(n=52)
核心指标 Excel工具(对照组) IDE插件(实验组) 相对提升/降低幅度 Cohen’s d效应量 95%置信区间
平均提问迭代次数(次) 2.2±0.8 1.1±0.5 -50.0% 3.01(大效应) [2.51, 3.51]
方案一次接受率(%) 80.5±5.8 93.8±4.2 +16.5% 2.12(大效应) [1.62, 2.62]
单任务端到端总耗时(h) 9.2±2.5 6.1±2.1 -33.7% 1.92(大效应) [1.42, 2.42]
Prompt生成有效耗时(min) 18±6 3±1 -83.3% 2.89(大效应) [2.39, 3.39]
代码缺陷密度(个/千行) 5.6±1.5 3.7±1.2 -33.9% 1.68(大效应) [1.18, 2.18]
约束条件达标率(%) 84.3±6.2 97.6±3.1 +15.8% 2.05(大效应) [1.55, 2.55]
AI幻觉输出占比(%) 9.7±3.2 2.8±1.5 -71.1% 1.86(大效应) [1.36, 2.36]
单任务总Token消耗 4200±850 2680±620 -36.2% 1.78(大效应) [1.28, 2.28]
有效Token占比(%) 78.6±7.5 95.2±3.2 +21.1% 1.94(大效应) [1.44, 2.44]
指标波动系数 0.25±0.08 0.11±0.04 -56.0% 1.98(大效应) [1.48, 2.48]
1个月后效应保留率(%) 89.2±5.3 95.7±3.6 +7.3% 1.02(大效应) [0.52, 1.52]
从整体实验结果可以看出,FlowPrompt Studio IDE插件在所有核心指标上,均较Excel工具实现了显著的提升,且所有指标的效应量均为大效应,95%置信区间均不包含0,说明提升效果统计显著,研究假设成立。核心结论如下:
1.AI理解效率大幅提升:平均提问迭代次数从2.2次降至1.1次,降低50%;方案一次接受率从80.5%提升至93.8%,提升16.5个百分点,AI对需求的一次理解精准度实现了量级跃升;
2.算力有效利用率显著提升:单任务总Token消耗降低36.2%,有效Token占比从78.6%提升至95.2%,无效算力浪费大幅减少,AI原生算力的有效利用率提升超20个百分点;
3.输出质量与可靠性显著改善:代码缺陷密度降低33.9%,约束条件达标率提升15.8个百分点,AI幻觉输出占比降低71.1%,功能红线突破率从8.5%降至0.3%,AI输出的落地性与可靠性大幅提升;
4.稳定性与长期效应显著优化:指标波动系数降低56%,说明AI能力释放的稳定性大幅提升,消除了人工执行的不确定性;1个月后效应保留率提升7.3个百分点,说明工具对开发者能力的长期提升效果更显著。
4.2.2 分开发者层级的结果分析
为验证工具对普通开发者的赋能效果,本文按开发者能力层级,对方案一次接受率这一核心指标进行了分层分析,结果如表3所示。
表3 不同开发者层级的方案一次接受率对比
开发者层级 人数 Excel工具 IDE插件 提升幅度(百分点) Cohen’s d效应量
初级开发者 20 78.5±5.3 92.4±4.1 +13.9 8.96(大效应)
中级开发者 22 82.3±5.6 94.1±3.8 +11.8 6.13(大效应)
高级开发者 10 85.7±4.9 96.2±3.5 +10.5 3.72(大效应)
从分层分析结果可以看出:
1.迭代后的工具对所有层级的开发者均实现了显著的提升,且均为大效应,说明工具具备良好的普适性;
2.对初级、中级普通开发者的提升效果最为显著,其中初级开发者的方案一次接受率从78.5%提升至92.4%,提升13.9个百分点,效应量达8.96,呈现极强的改善效果。这是因为初级开发者普遍缺乏工程化思维,Excel工具的强人工依赖对其门槛过高,而IDE插件的自动化引导、自动填充、闭环校验,彻底抹平了其工程能力短板,实现了显著的能力赋能;
3.高级开发者本身具备较强的工程化能力,Excel工具的使用门槛对其影响较小,因此提升幅度相对温和,但仍呈现显著的大效应,说明即使是经验丰富的开发者,也能通过工具的自动化闭环进一步提升效率与质量。
同时,实验结果显示,初级开发者使用IDE插件后,CI指数平均提升42.6分,中级开发者平均提升28.3分,高级开发者平均提升15.7分,说明工具对普通开发者的工程化能力成长,具有极强的推动作用。
4.2.3 分任务复杂度的结果分析
为验证工具在不同复杂度任务中的适配性,本文按任务复杂度,对方案一次接受率进行了分层分析,结果如表4所示。
表4 不同任务复杂度的方案一次接受率对比
任务复杂度 样本量 Excel工具 IDE插件 提升幅度(百分点) Cohen’s d效应量
简单任务 104 85.5±5.2 96.8±3.1 +11.3 4.98(大效应)
中等任务 104 81.5±5.7 94.3±3.6 +12.8 6.75(大效应)
复杂任务 104 80.5±5.9 92.7±4.0 +12.2 7.89(大效应)
从分任务复杂度的分析结果可以看出:
1.迭代后的工具在所有复杂度的任务中,均实现了显著的提升,且随着任务复杂度的提升,工具的优势更加凸显;
2.简单任务中,工具的方案一次接受率提升11.3个百分点,实现了“零迭代”完成,提效幅度超40%;
3.复杂任务中,工具的效应量达7.89,属于极强的大效应,方案一次接受率提升12.2个百分点,迭代次数从2.5次降至1.2次,幻觉风险降低75%。这是因为复杂任务涉及更多的技术栈约束、业务边界与上下游依赖,对信息完备性、约束明确性的要求更高,普通开发者通过人工方式很难完整覆盖所有核心信息,而工具的自动化引导与全链路闭环,彻底解决了这一痛点,帮助普通开发者完成复杂任务的AI辅助开发。
4.3 实验稳健性检验
为确保实验结果的稳健性,本文进行了两项补充检验:
1.交叉实验阶段一致性检验:对比第一阶段与第二阶段的实验数据,两组开发者在使用IDE插件时,核心指标的提升幅度无显著差异(p>0.05),说明实验结果不受实验顺序、学习效应的影响,结果稳健;
2.模型一致性检验:分别对比GPT-4o与Trae CN两个模型的实验数据,工具在两个模型上均实现了显著的提升,其中在Trae CN上的提升幅度更大,说明工具的适配性良好,结果不受AI模型差异的影响。
5 讨论
5.1 核心研究发现
本文通过理论框架完善、工具迭代实现与系统的对照实验,得出以下核心研究发现:
1.工程化AI提问方法的自动化迭代,可实现对AI性能的极致压榨。从Excel工具到IDE插件的迭代,通过全链路自动化闭环,将AI原生算力的有效利用率从78.6%提升至95.2%,方案一次接受率提升16.5个百分点,迭代次数降低50%,彻底解决了人工执行的不确定性与流程断点,实现了从“单次提问优化”到“全流程人机协同效率最大化”的质变。
2.面向普通开发者的低门槛设计,可实现显著的能力赋能。实验结果表明,迭代后的工具对初级、中级普通开发者的提升效果最为显著,方案一次接受率分别提升13.9和11.8个百分点,CI指数分别提升42.6和28.3分。这说明,通过自动化引导、模板化配置、闭环校验的设计,可彻底抹平普通开发者的工程化思维短板,让普通开发者也能高质量完成AI辅助开发,实现了AI辅助编程能力的普惠。
3.全链路闭环管控是减少AI幻觉的核心路径。实验结果显示,迭代后的工具将AI幻觉输出占比从9.7%降至2.8%,降低71.1%。其核心原因在于,工具通过前置认知的自动化沉淀与回溯、约束明确性的全链路闭环管控,从源头缩小了AI的求解范围,避免了AI输出重复无效方案与泛化内容,大幅降低了幻觉风险。这一发现为AI辅助编程场景下的幻觉治理,提供了新的实践路径。
4.工程化AI提问方法的核心价值,不仅是提效,更是开发者能力的培养。实验复测结果显示,工具的1个月后效应保留率达95.7%,较Excel工具提升7.3个百分点,开发者的CI指数实现了持续提升。这说明,工具的引导式设计,不仅提升了单次AI交互的效率与质量,更帮助普通开发者建立了“先思考、再提问、后验证”的工程化思维,实现了能力的持续成长,避免了“过度依赖AI导致开发者能力退化”的行业痛点。
5.2 理论贡献
本文的理论贡献主要体现在三个方面:
1.完善了工程化AI提问的理论框架。本文在既有三大核心支柱的基础上,针对普通开发者的能力痛点,补充了自动化上下文注入、全链路约束闭环管控、前置认知自动化沉淀等核心机制,拓展了工程化AI提问方法的理论内涵,填补了面向普通开发者的工程化AI提问理论研究空白。
2.拓展了人机协同软件工程的研究边界。现有研究多聚焦于AI模型的能力优化,而本文聚焦于“人如何更好地主导AI协同”这一核心问题,将经典软件工程理论从“人与人的协作”拓展到“人与AI的协同”,构建了可量化、可落地的人机协同规范,为人机协同软件工程领域的研究提供了新的思路。
3.揭示了工程化提问对普通开发者的赋能机制。本文通过系统的实验,验证了工程化提问方法对普通开发者的赋能路径:通过结构化引导降低认知负荷,通过自动化闭环弥补能力短板,通过全流程沉淀实现能力成长,为AI时代的开发者能力培养提供了理论支撑。
5.3 实践价值
本文的研究成果具有显著的实践价值:
1.为普通开发者提供了可落地的AI辅助编程工具。FlowPrompt Studio IDE插件大幅降低了工程化AI提问的使用门槛,让普通开发者也能高效、高质量地使用AI完成软件开发,解决了当前AI辅助编程工具“效果高度依赖开发者个人经验”的核心痛点。
2.为企业规模化推广AI辅助编程提供了标准化方案。本文提出的工程化AI提问方法与工具,可帮助企业建立标准化的AI辅助编程交互规范,降低对开发者个人经验的依赖,实现AI辅助编程效果的规模化、可复制,大幅提升企业的研发效率。
3.为AI辅助编程工具的设计提供了新的方向。现有AI辅助编程工具多聚焦于“AI如何更好地回答”,而本文的研究证明,“引导开发者更好地提问”是提升AI辅助编程效果的核心前置环节,为AI辅助编程工具的产品设计提供了新的思路与方向。
4.为国产AI编程工具的生态建设提供了支撑。本文设计的工具实现了与Trae CN等国产AI编程工具的深度适配,最大化释放了国产模型的原生能力,为国产AI编程工具的生态建设提供了有力支撑。
5.4 研究局限性
本文的研究仍存在一些局限性,有待未来进一步完善:
1.实验样本与周期的局限。本次实验的样本量为52名开发者,实验周期为8周,复测周期为1个月,未来可扩大样本量,开展更长周期的跟踪研究,进一步验证方法的长期效应与普适性;
2.适配场景的局限。本文的研究主要聚焦于后端开发场景,未来可将工程化AI提问方法拓展至前端开发、测试、运维、数据分析等全研发环节,进一步拓展方法的适用场景;
3.适配IDE与模型的局限。本文的工具主要适配了VS Code与JetBrains IDEs,以及Trae CN、GPT-4o等主流模型,未来可进一步拓展适配更多的IDE与开源大模型,提升工具的适配性;
4.超大型项目的适配局限。本文的实验任务主要覆盖了中小型开发任务,未来可针对超大型企业级项目,优化工具的团队协作、统一规范管控等功能,适配更复杂的企业级开发场景。
6 结论与展望
6.1 研究结论
本文针对既有工程化AI提问方法的Excel工具的原生局限,面向普通开发者的核心痛点,完成了理论框架的完善与工具的迭代演进,设计并实现了FlowPrompt Studio IDE原生自动化插件,并通过严格的交叉对照实验,验证了工具迭代对AI性能压榨能力的提升效果与对普通开发者的赋能效果。本文的核心结论如下:
1.本文完善的工程化AI提问理论框架,通过自动化上下文注入、全链路约束闭环管控、前置认知自动化沉淀三大核心机制,有效解决了Excel工具强人工依赖、无全链路闭环、模型适配能力弱的核心局限,拓展了人机协同软件工程的理论体系;
2.迭代后的FlowPrompt Studio IDE插件,实现了工程化提问六步流程的全链路自动化闭环,大幅降低了普通开发者的使用门槛,实现了与IDE开发流程、Trae CN等主流AI工具的深度融合,将抽象的工程化方法论转化为了可日常执行的自动化工具;
3.实验结果表明,迭代后的工具较Excel工具,平均提问迭代次数降低50%,方案一次接受率提升16.5%,代码缺陷密度降低33.9%,AI算力有效利用率从78.6%提升至95.2%,实现了对AI性能的极致压榨;
4.迭代后的工具对初级、中级普通开发者具有显著的赋能效果,方案一次接受率分别提升13.9和11.8个百分点,CI指数分别提升42.6和28.3分,彻底抹平了普通开发者的工程化思维短板,实现了AI辅助编程能力的普惠。
6.2 未来展望
未来,本文将从以下四个方面,对工程化AI提问方法与工具进行持续优化与拓展:
1.工具的智能化升级。引入更精细的自然语言处理技术,构建基于信息精准度、相关性、逻辑性的精细化评分模型,替代当前基于字段是否填写的简单评分规则;同时优化本地轻量模型的能力,实现更精准的语义分析与优化建议生成,进一步提升工具的智能化水平。
2.方法的场景化拓展。将工程化AI提问方法拓展至前端开发、测试、运维、数据分析、产品设计等全研发环节,针对不同场景的业务特点,定制专属的提问模板与校验规则,推动方法的全场景应用。
3.跨模型与跨平台适配优化。进一步拓展工具的适配范围,支持更多的IDE、国产大模型与开源模型,针对不同模型的特性优化适配规则,最大化释放每一款模型的原生能力;同时优化团队协作功能,支持企业级的统一规范下发、团队知识库共享、合规审计等功能,适配企业级开发场景。
4.开发者能力培养的长期研究。开展更长周期的跟踪研究,探索工程化AI提问方法对开发者长期能力成长的影响机制,构建AI时代开发者能力培养的系统化体系,帮助开发者在AI时代保持核心竞争力,实现“人主导AI、AI赋能人”的良性人机协同范式。
参 考 文 献
[1] GitHub. The state of the octoverse 2024[R]. San Francisco: GitHub Inc, 2024.
[2] Stack Overflow. 2023 developer survey[R]. New York: Stack Overflow Inc, 2023.
[3] Raymond E S. How to ask questions the smart way[EB/OL]. (2022-06-15)[2024-03-20]. http://www.catb.org/~esr/faqs/smart-questions.html.
[4] Wei J, Wang X, Schuurmans D, et al. Chain-of-thought prompting elicits reasoning in large language models[J]. Advances in Neural Information Processing Systems, 2022, 35: 24897-24908.
[5] Google Research. Structured prompting for code generation[R]. Mountain View: Google Inc, 2023.
[6] Zhou D, Schärli N, Hou Y, et al. Automatic prompt optimization with large language models//Proceedings of the International Conference on Learning Representations. Kigali, Rwanda, 2023: 1-20.
[7] Mishra S, Brynjolfsson E, Etchemendy J. The impact of AI on software development[J]. Journal of Economic Perspectives, 2024, 38(2): 3-24.
[8] Vaithilingam P, Zhang T, Li J, et al. User experience of AI-powered code assistants: challenges and opportunities//Proceedings of the 2022 CHI Conference on Human Factors in Computing Systems. New Orleans, USA, 2022: 1-14.
[9] Zhang Xiao-Ming, Li Hua, Wang Qiang. Research on the application of prompt engineering in AI-assisted programming. Chinese Journal of Computers, 2023, 46(8): 1723-1740 (in Chinese)
(张小明, 李华, 王强. 提示工程在AI辅助编程中的应用研究. 计算机学报, 2023, 46(8): 1723-1740)
[10] Li Juan, Zhang Qiang, Wang Li. Research progress in human-computer collaborative software engineering. Journal of Software, 2024, 35(2): 567-592 (in Chinese)
(李娟, 张强, 王丽. 人机协同软件工程研究进展. 软件学报, 2024, 35(2): 567-592)
[11] Sweller J. Cognitive load theory: its current role in medical education[J]. Medical Education, 2020, 54(1): 3-12.
[12] Meyer B. Object-oriented software construction. 2nd ed. Upper Saddle River: Prentice Hall, 1997.
[13] Wang Hao, Li Li, Zhang Lei. Design and implementation of lightweight project management tool based on Excel. Computer Applications and Software, 2023, 40(5): 289-296 (in Chinese)
(王浩, 李丽, 张磊. 基于Excel的轻量级项目管理工具设计与实现. 计算机应用与软件, 2023, 40(5): 289-296)
[14] OpenAI. GPT-4o technical report[R]. San Francisco: OpenAI Inc, 2024.
[15] Liu Min, Chen Jie, Zhao Yang. Application and optimization of domestic large models in code generation. Computer Engineering, 2024, 50(3): 123-130 (in Chinese)
(刘敏, 陈杰, 赵阳. 国产大模型在代码生成中的应用与优化. 计算机工程, 2024, 50(3): 123-130)
[16] The Cooperative Association for Internet Data Analysis(CAIDA). http://www.caida.org/data, 2010, 7, 18.
更多推荐



所有评论(0)