arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

AI自己出题自己练:港科大造出8178道科学编程题,准确率涨10个点

作者:arXivDaily编辑部 arXiv 2609.30054 cs · cs.AI

论文导读

香港科技大学联合上海人工智能实验室、清华大学、南洋理工大学提出SciWalker,让AI按算子链自动出科学编程题,并用真实执行反馈筛选修复。他们造出8178道高质量题目,用GSPO训练后,Qwen3.5-9B在SciCode上的准确率从29.3%升到39.2%。科研编程的训练数据荒有了自动化解法。

想练科学编程,却没有题可刷

要让大模型做好科学计算编程,离不开高质量训练数据。但现实难题摆在那:靠人工出一道贴近真实科研的题,又贵又慢;想系统覆盖众多科学领域和算法组合,几乎不现实。结果就是模型在通用代码上表现不错,一到需要结合科学库和领域知识的题就容易卡壳。

团队的想法是让AI自己当出题人,但不能天马行空地编——编出来的题必须在真实科学计算中跑得通、有依据。

先画“算子图”,再让AI照着出题

SciWalker的做法分两步走。先做结构化的工作流设计:把科学计算库的接口和不同操作方式组合成一个个算子,算子之间连成图,再从图中采样算子链,作为一条计算流程的线索。

然后让大模型照着这些线索生成题目、参考解答和测试用例。关键在于执行反馈:生成的代码真的拿去跑,跑失败就带着报错信息反复修复。再配合结构化的工作流组合、验证和质量审查,最终题目既有科学依据、计算方式多样,又能保证可执行。

图:流程图展示算子组合、链式采样、题目生成与执行反馈修复的完整流水线。

8178道题,覆盖5领域32子域

用这套框架,团队构建了8178道高质量问题,横跨5个科学领域、32个子领域。下图给出题库的领域覆盖和构成,可以看到题目并非集中在单一方向,而是均衡分布在不同子域。

图:数据集构成图按领域和子域展示8178道题的分布情况。

为了验证这些题真能用来训练,团队在Qwen3.5-9B上用GSPO算法做强化学习。结果SciCode子问题准确率从29.3%提升到39.2%,提高9.9个百分点,增益还体现在科学代码生成、代码修复和推理等多个基准上。下图是SciCode性能对比,训练后的模型提升明显。

图:性能对比图给出训练前后及各基线在SciCode上的准确率数值。

未来落地:把出题能力变成可复用的基础设施

代码已经开源,意味着这套“算子图加执行反馈”的出题流程可以扩展到更多科学库和领域,为训练科研编程模型持续供数。相比人工标注,它把边际成本压到很低,同时用真实执行守住质量底线。

下一步可以引入更复杂的跨学科工作流、更难的长链条问题,并探索让模型在做题过程中反过来推动出题难度自适应。当“出题—训练—评测”形成自动闭环,科学计算模型的迭代速度有望明显加快。

参考资料

https://arxiv.org/abs/2609.30054

https://arxiv.org/html/2609.30054

↑