arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-28 至 2026-01-28 共收录 54 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 54 篇

2601.18945 2026-01-28 cs.DL 89%

Large Language Models for Departmental Expert Review Quality Scores

大型语言模型用于部门专家评审质量评分

Liv Langfeldt, Dag W. Aksnes, Henrik Karlstrøm, Mike Thelwall

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究探讨了大型语言模型在内部部门评审中预测学术文章质量评分的能力,发现其与专家评分存在中等相关性,但报告质量低于人类专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00600 2026-01-28 cs.CL cs.LG 88%

A Context-Aware Dual-Metric Framework for Confidence Estimation in Large Language Models

一种面向上下文的双指标框架用于大型语言模型中的置信度估计

Mingruo Yuan, Shuyi Zhang, Ben Kao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 CRUX是一种面向上下文的双指标框架,通过上下文熵减少和统一一致性检验提升大型语言模型的置信度估计效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11254 2026-01-28 cs.CL 88%

Do Psychometric Tests Work for Large Language Models? Evaluation of Tests on Sexism, Racism, and Morality

心理测试在大语言模型中是否有效?对性别歧视、种族主义和道德的测试评估

Jana Jung, Marlene Lutz, Indira Sen, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS - Leibniz Institute for the Social Sciences(莱比锡社会科学研究所) Complexity Science Hub Vienna(维也纳复杂科学中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究评估了心理测试在大语言模型上的有效性,发现其在性别歧视、种族主义和道德方面的测试分数与模型行为不一致,表明需进一步调整以适应LLMs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00961 2026-01-28 cs.AI cs.LG 88%

LLM-Generated Explanations Do Not Suffice for Ultra-Strong Machine Learning

LLM生成的解释不足以实现超强机器学习

Lun Ai, Johannes Langer, Ute Schmid, Stephen Muggleton

机构 * Department of Computing, Imperial College London(帝国理工学院计算系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出LENS框架,通过神经符号方法生成逻辑程序解释,发现LLM生成的解释在人类学习中效果有限,需结合人类认知约束实现超强机器学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05895 2026-01-28 cs.CV 88%

BTCChat: Advancing Remote Sensing Bi-temporal Change Captioning with Multimodal Large Language Model

BTCChat: 通过多模态大语言模型推进遥感双时相变化描述

Yujie Li, Wenjia Xu, Yuanben Zhang, Zhiwei Wei, Mugen Peng

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Aerospace Information Research Institute(航天信息研究所) Chinese Academy of Sciences(中国科学院) School of Geographical Sciences(地理科学学院) Hunan Normal University(湖南师范大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 BTCChat通过多模态大语言模型提升遥感双时相变化描述能力,引入变化提取模块和提示增强机制,实现更精确的视觉-语义对齐和更优的性能表现。

Comments 5 pages, 2 figures; Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18949 2026-01-28 cs.SE cs.AI 87%

Tricky$^2$: Towards a Benchmark for Evaluating Human and LLM Error Interactions

Tricky$^2$:面向评估人类与LLM错误交互的基准

Cole Granger, Dipin Khati, Daniel Rodriguez-Cardenas, Denys Poshyvanyk

机构 * William and Mary(威廉玛丽学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 Tricky$^2$是一个混合数据集,用于评估人类和LLM错误交互,包含人类和LLM生成的错误,支持混合错误行为分析和修复鲁棒性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19267 2026-01-28 cs.CL 86%

DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models

DiaDem: 促进音频视频字幕中的对话描述以提升多模态大语言模型

Xinlong Chen, Weihong Lin, Jingyun Hua, Linli Yao, Yue Ding, Bozhou Li, Bohan Zeng, Yang Shi, Qiang Liu, Yuanxing Zhang, Pengfei Wan, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Peking University(北京大学) Nanjing University(南京大学)

专题命中 评测与基准 :large language model(title);language model(title);SFT(abstract);分类 cs.CL

AI总结 DiaDem通过合成高质量数据集和难度分区的两阶段GRPO策略,提升了音频视频字幕中的对话描述准确性,并在多种基准测试中表现出色。

Comments Project webpage: https://diadem-captioner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19435 2026-01-28 cs.GT cs.AI cs.CL 86%

Ad Insertion in LLM-Generated Responses

在大语言模型生成响应中插入广告

Shengwei Xu, Zhaohua Chen, Xiaotie Deng, Zhiyi Huang, Grant Schoenebeck

机构 * University of Michigan(密歇根大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了解耦广告插入与响应生成、以及竞价与用户查询的框架,通过基于类型拍卖机制实现近最优的社会福利,同时提高计算效率和上下文一致性。

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15098 2026-01-28 cs.CL cs.AI 86%

TextMineX: Data, Evaluation Framework and Ontology-guided LLM Pipeline for Humanitarian Mine Action

TextMineX: 用于人道主义排雷行动的数据集、评估框架及基于本体的LLM流水线

Chenyue Zhou, Gürkan Solmaz, Flavio Cirillo, Kiril Gashteovski, Jonathan Fürst

机构 * NEC Laboratories Europe(NEC欧洲实验室) University of Stuttgart(斯图加特大学) VAGO Solutions(VAGO解决方案) Zurich University of Applied Sciences(苏黎世应用科学大学) CAIR, Ss. Cyril and Methodius University of Skopje, North Macedonia(CAIR,斯科普耶塞尔维亚·梅托迪乌斯大学,北马其顿)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TextMineX通过构建首个HMA领域数据集和基于本体的LLM流水线,提升文本中领域知识的提取准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21372 2026-01-28 cs.LG cs.AI 86%

Improving LLM-based Global Optimization with Search Space Partitioning

通过搜索空间划分改进基于LLM的全局优化

Andrej Schwanke, Lyubomir Ivanov, David Salinas, Fabio Ferreira, Aaron Klein, Frank Hutter, Arber Zela

机构 * University of Freiburg(弗赖堡大学) ELLIS Institute Tübingen(图宾根ELLIS研究所) Prior Labs(Prior实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HOLLM通过搜索空间划分提升LLM在高维优化中的性能,有效平衡探索与利用,优于现有全局优化方法。

Comments 31 pages, 19 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19899 2026-01-28 cs.CL 85%

Evaluation of Oncotimia: An LLM based system for supporting tumour boards

对Oncotimia的评估:一种基于LLM的系统,用于支持肿瘤板

Luis Lorenzo, Marcos Montana-Mendez, Sergio Figueiras, Miguel Boubeta, Cristobal Bernardo-Castineira

机构 * Innovation Department, Bahía Software SLU(Bahía Software SLU创新部)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Oncotimia通过LLM自动完成肺癌肿瘤板表单,提高了效率并减少了文档负担。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19197 2026-01-28 cs.IR cs.AI 85%

HELM: A Human-Centered Evaluation Framework for LLM-Powered Recommender Systems

HELM:一种面向LLM推荐系统的以人为本的评估框架

Sushant Mehta

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HELM框架通过五个以人为本的维度评估LLM推荐系统,揭示传统指标无法捕捉的关键质量维度,并展示GPT-4在解释质量与交互自然性上的优势及流行度偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19106 2026-01-28 cs.SE cs.AI 85%

Detecting and Correcting Hallucinations in LLM-Generated Code via Deterministic AST Analysis

通过确定性AST分析检测和纠正LLM生成的代码中的幻觉

Dipin Khati, Daniel Rodriguez-Cardenas, Paul Pantzer, Denys Poshyvanyk

机构 * William & Mary(威廉玛丽大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过确定性AST分析检测并纠正LLM生成代码中的知识冲突幻觉,实现高精度和召回率的自动修复。

Comments Accepted to FORGE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18846 2026-01-28 cs.AI cs.NE 85%

LLM Driven Design of Continuous Optimization Problems with Controllable High-level Properties

基于大语言模型的连续优化问题可控高阶属性设计

Urban Skvorc, Niki van Stein, Moritz Seiler, Britta Grimme, Thomas Bäck, Heike Trautmann

机构 * Machine Learning and Optimization, Paderborn University, Germany(机器学习与优化,帕德博恩大学,德国) Leiden Institute of Advanced Computer Science, Leiden University, The Netherlands(莱顿先进计算机科学研究所,莱顿大学,荷兰) Data Management and Biometrics, University of Twente, The Netherlands(数据管理与生物特征,埃因霍温大学,荷兰)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型设计具有可控高阶属性的连续优化问题,通过生成函数并验证其结构特征,扩展了基准测试空间。

Comments 17 pages, accepted at EvoApplications 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15303 2026-01-28 cs.CR cs.AI cs.CY 79%

DSSmoothing: Toward Certified Dataset Ownership Verification for Pre-trained Language Models via Dual-Space Smoothing

DSSmoothing:通过双空间平滑实现预训练语言模型的认证数据集所有权验证

Ting Qiao, Xing Liu, Wenke Huang, Jianbin Li, Zhaoxin Fan, Yiming Li

机构 * North China Electric Power University(华北电力大学) Research Institute, China Unicom(中国联合研究院) Wuhan University(武汉大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 DSSmoothing通过双空间平滑在灰盒设置下实现预训练语言模型的数据集所有权验证,提供可证明的鲁棒性保证。

Comments To appear in WWW 2026. 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14401 2026-01-28 cs.MA cs.AI 79%

The Role of Social Learning and Collective Norm Formation in Fostering Cooperation in LLM Multi-Agent Systems

在LLM多智能体系统中,社会学习和集体规范形成促进合作的作用

Prateek Gupta, Qiankun Zhong, Hiromu Yakura, Thomas Eisenmann, Iyad Rahwan

机构 * Center for Humans and Machines(人类与机器中心) Max-Planck Institute for Human Development(人类发展马克斯·普朗克研究所)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出了一种无显式奖励信号的CPR模拟框架,通过社会学习和规范惩罚机制研究LLM多智能体系统中合作与规范的内生形成。

Comments Accepted at the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18827 2026-01-28 cs.SE cs.AI 79%

Automated structural testing of LLM-based agents: methods, framework, and case studies

基于大语言模型的智能体的自动化结构测试:方法、框架与案例研究

Jens Kohl, Otto Kruse, Youssef Mostafa, Andre Luckow, Karsten Schroer, Thomas Riedl, Ryan French, David Katz, Manuel P. Luitz, Tanrajbir Takher, Ken E. Friedl, Céline Laurent-Winter

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的智能体结构测试方法,通过跟踪、模拟和断言实现自动化测试,提升测试效率与质量。

Comments 10 pages, 5 figures. Preprint of an accepted paper at IEEE BigData 2025 (main track). Source code for the introduced methods and framework available at https://github.com/awslabs/generative-ai-toolkit

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17520 2026-01-28 cs.LG cs.CL 79%

MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device Control

MobileSafetyBench: 评估移动设备控制自主代理的安全性

Juyong Lee, Dongyoon Hahm, June Suk Choi, W. Bradley Knox, Kimin Lee

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 MobileSafetyBench通过Android模拟器评估移动设备控制自主代理的安全性,揭示基于LLMs的代理在安全任务中存在缺陷,提出提示方法提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19583 2026-01-28 cs.SE 78%

Toward Architecture-Aware Evaluation Metrics for LLM Agents

迈向面向架构的LLM代理评估指标

Débora Souza, Patrícia Machado

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出了一种面向架构的LLM代理评估方法,通过连接代理组件与可观察行为及评估指标,提升评估的针对性和透明度。

Comments Accepted at CAIN 2026 (IEEE/ACM 5th International Conference on AI Engineering)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19239 2026-01-28 cs.SE 78%

LLM-based Vulnerability Detection at Project Scale: An Empirical Study

基于大语言模型的项目级漏洞检测:一项实证研究

Fengjie Li, Jiajun Jiang, Dongchi Chen, Yingfei Xiong

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文研究了基于LLM的项目级漏洞检测方法,发现其在召回率低的情况下仍能发现更多漏洞,但存在高误报率和计算成本问题。

Comments 19 pages, 13 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19029 2026-01-28 cs.SD eess.AS 78%

Audio Foundation Models Outperform Symbolic Representations for Piano Performance Evaluation

音频基础模型在钢琴演奏评估中优于符号表示

Jai Dhiman

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出使用音频基础模型在钢琴演奏评估中优于符号表示,通过实验验证音频模型在19个维度上的优越性。

Comments 6 pages, 4 figures, 2 tables. Code available at https://github.com/Jai-Dhiman/crescendai

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01509 2026-01-28 cs.CL 77%

PROPHET: An Inferable Future Forecasting Benchmark with Causal Intervened Likelihood Estimation

PROPHET:一个基于因果干预似然估计的可推断未来预测基准

Zhengwei Tao, Pu Wu, Zhi Jin, Xiaoying Bai, Haiyan Zhao, Chengfeng Dou, Xiancai Chen, Jia Li, Linyu Li, Chongyang Tao, Wentao Zhang

机构 * Peking University(北京大学) Wuhan University(武汉大学) Beihang University(北京航空航天大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PROPHET引入了基于因果干预似然估计的可推断未来预测基准,通过CIL评估预测问题的可推断性,提升未来事件预测的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18771 2026-01-28 cs.LG cs.SI 77%

Exploring Graph Learning Tasks with Pure LLMs: A Comprehensive Benchmark and Investigation

探索纯大语言模型在图学习任务中的应用:全面的基准测试与调查

Yuxiang Wang, Xinnan Dai, Wenqi Fan, Yao Ma

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Michigan State University(密歇根州立大学) The Hong Kong Polytechnic University(香港理工大学) Rensselaer Polytechnic Institute(纽约理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.LG

AI总结 本研究探讨纯大语言模型在图学习任务中的应用,通过全面的基准测试与分析,发现指令微调的LLMs在少样本设置中表现优异,具备强大的领域迁移能力和良好的泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16435 2026-01-28 cs.CV cs.CL 77%

Human Cognitive Benchmarks Reveal Foundational Visual Gaps in MLLMs

人类认知基准揭示大规模多模态语言模型中的基础视觉缺陷

Jen-Tse Huang, Dasen Dai, Jen-Yuan Huang, Youliang Yuan, Xiaoyuan Liu, Wenxuan Wang, Wenxiang Jiao, Pinjia He, Zhaopeng Tu, Haodong Duan

机构 * CUHK(香港中文大学) PKU(北京大学) CUHKSZ(香港中文大学深圳分校) RUC(中国人民大学) Tencent(腾讯) SHLab(深圳实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 人类认知基准揭示大规模多模态语言模型在基础视觉能力上的不足,通过VisFactor评估发现模型在关键视觉任务上表现不佳。

Comments Update: Evaluated 23 SOTA MLLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18844 2026-01-28 cs.SE cs.AI 77%

Reducing False Positives in Static Bug Detection with LLMs: An Empirical Study in Industry

利用大语言模型减少静态bug检测中的误报:一项行业内的实证研究

Xueying Du, Jiayi Feng, Yi Zou, Wei Xu, Jie Ma, Wei Zhang, Sisi Liu, Xin Peng, Yiling Lou

机构 * Fudan University(复旦大学) Tencent(腾讯)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究利用大语言模型在腾讯企业环境中减少静态代码分析中的误报,通过实证研究展示LLM在工业场景下的高效性和成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15580 2026-01-28 cs.LG cs.CL 76%

Language Models are Symbolic Learners in Arithmetic

语言模型在算术中是符号学习者

Chunyuan Deng, Zhiqi Li, Roy Xie, Ruidi Chang, Hanjie Chen

机构 * Department of Computer Science(计算机科学系) Rice University(里士满大学) College of Computing(计算学院) Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.LG

AI总结 本文研究语言模型在算术运算中通过学习符号捷径而非算法来掌握算术能力。

Comments TMLR 2026. Code at https://github.com/chili-lab/Symbolic-Arithmetic

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19532 2026-01-28 cs.AI cs.CL cs.LG 75%

Benchmarks Saturate When The Model Gets Smarter Than The Judge

基准在模型比裁判更智能时达到饱和

Marthe Ballon, Andres Algaba, Brecht Verbeken, Vincent Ginis

机构 * Data Analytics Lab, Vrije Universiteit Brussel(自由大学布鲁塞尔数据分析实验室) imec-SMIT, Vrije Universiteit Brussel(imec-SMIT,自由大学布鲁塞尔) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现当模型比裁判更智能时,基准测试的准确性下降,强调了高质量数据集和可靠裁判的重要性。

Comments 17 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19287 2026-01-28 cs.SE 75%

Understanding Dominant Themes in Reviewing Agentic AI-authored Code

理解代理AI生成代码的主导主题

Md. Asif Haider, Thomas Zimmermann

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了代理AI生成代码的评审主题,通过大规模实证分析发现,评审主要关注文档、重构和格式问题,而非功能正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23785 2026-01-28 cs.CL cs.AI cs.CY 73%

Meaning Is Not A Metric: Using LLMs to make cultural context legible at scale

意义并非一种度量:利用大语言模型在大规模AI社会技术系统中使文化背景可理解

Cody Kommers, Drew Hemment, Maria Antoniak, Joel Z. Leibo, Hoyt Long, Emily Robinson, Adam Sobey

机构 * The Alan Turing Institute(艾伦·图灵研究所) University of Edinburgh(爱丁堡大学) University of Colorado Boulder(科罗拉多大学丹佛分校) University of Chicago(芝加哥大学) University of Exeter(埃克塞特大学) University of Southampton(南安普顿大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了利用大语言模型在大规模AI系统中通过厚描述使文化背景可理解的挑战与方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01098 2026-01-28 cs.SE cs.AI cs.CL 73%

Towards Automated Smart Contract Generation: Evaluation, Benchmarking, and Retrieval-Augmented Repair

迈向自动智能合约生成:评估、基准测试与检索增强修复

Zaoyu Chen, Haoran Qin, Nuo Chen, Xiangyu Zhao, Lei Xue, Xiapu Luo, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SolBench和RAR框架,通过基于执行的基准测试和检索增强修复方法,提升Solidity智能合约生成的准确性和效率。

Comments Accepted by FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏