arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2603.01167 2026-03-03 cs.CL 88%

DEP: A Decentralized Large Language Model Evaluation Protocol

DEP:一种去中心化的大型语言模型评估协议

Jianxiang Peng, Junhao Li, Hongxiang Wang, Haocheng Lyu, Hui Guo, Siyi Hao, Zhen Wang, Chuang Liu, Shaowei Zhang, Bojian Xiong, Yue Chen, Zhuowen Han, Ling Shi, Tianyu Dong, Juesi Xiao, Lei Yang, Yuqi Ren, Deyi Xiong

机构 * TJUNLP Lab, Tianjin University, Tianjin, China(天津大学天津实验室) National Supercomputing Center in Tianjin(天津国家超算中心) Yuanhui AI(元慧AI)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 DEP提出一种去中心化的评估协议,通过匹配服务器实现统一、标准化的LLM评估,支持模块化和即插即用的评估方式,减少基准测试泄露风险并提高可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16395 2026-03-03 cs.CL 88%

OJBench: A Competition Level Code Benchmark For Large Language Models

OJBench: 一个面向大语言模型的竞赛级代码基准

Zhexu Wang, Yiping Liu, Yejie Wang, Wenyang He, Bofei Gao, Muxi Diao, Yanxu Chen, Kelin Fu, Flood Sung, Zhilin Yang, Tianyu Liu, Weiran Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) Moonshot AI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 OJBench是一个用于评估大语言模型竞赛级代码推理能力的基准,通过232个编程竞赛问题揭示了现有模型在复杂推理任务中的局限性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04490 2026-03-03 cs.CL q-bio.GN 88%

Large Language Models in Bioinformatics: A Survey

大语言模型在生物信息学中的应用:综述

Zhenyu Wang, Zikang Wang, Jiyue Jiang, Pengan Chen, Xiangyu Shi, Yu Li

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University Third Hospital(北京大学第三医院) The Hong Kong Polytechnic University(香港理工大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文综述了大语言模型在生物信息学中的应用,涵盖基因组序列建模、RNA结构预测等核心方法,并探讨了数据稀缺和跨组学整合等挑战及未来发展方向。

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19006 2026-02-24 cs.AI quant-ph 88%

Evaluating Large Language Models on Quantum Mechanics: A Comparative Study Across Diverse Models and Tasks

评估大型语言模型在量子力学中的表现:跨多样模型和任务的比较研究

S. K. Rithvik

机构 * Quantum Science and Technology Laboratory, Physical Research Laboratory, Navrangpura, Ahmedabad 380009, India(量子科学与技术实验室,物理研究实验室,Ahmedabad) Indian Institute of Technology Gandhinagar, Palaj, Gandhinagar 382055, India(印度理工学院冈达塞瓦尔)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究评估了不同大型语言模型在量子力学问题上的表现,揭示了模型层级、任务难度及工具增强效果的差异,提供了可重复的基准和性能分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21193 2026-02-20 cs.CL 88%

Estonian Native Large Language Model Benchmark

爱沙尼亚原生大语言模型基准

Helena Grete Lillepalu, Tanel Alumäe

机构 * Department of Software Science, Tallinn University of Technology, Estonia(软件科学系,塔林技术大学,爱沙尼亚)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL

AI总结 本文提出爱沙尼亚语言的大语言模型基准,通过七个多样化的数据集评估不同模型的性能,结合人类和LLM评判方法,验证了高性能模型在爱沙尼亚语言评估中的有效性。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16639 2026-02-19 cs.CL 88%

AREG: Adversarial Resource Extraction Game for Evaluating Persuasion and Resistance in Large Language Models

AREG:对抗性资源提取游戏用于评估大型语言模型的说服力与抗性

Adib Sakhawat, Fardeen Sadab

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Islamic University of Technology(伊斯兰技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 AREG通过对抗性资源提取游戏评估大型语言模型的说服与抗性能力,发现两者弱相关且存在系统性防御优势。

Comments 15 pages, 5 figures, 11 tables. Includes appendix with detailed experimental results and prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15312 2026-02-18 cs.CL econ.EM 88%

Extracting Consumer Insight from Text: A Large Language Model Approach to Emotion and Evaluation Measurement

从文本中提取消费者洞察:一种大型语言模型方法用于情绪和评价测量

Stephan Ludwig, Peter J. Danaher, Xiaohao Yang, Yu-Ting Lin, Ehsan Abedin, Dhruv Grewal, Lan Du

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究提出Linguistic eXtractor模型,通过大型语言模型有效测量消费者情绪和评价,验证情绪对购买行为的影响,并提供免费网页应用支持大规模分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21654 2026-02-18 cs.AI 88%

ScholarGym: Benchmarking Large Language Model Capabilities in the Information-Gathering Stage of Deep Research

ScholarGym:在深度研究的信息收集阶段评估大语言模型能力

Hao Shen, Hang Yang, Zhouhong Gu, Weili Han

机构 * Fudan University(复旦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 ScholarGym通过分解深度研究信息收集阶段,评估大语言模型在查询规划、工具调用和相关性评估中的能力差异,揭示开源与专有模型性能差距的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13084 2026-02-16 cs.CL 88%

Exploring a New Competency Modeling Process with Large Language Models

探索基于大语言模型的新能力建模过程

Silin Du, Manqing Xin, Raymond Jia Wang

机构 * School of Economics and Management, Tsinghua University, Beijing, China(经济管理学院,清华大学,北京,中国) Bill-JC Technology, Wuhan, China(Bill-JC科技,武汉,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究提出基于大语言模型的新能力建模方法,通过结构化计算组件提升建模的透明性、数据驱动性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11091 2026-02-12 cs.CL 88%

Can Large Language Models Make Everyone Happy?

大语言模型能否让所有人快乐?

Usman Naseem, Gautam Siddharth Kashyap, Ebad Shabbir, Sushant Kumar Ray, Abdullah Mohammad, Rafiq Ali

机构 * Macquarie University(麦考瑞大学) DSEU-Okhla University of Delhi(德里大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出MisAlign-Profile基准,通过构建MISALIGNTRADE数据集,评估大语言模型在安全、价值和文化维度间的不匹配权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13240 2026-02-10 cs.LG 88%

Knowing What You Know Is Not Enough: Large Language Model Confidences Don't Align With Their Actions

知道你所知道的并不足够:大型语言模型的置信度与行为不一致

Arka Pal, Teo Kitanovski, Arthur Liang, Akilesh Potti, Micah Goldblum

机构 * Vanderbilt University(范德比大学) MIT(麻省理工学院) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 研究发现大型语言模型的置信度与行为不一致,静态校准无法预测动态设置中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07079 2026-02-10 cs.SE cs.CL 88%

Comprehensive Evaluation of Large Language Models on Software Engineering Tasks: A Multi-Task Benchmark

对大型语言模型在软件工程任务中的综合评估:一个多任务基准测试

Go Frendi Gunawan, Mukhlis Amien

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文评估了11种先进LLMs在五个软件工程任务中的表现,发现模型在完成时间、工具效率和成本上存在显著差异,同时揭示了两种低效模式,并展示了编码任务的成功率与研究任务的挑战性差异。

Comments 10 pages, 7 figures. Under review. Code and data will be fully released

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05633 2026-02-06 cs.CL 88%

CASTLE: A Comprehensive Benchmark for Evaluating Student-Tailored Personalized Safety in Large Language Models

CASTLE:一个评估大语言模型学生定制个性化安全性的综合基准

Rui Jia, Ruiyi Lan, Fengrui Liu, Zhongxiang Dai, Bo Jiang, Jing Shao, Jingyuan Chen, Guandong Xu, Fei Wu, Min Zhang

机构 * East China Normal University(华东师范大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Education University of Hong Kong(香港教育大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 CASTLE基准通过评估学生定制个性化安全性,揭示大语言模型在不同学生属性下的安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04142 2026-02-06 cs.CV cs.AI 88%

JSynFlow: Japanese Synthesised Flowchart Visual Question Answering Dataset built with Large Language Models

JSynFlow:利用大语言模型构建的日本合成流程图视觉问答数据集

Hiroshi Sasaki

机构 * The Japan Research Institute, Limited(日本研究所有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 JSynFlow利用大语言模型生成日本流程图视觉问答数据集,提升VLM在流程图问答任务中的性能。

Comments 7 pages, 1 figure

Journal ref Proceedings of the Annual Conference of JSAI, JSAI2025:2Win587-2Win587, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14759 2026-02-06 cs.SE cs.LG 88%

LEANCODE: Understanding Models Better for Code Simplification of Pre-trained Large Language Models

LEANCODE: 为预训练大语言模型的代码简化更好地理解模型

Yan Wang, Ling Ding, Tien N Nguyen, Shaohua Wang, Yanan Zheng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 LeanCode通过上下文感知注意力分数优化代码简化,提升预训练大语言模型在代码搜索和摘要任务中的性能。

Comments ACL 2025 Main. Our code and dataset are available at https://github.com/akai-sh/LeanCode

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 1551-1567 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02738 2026-02-04 cs.SD cs.AI 88%

When Noise Lowers The Loss: Rethinking Likelihood-Based Evaluation in Music Large Language Models

噪声降低损失:重新思考音乐大语言模型中的基于似然的评估

Xiaosha Li, Chun Liu, Ziyu Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) ByteDance Inc.(字节跳动公司) Courant Institute of Mathematical Sciences, New York University(纽约大学应用数学科学研究所) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed人工智能大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出通过损失曲线形状而非绝对值来评估音乐生成质量,揭示模型对局部破坏的敏感性,为更有效的训练目标和基准提供新思路。

Comments Accepted by IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02519 2026-02-04 cs.CY cs.AI 88%

Evaluation of Large Language Models' educational feedback in Higher Education: potential, limitations and implications for educational practice

对高等教育中大语言模型教育反馈的评估:潜力、限制及对教育实践的影响

Daniele Agostini, Federica Picasso

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究评估了大语言模型在高等教育中的教育反馈潜力,发现其能生成结构良好的反馈,但需明确指导以提升教育实践效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02467 2026-02-03 cs.CL 88%

Indications of Belief-Guided Agency and Meta-Cognitive Monitoring in Large Language Models

信念引导的代理与元认知监控在大语言模型中的迹象

Noam Steinmetz Yalon, Ariel Goldstein, Liad Mudrik, Mor Geva

机构 * Blavatnik School of Computer Science and AI(Blavatnik计算机科学与人工智能学院) Tel Aviv University(特拉维夫大学) School of Psychological Sciences(心理学学院) Sagol School of Neuroscience(神经科学学院) Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究 institute) University of Cambridge(剑桥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过HOT-3指标探讨大语言模型中信念引导的代理与元认知监控的存在,揭示了信念形成对行动选择的影响及模型自我监控的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01163 2026-02-03 cs.CV cs.AI 88%

Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models

基于多模态大语言模型的语义感知无人机着陆地评估:从遥感图像

Chunliang Hua, Zeyuan Yang, Lei Zhang, Jiayang Sun, Fengwen Chen, Chunlan Zeng, Xiao Hu

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) LASER, International Digital Economy Academy(LASER,国际数字经济学院) Department of Electronic Engineering, East China Normal University(电子工程系,华东师范大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出基于多模态大语言模型的无人机着陆地评估方法,通过语义感知与多模态融合提升风险识别精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00300 2026-02-03 cs.CL 88%

Faithful-Patchscopes: Understanding and Mitigating Model Bias in Hidden Representations Explanation of Large Language Models

Faithful-Patchscopes: 理解和缓解大语言模型隐藏表示解释中的模型偏差

Xilin Gong, Shu Yang, Zehua Cao, Lynne Billard, Di Wang

机构 * University of Georgia(佐治亚大学) King Abdullah University of Science(国王阿卜杜勒-阿齐兹大学) Hong Kong Center for Construction Robotics(香港建筑机器人中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出BALOR方法,通过logit校准缓解大语言模型隐藏表示解释中的模型偏差,提升解释的忠实度和上下文信息的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06307 2026-02-02 cs.AI 88%

Can AI Make Energy Retrofit Decisions? An Evaluation of Large Language Models

人工智能能做出能源改造决策吗?大型语言模型的评估

Lei Shu, Dong Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文评估了大型语言模型在住宅能源改造决策中的表现,发现其在技术目标上表现较好,但在社会技术决策上受限于经济权衡和本地环境,需进一步提升准确性与上下文处理能力。

Journal ref Buildings 2025, 15(22), 4081

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13524 2026-02-02 cs.CL 88%

OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models

OMGEval: 一种开放的多语言生成评估基准用于大型语言模型

Yang Liu, Meng Xu, Shuo Wang, Liner Yang, Haoyu Wang, Zhenghao Liu, Cunliang Kong, Yun Chen, Yang Liu, Maosong Sun, Erhong Yang

机构 * Beijing Language and Culture University(北京语言大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Northeastern University(东北大学) Shanghai University of Finance and Economics(上海金融学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 OMGEval是一个开放的多语言生成评估基准,通过提供多种语言的开放性问题,评估大型语言模型在不同文化背景下的能力,旨在提升多语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20546 2026-01-29 cs.CL 88%

Beyond Divergent Creativity: A Human-Based Evaluation of Creativity in Large Language Models

超越发散性创造:基于人类的大型语言模型创造力评估

Kumiko Nakajima, Jan Zuiderveld, Sandro Pezzelle

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出CDAT任务,基于人类创造力理论,评估LLMs在新颖性与适当性之间的平衡,发现较小模型更具创造力,而高级模型更注重适当性。

Comments Accepted to Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23565 2026-01-29 cs.CV cs.AI 88%

RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature

RxnBench: 一个用于评估大语言模型在科学文献中理解化学反应的多模态基准

Hanzheng Li, Xi Fang, Yixuan Li, Chaozheng Huang, Junjie Wang, Xi Wang, Hongzhe Bai, Bojun Hao, Shenyu Lin, Huiqi Liang, Linfeng Zhang, Guolin Ke

机构 * DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Peking University(北京大学) New York University(纽约大学) Fudan University(复旦大学) Xiamen University(厦门大学) ShanghaiTech University(上海科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 RxnBench通过两个任务评估大语言模型在化学反应理解上的能力,揭示模型在深度化学逻辑和结构识别上的不足,强调需改进视觉编码和推理能力以推动AI化学发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11254 2026-01-28 cs.CL 88%

Do Psychometric Tests Work for Large Language Models? Evaluation of Tests on Sexism, Racism, and Morality

心理测试在大语言模型中是否有效?对性别歧视、种族主义和道德的测试评估

Jana Jung, Marlene Lutz, Indira Sen, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS - Leibniz Institute for the Social Sciences(莱比锡社会科学研究所) Complexity Science Hub Vienna(维也纳复杂科学中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究评估了心理测试在大语言模型上的有效性,发现其在性别歧视、种族主义和道德方面的测试分数与模型行为不一致,表明需进一步调整以适应LLMs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18554 2026-01-27 cs.AI 88%

Deconstructing Instruction-Following: A New Benchmark for Granular Evaluation of Large Language Model Instruction Compliance Abilities

解构指令遵循:一个用于大语言模型指令合规能力细粒度评估的新基准

Alberto Purpura, Li Wang, Sahil Badyal, Eugenio Beaufrand, Adam Faulkner

机构 * Card Intelligence, Capital One(Card Intelligence,Capital One)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出MOSAIC基准,通过细粒度分析揭示大语言模型在复杂指令遵循中的差异与弱点,为提升模型可靠性提供关键洞察。

Comments Paper accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21679 2026-01-27 cs.CL cs.CY 88%

JiraiBench: A Bilingual Benchmark for Evaluating Large Language Models' Detection of Human Self-Destructive Behavior Content in Jirai Community

JiraiBench:一个双语基准,用于评估大型语言模型在Jirai社区中检测人类自毁行为内容的效果

Yunze Xiao, Tingyu He, Lionel Z. Wang, Yiming Ma, Xingyu Song, Xiaohang Xu, Mona Diab, Irene Li, Ka Chung Ng

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学) The Hong Kong Polytechnic University(香港理工大学) The University of Tokyo(东京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 JiraiBench通过双语评估揭示文化接近性在检测自毁内容中的重要性,展示跨语言知识迁移的潜力。

Comments 20 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15277 2026-01-22 cs.CL 88%

Robust Fake News Detection using Large Language Models under Adversarial Sentiment Attacks

利用大语言模型在对抗性情感攻击下的鲁棒虚假新闻检测

Sahar Tahmasebi, Eric Müller-Budack, Ralph Ewerth

机构 * TIB – Leibniz Information Centre for Science TIB -- Leibniz Information Centre for Science Marburg University \& Hessian Center for Artificial Intelligence (hessian.AI) Marburg/Darmstadt \ TIB \& L3S Research Center Hannover Germany

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出AdSent框架,通过可控情感对抗攻击和情感无关训练策略,提升虚假新闻检测在对抗性情感攻击下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15188 2026-01-22 cs.SE cs.AI cs.PL 88%

Benchmarking Large Language Models for ABAP Code Generation: An Empirical Study on Iterative Improvement by Compiler Feedback

对大型语言模型在ABAP代码生成中的性能评估:一项通过编译器反馈实现迭代改进的实证研究

Stephan Wallraven, Tim Köhne, Hartmut Westenberger, Andreas Moser

机构 * Technische Hochschule Köln(科隆技术大学) CONSILIO GmbH(CONSILIO公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究通过实证分析评估了大型语言模型在生成ABAP代码中的性能,探讨了编译器反馈对迭代改进的影响,并揭示了不同模型在任务类型上的表现差异。

Comments 20 pages, 10 figures, Author: Hartmut Westenberger (ORCID: 0009-0009-9063-8318)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14261 2026-01-22 cs.CV cs.HC cs.LG 88%

Intelligent Power Grid Design Review via Active Perception-Enabled Multimodal Large Language Models

通过主动感知多模态大语言模型实现智能电网设计审查

Taoliang Tan, Chengwei Ma, Zhen Tian, Zhao Lin, Dongdong Li, Si Shi

机构 * Yangjiang Yangxi Power Supply Bureau, Guangdong Power Grid Co., Ltd., Yangjiang, China(阳江阳西供电局,广东电网公司) Guangdong Laboratory of Artificial Intelligence(广东人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出基于主动感知多模态大语言模型的智能电网设计审查方法,通过三阶段框架提升对设计错误的识别准确性和审查可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏