arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-12 至 2026-02-12 共收录 51 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 51 篇

2602.10799 2026-02-12 cs.CV cs.AI 89%

RSHallu: Dual-Mode Hallucination Evaluation for Remote-Sensing Multimodal Large Language Models with Domain-Tailored Mitigation

RSHallu: 远程传感多模态大语言模型的双模式幻觉评估与领域定制缓解

Zihui Zhou, Yong Feng, Yanying Chen, Guofan Duan, Zhenxi Song, Mingliang Zhou, Weijia Jia

机构 * College of Computer Science, Chongqing University(重庆大学计算机科学学院) Heavy Rainfall Research Center of China(中国强降水研究中心) CMA Key Open Laboratory of Transforming Climate Resources to Economy, Chongqing Institute of Meteorological Sciences(中国气象局气候资源转化经济重点开放实验室、重庆气象科学研究院) Chongqing Metropolitan College of Science(重庆科学理工学院) School of Intelligence Science(智能科学学院) College of Artificial Intelligence, Harbin Institute of Technology(人工智能学院、哈尔滨工业大学) BNU-UIC Institute of Artificial Intelligence(北京师范大学-国际学院人工智能与未来网络研究院) Future Networks, Beijing Normal University at Zhuhai(未来网络、北京师范大学珠海分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 RSHallu通过双模式检查和领域定制数据集,提升遥感多模态大语言模型的幻觉缓解效果,提高无幻觉率21.63个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09210 2026-02-12 cs.CV cs.AI 89%

MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models

MME-Emotion:多模态大语言模型情感智能的综合评估基准

Fan Zhang, Zebang Cheng, Chong Deng, Haoxuan Li, Zheng Lian, Qian Chen, Huadai Liu, Wen Wang, Yi-Fan Zhang, Renrui Zhang, Ziyu Guo, Zhihong Zhu, Hao Wu, Haixin Wang, Yefeng Zheng, Xiaojiang Peng, Xian Wu, Kun Wang, Xiangang Li, Jieping Ye, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室) SZTU(深圳技术大学) Peking University(北京大学) Tongji University(同济大学) CASIA(中国科学院自动化所) Tencent(腾讯) UCLA(加州大学洛杉矶分校) Westlake University(西湖大学) NTU(国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 MME-Emotion是首个评估多模态大语言模型情感智能的综合基准,揭示当前模型在情感识别和推理上的不足,并通过多智能体框架提供混合指标分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11022 2026-02-12 cs.IT math.IT 89%

Information Abstraction for Data Transmission Networks based on Large Language Models

基于大语言模型的数据传输网络中的信息抽象

Haoyuan Zhu, Haonan Hu, Jie Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出信息抽象度(DIA)作为衡量信息压缩与语义保留的度量,通过大语言模型引导的视频传输实验,展示了DIA在降低传输开销和保持语义保真方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10119 2026-02-12 cs.LG cs.AI cs.CL cs.CY 89%

Large Language Models Predict Functional Outcomes after Acute Ischemic Stroke

大型语言模型预测急性缺血性中风后的功能结局

Anjali K. Kapoor, Anton Alyakin, Jin Vivian Lee, Eunice Yang, Annelene M. Schulze, Krithik Vishwanath, Jinseok Lee, Yindalon Aphinyanaphongs, Howard Riina, Jennifer A. Frontera, Eric Karl Oermann

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了大型语言模型在预测急性缺血性中风后功能结局中的有效性,发现微调后的Llama模型在准确率上表现优异,可替代传统结构化数据方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10354 2026-02-12 cs.CL cs.LG 88%

Physically Interpretable AlphaEarth Foundation Model Embeddings Enable LLM-Based Land Surface Intelligence

可解释的AlphaEarth基础模型嵌入使基于大语言模型的地表智能成为可能

Mashrekur Rahman

机构 * Dartmouth College(达特茅斯学院)

专题命中 评测与基准 :LLM(title,abstract);foundation model(title,abstract);分类 cs.CL、cs.LG

AI总结 基于AlphaEarth基础模型的可解释嵌入,通过检索增强生成实现地表智能,验证了卫星嵌入在环境决策中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11091 2026-02-12 cs.CL 88%

Can Large Language Models Make Everyone Happy?

大语言模型能否让所有人快乐?

Usman Naseem, Gautam Siddharth Kashyap, Ebad Shabbir, Sushant Kumar Ray, Abdullah Mohammad, Rafiq Ali

机构 * Macquarie University(麦考瑞大学) DSEU-Okhla University of Delhi(德里大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出MisAlign-Profile基准,通过构建MISALIGNTRADE数据集,评估大语言模型在安全、价值和文化维度间的不匹配权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09651 2026-02-12 cs.CV cs.AI cs.LG 88%

Geospatial Representation Learning: A Survey from Deep Learning to The LLM Era

地理空间表示学习:从深度学习到大语言模型时代的一次综述

Xixuan Hao, Yutian Jiang, Xingchen Zou, Jiabo Liu, Yifang Yin, Song Gao, Flora Salim, Tianrui Li, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) The University of New South Wales(新南威尔士大学) Southwest Jiaotong University(西南交通大学) Institute for Infocomm Research (I$^2$R), A*STAR(信息通信研究院(I$^2$R),A*STAR)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文综述了从深度学习到大语言模型时代的地理空间表示学习,探讨了其方法、应用及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10748 2026-02-12 cs.DB 88%

Benchmarking Large Language Models for Knowledge Graph Validation

对大型语言模型在知识图谱验证中的基准测试

Farzad Shami, Stefano Marchesin, Gianmaria Silvello

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出FactCheck基准,评估大型语言模型在知识图谱验证中的性能,发现其在稳定性、可靠性及多模型共识策略上的不足,强调了建立系统评估框架的重要性。

Comments Accepted paper by the 29th International Conference on Extending Database Technology (EDBT'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10639 2026-02-12 cs.CV cs.CR cs.MM 88%

VideoSTF: Stress-Testing Output Repetition in Video Large Language Models

VideoSTF: 视频大语言模型中输出重复性压力测试

Yuxin Cao, Wei Song, Shangzhi Xu, Jingling Xue, Jin Song Dong

机构 * National University of Singapore(新加坡国立大学) University of New South Wales(新南威尔士大学) CSIRO’s Data61(CSIRO数据61)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 VideoSTF通过系统测量和压力测试揭示视频大语言模型中普遍存在的输出重复问题,发现其对时间扰动高度敏感,并暴露了其作为安全漏洞的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10881 2026-02-12 cs.CL cs.AI cs.LG 87%

Diagnosing Structural Failures in LLM-Based Evidence Extraction for Meta-Analysis

诊断基于大型语言模型的证据提取在元分析中的结构性故障

Zhiyin Tan, Jennifer D'Souza

机构 * L3S Research Center, Leibniz University Hannover(莱比锡大学汉诺威分校L3S研究中心) TIB Leibniz Information Centre for Science(莱比锡信息中心科学与技术研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现当前LLM在元分析中存在结构性缺陷,导致关联元组提取不可靠,需改进结构性和数值基础。

Comments Accepted at the 22nd Conference on Information and Research Science Connecting to Digital and Library Science (IRCDL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21963 2026-02-12 cs.CY cs.AI cs.CL cs.SI 86%

Industrialized Deception: The Collateral Effects of LLM-Generated Misinformation on Digital Ecosystems

工业化的欺骗:大语言模型生成的虚假信息对数字生态系统的影响

Alexander Loth, Martin Kappes, Marc-Oliver Pahl

机构 * Frankfurt University of Applied Sciences(法兰克福应用科学大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出JudgeGPT和RogueGPT工具,研究人类对AI生成虚假信息的感知与检测,探讨生成与检测之间的竞争及缓解策略。

Comments Accepted at ACM TheWebConf '26 Companion

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17512 2026-02-12 cs.AI cs.CL 86%

Is Your LLM Really Mastering the Concept? A Multi-Agent Benchmark

你的大语言模型真的掌握了概念吗?一个多智能体基准

Shuhang Xu, Weijian Deng, Yixuan Zhou, Fangwei Zhong

机构 * Beijing Normal University(北京师范大学) Australian National University(澳大利亚国立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CK-Arena,通过多智能体社交推理游戏评估大语言模型的概念理解能力,揭示模型在概念掌握上的差异性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16252 2026-02-12 cs.CL 85%

Does Localization Inform Unlearning? A Rigorous Examination of Local Parameter Attribution for Knowledge Unlearning in Language Models

定位信息是否有助于去学习?对语言模型中知识去学习的局部参数归因的严格检验

Hwiyeong Lee, Uiji Hwang, Hyelim Lim, Taeuk Kim

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文通过实验验证局部参数更新对语言模型知识去学习的有效性,发现参数局部性并不必然指示有效知识去除。

Comments The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10620 2026-02-12 cs.SE cs.CL 85%

ISD-Agent-Bench: A Comprehensive Benchmark for Evaluating LLM-based Instructional Design Agents

ISD-Agent-Bench: 一个用于评估基于大语言模型的教学系统设计代理的全面基准

YoungHoon Jeon, Suwan Kim, Haein Son, Sookbun Lee, Yeil Jeong, Unggi Lee

机构 * Upstage Opentutorials Indiana University Bloomington(印第安纳大学布卢明顿分校) Korea University Sejong Campus(韩国大学世宗校区)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ISD-Agent-Bench通过结合经典ISD理论与现代推理方法,为评估基于LLM的教学系统设计代理提供了全面的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10568 2026-02-12 cs.LG 85%

Gauss-Newton Unlearning for the LLM Era

大语言模型时代的Gauss-Newton反学习

Lev McKinney, Anvith Thudi, Juhan Bae, Tara Rezaei, Nicolas Papernot, Sheila A. McIlraith, Roger Grosse

机构 * University of Toronto(多伦多大学) MIT(麻省理工学院) Vector Institute for Artificial Intelligence(人工智能向量研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 K-FADE通过K-FAC近似实现大语言模型的高效反学习,减少遗忘集影响的同时保留保留集行为。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10453 2026-02-12 cs.CR cs.CL 85%

The Landscape of Prompt Injection Threats in LLM Agents: From Taxonomy to Analysis

大语言模型代理中提示注入威胁的图景:从分类到分析

Peiran Wang, Xinfeng Li, Chong Xiang, Jinghuai Zhang, Ying Li, Lixia Zhang, Xiaofeng Wang, Yuan Tian

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述了大语言模型代理中提示注入威胁的分类与分析,提出AgentPI基准以评估依赖上下文交互的代理行为,揭示现有防御的局限性并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10171 2026-02-12 cs.SE cs.AI 85%

EvoCodeBench: A Human-Performance Benchmark for Self-Evolving LLM-Driven Coding Systems

EvoCodeBench:用于自演化LLM驱动编码系统的性能基准

Wentao Zhang, Jianfeng Wang, Liheng Liang, Yilei Zhao, HaiBin Wen, Zhe Zhao

机构 * Nanyang Technological University(南洋理工大学) East China University of Science and Technology(东华大学) Guangdong Ocean University(广东海洋大学) City University of Hong Kong(香港城市大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EvoCodeBench通过跨语言对比和人类表现评估,评估自演化LLM驱动编码系统的性能提升与效率改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10715 2026-02-12 cs.CL cs.AI 84%

Locomo-Plus: Beyond-Factual Cognitive Memory Evaluation Framework for LLM Agents

Locomo-Plus:面向LLM代理的超越事实性认知记忆评估框架

Yifei Li, Weidong Guo, Lingling Zhang, Rongman Xu, Muye Huang, Hui Liu, Lijiao Xu, Yu Xu, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) Tencent(腾讯)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 LoCoMo-Plus提出一种基于约束一致性的评估框架,用于评估LLM代理在长期对话中处理隐含约束的能力,揭示现有基准无法捕捉的认知记忆挑战。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07815 2026-02-12 cs.CV 82%

Out of the box age estimation through facial imagery: A Comprehensive Benchmark of Vision-Language Models vs. out-of-the-box Traditional Architectures

走出盒子进行年龄估计:一种视觉-语言模型与传统架构全面基准的比较

Simiao Ren, Xingyu Shen, Ankit Raj, Albert Dai, Caroline, Zhang, Yuan Xu, Zexi Chen, Siqi Wu, Chen Gong, Yuxin Zhang

机构 * Reality Inc Duke University(杜克大学) New York University(纽约大学) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract)

AI总结 本文通过对比视觉-语言模型与传统架构,发现零样本VLM在面部年龄估计中表现优于专门模型,且在年龄验证中显著降低误判率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10848 2026-02-12 cs.LG cs.AI 81%

Time Series Foundation Models for Energy Load Forecasting on Consumer Hardware: A Multi-Dimensional Zero-Shot Benchmark

用于消费者硬件的能源负载预测时间序列基础模型:一个多维零样本基准

Luigi Simeone

机构 * Independent Researcher, Turin, Italy(独立研究者, 意大利都灵)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个多维零样本基准,评估了四种时间序列基础模型在能源负载预测中的表现,揭示了预训练模型在准确性、校准和鲁棒性上的优势。

Comments 27 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10371 2026-02-12 cs.LG 79%

Simple LLM Baselines are Competitive for Model Diffing

简单的LLM基线在模型差异分析中具有竞争力

Elias Kempf, Simon Schrodi, Bartosz Cywiński, Thomas Brox, Neel Nanda, Arthur Conmy

机构 * University of Freiburg(弗赖堡大学) MATS IDEAS Research Institute(IDEAS研究所)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

AI总结 本文提出评估指标,比较了基于LLM和SAE的方法在模型差异分析中的性能,发现改进的LLM基线方法在表现上与SAE方法相当,且能揭示更多抽象行为差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10118 2026-02-12 cs.CL cs.CY 79%

Reviewing the Reviewer: Elevating Peer Review Quality through LLM-Guided Feedback

审查审查者:通过LLM引导的反馈提升同行评审质量

Sukannya Purkayastha, Qile Wan, Anne Lauscher, Lizhen Qu, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, Technical University of Darmstadt and National Research Center for Applied Cybersecurity ATHENE, Germany(技术大学达姆施塔特计算机科学系 Ubiquitous Knowledge Processing Lab(UKP Lab)及国家应用网络安全研究中心 ATHENE,德国) Department of Data Science & AI, Monash University, Australia(墨尔本大学数据科学与人工智能系,澳大利亚) Data Science Group, University of Hamburg(汉堡大学数据科学组)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出一种基于LLM的框架,通过分解评审段落、识别问题并生成针对性反馈,提升同行评审质量,实验显示其效果优于现有方法,提高了92.4%的评审质量。

Comments 39 pages, 22 figures, 29 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23001 2026-02-12 cs.CL cs.AI 79%

Bias Beyond Borders: Political Ideology Evaluation and Steering in Multilingual LLMs

偏见超越国界:多语言大语言模型中的政治意识形态评估与引导

Afrozah Nadeem, Agrima Seth, Mehwish Nasim, Usman Naseem

机构 * School of Computing, Macquarie University, Australia(麦考瑞大学计算机学院) Microsoft, USA(微软公司) University of Western Australia, Australia(西澳大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出跨语言对齐引导框架,用于评估和减轻多语言LLM中的政治偏见,通过跨语言对齐意识形态表示以实现公平性与多样性的平衡。

Comments PrePrint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10529 2026-02-12 cs.CY 78%

Drawing Your Programs: Exploring the Applications of Visual-Prompting with GenAI for Teaching and Assessment

绘制你的程序:探索视觉提示与生成式AI在教学与评估中的应用

David H. Smith, S. Moonwara A. Monisha, Annapurna Vadaparty, Leo Porter, Daniel Zingaro

专题命中 评测与基准 :prompting(title,abstract)

AI总结 本文探讨利用视觉提示与生成式AI在编程教学与评估中的应用,通过学生构建的分解图提示GPT-4.1生成代码,展示多模态提示在编程教育中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10964 2026-02-12 cs.AI 77%

Can LLMs Cook Jamaican Couscous? A Study of Cultural Novelty in Recipe Generation

LLMs能否制作牙买加 couscous?对 recipe generation 中文化新颖性的研究

F. Carichon, R. Rampa, G. Farnadi

机构 * MILA, McGill University(蒙特利尔大学MILA) École de technologie supérieure (ÉTS)(高等技术学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究LLMs在生成食谱时对文化新颖性的表现,发现其无法有效生成文化代表性的食谱,揭示了LLMs在文化导向生成中的局限性。

Comments 14 pages, 12 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10367 2026-02-12 cs.AI 77%

LiveMedBench: A Contamination-Free Medical Benchmark for LLMs with Automated Rubric Evaluation

LiveMedBench: 一个无污染的医疗基准测试,用于具有自动评分评估的LLM

Zhiling Yan, Dingjie Song, Zhe Fang, Yisheng Ji, Xiang Li, Quanzheng Li, Lichao Sun

机构 * Lehigh University(莱维大学) Harvard University(哈佛大学) Imperial College London(伦敦帝国学院) Massachusetts General Hospital(麻省总医院) Harvard Medical School(哈佛医学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LiveMedBench通过持续更新和自动评分框架,提供无污染的医疗基准测试,验证LLM在临床推理中的性能,揭示数据污染和上下文适应性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10758 2026-02-12 cs.SE 75%

Hidden Licensing Risks in the LLMware Ecosystem

LLM生态系统中的隐藏许可风险

Bo Wang, Yueyang Chen, Jieke Shi, Minghui Li, Yunbo Lyu, Yinan Wu, Youfang Lin, Zhou Yang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出LiAgent框架,通过LLM分析LLMware生态系统的许可证兼容性,显著提升检测性能,发现多个潜在的许可证冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10138 2026-02-12 cs.CV cs.AI cs.CL cs.LG 75%

Multimodal Information Fusion for Chart Understanding: A Survey of MLLMs -- Evolution, Limitations, and Cognitive Enhancement

多模态信息融合用于图表理解:MLLMs的综述——演变、局限与认知增强

Zhihang Yi, Jian Zhao, Jiancheng Lv, Tao Wang

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) Engineering Research Center of Machine Learning(机器学习工程研究中心) China Telecom Institute of AI(中国电信人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了多模态大语言模型在图表理解中的应用,分析了其演变、局限及未来发展方向,旨在推动更稳健的系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16471 2026-02-12 cs.CV 75%

Order from Chaos: Physical World Understanding from Glitchy Gameplay Videos

秩序从混沌:从 glitchy 游戏视频中理解物理世界

Meng Cao, Haoran Tang, Haoze Zhao, Mingfei Han, Ruyang Liu, Qiang Sun, Xiaojun Chang, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Peking University(北京大学) University of Toronto(多伦多大学) Sun Yat-sen University(孙中山大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出 PhysGame 数据集和 GameBench 基准,通过利用游戏视频中的 glitch 异常,提升物理推理能力,实验显示在多个基准上取得显著提升。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10833 2026-02-12 cs.SE 75%

SELU: A Software Engineering Language Understanding Benchmark

SELU:软件工程语言理解基准

Fabian C. Peña, Steffen Herbold

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 SELU基准评估了LLMs在软件工程文本理解任务中的性能,发现微调模型表现最佳,领域适应未显著提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏