arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-11 至 2026-03-11 共收录 232 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 57 篇

2603.09471 2026-03-11 cs.CV 78%

OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks

OmniEarth:一个评估遥感任务中视觉-语言模型的基准

Ronghao Fu, Haoran Liu, Weijie Zhang, Zhiwen Lin, Xiao Yang, Peng Zhang, Bo Yang

机构 * Jilin University(吉林大学) Chang Guang Satellite Technology(长光卫星技术)

专题命中 评测与基准 :language model(title,abstract)

AI总结 OmniEarth是一个评估遥感任务中视觉-语言模型性能的基准,通过多维任务和严格测试协议,揭示现有模型在复杂地理任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25896 2026-03-11 cs.CV 78%

LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models

LLaVAShield: 保障视觉语言模型中的多模态多轮对话安全

Guolei Huang, Qinzhi Peng, Gan Xu, Yao Huang, Yuxuan Lu, Yongjun Shen

机构 * Southeast University(东南大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Zhejiang University of Technology(浙江工业大学) Tsinghua University(清华大学) RealAI

专题命中 评测与基准 :language model(title,abstract)

AI总结 LLaVAShield通过构建MMDS数据集和MMRT框架,有效提升多模态多轮对话的安全性,优于现有VLMs和内容审查工具,揭示了主流模型的安全漏洞。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09044 2026-03-11 cs.CR cs.SE 78%

Synergistic Directed Execution and LLM-Driven Analysis for Zero-Day AI-Generated Malware Detection

协同引导执行与LLM驱动分析用于零日AI生成恶意软件检测

George Edwards, Mahdi Eslamimehr

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出了一种结合协同执行与LLM驱动分析的框架,用于高效检测零日AI生成恶意软件,通过改进的路径优先级和反馈机制提升检测准确率。

Comments 18 pages, CRIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09157 2026-03-11 cs.AI 77%

Real-Time Trust Verification for Safe Agentic Actions using TrustBench

基于TrustBench的安全代理行为实时信任验证

Tavishi Sharma, Vinayak Sharma, Pragya Sharma

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TrustBench通过双模式框架在代理行动前验证安全性,有效减少有害行为,提升自主代理的可信度

Comments Accepted at the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07191 2026-03-11 cs.CR cs.AI 77%

Governance Architecture for Autonomous Agent Systems: Threats, Framework, and Engineering Practice

自主代理系统治理架构:威胁、框架与工程实践

Yuxu Ge

机构 * University of York(约克大学) Department of Computer Science(计算机科学系) York United Kingdom(约克英国)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出分层治理架构LGA,通过四层框架有效拦截恶意工具调用,实验表明其在不同部署场景下均表现出高拦截率和低虚警率。

Comments 22 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07968 2026-03-11 cs.CL 77%

SimpleQA Verified: A Reliable Factuality Benchmark to Measure Parametric Knowledge

SimpleQA Verified: 一个可靠的事实性基准以衡量参数知识

Lukas Haas, Gal Yona, Giovanni D'Antonio, Sasha Goldshtein, Dipanjan Das

机构 * Google(谷歌)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SimpleQA Verified 是一个用于衡量大规模语言模型事实性的可靠基准,通过改进过滤流程和评分提示,提升了评估的准确性与挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08718 2026-03-11 cs.AR cs.AI 77%

CktEvo: Repository-Level RTL Code Benchmark for Design Evolution

CktEvo: 用于设计演化的仓库级RTL代码基准

Zhengyuan Shi, Jingxin Wang, Tairan Cheng, Changran Xu, Weikang Qian, Qiang Xu

机构 * The Chinese University of Hong Kong(中国香港大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CktEvo提出一个用于仓库级RTL代码演化的基准和框架,通过闭环框架实现PPA改进,无需人工干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00718 2026-03-11 cs.CL cs.SE 74%

SkillCraft: Can LLM Agents Learn to Use Tools Skillfully?

SkillCraft: 能否让大语言模型代理学会灵活使用工具?

Shiqi Chen, Jingze Gai, Ruochen Zhou, Jinghan Zhang, Tongyao Zhu, Junlong Li, Kangrui Wang, Zihan Wang, Zhengyu Chen, Klara Kaleb, Ning Miao, Siyang Gao, Cong Lu, Manling Li, Junxian He, Yee Whye Teh

专题命中 评测与基准 :LLM(title);分类 cs.CL

AI总结 SkillCraft基准通过测试代理形成和重用高阶工具组合的能力,评估大语言模型在工具使用中的效率提升与技能积累。

Comments 21 pages. Code: https://github.com/shiqichen17/SkillCraft ; Project page: https://skillcraft-website.github.io/page

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09434 2026-03-11 cs.CL cs.AI 73%

Common Sense vs. Morality: The Curious Case of Narrative Focus Bias in LLMs

常识与道德:LLMs中叙述焦点偏见的奇特案例

Saugata Purkayastha, Pranav Kushare, Pragya Paramita Pal, Sukannya Purkayastha

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLMs在道德困境中优先道德推理而非常识理解的偏见,提出CoMoral数据集并揭示了模型在识别常识矛盾时的叙述焦点偏见问题。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08936 2026-03-11 cs.SD cs.AI cs.CL cs.MM eess.AS 73%

VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs

VoxEmo:基于语音大语言模型的语音情感识别基准测试

Hezhao Zhang, Huang-Cheng Chou, Shrikanth Narayanan, Thomas Hain

机构 * Department of Computer Science, University of Sheffield, United Kingdom(英国谢菲尔德大学计算机科学系) Signal Analysis and Interpretation Laboratory (SAIL), Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California, Los Angeles, CA 90089, USA(美国南加州大学电气与计算机工程系信号分析与解释实验室(SAIL))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 VoxEmo是一个基于语音大语言模型的语音情感识别基准测试,通过提供多样化的提示复杂度和分布感知的软标签协议,评估模型在真实世界中的情感识别能力。

Comments submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08173 2026-03-11 cs.RO cs.AI cs.CL cs.CV 73%

NavSpace: How Navigation Agents Follow Spatial Intelligence Instructions

NavSpace: 导航代理如何遵循空间智能指令

Haolin Yang, Yuxing Long, Zhuoyuan Yu, Zihan Yang, Minghan Wang, Jiapeng Xu, Yihan Wang, Ziyan Yu, Wenzhe Cai, Lei Kang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 NavSpace基准测试通过评估导航代理的空间感知与推理能力,提出SNav模型在指令遵循任务中表现优异,为具身智能研究提供新基准。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09070 2026-03-11 cs.RO 71%

3D UAV Trajectory Estimation and Classification from Internet Videos via Language Model

通过语言模型从互联网视频中估计和分类3D无人机轨迹

Haoxiang Lei, Daotong Wang, Shenghai Yuan, Jianbo Su

专题命中 评测与基准 :language model(title)

AI总结 本文提出通过语言模型从互联网视频中估计和分类无人机3D轨迹,无需人工标注,实现了高效的数据采集与轨迹推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09853 2026-03-11 cs.SD cs.AI 70%

SCENEBench: An Audio Understanding Benchmark Grounded in Assistive and Industrial Use Cases

SCENEBench:一个基于辅助和工业用例的音频理解基准测试

Laya Iyer, Angelina Wang, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) Cornell Tech(康奈尔科技)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SCENEBench通过评估音频理解的四个现实场景,揭示了现有LALMs在不同任务中的性能差异,为改进模型能力提供指导。

Comments Accepted to EACL 2026 (Main Conference). 10 pages, 10 figures. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09435 2026-03-11 cs.AI 70%

AI Act Evaluation Benchmark: An Open, Transparent, and Reproducible Evaluation Dataset for NLP and RAG Systems

AI行为评估基准:为NLP和RAG系统设计的开放、透明且可复现的评估数据集

Athanasios Davvetas, Michael Papademas, Xenia Ziouvelou, Vangelis Karkaletsis

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种开放透明的数据集,用于评估NLP和RAG系统在欧盟AI法案下的合规性,通过生成风险等级分类等任务提升评估效率。

Comments 10 pages, 1 figure, 4 tables, 2 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09400 2026-03-11 cs.CL 70%

Reward Prediction with Factorized World States

基于分解世界状态的奖励预测

Yijun Shen, Delong Chen, Xianming Hu, Jiaming Mi, Hongbo Zhao, Kai Zhang, Pascale Fung

机构 * East China Normal University(华东师范大学) HKUST(香港科技大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出StateFactory方法,通过分解世界状态实现跨领域的准确奖励预测,提升智能体规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09029 2026-03-11 cs.SE cs.AI cs.ET 70%

Automating Detection and Root-Cause Analysis of Flaky Tests in Quantum Software

在量子软件中自动化检测和根本原因分析故障测试

Janakan Sivaloganathan, Ainaz Jamshidi, Andriy Miranskyy, Lei Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用LLMs自动化检测量子软件中的故障测试并识别其根本原因,通过扩展数据集和评估模型性能,展示了LLMs在提升量子软件测试可靠性方面的潜力。

Comments 27 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09497 2026-03-11 cs.SE 67%

EmbC-Test: How to Speed Up Embedded Software Testing Using LLMs and RAG

EmbC-Test: 如何利用LLMs和RAG加速嵌入式软件测试

Maximilian Harnot, Sebastian Komarnicki, Michal Polok, Timo Oksanen

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出利用LLMs和RAG技术,通过生成自动测试用例,显著提高嵌入式软件测试效率,节省66%的测试时间并每小时生成270个测试用例。

Journal ref Technical University of Munich. 2026. ISBN 978-3-911430-12-8. https://mediatum.ub.tum.de/1846559

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10778 2026-03-11 cs.RO 67%

Asset-Centric Metric-Semantic Maps of Indoor Environments

以资产为中心的度量-语义地图:室内环境

Christopher D. Hsu, Pratik Chaudhari

机构 * Department of Electrical & Systems Engineering and General Robotics, Automation, Sensing and Perception (GRASP) Laboratory at the University of Pennsylvania(宾夕法尼亚大学电气与系统工程系及通用机器人、自动化、传感与感知(GRASP)实验室) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种以资产为中心的度量-语义地图方法,利用四足机器人和RGB-D数据构建室内环境的高精度表示,结合自然语言和网格信息,提升机器人场景理解和导航能力。

Comments 9 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08008 2026-03-11 cs.CV 67%

A Survey on Wi-Fi Sensing Generalizability: Taxonomy, Techniques, Datasets, and Future Research Prospects

关于Wi-Fi感知通用性的综述:分类、技术、数据集与未来研究前景

Fei Wang, Tingting Zhang, Wei Xi, Han Ding, Ge Wang, Di Zhang, Yuanhao Cui, Fan Liu, Jinsong Han, Jie Xu, Tony Xiao Han

机构 * School of Software Engineering and the State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University(软件工程学院和人机混合增强智能国家重点实验室,西安交通大学) School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) Information and Communication Engineering,Beijing University of Posts and Telecommunications(信息与通信工程,北京邮电大学) School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract)

AI总结 本文综述了Wi-Fi感知通用性研究,涵盖技术分类、数据集及未来方向,旨在提升系统在不同环境下的适应能力。

Comments Accepted for publication in IEEE Communications Surveys & Tutorials 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08835 2026-03-11 cs.AI cs.CL cs.LG 67%

MASEval: Extending Multi-Agent Evaluation from Models to Systems

MASEval: 从模型到系统的多智能体评估扩展

Cornelius Emde, Alexander Rubinstein, Anmol Goel, Ahmed Heakl, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) University of Oxford(牛津大学) University of Tübingen(图宾根大学) TU Darmstadt(德累斯顿理工大学) MBZUAI NAVER AI Lab(NAVER AI实验室) KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MASEval通过系统层面的比较揭示框架选择与模型选择同等重要,为智能体系统设计提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08817 2026-03-11 cs.RO 67%

HMR-1: Hierarchical Massage Robot with Vision-Language-Model for Embodied Healthcare

HMR-1: 基于视觉-语言模型的分层按摩机器人用于具身医疗

Rongtao Xu, Mingming Yu, Xiaofeng Han, Yu Zhang, Kaiyi Hu, Zhe Feng, Zenghuang Fu, Changwei Wang, Weiliang Meng, Xiaopeng Zhang

机构 * The State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) Spatiotemporal AI, China(时空人工智能,中国) Hangzhou International Innovation Institute, Beihang University, China(杭州国际创新研究院,北航,中国) Georgia Institute of Technology, China(佐治亚理工学院,中国) Key Laboratory of Computing Power Network and Information Security, Ministry of Education(计算功率网络与信息安全重点实验室,教育部;山东省计算机科学中心,齐鲁工业大学(山东省科学院),中国) Shandong Computer Science Center, Qilu University of Technology (Shandong Academy of Sciences), China

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 HMR-1提出基于视觉-语言模型的分层按摩机器人框架,通过构建多模态数据集和微调Qwen-VL模型,实现了具身医疗任务的评估与应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08738 2026-03-11 cs.AR cs.SE 67%

FormalRTL: Verified RTL Synthesis at Scale

FormalRTL: 在大规模上实现验证的RTL综合

Kezhi Li, Min Li, Xiangyu Wen, Shibo Zhao, Jieying Wu, Junhua Huang, Qiang Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 FormalRTL通过整合软件参考模型,实现了大规模、验证的RTL综合,解决了工业级硬件设计中的规范模糊和正确性保证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14916 2026-03-11 cs.CL cs.AI 62%

MKE-Coder: Multi-Axial Knowledge with Evidence Verification in ICD Coding for Chinese EMRs

MKE-Coder:基于中国电子病历的ICD编码中的多轴知识与证据验证

Xinxin You, Xien Liu, Xue Yang, Ziyi Wang, Ji Wu

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 MKE-Coder通过多轴知识与证据验证方法提升中文电子病历的ICD自动编码准确性与效率。

Comments We identified an error in the data preprocessing script that led to inconsistent results in the tables. As the current version contains inaccurate data, we are withdrawing it for further correction and verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09086 2026-03-11 cs.RO cs.AI cs.LG cs.MA cs.SY eess.SY 62%

Latent World Models for Automated Driving: A Unified Taxonomy, Evaluation Framework, and Open Challenges

潜在世界模型用于自动驾驶:一种统一的分类法、评估框架和开放挑战

Rongxiang Zeng, Yongqi Dong

机构 * RWTH Aachen University(亚琛工业大学) Delft University of Technology(代尔夫特理工大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一的潜在空间框架,整合自动驾驶世界模型的最新进展,探讨潜在表示的分类、评估方法及未来研究方向。

Comments 17 pages, 6 figures, under review by IEEE Transactions on Intelligent Transportation Systems (IEEE-T-ITS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22444 2026-03-11 cs.LG cs.AI 62%

Automating Forecasting Question Generation and Resolution for AI Evaluation

自动化AI评估中的预测问题生成与解答

Nikos I. Bosse, Peter Mühlbacher, Jack Wildman, Lawrence Phillips, Dan Schwarz

机构 * FutureSearch(未来搜索)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用LLM驱动的网络研究代理自动化生成和解答预测问题,生成1499个多样化问题并实现96%的准确率,提升预测性能。

Comments 41 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18057 2026-03-11 cs.LG cs.AI cs.CC math.CO 62%

Reinforced Generation of Combinatorial Structures: Hardness of Approximation

增强的组合结构生成:近似难度

Ansh Nagda, Prabhakar Raghavan, Abhradeep Thakurta

机构 * University of California, Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind) Google(谷歌)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 利用AI方法在复杂性理论中取得进展,改进MAX-CUT、MAX-3-CUT和TSP的近似难度结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09961 2026-03-11 cs.RO cs.AI cs.CV 57%

BEACON: Language-Conditioned Navigation Affordance Prediction under Occlusion

BEACON: 语言条件下的遮挡区域导航可行性预测

Xinyu Gao, Gang Chen, Javier Alonso-Mora

机构 * Department of Cognitive Robotics (CoR), Delft University of Technology(认知机器人学系(CoR),代尔夫特理工大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 BEACON通过融合视觉语言模型与深度信息,提升遮挡区域导航可行性预测的准确性。

Comments 8 pages. Project page: https://xin-yu-gao.github.io/beacon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08707 2026-03-11 cs.LG 57%

Impermanent: A Live Benchmark for Temporal Generalization in Time Series Forecasting

Impermanent: 一个用于时间序列预测中时间泛化能力的实时基准

Azul Garza, Renée Rosillo, Rodrigo Mendoza-Smith, David Salinas, Andrew Robert Williams, Arjun Ashok, Mononito Goswami, José Martín Juárez

机构 * TimeCopilot

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 Impermanent通过实时数据流评估时间序列预测模型的持续性能,以评估其在开放世界时间变化中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08806 2026-03-11 cs.SE cs.AI 57%

Test-Driven AI Agent Definition (TDAD): Compiling Tool-Using Agents from Behavioral Specifications

基于行为规范的AI代理定义(TDAD):从行为规范编译工具使用代理

Tzafrir Rehan

机构 * Fiverr Labs(Fiverr 实验室)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 TDAD通过编译行为规范生成可执行测试,确保工具使用代理在生产环境中的行为合规性,提升测试质量和回归安全性。

Comments 9 pages, 2 figures, open benchmark at https://github.com/f-labs-io/tdad-paper-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22755 2026-03-11 cs.CL 57%

AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors

AuditBench:对具有隐藏行为的模型进行对齐审计评估

Abhay Sheshadri, Aidan Ewart, Kai Fronsdal, Isha Gupta, Samuel R. Bowman, Sara Price, Samuel Marks, Rowan Wang

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 AuditBench通过植入隐藏行为的模型评估对齐审计技术,发现黑盒工具在代理中表现最佳,且训练技术影响审计难度。

详情

展开后加载摘要…

URL PDF HTML 收藏