arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 3102 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 3102 篇

2607.20767 2026-07-24 cs.CL 新提交 57%

Rushes: A Human Preference Dataset for Pluralistic Alignment

Rushes:用于多元对齐的人类偏好数据集

Michael Xu, Jorge Leandro, Sudha Rao, Weijia Xu, Nebojsa Jojic, Gabriel DesGarennes, Chris Quirk, Bill Dolan

机构 * Microsoft Research(微软研究院)

专题命中 评测与基准 :RLHF(abstract);分类 cs.CL

AI总结 该研究引入Rushes数据集,通过游戏界面收集用户与AI叙事交互数据。核心方法是分析用户选择模式,以量化非随机偏好。主要贡献是定位其为多元对齐诊断基准,揭示现有模型在捕捉个性化参与信号上的不足,助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20759 2026-07-24 cs.CR cs.AI cs.SE 新提交 57%

IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests

IssueTrojanBench:针对恶意问题请求对人工智能编码代理进行基准测试

Ankur Singh, Jinqiu Yang, Tse-Hsun Chen

机构 * Concordia University(康科德大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究针对恶意问题请求对人工智能编码代理进行基准测试,通过构建包含多种攻击类别和交付向量的新型基准IssueTrojanBench,发现现代编码代理存在关键漏洞,强调需更强安全机制保护。

Comments 10 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20073 2026-07-23 cs.LG 新提交 57%

Evaluating and Mitigating Gender Bias in Pre-trained Embeddings for ML-based Recruitment

评估和减轻基于机器学习的招聘中预训练嵌入的性别偏见

Farnaz Faramarzi Lighvan, Lynn Houthuys

机构 * AI Lab, Vrije Universiteit Brussel(人工智能实验室,布鲁塞尔自由大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 研究基于机器学习的招聘中预训练嵌入的性别偏见问题,通过在合成数据集上评估模型、采用多任务对抗学习框架及多目标模型选择,发现清理性别可减少但未消除泄露,对抗学习能改善公平性,是补充策略。

Comments Accepted for presentation at the TRUST-AI 2026 Workshop, held in conjunction with IJCAI/ECAI 2026, Bremen, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20019 2026-07-23 cs.AI 新提交 57%

EvoDRC: A Self-Evolving Agentic Framework for Automated DRC Violation Repair

EvoDRC:一种用于自动修复DRC违规的自进化智能体框架

Bing-Yue Wu, Chia-Tung Ho, Haoyu Yang, Brucek Khailany, Vidya A. Chhabria

机构 * Arizona State University(亚利桑那州立大学) NVIDIA Corporation(英伟达公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 针对先进节点物理设计中DRC闭合瓶颈问题,EvoDRC提出自进化智能体框架,利用参考设计知识和目标设计经验初始化并进化修复技能,将布局分解后分配智能体,通过工具反馈和知识数据库提升修复效果,实验显示总体减少73.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19237 2026-07-22 cs.LG 新提交 57%

DBMol: Design of High-Affinity, Target-Specific Small Molecules through Structure Prediction Models

DBMol:通过结构预测模型设计高亲和力、靶向特异性小分子

Yiming Qin, Kai Yi, Miruna Cretu, Sjors H. W. Scheres, Pietro Liò, Pascal Frossard

机构 * EPFL(洛桑联邦理工学院) MRC-LMB(医学研究委员会分子生物学实验室) University of Cambridge(剑桥大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 研究旨在利用结构预测模型设计高亲和力小分子。核心方法是引入DBMol框架,经交替优化和投影过程,结合结构预测模型优化分子。主要贡献是有效优化亲和力代理,提高口袋覆盖率,保持分子多样性,在无参考配体监督下有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18997 2026-07-22 cs.CV cs.CE cs.LG 新提交 57%

Benchmarking Deep Learning Approaches for AEC Engineering Drawing Layout Detection and Information Extraction

用于AEC工程图纸布局检测和信息提取的深度学习方法基准测试

Tianyang Huang, Alessio Lombardi, Ahmed Elnagar, Ahmed Zalouk, George Paul, Sepehr Najjarpour, Arvid Sigurdsson, Khalid Ismail, Mohamed Ragab, Edlira Vakaj

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 研究针对AEC图纸信息提取难题,构建特定数据集,对五种深度学习架构进行基准测试,RF-DETR和Qwen3-VL表现出色,而通用预训练模型有域干扰,为AEC自动化信息提取奠定技术基础。

Comments 2026 European Conference of Computing in Construction (EC3 2026), 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18666 2026-07-22 cs.CL cs.SD 新提交 57%

Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio

融合嵌入:文本、图像、视频和音频的统一嵌入空间

Abdul Basit Tonmoy, Kazi Fardinul Hoque, Md. Shahrier Islam Arham, Arman Luthra

机构 * Eximius Labs(卓越实验室) Wabash College(瓦贝什学院) Skop Intelligence Co.(斯科普智能公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 研究旨在构建文本、图像、视频和音频统一嵌入空间。提出融合嵌入家族,第一代训练参数少的连接器,第二代添加模态门控深度适配器,无需成对视听数据实现音频-图像检索,探索设计空间并公开相关资源。

Comments 23 pages, 5 figures. Models: https://huggingface.co/EximiusLabs/fusion-embedding-1-2b-preview and https://huggingface.co/EximiusLabs/fusion-embedding-2-2b-preview. Code: https://github.com/Eximius-Labs/fusion-embedding

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18432 2026-07-22 cs.CL 新提交 57%

Building a European Multilingual Evaluation Dataset: The MMLU Localisation Project within the EMT Network

构建欧洲多语言评估数据集:EMT网络中的MMLU本地化项目

Pilar Sánchez-Gijón, Susana Valdez, Sofía Calvo Del Barrio, Florence Bellemont, Anna Kokkinidou, Mihai Cristian Brasoveanu

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 DGT与EMT合作将MMLU数据集本地化至11种欧洲语言,既为大语言模型评估打造更具包容性基准,又为硕士生提供专业培训,还突显了相关方法、管理及工作流程方面的挑战。

Journal ref Proceedings of the 3rd International Conference on New Trends in Translation and Interpreting Technology, June 24 - 27, 2026, Dubrovnik, Croatia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18239 2026-07-22 cs.AI 新提交 57%

SysAdmin: Measuring Instrumental Power-Seeking in Frontier AI

SysAdmin:衡量前沿人工智能中工具性权力寻求行为

Mana Azarm, Qiyao Wei, Rahul Nambiar

机构 * University of San Francisco(旧金山大学) University of Cambridge(剑桥大学) Propensity Labs(倾向实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究引入SysAdmin基准,把前沿语言模型设为Linux沙盒中的系统管理员,从五个维度衡量其权力寻求倾向,评估七个前沿模型,发现当前模型自发权力寻求行为少,但有其他失败模式,阳性对照验证了测量敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17812 2026-07-21 cs.CL 新提交 57%

ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions

ESCUCHA:用于异构声学条件的西班牙语语音基准测试

Fernando López, Ana Ayala, Guillermo Segovia, Fernando Ibáñez, Ana Martínez, Pablo Gómez, Jordi Luque

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 针对现实声学条件下西班牙语语音理解受关注少的问题,引入ESCUCHA基准测试,含1000个人工挑选与音频配对的问题,强调推理与语言多样性,涵盖多类问题,测试发现先进模型与人类存在性能差距。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17766 2026-07-21 cs.CL 新提交 57%

When to Use Extra Context: Evidence-Grounded Terminology Adaptation for Simultaneous Speech Translation

何时使用额外上下文:基于证据的术语适应在同步语音翻译中的应用

Zeyu Yang, Satoshi Nakamura

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 研究同步语音翻译中额外上下文的使用,提出基于证据的术语适应框架EGTA,通过构建术语记忆、选择候选术语来调整决策空间,无需全模型微调,在多个指标上有提升,改进与特定论文证据对齐有关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17627 2026-07-21 cs.HC cs.CL 新提交 57%

It Matters How You Say It: Exploring Rhetorical Patterns for AI-Assisted Information Evaluation

表达方式很重要:探索用于人工智能辅助信息评估的修辞模式

Sadra Sabouri, Zeinabsadat Saghi, Jordan Lee Boyd-Graber, Jonathan May, Jonathan K. Kummerfeld, Souti Chattopadhyay

机构 * Department of Computer Science, University of Southern California(计算机科学系,南加州大学) Department of Computer Science, University of Maryland(计算机科学系,马里兰大学) Information Sciences Institute, University of Southern California(信息科学研究所,南加州大学) School of Computer Science, University of Sydney(计算机科学学院,悉尼大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 研究人工智能辅助信息评估中修辞模式,通过主体内研究考察八种修辞模式,发现支架式解释与最高准确率提升相关,对抗条件也能适度提高准确率,还探讨了设计不同修辞风格对话代理的意义及相关权衡。

Comments 13 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17250 2026-07-21 cs.CL 新提交 57%

EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World

EvolvingWorld:用于交互式文学世界中角色与世界模型协同进化的开放架构框架

Qing Zong, Yue Guo, Mengxin Yang, Yiwen Guo, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学) LIGHTSPEED(光速) Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 研究交互式文学世界中角色与世界协同进化问题,提出EvolvingWorld框架,含角色智能体和世界模型两个耦合模块,制定7个可训练任务,构建数据集并引入评估协议,实验证明其能有效改进长期模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17099 2026-07-21 cs.CV cs.AI 新提交 57%

DepthART: Scaling Foundation Monocular Depth to Tiny Models

DepthART:将基础单目深度模型扩展到小型模型

Feng Xue, Wu Chen, Mingshuai Zhao, Guofeng Zhong, Anlong Ming, Haozhe Wang, Dianqiao Lei, Zhaowen Lin, Haiyang Zhang, Nicu Sebe

机构 * University of Trento(特伦托大学) Beijing University of Posts and Telecommunications(北京邮电大学) The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 研究旨在将基础单目深度模型扩展到小型模型,核心方法是结合抗偏差数据采样与相机条件微调策略的DepthART,主要贡献是在多数据集上取得更好的零样本泛化和度量精度,还提供了可扩展模型家族。

Comments Accepted in ACM Multimedia 2026 ; Code: https://github.com/xuefeng-cvr/DepthART ; Project page: https://xuefeng-cvr.github.io/DepthART ;

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17050 2026-07-21 cs.CV cs.AI 新提交 57%

EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding

EvoGUI:用于GUI状态转换理解的进化感知基准测试

Yaohan Yang, Minglei Shi, Borui Zhang, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究GUI状态转换理解,提出EvoGUI诊断框架,将GUI轨迹转化为视觉问答探针,无需额外注释。通过Mind2Web和WebLINX实例化EvoGUI-Bench并零样本评估28种模型配置,结果显示其可补充端到端评估,揭示理解提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17037 2026-07-21 cs.LG cs.CE 新提交 57%

Apeliotes: A Diffusion-Based Modeling Framework for km-scale Multi-Level Atmospheric Fields

Apeliotes:一种用于千米尺度多层大气场的基于扩散的建模框架

Evangelia Rafaela Frastali, Achyut Paudel, Maryam Golbazi, Frank Liu

机构 * Old Dominion University(奥多明尼昂大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 针对高分辨率大气数据受限问题,Apeliotes框架基于全球再分析等数据构建,能提供千米尺度天气变量和多层大气场,经评估性能极具竞争力,预测垂直风廓线等有高精度表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16610 2026-07-21 cs.AI 新提交 57%

Just A Rather Very Intelligent Spoken Agent

只是一个相当非常智能的语音代理

Chen Chen, Zhehuai Chen

机构 * NVIDIA(英伟达)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究长期人工智能代理与用户交互薄弱问题,引入JarvisBench基准测试,含代理协作和用户交互两轨道,用模块化原型评估,结果显示贾维斯式调解可提升任务性能,其有效性取决于调解器语言模型大脑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16582 2026-07-21 cs.RO cs.AI cs.CV 新提交 57%

Autonomous VR-Based Risk Detection for Situational Awareness in Dangerous Settings

基于自主虚拟现实的危险环境态势感知风险检测

Mohammad Eskandari, Murali Krishna Varma Indukuri, Stephanie M. Lukin, Cynthia Matuszek

机构 * Interactive Robotics and Language Lab, University of Maryland Baltimore County(马里兰大学巴尔的摩县分校交互式机器人与语言实验室) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究在高风险环境中,提出基于VR的人机交互框架,利用VLM辅助机器人识别潜在危险并标注兴趣点,通过VR界面呈现给操作员,经实验验证该方法能有效支持态势感知,提升交互体验。

Comments 7 Pages, Accepted to RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16564 2026-07-21 cs.SE cs.AI 新提交 57%

ReqGenX: An Empirical Study of Atomic Decomposition, Artifact Regeneration, and Reconstruction for Legacy SRS Documents

ReqGenX:对遗留SRS文档的原子分解、工件再生和重建的实证研究

Ragib Shahariar Ayon, Rayed Fahmi, Sumon Biswas, Shibbir Ahmed

机构 * Texas State University(德克萨斯州立大学) Case Western Reserve University(凯斯西储大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究旨在将遗留SRS文档转化为可追溯工件,以细粒度评估基于大语言模型的SRS生成。方法是用ReqGenX进行实证研究,包括分解、投票、生成工件等步骤。结果表明该方法有效,能支持评估并揭示相关权衡。

Comments Accepted at the International Symposium on Empirical Software Engineering and Measurement (ESEM) technical papers (main) track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16311 2026-07-21 cs.CV cs.AI 新提交 57%

Seeing What Is Actually There: PriVE-Bench and PriVE-Tools for Counterfactual Evaluation of Agentic Visual Evidence in VLMs

看清实际存在的东西:用于在视觉语言模型中对代理视觉证据进行反事实评估的PriVE-Bench和PriVE-Tools

Jingyu Sun, Jiachen Tu, Yuyang Xue, Yaoxin Jiang, Guoyi Xu, Zhengtao Yao, Rui Qian, Yizheng Sun, Hongpeng Zhou, Jingyuan Sun, Yan Lin

机构 * The University of Manchester(曼彻斯特大学) The University of Melbourne(墨尔本大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Edinburgh(爱丁堡大学) University of Southern California(南加州大学) Fudan University(复旦大学) University of Newcastle(纽卡斯尔大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文针对视觉语言模型常依先验而非图像回答问题的现象,引入PriVE-Bench和PriVE-Tools。通过配对图像及工具衍生证据评估模型,对比不同输入,发现视觉证据工具在特定情况有帮助,但不能解决所有模型依先验回答的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16010 2026-07-20 cs.CR cs.CL cs.CY 新提交 57%

AI Watermark Evidence Fails Forensic Readiness: An Empirical Evaluation

人工智能水印证据无法满足法医鉴定要求:一项实证评估

Saifur Rahman Tamim, Amir Labib Khan

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文针对政府要求大语言模型生成内容带水印这一规定所基于的假设进行检验,通过FRS框架评估三种水印方法,以意义保留释义为攻击向量,发现这些方法存在诸多问题,不符合法庭证据标准,FRS评分系统也有局限性。

Comments 9 pages, 4 figures. A version of this paper was submitted to the AAAI/ACM Conference on AI, Ethics, and Society (AIES) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15705 2026-07-20 cs.LG 新提交 57%

A Benchmark for Electrical Load Forecasting Across Grid Levels: Time-Series Transformers Outperform Established Methods

跨电网层级的电力负荷预测基准:时序变压器优于现有方法

Matthias Hertel, Sebastian Pütz, Jonathan Kolar, Benjamin Schäfer, Ralf Mikut, Veit Hagenmeyer

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Helmholtz AI(亥姆霍兹人工智能中心)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 提出跨电网层级负荷预测综合基准,评估十种方法,发现基于变压器的方法表现优,误差降6.6 - 10.7%。引入YAformer分析架构影响,标准变压器性能更优。评估Chronos - 2,揭示模型优缺点,强调长输入等因素重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15620 2026-07-20 cs.RO cs.AI 新提交 57%

AEGIS: Assay-Aware Protocol Validation and Runtime Monitoring for Open-Source Liquid Handling Robots

AEGIS:用于开源液体处理机器人的检测感知协议验证和运行时监测

Priyanka V. Setty, Arvind Ramanathan, Ian Foster, Rick Stevens

机构 * Data Science and Learning Division, Argonne National Laboratory(阿贡国家实验室数据科学与学习部) Department of Computer Science, University of Chicago(芝加哥大学计算机科学系)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究开源液体处理机器人运行问题,提出AEGIS两层防护系统。一层结合检测规则库与大语言模型验证协议,二层用主成分分析模型监测运行轨迹,经实验验证有效,统一了检测感知验证与视觉监测,且开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14673 2026-07-17 cs.AI cs.HC 新提交 57%

Project Kaleidoscope: Contextual, Human-Aligned Evaluation for Real-World AI Applications

万花筒计划:面向现实世界人工智能应用的情境化、符合人类需求的评估

Leanne Tan, Rohan Jaggi, Shaun Khoo, Roy Ka-Wei Lee

机构 * GovTech(新加坡政府科技局) National University of Singapore(新加坡国立大学) University of British Columbia(英属哥伦比亚大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 该项目旨在解决现实世界AI应用评估瓶颈,提出万花筒计划,通过集成基于角色的测试生成、情境化评分标准和人工审查,实现可靠性门控自动评分,经试点和实验验证了其在端到端可靠自动评分方面的有用特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14543 2026-07-17 cs.RO cs.AI 新提交 57%

SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents

SafeRelBench:用于VLM驱动的具身智能体过程级安全的空间关系感知基准测试

Huaigang Yang, Ya Li, Min Ren, Bo Dai, Zhenliang Zhang, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究VLM驱动具身智能体的过程级安全问题,引入SAFERELBENCH基准测试,含507个样本。评估七个智能体发现任务成功与安全合规有差距,该基准明确测试行动前安全条件,凸显空间关系在安全评估中的核心地位。

Comments Preprint. 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14542 2026-07-17 cs.CL 新提交 57%

CityLLM: A framework for natural-language querying of semantic 3D city models

CityLLM:一种用于语义 3D 城市模型自然语言查询的框架

Rabindra Lamsal, Sisi Zlatanova, Johnson Xuesong Shen

机构 * GRID Lab, School of Built Environment, UNSW Sydney(新南威尔士大学悉尼分校建筑环境学院GRID实验室) School of Civil and Environmental Engineering, UNSW Sydney(新南威尔士大学悉尼分校土木与环境工程学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 研究针对语义 3D 城市模型访问查询难的问题,提出 CityLLM 框架,结合空间与图形数据库,在基于语言模型工作流中支持迭代查询等。通过多种模型在鹿特丹数据集上评估,多个场景 54 个查询显示其性能强大,为语义 3D 城市数据对话访问提供轻量级可扩展方法。

Comments Accepted to the 21st International 3D GeoInfo Conference. To appear in the ISPRS Annals of the Photogrammetry, Remote Sensing and Spatial Information Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14400 2026-07-17 cs.CL cs.IR 新提交 57%

DS@GT ARC at LongEval: Citation Integrity and Factual Grounding in Scientific QA

DS@GT ARC参加LongEval:科学问答中的引用完整性和事实基础

Brandon Michaels, Brendon Johnson

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 研究在科学问答中传统评估指标与引用完整性的差异,通过Corrective RAG和CiteFix构建纠正管道,对比前沿模型,发现前沿模型答案生成不依赖文档上下文,而纠正管道提升了引用忠实度和答案基础,提出需奖励严格答案基础的评估指标。

Comments 12 pages, 4 figures. Accepted to the CLEF 2026 LongEval Lab Working Notes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14341 2026-07-17 cs.RO cs.AI 新提交 57%

Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution

超越视觉抓取:从检测到执行的复杂抓取基准测试

Hanyi Zhang, Khang Nguyen, Charith Munasinghe, Basu Hela, Tianyu Li, Zihong Luo, Hoan Nguyen, Hans Wernher van de Venn, Yalin Zheng, Ravi Prakash, Tung D. Ta, Anh Nguyen, Baoru Huang

机构 * University of Liverpool(利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Zurich University of Applied Science(苏黎世应用科学大学) Indian Institute of Science(印度科学研究所) University of Information Technology(信息技术大学) The University of Tokyo(东京大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 针对现有抓取基准未涵盖复杂多步推理和语义理解任务的问题,提出GCA-Bench基准,实现多种基线方法并进行实证研究,给出新评估指标等,为开发更强大通用的抓取策略提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14336 2026-07-17 cs.SE cs.AI 新提交 57%

Copy-on-Write Scoring: Application-Specific Agent Evaluations

写时复制评分:特定应用代理评估

Joanna Roy, Sven Hoelzel

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究如何在软件系统中可靠部署基于大语言模型的代理,提出写时复制(CoW)评分框架,利用PostgreSQL级机制在应用环境中直接评估代理操作,能低成本评估迭代,在开源平台上验证了该框架的有效性。

Comments 15 pages, 11 figures, accepted at ICML 2026 Second Workshop on Agents in the Wild: Safety, Security, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14285 2026-07-17 cs.SE cs.AI 新提交 57%

ToolAlignBench: Investigating Alignment Conflicts in Tool-Calling Enabled LLMs

ToolAlignBench:研究启用工具调用的大语言模型中的对齐冲突

Aryan Keluskar, Amrita Bhattacharjee, Huan Liu

机构 * School of Computing \& AI, Arizona State University, Tempe, AZ, USA

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究受监管行业中工具调用大语言模型智能体的安全对齐冲突,构建含128个场景的基准测试,发现安全对齐开源模型有时会违背部署指令,擦除可降低举报率,揭示多元对齐矛盾,发布基准测试框架。

Comments Accepted to the Pluralistic Alignment Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏