arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1498 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1498 篇

2511.01390 2026-07-03 cs.CV cs.AI cs.MM 版本更新 70%

SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment

SEPS:面向细粒度跨模态对齐的语义增强补丁精简框架

Xinyu Mao, Junsi Li, Haoji Zhang, Yu Liang, Ming Sun

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SEPS框架,通过两阶段机制整合稠密与稀疏文本语义,识别显著视觉补丁,并利用相关性感知选择与均值计算突出关键补丁-词对应,提升跨模态相似度评估,在Flickr30K和MS-COCO上rSum提升23%-86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03137 2026-07-02 cs.AI 版本更新 70%

Think-Before-Speak: From Internal Evaluation to Public Expression in Multi-Agent Social Simulation

Think-Before-Speak: 从内部评估到多智能体社会模拟中的公开表达

Kaiqi Yang, Tai-Quan Peng, Sanguk Lee, Hui Liu

机构 * Michigan State University(密歇根州立大学) Hankuk University of Foreign Studies(韩国民法大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出TBS框架,通过分离智能体的内部推理与公开话语生成,模拟从内部评估到公开表达的路径,并在气候政策讨论中验证其机制敏感性。

Comments 8 pages of main content, 14 pages including references and appendices, 3 figures. Accepted to the KDD'26 Workshop on SciSoc Agents & LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00767 2026-07-02 cs.LG 版本更新 70%

ActivityNarrated: An Open-Ended Narrative Paradigm for Wearable Human Activity Understanding

ActivityNarrated: 一种面向可穿戴人类活动理解的开放性叙事范式

Lala Shakti Swarup Ray, Mengxi Liu, Alcina Pinto, Deepika Gurung, Daniel Geissler, Paul Lukowoicz, Bo Zhou

机构 * DFKI Kaiserslautern(德国人工智能研究中心凯泽斯劳滕) RPTU(莱茵兰-普法尔茨州凯泽斯劳滕-兰道工业大学)

专题命中 评测与基准 :language model(abstract);small language model(abstract);分类 cs.LG

AI总结 本文提出一种开放性叙事范式,通过将可穿戴传感器数据与自然语言描述对齐,实现开放词汇环境下的人类活动理解,实验表明其在跨参与者评估中表现优于传统闭合集方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16859 2026-07-02 cs.AI 版本更新 70%

SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models

SocialOmni: 全模态模型中音视频社交互动性的基准测试

Tianyu Xie, Jinfa Huang, Yuexiao Ma, Rongfang Luo, Yan Yang, Wang Chen, Yuhui Zeng, Yixuan Zou, Qingchuan Ma, Zhiqiang Lu, Ruize Fang, Xiawu Zheng, Jiebo Luo, Rongrong Ji

机构 * Media Analytics and Computing Lab, Xiamen University(厦门大学媒体分析与计算实验室) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究所) School of Informatics, Xiamen University(厦门大学信息学院) Sichuan Agricultural University(四川农业大学) Department of Computer Science, University of Rochester(罗切斯特大学计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SocialOmni基准,从说话人分离、打断时机和自然打断生成三个维度评估全模态大模型的社交互动能力,发现感知准确性与上下文打断生成能力存在显著脱耦。

Comments Code is available at https://github.com/MAC-AutoML/SocialOmni and dataset is available at https://huggingface.co/datasets/alexisty/SocialOmni

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06701 2026-07-02 cs.SE cs.AI 版本更新 70%

Structural Enforcement of Statistical Rigor in AI-Driven Discovery: A Functional Architecture

AI驱动发现中统计严谨性的结构强制:一种功能架构

Karen Sargsyan

机构 * Institute of Chemistry, Academia Sinica(中央研究院化学研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出一种功能架构,通过Haskell领域特定语言和OS级沙箱强制统计严谨性,结合Lean~4形式化验证的LORD++在线FDR控制,实现从定理到浮点实现的验证链,有效控制错误发现率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05950 2026-06-29 cs.AI 版本更新 70%

Edit-R2: Context-Aware Reinforcement Learning for Multi-Turn Image Editing

Edit-R2:面向多轮图像编辑的上下文感知强化学习

Yuxiao Ye, Haoran He, Fangyuan Kong, Xintao Wang, Pengfei Wan, Kun Gai, Ling Pan

机构 * Hong Kong University of Science and Technology(香港理工大学) Kuaishou Technology(快手科技)

专题命中 评测与基准 :foundation model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出Edit-R2框架,通过重构会话意图和联合优化推理与生成的强化学习,解决多轮图像编辑中的长上下文稀释和状态污染问题,并在MICE-Bench基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22536 2026-06-29 cs.CV cs.CL 版本更新 70%

SpaceDG: Benchmarking Spatial Intelligence under Visual Degradation

SpaceDG: 在视觉退化下评估空间智能的基准测试

Xiaolong Zhou, Yifei Liu, Ziyang Gong, Jiarui Li, Qiyue Zhao, Muyao Niu, Yuanyuan Gao, Le Ma, Xue Yang, Hongjie Zhang, Zhihang Zhong

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Electronic Science and Technology of China(电子科技大学) Chongqing University(重庆大学) The University of Tokyo(东京大学) Beihang University(北航) Northwestern Polytechnical University(西北工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SpaceDG,首个针对退化感知空间理解的大型数据集,通过物理基础的退化合成引擎生成9种退化类型,评估多模态大语言模型在视觉退化下的空间推理能力,并展示在退化条件下微调可提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17642 2026-06-29 cs.AI 版本更新 70%

Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health Context

Health-ORSC-Bench:衡量健康领域过度拒绝与安全完成的基准

Zhihao Zhang, Liting Huang, Guanghao Wu, Preslav Nakov, Heng Ji, Usman Naseem

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型在健康场景中过度拒绝良性查询或对有害查询不安全遵从的问题,提出Health-ORSC-Bench基准,通过31,920个边界提示评估模型在意图模糊下的过度拒绝与安全完成质量,揭示安全优化模型过度拒绝率达80%。

Comments Accepted by ACL'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05143 2026-06-25 cs.AI cs.IR 版本更新 70%

CausalRAG2: Hierarchical Causal Knowledge Graph Design for RAG

CausalRAG2: 面向RAG的分层因果知识图谱设计

Nengbo Wang, Tuo Liang, Vikash Singh, Chaoda Song, Van Yang, Yu Yin, Jing Ma, Jagdip Singh, Vipin Chaudhary

机构 * Department of Computer and Data Sciences, Case Western Reserve University, Cleveland, OH, USA(计算机与数据科学系,凯斯西储大学,克利夫兰,OH,USA) Design and Innovation Department, Case Western Reserve University, Cleveland, OH, USA(设计与创新部门,凯斯西储大学,克利夫兰,OH,USA)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CausalRAG2框架,通过分层模块间的因果门控机制显式建模因果关系,抑制虚假相关,实现大规模知识图谱上的可扩展推理,并引入HolisQA基准,实验表明其优于现有图基RAG方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17037 2026-06-25 cs.CV cs.AI 版本更新 70%

AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs

AMVICC: 一种用于VLM和IGM跨模态故障模式分析的新型基准

Aahana Basappa, Pranay Goel, Anusri Karra, Anish Karra, Asa Gilmore, Kevin Zhu

机构 * Centennial High School, Frisco, Texas, USA(Centennial High School, Texas, USA) Lebanon Trail High School, Frisco, Texas, USA(Lebanon Trail High School, Texas, USA) West Windsor-Plainsboro High School, Princeton Junction, New Jersey, USA(West Windsor-Plainsboro High School, New Jersey, USA) Algoverse AI Research, Palo Alto, California, USA(Algoververse AI Research, California, USA)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AMVICC基准,通过图像到文本和文本到图像任务系统比较多模态大模型和图像生成模型的视觉推理失败模式,发现故障模式在模型和模态间共享,但存在特定于模型和模态的失败。

Comments 14 pages, 4 figures, 8 tables. Presented at the 39th Conference on Neural Information Processing Systems Workshop: VLM4RWD. Presented at the 43th International Conference on Machine Learning Workshops: ICML 2026 CTB, ICML 2026 FAGEN, ICML 2026 EMM-QA. Authors Aahana Basappa and Pranay Goel contributed equally. Code: https://github.com/AahanaB24/AMVICC, Data: https://doi.org/10.5281/zenodo.17646068

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04458 2026-06-23 cs.CL cs.IR 版本更新 70%

DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation

DoGMaTiQ:面向报告评估的问答片段自动生成

Bryan Li, William Walden, Yu Hou, Gabrielle Kaili-May Liu, Dawn Lawrie, James Mayfield, Eugene Yang, Chris Callison-Burch, Laura Dietz

机构 * Google Inc.(谷歌公司) Johns Hopkins University(约翰霍普金斯大学) University of Maryland(马里兰大学) Yale University(耶鲁大学) University of Pennsylvania(宾夕法尼亚大学) University of New Hampshire(新罕布什尔大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出DoGMaTiQ流水线,通过文档锚定生成、释义聚类和基于质量准则的子选择三步自动生成高质量QA片段,实现报告的全自动评估,在跨语言任务中与人工判断高度相关。

Comments ICTIR '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13312 2026-06-23 cs.MM cs.LG 版本更新 70%

Design-MLLM: A Reinforcement Alignment Framework for Verifiable and Aesthetic Interior Design

Design-MLLM:一种用于可验证且美观的室内设计的强化对齐框架

Yuxuan Yang, Xiaotong Mao, Jingyao Wang

机构 * National Jiangsu University of Finance(江苏财经大学) University of Lorraine(洛林大学) Institute of Electronics and Information Technology, Chinese Academy of Sciences(中国科学院电子信息技术研究所) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Design-MLLM框架,通过双分支美学导向奖励的强化对齐,解决室内设计中空间可行性硬约束与美学偏好软约束的矛盾,生成既可行又美观的设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01152 2026-06-23 cs.AI 版本更新 70%

DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent

DeepResearch-9K:一个具有挑战性的深度研究智能体基准数据集

Tongzhou Wu, Yuhao Wang, Xinyu Ma, Xiuqiang He, Shuaiqiang Wang, Dawei Yin, Xiangyu Zhao

机构 * Shenzhen Technology University(深圳技术大学) City University of Hong Kong(香港城市大学) Baidu Inc.(百度公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 为解决深度研究智能体缺乏大规模挑战性数据集和开源训练框架的问题,构建了DeepResearch-9K数据集,包含9000个多难度问题、搜索轨迹和可验证答案,并开发了开源训练框架DeepResearch-R1,实验表明训练后的智能体在基准测试上达到最优。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25160 2026-06-19 cs.AI 版本更新 70%

ScaleWoB: Guiding GUI Agents with Coding Agents via Large-Scale Environmental Synthesis

SimuWoB: 模拟真实世界移动应用以实现快速且保真的GUI智能体基准测试

Guohong Liu, Jialei Ye, Pengzhi Gao, Wei Liu, Jian Luan, Yunxin Liu, Yuanchun Li

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) University of Electronic Science and Technology of China(电子科技大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus团队)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有移动GUI智能体基准测试与现实应用之间的差距,提出全合成基准SimuWoB,通过鲁棒的虚拟环境生成框架合成高保真任务和环境,自动提供有效奖励,实现对复杂长程交互的高效可重复评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16606 2026-06-19 cs.CL 版本更新 70%

Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech

Omnilingual SONAR:跨语言与跨模态句子嵌入,连接大规模多语言文本与语音

Omnilingual SONAR Team, João Maria Janeiro, Pere-Lluís Huguet Cabot, Ioannis Tsiamas, Yen Meng, Vivek Iyer, Guillem Ramírez, Loic Barrault, Belen Alastruey, Xiang "Tony" Cao, Yu-An Chung, Marta R. Costa-Jussa, David Dale, Kevin Heffernan, Jaehyeong Jo, Artyom Kozhevnikov, Alexandre Mourachko, Christophe Ropers, Holger Schwenk, Paul-Ambroise Duquenne

机构 * FAIR at Meta(Meta的FAIR)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出OmniSONAR模型,通过渐进式训练和教师-学生蒸馏,在数千种语言上实现文本、语音、代码和数学表达式的统一语义嵌入,在跨语言检索和翻译任务上显著降低错误率,并支持零样本语音翻译。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04086 2026-06-18 cs.CL 版本更新 70%

ToolGrad: Efficient Tool-use Dataset Generation with Textual "Gradients"

ToolGrad:利用文本“梯度”高效生成工具使用数据集

Zhongyi Zhou, Kohei Uehara, Haoyu Zhang, Jingtao Zhou, Lin Gu, Ruofei Du, Zheng Xu, Tatsuya Harada

机构 * Google(谷歌) The University of Tokyo(东京大学) RIKEN AIP(日本学术振兴会AIP) Tohoku University(东北大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出ToolGrad框架,通过文本“梯度”引导的迭代过程先构建有效工具使用链再合成用户查询,实现低成本、高成功率的数据生成,训练模型性能超越基线。

Comments ACL 2026 Findings. Source code: https://github.com/zhongyi-zhou/toolgrad

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20002 2026-06-18 cs.CV cs.AI cs.CR 版本更新 70%

Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation

语义路由器:通过单一对抗扰动劫持多模态大语言模型的可行性研究

Changyue Li, Jiaying Li, Youliang Yuan, Jiaming He, Zhicong Huang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) School of Data Science, School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院、人工智能学院、香港中文大学(深圳))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出语义感知通用扰动(SAUP),作为语义路由器同时劫持多个无状态决策,通过理论分析和SORT优化策略实现,在Qwen上对五个目标达到66%攻击成功率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16468 2026-06-18 cs.LG 版本更新 70%

The Road to Artificial SuperIntelligence: A Comprehensive Survey of Superalignment

通往人工超级智能之路:超级对齐的全面综述

HyunJin Kim, DongHyun Ryu, Xiaoyuan Yi, Jing Yao, Jianxun Lian, Muhua Huang, Shitong Duan, JinYeong Bak, Xing Xie

机构 * Microsoft Research Asia(微软亚洲研究院) Sungkyunkwan University(顺天大学) Stanford University(斯坦福大学) Fudan University(复旦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文综述了超级对齐问题,通过分析可扩展监督范式(夹层、自我增强和弱到强泛化)及其局限性,探讨了监督、控制和管理人工超级智能的挑战与路径。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09163 2026-06-16 cs.AI 版本更新 70%

FORTIS: Benchmarking Over-Privilege in Agent Skills

FORTIS:评估代理技能中的过度特权

Shawn Li, Chenxiao Yu, Han Wang, Wei Yang, Ryan Rossi, Franck Dernoncourt, Xiyang Hu, Philip Yu, Chaowei Xiao, Huan Zhang, Yue Zhao

机构 * University of Southern California(南加州大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究) Arizona State University(亚利桑那州立大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现,当前代理技能层普遍存在过度特权问题,模型在选择和执行技能时常超出任务需求,导致性能不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18827 2026-06-16 q-bio.NC cs.AI 版本更新 70%

OmniMouse: Scaling properties of multi-modal, multi-task Brain Models on 150B Neural Tokens

OmniMouse: 基于1500亿神经令牌的多模态多任务脑模型的可扩展性

Konstantin F. Willeke, Polina Turishcheva, Alex Gilbert, Goirik Chakrabarty, Hasan A. Bedel, Paul G. Fahey, Yongrong Qiu, Marissa A. Weis, Michaela Vystrčilová, Taliah Muhammad, Lydia Ntanavara, Rachel E. Froebe, Kayla Ponder, Zheng Huan Tan, Emin Orhan, Erick Cobos, Sophia Sanborn, Katrin Franke, Fabian H. Sinz, Alexander S. Ecker, Andreas S. Tolias

机构 * Department of Ophthalmology, Byers Eye Institute, Stanford University(斯坦福大学眼科学系、比尔斯眼科研究所) Stanford Bio-X, Stanford University(斯坦福大学生物交叉学科) Wu Tsai Neurosciences Institute, Stanford University(斯坦福大学吴泰教授神经科学研究所) Institute of Computer Science and Campus Institute Data Science, University Göttingen(哥廷根大学计算机科学研究所和校园数据科学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 利用小鼠视觉皮层31亿神经元数据,训练多模态多任务模型OmniMouse,在神经预测、行为解码等任务上达到最优,发现性能随数据量可靠提升但模型规模收益饱和,与AI领域标准扩展规律相反。

Comments Published at ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11364 2026-06-16 cs.AI 版本更新 70%

The Missing Knowledge Layer in Cognitive Architectures for AI Agents

AI智能体认知架构中缺失的知识层

Michaël Roynard

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对现有AI智能体认知架构(如CoALA和JEPA)缺乏独立知识层的问题,提出四层分解架构(知识、记忆、智慧、智能),各层具有不同的持久性语义,并通过Python和Rust实现验证了架构分离的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07539 2026-06-16 cs.CL 版本更新 70%

MAWARITH: A Dataset and Benchmark for Legal Inheritance Reasoning with LLMs

MAWARITH:面向大语言模型的法律继承推理数据集与基准

Abdessalam Bouchekif, Shahd Gaben, Samer Rashwani, Somaya Eltanbouly, Mutaz Al-Khatib, Heba Sbahi, Mohammed Ghaly, Emad Mohamed

机构 * Hamad Bin Khalifa University, Qatar(卡塔尔哈马德比内卡菲大学) Nazarbayev University, Kazakhstan(哈萨克斯坦纳扎尔巴耶夫大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MAWARITH数据集,包含12,500个阿拉伯语继承案例,支持端到端的伊斯兰继承推理,并设计MIR-E多阶段评估指标,实验显示商业模型达90%而开源模型低于50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17990 2026-06-16 cs.AI 版本更新 70%

WorkflowPerturb: Calibrated Stress Tests for Evaluating Multi-Agent Workflow Metrics

WorkflowPerturb:用于评估多智能体工作流度量的校准压力测试

Madhav Kanda, Sharad Agarwal, Rodrigo Fonseca, Alok Gautam Kumbhare, Pedro Las-Casas

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出WorkflowPerturb基准,通过对黄金工作流施加分级扰动来评估多智能体工作流度量,揭示度量分数校准不良问题,支持变更管理中的严重性感知解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13725 2026-06-16 cs.CR cs.AI 版本更新 70%

Can We Stop Malicious AI? KILLBENCH: A Benchmark for External AI Kill Switch Feasibility

我们能阻止恶意AI吗?KILLBENCH:外部AI终止开关可行性基准

Sechan Lee, Hyounghun Kim, Sangdon Park

机构 * Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Killbench基准,通过外部信号(如输入文本)评估终止恶意AI代理行为的方法,无需访问内部参数,实验表明在多种模型上外部终止开关具有可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30931 2026-06-15 cs.CL 版本更新 70%

MineExplorer: Evaluating Open-World Exploration of MLLM Agents in Minecraft

MineExplorer: 评估MLLM智能体在Minecraft中的开放世界探索能力

Tianjie Ju, Yueqing Sun, Zheng Wu, Wei Zhang, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Gongshen Liu, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Meituan(美团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MineExplorer基准,通过多智能体合成工作流构建隐式多跳任务,评估多模态大语言模型在Minecraft中的开放世界探索能力,发现长轨迹协调仍是挑战。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05782 2026-06-15 cs.CL 版本更新 70%

FineDialFact: A benchmark for Fine-grained Dialogue Fact Verification

FineDialFact:细粒度对话事实验证基准

Xiangyan Chen, Yufeng Li, Yujian Gan, Arkaitz Zubiaga, Matthew Purver

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对对话系统幻觉检测中事实标签粗粒度的问题,提出细粒度对话事实验证基准FineDialFact,基于公开数据集构建并评估多种基线方法,实验表明思维链推理可提升性能,但最佳F1仅0.74,任务仍具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20763 2026-06-12 cs.LG 版本更新 70%

ShapeBench: A Scalable Benchmark and Diagnostic Suite for Standardized Evaluation in Aerodynamic Shape Optimization

ShapeBench: 一种可扩展的基准和诊断套件,用于气动形状优化的标准化评估

Shaghayegh Fazliani, Krissh Chawla, Jack Guo, Yiren Shen, Matthias Ihme, Madeleine Udell

机构 * Stanford University(斯坦福大学) Spinoza Labs(斯皮诺扎实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出ShapeBench,一个开源的气动形状优化基准,提供统一的API,涵盖103个任务和八个形状类别,通过验证的代理模型和高保真CFD流程进行系统分析,展示了不同形状类别和问题形式中优化器排名的显著差异,强调了需要更通用方法的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21227 2026-06-12 cond-mat.mtrl-sci cs.AI 版本更新 70%

PhononBench:A Large-Scale Phonon-Based Benchmark for Dynamical Stability in Crystal Generation

PhononBench:面向晶体生成中动态稳定性的基于声子的大规模基准

Xiao-Qi Han, Ze-Feng Gao, Wen-Kao Li, Peng-Jie Guo, Zhong-Yi Lu

机构 * School of Physics, Renmin University of China(中国人民大学物理学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PhononBench,首个大规模AI生成晶体动态稳定性基准,利用MatterSim势高效计算声子,评估7个模型生成的133,838个结构,发现平均动态稳定性率仅32.15%。

Comments 53 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18289 2026-06-11 cs.CL cs.CY cs.MA 版本更新 70%

Food4All: An Agentic Framework and Benchmark for Food Resource Navigation with Adaptive User Understanding

Food4All: 一种具有自适应用户理解能力的食物资源导航智能体框架与基准

Yiyang Li, Weixiang Sun, Tianyi Ma, Kaiwen Shi, Zheyuan Zhang, Yanfang Ye

机构 * University of Notre Dame(诺特大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Food4All框架,结合食物搜索工具与300个多轮评估任务,在686个印第安纳食物资源上评估六种大语言模型,诊断其在约束条件处理和非理想用户交互中的不足。

Comments We have further refined the benchmark construction and experimental presentation to improve clarity and consistency. The revised version includes updated task design, food-resource data, and evaluation details to better align the benchmark with the intended food resource referral setting. These changes provide a more precise presentation of the experimental findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07840 2026-06-11 cs.IR cs.AI 版本更新 70%

SAGE: Scalable AI Governance & Evaluation

SAGE: 可扩展的人工智能治理与评估

Benjamin Le, Xueying Lu, Nick Stern, Wenqiong Liu, Igor Lapchuk, Xiang Li, Baofen Zheng, Kevin Rosenberg, Jiewen Huang, Zhe Zhang, Abraham Cabangbang, Satej Milind Wagle, Jianqiang Shen, Raghavan Muthuregunathan, Abhinav Gupta, Mathew Teoh, Andrew Kirk, Thomas Kwan, Jingwei Wu, Wenjing Zhang

机构 * LinkedIn Corporation(LinkedIn公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SAGE框架,通过双向校准循环将高质量的人类产品判断转化为可扩展的评估信号,解决了大规模搜索系统中相关性评估的治理差距问题,并实现了92倍成本降低的模型迭代和政策监督。

详情

展开后加载摘要…

URL PDF HTML 收藏