arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 832 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 197 篇

2604.07967 2026-06-02 cs.CL cs.AI 79%

AtomEval: Validity-Aware Atomic Evaluation of Adversarial Claim Rewriting in Fact Verification

AtomEval: 事实核查中对抗性声明重写的有效性感知原子评估

Hongyi Cen, Mingxin Wang, Yule Liu, Jingyi Zheng, Hanze Jia, Tan Tang

机构 * Zhejiang University(浙江大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出AtomEval协议,通过原子分解和保留门控,区分有效规避验证与改变命题的重写,并引入VASR指标,解决传统ASR膨胀问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24511 2026-06-02 cs.LG cs.AI cs.CR 79%

Claudini: Autoresearch Discovers State-of-the-Art Adversarial Attack Algorithms for LLMs

Claudini: 自动研究发现针对LLM的最先进对抗攻击算法

Alexander Panfilov, Peter Romov, Igor Shilov, Yves-Alexandre de Montjoye, Jonas Geiping, Maksym Andriushchenko

机构 * MATS ELLIS Institute(MATS ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心) Imperial College London(伦敦帝国理工学院)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种自动研究循环,利用前沿AI代理(如Claude Code和Codex)自动发现针对大语言模型的新型对抗攻击算法,在白盒越狱和提示注入评估中达到最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10541 2026-06-02 cs.LG cs.AI 79%

Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?

重新思考强化学习评估:基准测试能否真正揭示强化学习方法的失败?

Zihan Chen, Yiming Zhang, Hengguang Zhou, Zenghui Ding, Yining Sun, Cho-Jui Hsieh

机构 * HFIPS, Chinese Academy of Sciences(中国科学院HFIPS) University of Science and Technology of China(中国科学技术大学) University of California, Los Angeles(美国加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过引入诊断套件和Oracle性能差距(OPG)指标,发现当前基准测试无法可靠区分强化学习方法在训练集和测试集上的性能差异,并揭示现有方法在分布偏移、难度变化和反事实场景中泛化能力不足,提出更可靠基准设计的三项核心原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09608 2026-06-02 cs.CV cs.AI cs.CL 79%

StreamingVLM: Real-Time Understanding for Infinite Video Streams

StreamingVLM:无限视频流的实时理解

Ruyi Xu, Guangxuan Xiao, Yukang Chen, Liuning He, Yao Lu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 评测与基准 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出StreamingVLM,通过统一训练与流推理的框架,利用注意力汇点状态复用和滑动窗口机制实现无限视频流的实时稳定理解,在Inf-Streams-Eval基准上以8 FPS速度达到66.18%胜率,并提升通用VQA能力。

Comments Published as a conference paper at ICLR 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00112 2026-06-02 cs.NE cs.CV 78%

Evolving to the Aesthetics of a Vision-Language Model

进化到视觉语言模型的美学

Stephen James Krol, Jon McCormack

机构 * SensiLab, Monash University Melbourne, Australia(传感实验室,墨尔本莫纳什大学,澳大利亚)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本研究探索使用视觉语言模型(VLM)通过CLIP-IQA评分或成对比较结合Glicko评级系统来评估进化设计的美学,并与艺术家排名对比分析两种方法的优劣。

Comments Paper presented at ICCC26, June 29 - July 3, 2026, Coimbra, Portugal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20251 2026-06-02 cs.CV eess.IV 78%

Degradation-Aware Metric Prompting for Hyperspectral Image Restoration

退化感知度量提示用于高光谱图像恢复

Binfeng Wang, Di Wang, Haonan Guo, Ying Fu, Jing Zhang

机构 * School of Computer Science and Technology, Beijing Institute of Technology, Beijing, China(北京理工大学计算机科学与技术学院) School of Computer Science, Wuhan University, Wuhan, Hubei, China(武汉大学计算机学院) Zhongguancun Academy, Beijing, China(中关村学院)

专题命中 评测与基准 :prompting(title,abstract)

AI总结 提出退化感知度量提示(DAMP)框架,通过可解释的空间-光谱度量作为退化提示,结合退化自适应混合专家(DAMoE)模块,实现多维度退化统一恢复,在自然和遥感高光谱数据集上达到最先进性能并展现零样本泛化能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01936 2026-06-02 cs.CL 77%

What to Format and How: A Benchmark and Workflow Approach for Document Formatting

格式化什么以及如何格式化:文档格式化的基准与工作流方法

Shihao Rao, Liang Li, Jiapeng Liu, Tong Lin, Bing Li, Xiyan Gao, Peng Fu, Jing Huang, Can Ma

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对内容感知的文档格式化任务,提出基准DocFormBench和工作流方法DocFormFlow,通过解耦目标定位与修改执行,在提升准确率的同时降低token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01276 2026-06-02 cs.CL 77%

Worlds Within Words: Translating Culture in Ancient Chinese Texts with Multi-Agent Coordination

词中世界:基于多智能体协调的古代汉语文本文化翻译

Xiaoqi He, Kaixin Lan, Mu You, Tao Fang, Lidia S. Chao, Derek F. Wong

机构 * NLP2 CT Lab, Department of Computer and Information Science, University of Macau(澳门大学自然语言处理与计算机实验室,计算机与信息科学系) Institute of International Language Services Studies, Macau Millennium College(澳门 millennium 学院国际语言服务研究学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对古代汉语文本中文化负载词的翻译难题,提出多智能体文化感知翻译框架MACAT,通过选择性显化策略动态识别文化短语并注入简洁解释,在中医经典和《论语》上优于基线模型。

Comments The preprint manuscript is 20 pages long and is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00369 2026-06-02 cs.CY cs.LG 77%

Quantifying the Salience of Geo-Cultural Values for Pluralistic Safety Alignment

量化地理文化价值对多元安全对齐的显著性

Arkadiy Saakyan, Charvi Rastogi, Lora Aroyo

机构 * University of Oxford(牛津大学) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.LG

AI总结 通过多层次模型分析,发现文化区域归属对安全评分有显著影响(p<0.05),约10%的项目存在文化敏感性,当前LLM无法可靠替代人类评分员但可辅助筛选。

Comments 119 pages, 13 figures. ICML 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16571 2026-06-02 cs.CL 77%

Utility-Preserving De-Identification for Math Tutoring: Investigating Numeric Ambiguity in the MathEd-PII Benchmark Dataset

数学辅导中的效用保持去标识化:MathEd-PII基准数据集中的数值歧义研究

Zhuqian Zhou, Kirk Vanacore, Bakhtawar Ahtisham, Jinsook Lee, Doug Pietrzak, Daryl Hedley, Jorge Dias, Chris Shaw, Ruth Schäfer, René F. Kizilcec

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 针对数学辅导对话中数值表达式与标识符相似导致过度去标识化的问题,提出MathEd-PII基准数据集,并采用领域感知提示策略(F1达0.821)在保持数据效用的同时有效检测PII。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00986 2026-06-02 cs.CL 77%

ADRA-Bank: A Modular Benchmark for Academic Deep Research Agents

ADRA-Bank:面向学术深度研究智能体的模块化基准

Zhihan Guo, Feiyang Xu, Yifan Li, Muzhi Li, Shuai Zou, Jiele Wu, Han Shi, Haoli Bai, Ho-fung Leung, Irwin King

机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学) National University of Singapore, Singapore, Singapore(新加坡国立大学) Huawei Technologies, Hong Kong SAR, China(华为技术有限公司) Independent(独立)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 针对现有基准侧重检索而忽视规划与推理、且缺乏学术领域覆盖的问题,提出ADRA-Bank模块化基准,包含10个学术领域的200个人工标注实例,并设计ADRA-Eval评估范式,通过端到端和隔离评估两种模式测试规划、检索和推理能力,揭示智能体在跨源检索和跨领域一致性上的不足,并指出提升高层规划能力是释放基础LLM推理潜力的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01930 2026-06-02 cs.CL 77%

OARelatedWork: A Large-Scale Dataset of Related Work Sections with Full-texts from Open Access Sources

OARelatedWork:来自开放获取源的大规模相关工作章节数据集及其全文

Martin Docekal, Martin Fajcik, Pavel Smrz

机构 * Brno University of Technology(布拉格技术大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出OARelatedWork数据集,包含全文和完整相关工作章节,用于从开放获取源生成相关工作,并评估了多种模型,发现大型语言模型在处理全文时事实准确性下降,而人类作者常引入无根据的抽象声明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02547 2026-06-02 cs.GT 75%

Pluralistic Leaderboards

多元排行榜

Nika Haghtalab, Ariel D. Procaccia, Han Shao, Serena Lutong Wang, Kunhe Yang

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对用户偏好异质性导致传统Bradley-Terry模型排名失真的问题,提出基于社会选择理论的局部稳定机制,仅需少量用户比较即可实现稳定的多元排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01993 2026-06-02 cs.CL cs.AI cs.LG 75%

MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?

MMG2Skill: 智能体能否从野外指南中提炼出自我进化的技能?

Xinyu Che, Junqi Xiong, Yunfei Ge, Xinping Lei, Shihao Li, Hang Yan, Han Li, Yuanxing Zhang, Zhiqi Bai, Jinhua Hao, Ming Sun, Han Li, Jiaheng Liu

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MMG2Skill框架,将多模态异构的野外指南编译为可编辑技能,通过轨迹级根因反馈持续改进,在GUI控制、开放游戏和策略卡牌任务中显著提升VLM智能体性能。

Comments 35 pages, 12 figures, 13 tables. Code: https://github.com/NJU-LINK/MMG2Skill

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01286 2026-06-02 cs.SE cs.AI cs.CL cs.LG 75%

BenchEvolver: Frontier Task Synthesis via Solution-Centric Evolution

BenchEvolver: 通过以解决方案为中心的进化进行前沿任务合成

Yangzhen Wu, Aaron J. Li, Wenjie Ma, Li Cao, Ziheng Zhou, Mert Cemri, Shu Liu, Yuran Xiu, Chenxiao Yan, Haikun Zhao, Bin Yu, Ion Stoica, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BenchEvolver框架,通过进化参考解决方案自动生成更难的编程问题,以解决基准饱和问题,并在LiveCodeBench和SciCode上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00118 2026-06-02 cs.SE cs.PL 75%

An Empirical Study on Logging Evolution On Stack Overflow: Trends, Topics, and Challenges

关于 Stack Overflow 上日志演变的实证研究:趋势、主题和挑战

Patrick Loic Foalem, Andre Nguimbous, Foutse Khomh, Heng Li, Ettore Merlo

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 基于 Stack Overflow 上的 216,094 篇帖子,使用大语言模型分类方法,识别出 11 个日志相关主题,并发现容器化环境中的日志记录是最具挑战性的主题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00030 2026-06-02 cs.CY 75%

From Parliamentary Rhetoric to Enacted Law: An NLP Pipeline for Semantic Auditing of the Greek Legislative Process

从议会修辞到制定法:用于希腊立法过程语义审计的NLP流水线

Despoina Antonakaki, Sotiris Ioannidis

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一个多模态计算流水线,通过NLP分析议会辩论和立法文本,揭示法律复杂性、模糊性以及政治承诺与法律实施之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26102 2026-06-02 cs.CV 75%

InstructSAM: Segment Any Instance with Any Instructions

InstructSAM: 根据任意指令分割任意实例

Yuqian Yuan, Wentong Li, Zhaocheng Li, Yutong Lin, Juncheng Li, Siliang Tang, Jun Xiao, Yueting Zhuang, Wenqiao Zhang

机构 * Zhejiang University(浙江大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 提出InstructSAM框架,通过将指令驱动实例分割建模为集合结构查询预测问题,并设计显式推理到实例查询接口,结合视觉语言模型和SAM3实现单次前向传播中的多实例分割。

Comments 19 pages, 8 figures, code: https://github.com/DCDmllm/InstructSAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02443 2026-06-02 cs.CL cs.AI cs.CV 73%

PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning

PaSBench-Video: 面向主动安全预警的流式视频基准

Yusong Zhao, Yuejin Xie, Youliang Yuan, Junjie Hu, Jitian Guo, Yujiu Yang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出PaSBench-Video基准,包含740个视频,评估多模态大模型在危险发生前及时发出预警的能力,发现现有模型在时序精度和低误报率上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02255 2026-06-02 cs.CL cs.AI 73%

Who Annotates in NLP? A Large-scale Assessment of Human Annotation Reporting between 2018 and 2025

谁在NLP中进行标注?2018年至2025年人工标注报告的大规模评估

Maria Kunilovskaya, Gagan Bhatia, Lisa Sophie Albertelli, Yanran Chen, Christian Greisinger, Lotta Kiefer, Christoph Leiter, Subhadeep Roy, Tewodros Achamaleh, Muhammad Arslan Manzoor, Sebastian Pohl, Yufang Hou, Steffen Eger

机构 * NLLG Lab University of Technology Nuremberg(NLLG实验室 梅尔堡技术大学) Interdisciplinary Transformation University(跨学科转型大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究通过大规模审计NLP论文中的人工标注报告,发现标注细节报告不完整,并提出了改进报告质量的框架和建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00014 2026-06-02 cs.CL cs.AI 73%

Toward Robust In-Context Learning: Leveraging Out-of-distribution Proxies for Target Inaccessible Demonstration Retrieval

面向鲁棒的上下文学习:利用分布外代理进行目标不可访问的演示检索

Hao Xu, Rite Bo, Fausto Giunchiglia, Yingji Li, Rui Song

机构 * College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院) Department of Information Engineering and Computer Science, University of Trento, Italy(特伦托大学信息工程与计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出DOPA框架,通过引入分布外代理近似不可访问的目标域并利用马氏距离全局多样性约束,提升大语言模型在分布偏移下的鲁棒性。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25773 2026-06-02 cs.CV cs.AI cs.CL 73%

v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound

v-HUB: 从视觉和声音理解视频幽默的基准

Zhengpeng Shi, Yanpeng Zhao, Jianqun Zhou, Yuxuan Wang, Qinrong Cui, Wei Bi, Songchun Zhu, Bo Zhao, Zilong Zheng

机构 * Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Beijing Institute for General Artificial Intelligence(北京一般人工智能研究院) Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出v-HUB基准,通过非语言短视频评估多模态大语言模型在仅凭视觉线索理解幽默的能力,并发现音频信息有助于提升幽默理解。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22221 2026-06-02 cs.IR cs.AI cs.CL cs.CY 73%

Evaluating Reliability Asymmetries in Chinese Factual Search and AI Answers

评估中文事实搜索与AI答案中的可靠性不对称性

Geng Liu, Li Feng, Mengxiao Zhu, Francesco Pierri

机构 * Department of Electronics, Information and Bioengineering, Politecnico di Milano(电子、信息与生物工程系,米兰理工学院) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过构建基于真实中文搜索日志的查询事实核查数据集,比较传统搜索引擎、大型语言模型和搜索集成AI概览在中文是非问题上的准确性、回答频率、极性差距及区域信息需求差异,揭示可靠性不仅取决于回答正确性,还受回答频率、否定主张处理和信息需求暴露风险影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16953 2026-06-02 cs.AI cs.LG 73%

LLM4Cov: Execution-Aware Agentic Learning for High-coverage Testbench Generation

LLM4Cov:面向高覆盖率测试生成的执行感知智能体学习

Hejia Zhang, Zhongming Yu, Chia-Tung Ho, Haoxing Ren, Brucek Khailany, Jishen Zhao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出LLM4Cov离线智能体学习框架,通过执行验证数据策展、策略感知数据合成和最差状态优先采样,在硬件验证中实现高覆盖率测试生成,4B参数模型在CVDP-ECov上达到69.2%通过率和90.4%平均覆盖率。

Comments ICML'26 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02548 2026-06-02 cs.CL 70%

SN-WER: Script-Normalized WER for Multi-Script Indic ASR Evaluation

SN-WER:用于多脚本印度语ASR评估的脚本归一化词错误率

Priyaranjan Pattnayak

机构 * Oracle America Inc.(Oracle美国公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出SN-WER指标,通过将参考和假设文本音译为规范脚本后计算WER,解决多脚本场景下WER高估错误的问题,在印度语上评估显示可减少高达12%的模型差距。

Comments Accepted to ACL 2026 MeLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02545 2026-06-02 cs.CL 70%

Transferable Self-Harm Surveillance from Emergency Department Triage Notes Using an Evidence-Augmented Machine Learning Approach

基于证据增强机器学习方法的急诊科分诊笔记可迁移自伤监测

Liuliu Chen, Gowri Rajaram, Eleanor Bailey, Katrina Witt, Michelle Lamblin, Jo Robinson, Mike Conway, Vlada Rozova

机构 * School of Computing and Information Systems, University of Melbourne(墨尔本大学计算与信息系) Orygen Centre for Youth Mental Health, University of Melbourne(墨尔本大学青年心理健康中心) Centre for Digital Transformation of Health, University of Melbourne(墨尔本大学医疗数字化转型中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出一种结合大语言模型筛选与证据提取的三阶段机器学习方法,从急诊科分诊笔记中检测自伤行为,并在三家澳大利亚医院验证了其高可迁移性和细粒度监测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02522 2026-06-02 cs.CV cs.AI 70%

Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events

Moment-Video: 诊断视频多模态大语言模型在瞬时视觉事件上的时间保真度

Xiaolin Liu, Yilun Zhu, Xiangyu Zhao, Xuehui Wang, Yan Li, Xin Li, Haoyu Cao, Xing Sun, Shaofeng Zhang, Xu Yang, Zhihang Zhong, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Southeast University(东南大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 Moment-Video 基准,通过瞬时视觉事件理解任务诊断视频 MLLMs 的时间保真度,发现最佳模型准确率仅 39.6%,多数开源模型低于 25%。

Comments 28 pages, 10 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02404 2026-06-02 cs.CL 70%

K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts

K-BrowseComp:基于韩国语境的网页浏览代理基准测试

Nahyun Lee, Dongkeun Yoon, Guijin Son, Geewook Kim, Dayoon Ko, Jeonghun Park, Haneul Yoo, Jaewon Cho, Junghun Park, Changyoon Lee, Kyochul Jang, Jaeyeon Kim, Eunsu Kim, Woojin Cho, Seungone Kim

机构 * Chung-Ang University(Chung-Ang 大学) KAIST(韩国科学技术院) Seoul National University(首尔国立大学) OnelineAI NAVER Cloud AI Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract_cn);foundation model(abstract);分类 cs.CL

AI总结 针对韩国语境,构建包含400个问题的网页浏览代理基准K-BrowseComp,评估前沿模型性能,发现其准确率显著低于BrowseComp,并公开数据与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02109 2026-06-02 cs.AI 70%

BADGER: Bridging Agentic and Deterministic Evaluation for Generative Enterprise Reasoning

BADGER:桥接生成式企业推理的自主与确定性评估

Shannon Serrao, Soumitra Chatterjee, Dorina Strori, Abhishek Sharma, Nathan Miller

机构 * Merkle Analytics

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出BADGER框架,统一文本到SQL评估与自主行为评估,通过混合执行准确率指标(Hybrid-EX)和自主评估套件,在工业查询上超越现有方法。

Comments 30 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01552 2026-06-02 cs.AI 70%

RoleCDE:Benchmarking and Mitigating Role-Alignment Trade-offs in Role-Playing Agents

RoleCDE:角色扮演代理中的角色-对齐权衡的基准测试与缓解

Huayi Lai, Shichao Song, Simin Niu, Hanyu Wang, Jiawei Yang, Zhouxing Wang, Zhiqiang Yin, Xun Liang

机构 * School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对角色扮演代理在角色特定价值与对齐约束冲突时的决策问题,提出首个基准RoleCDE,通过认知困境场景评估角色-场景基础、价值冲突解决和决策倾向,发现“角色价值解耦”现象,并基于RoleCDE的微调有效缓解该问题。

Comments 23pages

详情

展开后加载摘要…

URL PDF HTML 收藏