arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10507 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10507 篇

2606.09461 2026-06-09 cs.CL 新提交 57%

H2HMem: A Multimodal Memory Benchmark for Agents in Human-Human Interactions

H2HMem: 面向人际交互中智能体的多模态记忆基准

Shiping Zhu, Yibo Yang, Zhengyang Wang, Tiancheng Shen, Dandan Guo, Ming-Hsuan Yang

机构 * Jilin University(吉林大学) Shanghai Jiao Tong University(上海交通大学) University of California at Merced(加州大学默塞德分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出H2HMem基准,通过双人和多人多模态对话评估智能体在记忆召回、推理和应用方面的能力,揭示现有模型在多模态、多参与者场景下的显著局限。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09389 2026-06-09 cs.CL 新提交 57%

LexRubric: A Rubric-Guided Diagnostic Benchmark for Open-Ended Legal Tasks

LexRubric:面向开放式法律任务的基于评分指南的诊断基准

Yifan Chen, Haitao Li, Yiran Hu, Kaisong Song, Jun Lin, Yueyue Wu, Qingyao Ai, Min Zhang, Yiqun Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) University of Waterloo(滑铁卢大学) Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出LexRubric基准,包含649个中国法律咨询与司法考试实例及12,337条原子评分标准,通过六维框架评估LLM在开放式法律任务中的可靠性,发现当前模型仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08959 2026-06-09 cs.CV cs.CL 新提交 57%

ChinaHeritaQA: A Culturally-Grounded Visual Question Answering Dataset for World Heritage Sites in China

ChinaHeritaQA:面向中国世界遗产地的文化基础视觉问答数据集

Yi Zhang, Bolei Ma, Yong Cao, Chengyan Wu, Daniel Hershcovich, Anna-Carolina Haensch

机构 * LMU Munich(慕尼黑大学) FAU Erlangen-Nuremberg(埃尔朗根-纽伦堡大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Tübingen & Tübingen AI Center(图宾根大学与图宾根人工智能中心) Sun Yat-sen University(中山大学) University of Copenhagen(哥本哈根大学) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出ChinaHeritaQA多模态基准数据集,包含2279张图像和14133个双语多项选择题,覆盖七个认知维度,评估视觉语言模型在中国世界遗产上的文化推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08071 2026-06-09 cs.CL 新提交 57%

SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models

SurgiQ: 用于评估大语言模型手术理解的大规模多领域基准

Ayah Al-Naji, Edoardo Fazzari, Saif Alkindi, Hamdan Alhadhrami, Preslav Nakov, Cesare Stefanini

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出SurgiQ基准,包含13,055道多选题,覆盖六个外科领域和四种题型,用于评估LLM的手术推理能力。实验显示最佳模型准确率仅68.1%,通用模型优于多数生物医学模型,表明当前医学专业化未能充分覆盖手术知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07995 2026-06-09 cs.CL 新提交 57%

Customer-Agent: Overcoming Context Limitations in Ultra-Long Shopping Trajectories via Tool-Augmented Agents and RLVR

客户代理:通过工具增强代理和RLVR克服超长购物轨迹中的上下文限制

Hongye Liu, Rongmei Lin, Anurag Kashyap, Hejie Cui, Ricardo Henao, Besnik Fetahu, Bing Yin

机构 * Amazon(亚马逊) Duke University(杜克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出ShopTrajQA基准和客户代理框架,利用RLVR训练代理通过代码解释器自主检索解析外部轨迹文件,突破LLM上下文窗口限制,在超长购物轨迹推理中取得强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07992 2026-06-09 cs.AI cs.CR cs.SE 新提交 57%

VATS: Exploiting Implicit Authority in Error-Path Injection via Systematic Mutation

VATS: 通过系统性变异利用错误路径注入中的隐式权威

Harshil Patel, Kunal Pai

机构 * Harshil Patel Kunal Pai

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出VATS框架,通过七维变异生成对抗性负载,利用错误消息的隐式权威绕过安全机制,在四个前沿模型上实现高达100%的注入成功率。

Comments Published at Second Workshop on Agents in the Wild: Safety, Security, and Beyond (ICML 2026 AIWILD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07643 2026-06-09 cs.CV cs.AI cs.SD eess.AS 新提交 57%

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

AVI-Bench:迈向全模态大语言模型的人类级视听智能

Yaoting Wang, Ziyi Zhang, Wenming Tu, Shaoxuan Xu, Wenjie Du, Cheng Liang, Weijun Wang, Yuanchao Li, Guangyao Li, Hao Fei, Yuanchun Li, Henghui Ding, Yunxin Liu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出AVI-Bench基准,通过感知、理解、推理三阶段跨模态任务评估全模态大语言模型的视听智能,并引入AVI-Bench-PriSe测试原始视听感知,揭示当前模型局限,构建四级AVI分类体系。

Comments 31 pages, 8 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07541 2026-06-09 cs.HC cs.AI cs.CV cs.CY cs.MM 新提交 57%

Multimodal Large Language Models as Synthetic Participants in Video-Based Studies: An Evaluation

多模态大语言模型作为视频研究中的合成参与者:一项评估

Prabal Shrestha, Bohan Jiang, Haoning Xue, Huan Liu, Xinyi Zhou

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究评估多模态大语言模型在视频感知任务中模拟人类主观评分的表现,发现模型存在偏差且与人类一致性有限。

Comments Accepted to SocialLLM @ ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09823 2026-06-09 cs.MA cs.AI 版本更新 57%

CalBench: Evaluating Coordination-Privacy Trade-offs in Multi-Agent LLMs

CalBench: 评估多智能体大语言模型中的协调-隐私权衡

Chelsea Zou, Yiheng Yao, Selena She, Noah Goodman, Robert D. Hawkins

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 提出CalBench基准,用于在私有信息下评估多智能体日程协调中任务完成、成本、通信、公平性和隐私泄露的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26498 2026-06-09 cs.LG q-bio.QM 版本更新 57%

Do Larger Models Really Win in Drug Discovery? A Benchmark Assessment of Model Scaling in AI-Driven Molecular Property and Activity Prediction

大模型真的在药物发现中胜出吗?AI驱动的分子性质和活性预测中模型规模的基准评估

Jinjiang Guo, Sheng Ding

机构 * Global Health Drug Discovery Institute(全球健康药物发现研究所) School of Pharmaceutical Sciences(药学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文通过26个ADME、毒性及生物活性端点评估,发现传统机器学习在多数任务中表现最佳,大模型在部分困难分割中竞争力有限,模型性能依赖于任务与验证场景的适配性,而非单纯规模。

Comments Improved benchmark design and reproducibility, replaced restricted datasets with public benchmarks in primary analyses, and added sensitivity analyses supporting the interpretation of model scaling and evaluation protocol effects in molecular prediction

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26176 2026-06-09 cs.DB cs.CL 版本更新 57%

CacheRAG: A Semantic Caching System for Retrieval-Augmented Generation in Knowledge Graph Question Answering

CacheRAG:面向知识图谱问答中检索增强生成的语义缓存系统

Yushi Sun, Lei Chen

机构 * HKUST Hong Kong China(香港理工大学(中国)) HKUST(GZ) / HKUST Guangzhou / Hong Kong China (2018)(香港理工大学(广州)/ 香港理工大学(广州)/ 香港中国(2018))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对LLM驱动的KGQA系统作为无状态规划器导致模式幻觉和检索覆盖有限的问题,提出CacheRAG,一种基于缓存的架构,通过模式无关接口、多样性优化缓存检索和有界启发式扩展,将无状态规划器转变为持续学习器,显著提升准确性和真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11238 2026-06-09 cs.CL 版本更新 57%

SurveyLens: A Discipline-Aware Benchmark for Automatic Survey Generation

SurveyLens:一个学科感知的自动综述生成基准

Beichen Guo, Zhiyuan Wen, Jia Gu, Haochen Shi, Jian Wang, Senzhang Wang, Haoyang Li, Ruosong Yang, Shuaiqi Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学) Central South University(中南大学) Alibaba Cloud(阿里巴巴云)

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 提出SurveyLens,首个学科感知的自动综述生成基准,包含跨10个学科的1000篇人工撰写综述数据集和双视角评估框架,发现深度研究智能体在跨学科鲁棒性上最优,而所有范式在参考文献质量上仍薄弱。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22859 2026-06-09 cs.SE cs.AI 版本更新 57%

MEnvAgent: Scalable Polyglot Environment Construction for Verifiable Software Engineering

MEnvAgent:可扩展的多语言环境构建用于可验证软件工程

Chuanzhe Guo, Jingjing Wu, Sijun He, Yang Chen, Zhaoqi Kuang, Shilong Fan, Bingjin Chen, Siqi Bao, Jing Liu, Hua Wu, Qingfu Zhu, Wanxiang Che, Haifeng Wang

机构 * Tsinghua University(清华大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 提出MEnvAgent框架,通过多智能体规划-执行-验证架构和环境复用机制,自动构建多语言可执行环境,生成可验证任务实例,在10种语言1000个任务上提升F2P率8.6%并降低时间成本43%。

Comments Accepted as a Spotlight Paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18676 2026-06-09 cs.CV cs.AI 版本更新 57%

MedVision: Benchmarking Quantitative Medical Image Analysis

MedVision:定量医学图像分析的基准测试

Yongcheng Yao, Yongshuo Zong, Raman Dutt, Yongxin Yang, Sotirios A Tsaftaris, Timothy Hospedales

机构 * University of Edinburgh(爱丁堡大学) Queen Mary University of London(伦敦大学玛丽女王学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对当前医学视觉语言模型缺乏定量推理能力的问题,提出MedVision数据集和基准,涵盖22个公共数据集、3080万图像-标注对,通过监督和强化微调显著提升检测、肿瘤/病变大小估计和角度/距离测量性能。

Comments 22 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07433 2026-06-08 cs.CV cs.AI cs.MM 新提交 57%

Watch, Remember, Reason: Human-View Video Understanding with MLLMs

Watch, Remember, Reason: 基于多模态大语言模型的人类视角视频理解

Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang

机构 * School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) CASIA(中国科学院自动化研究所) University of Tokyo(东京大学) University of Liverpool(利物浦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) UC Merced(加州大学默塞德分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出人类视角下视频理解的三个功能能力(观看、记忆、推理),构建统一框架分析视频MLLM的感知、记忆、推理和预测,并总结挑战、方法、应用及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07402 2026-06-08 cs.CL 新提交 57%

M$^3$Exam: Benchmarking Multimodal Memory for Realistic User-Agent Interactions

M$^3$Exam: 面向真实用户-智能体交互的多模态记忆基准

Zhengjun Huang, Wenxuan Liu, Zhoujin Tian, Wei Chen, Junle Chen, Yuqian Wu, Fangyuan Zhang, Qintian Guo, Xiaofang Zhou

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Beijing University of Chemical Technology(北京化工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beijing Institute of Technology (Zhuhai)(北京理工大学(珠海)) Tencent Hy(腾讯(深圳)) Peng Cheng Laboratory(鹏城实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出M$^3$Exam基准,用于评估多模态大语言模型在真实用户-智能体交互中的跨模态推理和隐式信息推断能力,并设计M$^3$Proctor方法通过按需处理视觉源提升准确率13%,同时降低索引构建时间和检索token超70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07229 2026-06-08 cs.SD cs.CL cs.MM 新提交 57%

MMAE: A Massive Multitask Audio Editing Benchmark

MMAE:大规模多任务音频编辑基准

Ziyang Ma, Ruiqi Yan, Ruiyang Xu, Jie Fang, Zhikang Niu, Yi-Wen Chao, Wenming Tu, Tianrui Wang, Auden, Qi Chen, Wenxi Chen, Jiaying Chi, Yanru Huo, Zixuan Jiang, Xiquan Li, Yalin Li, Junxi Liu, Minghao Liu, Binghao Qiang, Yijia Shan, Zheshu Song, Tian Tan, Zixiang Wang, Zeyu Xie, Zhifei Xie, Xiaoyu Xing, Qixiang Xu, Chen Yang, Guanrou Yang, Shan Yang, Yifan Yang, Steve Yves, Haotian Zhang, Haina Zhu, Kai Yu, Liefeng Bo, Eng-Siong Chng, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Nanyang Technological University(南洋理工大学) Hunyuan Team, Tencent(腾讯 Hunyuan 团队) Tianjin University(天津大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出首个面向通用指令音频编辑的综合评估基准MMAE,涵盖7种音频模态、6级任务复杂度和8种操作类型,通过2000个样本和基于评分标准的评估框架揭示当前模型在精确执行和结构鲁棒性上的严重不足。

Comments Open-Source at https://github.com/ddlBoJack/MMAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07020 2026-06-08 cs.CL 新提交 57%

MADE: Beyond Scoring via a Multilingual Agentic Diagnosing Engine for Fine-Grained Evaluation Insights

MADE:超越评分——通过多语言智能诊断引擎实现细粒度评估洞察

Yilun Liu, Miao Zhang, Shimin Tao, Minggui He, Chunguang Zhao, Chenxin Liu, Li Zhang, Chen Liu, Cheng Qian, Liqun Deng, Xiaojun Meng, Daimeng Wei

机构 * Huawei(华为)

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 提出MADE多语言智能诊断引擎,将评估后分析分解为规划、聚合分析、实例检查、多语言文化反思和报告合成,在33个模型族、11个基准、26种语言等大规模设置下,诊断报告质量提升47%,专家偏好率达87.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06871 2026-06-08 cs.LG 新提交 57%

Evidence-Grounded Ensemble Diagnosis of 802.11 Packet Captures: A Multi-Stage Pipeline with Deterministic Reliability Scoring

基于证据的802.11数据包捕获集成诊断:具有确定性可靠性评分的多阶段流水线

Jerome Henry, Swadhin Pradhan, Miroslav Popovic

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出PROBE多阶段流水线,通过确定性证据框架和集成方法解决LLM在802.11诊断中的幻觉、置信度偏差和评估偏见问题,在87个企业Wi-Fi捕获上实现0.957的加权证据F1分数和96%的自动接受率。

Comments 37 pages, 9 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06869 2026-06-08 cs.AI 新提交 57%

Evidence-Based Intelligent Diagnostic and Therapeutic Visualization System with Large Language Models: Multi-Turn Interaction and Multimodal Treatment Plan Generation

基于证据的智能诊断与治疗可视化系统与大语言模型:多轮交互与多模态治疗方案生成

Yunhan Wang, Yuda Wang, Zhiying Tu, Mingqiang Song, Li Song, Kun Li, Dianhui Chu, Bolin Zhang

机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院) Shandong Key Laboratory of Digital Service Computing Technology and Systems(山东省数字服务计算技术与系统重点实验室) Weihai Municipal Hospital(威海市人民医院) Shanghai Taizhu Technology Co., Ltd(上海泰山技术有限公司) Tianjin Zhifu Qihuang Medical Technology Co., Ltd(天津中孚启黄医疗技术有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出知识增强的可视化诊断系统,通过知识图谱约束、信息增益驱动提问和多模态治疗呈现,提升中医辨证透明度和治疗可解释性。

Comments 29 pages, 9 figures, 5 tables, including supporting information

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06754 2026-06-08 cs.MA cs.CL 新提交 57%

MADRAG: Multi-Agent Debate with Retrieval-Augmented Generation for Training-Free Analytic Essay Scoring

MADRAG: 基于检索增强生成的多智能体辩论用于免训练分析性论文评分

Ali Keramati, Shiyuan Zhou, Sharad Mehrotra, Mark Warschauer

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出MADRAG框架,结合多智能体辩论与检索增强,通过倡导者、批评者和法官的交互以及检索示例校准,实现无需训练的论文评分,性能接近监督系统。

Comments 21 pages, 7 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06546 2026-06-08 cs.LG 新提交 57%

Elmes*: Automated Construction of Fine-Grained Evaluation Rubrics for Large Language Models in Long-Tail Educational Scenarios

Elmes*:面向长尾教育场景的大语言模型细粒度评估量规自动构建

Tao Liu, Ye Lu, Ruohua Zhang, Siyu Song, Wentao Liu, Aimin Zhou, Hao Hao

机构 * Shanghai Institute of AI for Education, East China Normal University(上海人工智能教育研究院,东华师范大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出Elmes*框架,自动构建细粒度场景特定量规,用于评估大语言模型在教育场景中的多维教学能力,构建Edu-330基准并揭示模型差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01120 2026-06-08 cs.AI 版本更新 57%

Diagnosing LLM Arbitration Behavior over Pre-evidence Epistemic States in RAG-based Fact-Checking

诊断基于RAG的事实核查中LLM对证据前认知状态的仲裁行为

Yuxi Sun, Wenbo Shang, Wei Gao, Xin Huang, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) Singapore Management University(新加坡 Management 大学)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 提出PAVE测试平台,通过将LLM验证器分为四种认知状态,评估其在检索增强生成事实核查中仲裁参数知识与检索证据的能力,发现不可靠且高度依赖模型的仲裁行为,并提出轻量级JSD测试时仲裁方法。

Comments Accepted to ACL-2026 Findings (voluntarily withdraw)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06600 2026-06-08 cs.CL 版本更新 57%

Probing Multimodal Large Language Models on Cognitive Biases in Chinese Short-Video Misinformation

探究多模态大语言模型在中国短视频虚假信息中的认知偏差

Jen-tse Huang, Chang Chen, Shiyang Lai, Wenxuan Wang, Michelle R. Kaufman, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) Chinese University of Hong Kong(香港中文大学) University of Chicago(芝加哥大学) Renmin University of China(中国人民大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过200个短视频数据集评估8种多模态大语言模型在健康领域虚假信息中的表现,发现Gemini-2.5-Pro表现最佳(信念分数71.5/100),而模型易受权威频道ID等社会线索影响。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22327 2026-06-08 cs.IR cs.AI cs.DL 版本更新 57%

Evaluating AI-based Scientific Knowledge Synthesis with Epidemiological Systematic Reviews

基于流行病学系统评价评估AI科学知识综合

Shreyansh Padarha, Ryan Othniel Kearns, Tristan Naidoo, Lingyi Yang, Łukasz Borchmann, Piotr BŁaszczyk, Christian Morgenstern, Ruth McCabe, Sangeeta Bhatia, Philip H. Torr, Jakob Foerster, Scott A. Hale, Thomas Rawson, Anne Cori, Elizaveta Semenova, Adam Mahdi

机构 * University of Oxford(牛津大学) Imperial College London(伦敦帝国理工学院) University of Nottingham(诺丁汉大学) Snowflake AI Research(Snowflake人工智能研究) Independent(独立)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出AgentSLR评估框架,包含自动化工作流和专家标注数据集,测试LLM在流行病学系统评价各阶段能力,发现无模型全面领先,结构化提取是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11333 2026-06-08 cs.AI 版本更新 57%

LLM-Augmented Digital Twin for Policy Evaluation in Short-Video Platforms

LLM增强的数字孪生用于短视频平台策略评估

Haoting Zhang, Yunduan Lin, Jinghai He, Denglin Jiang, Zuo-Jun Shen, Zeyu Zheng

机构 * University of California, Berkeley(加州大学伯克利分校) The Chinese University of Hong Kong(香港中文大学) New York University(纽约大学) The University of Hong Kong(香港大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 提出一种LLM增强的四模块数字孪生架构(用户、内容、交互、平台),通过事件驱动执行层和可插拔策略组件,支持在闭环动态下对平台策略(含AI策略)进行可复现的仿真评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06462 2026-06-05 cs.AI 57%

Benchmark Everything Everywhere All at Once

无处不在的基准测试

Shiyun Xiong, Dongming Wu, Peiwen Sun, Yuang Ai, Bokang Yang, Wencheng Han, Xiao-Hui Li, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(中大香港实验室) CPII under InnoHK(创新香港 CPII) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Shandong University(山东大学) Huawei Technologies(华为技术)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出Benchmark Agent,一个全自主智能体系统,自动化基准构建流程,以解决现有基准构建劳动密集、难以复用和性能饱和的问题。

Comments Project page: https://benchmarkagent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06448 2026-06-05 cs.AI 57%

Agent Memory: Characterization and System Implications of Stateful Long-Horizon Workloads

Agent记忆:有状态长时任务工作负载的表征与系统影响

Yasmine Omri, Ziyu Gan, Zachary Broveak, Robin Geens, Zexue He, Alex Pentland, Marian Verhelst, Tsachy Weissman, Thierry Tambe

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) MIT Media Lab(麻省理工学院媒体实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文首次对LLM agent记忆系统进行系统级表征,提出四轴分类法,通过阶段感知分析框架评估10种代表性系统,并给出10条系统设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06036 2026-06-05 cs.AI cs.IR 57%

Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents

记忆是重建的,而非检索的:面向LLM智能体的图记忆

Shuo Ji, Yibo Li, Bryan Hooi

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出MRAgent框架,通过关联记忆图和主动重建机制,使LLM智能体在推理过程中动态调整记忆访问,显著提升长程记忆推理性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05680 2026-06-05 cs.PL cs.AR cs.LG 57%

CASS-RTL: Correctness-Aware Subspace Steering for RTL Generation with LLMs

CASS-RTL:面向LLM的RTL生成的正确性感知子空间引导

Mohammad Akyash, Nowfel Mashnoor, Kimia Azar, Hadi Kamali

机构 * Department of Electrical and Computer Engineering (ECE), University of Central Florida, Orlando, FL 32816, USA(电子与计算机工程系,中央佛罗里达大学,奥兰多,佛罗里达州32816,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出CASS-RTL框架,通过识别LLM中与RTL正确性相关的注意力头并构建低维子空间进行轻量级干预,在无需额外监督或重训练的情况下提升RTL代码生成的功能准确性。

Comments Accepted to the IEEE International Conference on LLM-Aided Design (LAD '26)

详情

展开后加载摘要…

URL PDF HTML 收藏