arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-31 至 2026-08-31 共收录 351 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 75 篇

2608.27716 2026-08-31 cs.AI 新提交 77%

PCFBench: A Diagnostic Benchmark for Product Carbon Footprint Estimation

PCFBench:产品碳足迹估算的诊断基准

Krishna Rao, Andrew Dumit, Shaena Ulissi, Jacob Feintzeig, P. James Joyce, Daniel Frank, Steven Watson, Jonathan Glidden, Gizem Ilayda Dinc, Travis M. Kwee

机构 * Watershed Technology, Inc.(沃特斯hed科技公司)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 该研究推出PCFBench基准,针对现有PCF评估的缺陷,通过含614个条目的6项任务评估前沿LLM,发现其逐步生成PCF的准确率及质量守恒符合率均较低,将发布相关资源推动该领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27461 2026-08-31 cs.CL cs.AI cs.LG 新提交 75%

SciReC: Diagnostic Evaluation of Multimodal, Multi-Turn Relational Reasoning with Adaptive Interaction

SciReC:基于自适应交互的多模态多轮关系推理诊断评估

Nilay Yilmaz, Naga Sai Abhiram Kusumba, Stella Wenxing Liu, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学) Capital One(第一资本金融公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建了多模态学术对话基准SciReC,提出缺陷诊断框架DMRA评估多模态大语言模型的关系推理能力,发现不同模型在各类关系及领域上的表现差异,明确错误的主要来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28100 2026-08-31 cond-mat.mtrl-sci 新提交 75%

uMOF: A Universal Database, Benchmark, and Machine Learning Interatomic Potentials for Metal-Organic Frameworks

uMOF:面向金属有机框架的通用数据库、基准及机器学习原子间势

Théo Jaffrelot Inizan, Prathami Divakar Kamath, Alin Marin Elena, Kristin A. Persson

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本研究推出uMOF数据库、基准及两款通用MLIP,在MOF的动力学敏感属性预测上性能优于现有基准,误差降低80%以上。

Comments 19 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26536 2026-08-31 cs.CL cs.AI cs.CV cs.LG cs.RO 版本更新 75%

OceanGym: A Benchmark Environment for Underwater Embodied Agents

OceanGym: 一个用于水下具身智能体的基准环境

Yida Xue, Mingjun Mao, Xiangyuan Ru, Yuqi Zhu, Baochang Ren, Shuofei Qiao, Mengru Wang, Shumin Deng, Xinyu An, Ningyu Zhang, Ying Chen, Huajun Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27783 2026-08-31 eess.AS cs.CL cs.SD 新提交 74%

SURE-Challenge: Evaluating Speech Evidence Before Speech-LLM Generation

SURE-Challenge:评估语音大语言模型生成前的语音证据

Mengzhe Geng

专题命中 评测与基准 :LLM(title);分类 cs.CL

AI总结 该研究定义SURE-Challenge评估语音大语言模型生成前的准入步骤,以Qwen2-Audio和能量加Whisper评分规则开展实验,发现了仅答案评分遗漏的生成前错误模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27719 2026-08-31 cs.LG q-bio.NC 新提交 74%

Leveraging a Foundation Model for the EEG-Based Diagnosis of Alzheimer's Disease

利用基础模型实现基于脑电图的阿尔茨海默病诊断

Maggie Lin, Chung-Lin Hou, Tzyy-Ping Jung

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校) HippoScreen Neurotech Corp.(HippoScreen神经科技公司) Swartz Center for Computational Neuroscience(Swartz计算神经科学中心)

专题命中 评测与基准 :foundation model(title);分类 cs.LG

AI总结 本研究针对阿尔茨海默病诊断挑战,采用预训练于2500小时脑电图的大型脑模型LaBraM,结合随机森林分类器,仅用8秒脑电片段即达89.36%的ROC-AUC,优于传统方法,可提取临床相关生物标志物。

Comments 7 pages, 9 figures, 1 table. Accepted and presented at the 48th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24334 2026-08-31 cs.CV cs.CL cs.GR 版本更新 74%

SeMoCo: A Semantic-First Motion Codec for Motion Language Modeling

SeMoCo:面向运动语言建模的语义优先运动编解码器

Tianlv Huang, Hetian Guo, Ziyi Cai, Song Wang, Yanping Zhang, Zipei Fan, Xuan Song, Guangming Wu, Xin Zheng

机构 * Jilin University(吉林大学) Frontier Robotics(前沿机器人公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 SeMoCo是面向运动语言建模的语义优先运动编解码器,搭配双轴运动生成器,构建了Ω-MotionVerse数据集,在重构精度与文本到运动生成任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28283 2026-08-31 cs.CL cs.AI 新提交 73%

Embedding Models for Stance-Aware Argument Retrieval

面向立场感知的论证检索的嵌入模型

Angelo Sparacino, Francesca Toni, Adam Dejl

机构 * Imperial College London(帝国理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文针对立场感知的论证检索任务,发现现有稠密嵌入模型存在主题偏好、过度关注极性关键词等问题,通过引入诊断指标并提出结合平衡论证课程与立场反转论证的数据中心方案,缓解了模型过度纠正问题,提升了立场感知的论证检索效果。

Comments CMNA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27910 2026-08-31 cs.AI cs.CL cs.GT 新提交 73%

AI Alignment through a Game-theoretic Lens: A Survey

基于博弈论视角的AI对齐:一项综述

Yanan Cai, Zhongrui Zhao, Zhigang Lu, Ickjai Lee, Wei Emma Zhang, Minhui Xue, Yihong Zhang, Shuchao Pang, Wei Xiang

机构 * James Cook University(詹姆斯库克大学) Western Sydney University(西悉尼大学) Adelaide University(阿德莱德大学) CSIRO(联邦科学与工业研究组织) The University of Osaka(大阪大学) Nanjing University of Science and Technology(南京理工大学) Macquarie University(麦考瑞大学) La Trobe University(拉筹伯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本综述从博弈论视角梳理AI对齐的近期进展,针对偏好多样性等三大挑战整合相关文献,明确了博弈论在AI对齐中的作用、不足及未来构建稳健AI系统的挑战。

Comments This paper has been accepted by EMNLP-2026 as a main conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28232 2026-08-31 hep-ph 新提交 71%

HEPToolBench 1.2: Testing How Reliably Language Models Can Drive Particle Physics Software

HEPToolBench 1.2:测试语言模型驱动粒子物理软件的可靠程度

Aadarsh Singh, Sudhir K. Vempati

专题命中 评测与基准 :language model(title)

AI总结 该研究推出HEPToolBench 1.2基准,评估42个语言模型驱动粒子物理软件的性能,发现结构化接口可大幅提升任务通过数,且该提升并非源于提取规则差异。

Comments 28 pages, 8 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28467 2026-08-31 cs.CL 新提交 70%

Stranger, Fan, or Peer? A Systematic Study on the Role of Interlocutor in Persona-Based Dialogue Generation

陌生人、粉丝还是同伴?对对话者在基于角色的对话生成中作用的系统研究

Daniela Occhipinti, Malvina Nissim, Marco Guerini

机构 * Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Groningen(格罗宁根大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究通过分离训练、推理、评估三阶段的对话者传记可见性,发现训练阶段可见性对基于角色的对话生成影响更大,揭示了传记泄露的成因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28411 2026-08-31 cs.CR cs.AI 新提交 70%

LongPIBench: A Long-Context Benchmark for Prompt Injection

LongPIBench:用于提示注入的长上下文基准

Yupei Liu, Yuqi Jia, Neil Zhenqiang Gong, Jinyuan Jia

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人员推出涵盖4类场景的长上下文基准LongPIBench,发现现有提示注入防御在长上下文下漏洞显著,简单攻击即可绕过,该基准可用于系统评估此类防御。

Comments To appear in Findings of EMNLP'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28405 2026-08-31 cs.CL cs.CY 新提交 70%

CultureConverse: A Multilingual Multi-turn Simulation Harness for Culturally Grounded Assistance in East and Southeast Asia

CultureConverse:面向东亚与东南亚文化适配助手的多语言多轮模拟工具包

Bryan Chen Zhengyu Tan, Weihua Zheng, Thong T. Doan, Bich Ngoc Doan, Jia Wang Peh, Xiaoyuan Yi, Jing Yao, Xing Xie, Nancy F. Chen, Zhengyuan Liu, JinYeong Bak, Wafi Shamdi, Soo Kai Chie, Liew Yu Siong, Aina Azyyati Binti Mohamad Rezal, Lew Yan Yan Vanessa, Huadan Wu, Dylan Raharja, Nadya Yuki Wangsajaya, Akane Fukushige, Kazushi Kato, Koji Inoue, Tatsuya Kawahara, Jaehyung Seo, Dongjun Kim, Seungyoon Lee, Zi Haur Pang, Rui Yang Tan, Charibeth Ko Cheng, Maria Regina Justina Estuar, Jann Railey Montalan, Pham Minh Duc, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Microsoft Research Asia (MSRA)(微软亚洲研究院) Sungkyunkwan University (SKKU)(成均馆大学) Universiti Brunei Darussalam (UBD)(文莱大学) China University of Petroleum (East China)(中国石油大学(华东)) Nanyang Technological University (NTU)(南洋理工大学) Kyoto University(京都大学) Konkuk University(建国大学) Upstage AI

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究推出CultureConverse多语言多轮模拟工具包,构建含14610个基准回合的数据集,评估18个模型发现GPT-5 mini表现最优,微调后模型在文化相关任务上性能提升。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28378 2026-08-31 cs.CL 新提交 70%

PersonaForge: Realistic Multi-Turn User Simulation for Agentic Systems

PersonaForge:面向智能体系统的逼真多轮用户模拟

Hanglong Lv, Dawei Zhu, Lei Li, Bowen Ye, Huaqiu Liu, Yifan Song, Bofei Gao, Weimin Xiong, Jinhao Dong, Chenhong He, Lingpeng Kong, Qi Liu, Tong Yang, Fuli Luo

机构 * Peking University(北京大学) Xiaomi(小米) The University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对现有智能体系统训练评估中多轮用户交互数据不足的问题,提出PersonaForge模拟框架构建相关数据集与基准,实验证实其可提升智能体交互效率与任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28248 2026-08-31 cs.CV cs.CL 新提交 70%

Synth-JDoc: Synthesizing a Japanese Document Image Dataset for OCR with Diverse Layouts and Embedded Images

Synth-JDoc:用于OCR的、包含多样布局与嵌入图像的日文文档图像数据集合成

Keito Sasagawa, Shuhei Kurita, Daisuke Kawahara

机构 * Waseda University(早稻田大学) NII(信息学研究所) NII LLMC(信息学研究所语言媒体研究中心)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 本研究构建了含多样布局与嵌入图像的日文文档合成OCR数据集,可有效提升大型视觉语言模型读取竖排日文文本的性能,相关资源已公开。

Comments Accepted to ICDAR 2026, 17pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28233 2026-08-31 cs.AI 新提交 70%

REINS: Refusal-Enhanced Inhibitory Steering with Sparse Autoencoder Features

REINS:基于稀疏自编码器特征的增强拒绝抑制引导方法

Kai-Xuan Ding, Hao-Xiang Xu, Ji-Hua Peng, Zi-Qi Chen, Jiaqi Wang, Zhen-Hua Ling

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对现有SAE引导方法在复杂包装器有害提示上的不足,提出REINS方法,可抑制有害特征、增强安全弃权特征,在GUISE等数据集上大幅减少有害响应并保留模型通用能力。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28009 2026-08-31 cs.CL 新提交 70%

Beyond Global Scalars: Synergizing Token-Level Statistics and Deep Semantics for Adversarial AIGC Text Detection

超越全局标量:结合令牌级统计与深度语义的对抗性AIGC文本检测

Peiming Li, Yifan Wang, Zhiyuan Hu, Shiyu Li, Zheng Wei, Yang Tang

机构 * Tencent BAC(腾讯BAC) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有AIGC文本检测方法在对抗场景中的缺陷,提出NeuroStat框架,结合令牌级统计与深度语义,在MOSAIC基准上实现鲁棒性提升,建立对抗性文本检测新基准。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27953 2026-08-31 cs.AI 新提交 70%

The Illusion of $\textit{What If}$: Evaluating the Breakdown of Counterfactual Reasoning in LLMs

《“如果”的错觉:评估大型语言模型中反事实推理的失效》

Yucheng Wang, Yuetian Du, Zhengyi Liu, Rongyu Zhang, Bing Zhao, Boyu Yang, Ming Kong, Lin Qu, Hu Wei, Jie Liu, Qiang Zhu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(summary_cn);分类 cs.AI

AI总结 本研究提出开放域反事实推理基准WhatIfBench及评估框架PRISM,发现前沿LLM在该基准上表现未饱和,存在因果推理缺陷,凸显其反事实推理能力的不足。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17092 2026-08-31 cs.CR cs.CL 版本更新 70%

Securing Multi-Agent GIS Systems: Risk Evaluation and Prompt Hardening Optimization

保护多智能体GIS系统:风险评估与提示硬化优化

Kyle Gao, Pranavi Kotta, Linlin Xu, Jonathan Li, David A. Clausi

机构 * Department of Systems Design Engineering, University of Waterloo(系统设计工程系,滑铁卢大学) Department of Mechatronics Engineering, University of Waterloo(机电工程系,滑铁卢大学) Department of Geomatics Engineering, University of Calgary(测绘工程系,卡尔加里大学) Department of Geography and Environmental Management, University of Waterloo(地理与环境管理系,滑铁卢大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对多智能体GIS系统的安全风险,提出基于模块化状态机编排和提示优化的安全框架,通过红队测试和对抗演示提升系统鲁棒性。

Comments Kyle Gao and Pranavi Kotta contributed equally to this work. Accepted for publication in IEEE Geoscience and Remote Sensing Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04299 2026-08-31 cs.CL 版本更新 70%

The Company You Keep: How LLMs Respond to Dark Triad Traits

你所交往的公司:大语言模型如何回应黑暗三联特质

Angelica Henestrosa, Zeyi Lu, Pavel Chizhov, Ivan P. Yamshchikov

机构 * Technical University of Applied Sciences Würzburg-Schweinfurt(韦尔堡-施维林应用科学大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨LLMs对表达不同黑暗三联特质(操纵、自大、精神病态)的用户提示的回应方式,发现模型在不同严重程度下表现出纠正与强化行为的差异,对设计更安全的对话系统有启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28567 2026-08-31 cs.CV 新提交 67%

GeBDA: Building Damage Assessment as Text-Based Sequence Prediction

GeBDA:基于文本序列预测的建筑物损伤评估

Olivier Dietrich, Krishna Sapkota, Konrad Schindler, Genady Beryozkin

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌公司)

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

AI总结 本研究提出将建筑物损伤评估(BDA)转化为文本序列预测任务,基于通用视觉语言模型(VLM),用开源Gemma模型初步实现取得了有前景的双时相卫星图像损伤制图结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28266 2026-08-31 cs.RO 新提交 67%

CoCoBench: A Cooperative Coordination Benchmark for Embodied Multi-Agent Task Planning

CoCoBench:用于具身多智能体任务规划的协作协调基准

Yang Chen, Ye-Xin Xie, Lirong Che, Danyang Peng, Yuzhe Yang, Peiwen Lin, Xu Cao, Chuang Wang, Lei Yuan, Jian Su, Lan-Zhe Guo

机构 * Nanjing University(南京大学) AgiBot Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究人员提出CoCoBench这一家庭任务多智能体具身协调基准,评估11种MLLM后发现协调能力具构造特异性,为相关模型设计提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27912 2026-08-31 cs.IR 新提交 67%

ITER: Interaction-Aware Retrieval for Agentic Search

ITER:面向智能体搜索的交互感知检索

Haodong Chen, Shuai Wang, Yu Yin, Shengyao Zhuang, Guido Zuccon, Teerapong Leelanupab

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出交互感知稠密检索器ITER,利用智能体轨迹学习信号训练,在六种智能体骨干上优于LRAT,跨智能体鲁棒性强于AgentIR,在两个基准上获显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27587 2026-08-31 cond-mat.mtrl-sci 新提交 67%

Compiling Chemical Knowledge into Executable Descriptors for Materials Prediction

将化学知识编译为可执行描述符用于材料预测

Jaehwan Choi, Kunik Jang, Seongmin Kim, Shuan Chen, Kyungju Nam, Seung Hyo Noh, Donghwi Kim, Yousung Jung

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究提出CRISP框架,将化学知识编译为可执行描述符用于材料预测,其在无机晶体可合成性等任务上表现优于现有方法,建立了数据集无关的可迁移表征途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27977 2026-08-31 cs.AI cs.LG 版本更新 62%

D3-Gym: Constructing Real-World Verifiable Environments for Data-Driven Discovery

D3-Gym:构建现实世界可验证环境用于数据驱动发现

Hanane Nour Moussa, Yifei Li, Zhuoyang Li, Yankai Yang, Cheng Tang, Tianshu Zhang, Nesreen K. Ahmed, Ali Payani, Ziru Chen, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学) Cisco Research(思科研究)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 D3-Gym通过构建首个自动化的可验证环境数据集,提升科学数据驱动发现的模型能力,验证信号质量高,训练效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27886 2026-08-31 cs.AI 新提交 57%

Resource Constraints and Performance in Agentic AI Systems

智能体AI系统中的资源约束与性能

Amaz Salman, Malka Halgamuge, Teo Susnjak

机构 * School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) RMIT University(皇家墨尔本理工大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究对比OpenClaw与NanoBot两款智能体系统,发现两者完整任务完成率无统计差异,NanoBot部分完成率更高但资源消耗更优,建议智能体AI评估需结合能力、资源及执行记录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27484 2026-08-31 cs.AI cs.IR cs.MA 新提交 57%

CareGraph: An Auditable Hybrid AI Framework for Evidence-Grounded Personalized Longitudinal Health Intelligence

CareGraph:一种用于基于证据的个性化纵向健康智能的可审计混合AI框架

Pratik Ghawate, Tanvi Patil

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 CareGraph是可审计混合AI框架,用于将异构医疗记录转化为结构化证据,实验显示其在多指标上优于传统方法,为个性化健康系统提供安全受限基础。

Comments 21 pages, 7 figures, Code and data: https://github.com/PratikGhawate/ai-personalized-health-intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27477 2026-08-31 cs.AI cs.CV 新提交 57%

Benchmarking General Mobile Assistants in Challenging Real-World Scenarios

在具有挑战性的真实场景中对通用移动助手进行基准测试

Yiqi Zhu, Feiyu Gao, Jiaxing Fan, Jiahui Zeng, Minggang Wu, Chenliang Li, Haiyang Xu, Peng Li, Ming Yan, Yang Liu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 该研究提出名为GMA的移动助手基准,涵盖七个应用与300个不同难度任务,评估八个前沿模型发现其性能随任务复杂度提升而下降,还证实合适的智能体控制设计可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06382 2026-08-31 cs.AI 版本更新 57%

Rethinking Vacuity for OOD Detection in Evidential Deep Learning

重新审视证据深度学习中异常检测的空虚性

Claire McNamara

机构 * Accenture Labs(埃森哲实验室) Trinity College Dublin(都柏林三一学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究指出证据深度学习中空虚性指标对类别数敏感,通过实验证明类别数差异会导致AUROC和AUPR显著变化,提出需明确ID和OOD定义以避免评估偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04524 2026-08-31 cs.AI 版本更新 57%

BioPIE: A Biomedical Protocol Information Extraction Dataset for Experiment Understanding

BioPIE:面向实验理解的生物医学协议信息抽取数据集

Haofei Hou, Shunyi Zhao, Fanxu Meng, Kairui Yang, Lecheng Ruan, Qining Wang

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京理工大学先进制造与机器人学院) School of Integrated Circuits, Peking University(北京理工大学集成电路学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 提出BioPIE数据集,以程序为中心的知识图谱捕获实体、动作和关系,解决生物医学实验理解中的高信息密度和多步推理难题,并验证了信息抽取方法及问答系统的有效性。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏