arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2997 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2997 篇

2607.06485 2026-07-08 cs.CV cs.AI 新提交 79%

AirflowAttack: Thermal-Airflow Adversarial Perturbations against Infrared Remote-Sensing Vision-Language Models

AirflowAttack:针对红外遥感视觉语言模型的热气流对抗扰动

Cong Su, Jiaju Han, Xuemeng Sun, Chengyin Hu, Qike Zhang, Jiujiang Guo, Yiwei Wei, Jiahuan Long

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) Tianjin University(天津大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究针对红外遥感视觉语言模型的对抗攻击,提出AirflowAttack方法,用热气流湍流作扰动先验,由轻量级生成器合成扰动。该方法在多个CLIP主干上攻击成功率高,能降低模型场景分类准确率,还揭示了红外VLM生态系统的关键漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05970 2026-07-08 cs.IR cs.AI 新提交 79%

Faithful or Findable? Evaluating LLM-Generated Metadata for RDF Dataset Search

忠实还是可查找?评估用于RDF数据集搜索的大语言模型生成的元数据

Riccardo Terrenzi, Serkan Ayvaz

机构 * University of Southern Denmark(南部丹麦大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究RDF数据集六种元数据生成设置,评估其检索有效性与忠实性。发现无约束重写检索增益强但忠实性低,更有根据的设置提高了忠实性,基于配置文件的重写权衡最佳,将合成元数据定位为需综合评估多方面的系统级信息检索问题。

Comments 5 pages, 1 figure, accepted at SynthIR @ SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05171 2026-07-07 cs.CL 新提交 79%

RABBiT: Rapidly adaptive BOLD foundation model via brain-tuning for accurate zero-shot and few-shot prediction of speech-elicited responses in the brain

RABBiT:基于脑调优的快速自适应BOLD基础模型,用于脑内语音诱发响应的精准零样本与少样本预测

Omer Moussa, Mariya Toneva

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL

AI总结 针对脑语言理解泛化难问题,提出RABBiT紧凑音频-fMRI编码器,依托脑调优等创新实现跨被试跨场景语音诱发脑响应的高精度零/少样本预测,支撑规模化脑语言分析。

Comments Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04576 2026-07-07 cs.CL cs.CY cs.IR 新提交 79%

Progressive Disclosure for LLM-Maintained Wiki Knowledge Bases: a Preregistered Ablation

大语言模型维护的维基知识库的渐进式披露:一项预注册的对比研究

Theodore O. Cochran

机构 * AI for Altruism (A4A)(人工智能促进利他主义组织)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究针对大语言模型维护的维基知识库,通过预注册对比研究,改造知识库实现渐进式披露。虽原节省索引加载成本未实现,但答案质量达标且成本降低,源于更有针对性的访问。

Comments 14 pages, 2 figures, 6 tables. Preregistered on OSF (https://osf.io/feka7, DOI 10.17605/OSF.IO/FEKA7). Materials-availability and deviations described in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04528 2026-07-07 cs.AI 新提交 79%

Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents

测量多步语言模型智能体中工具诱导的信念差异

Haiwen Yi, Xinyuan Song

机构 * University of Toronto(多伦多大学) Emory University(埃默里大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究多步语言模型智能体中工具对其信念的影响,引入信念展开诊断,定义跨工具信念差异并分解,通过实验表明工具设计是智能体评估中的实验变量。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02623 2026-07-07 cs.LG cs.SY eess.SY 新提交 79%

Evaluating Time Series Foundation Models for Electricity Price Forecasting: Contamination Risk, Distributional Shifts, and Covariate Dependence

评估用于电价预测的时间序列基础模型:污染风险、分布变化和协变量依赖性

Zhenghua Pan, Ahmed Aziz Ezzat

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 针对电价预测中时间序列基础模型在协变量驱动、非平稳设置下泛化不足的问题,提出双数据集基准框架,评估其多方面表现,发现该模型有竞争力但性能依赖协变量支持,简单集成有潜力。

Journal ref ICML 2026 Foundation Models for Structured Data Workshop, 43rd International Conference on Machine Learning (ICML), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02599 2026-07-07 cs.SE cs.AI cs.LO 新提交 79%

AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents

AgentLTL:一种用于测量、执行和训练使用工具的语言模型代理程序合规性的跟踪验证框架

Laïla Elkoussy, Julien Perez

机构 * EPITA Bpifrance

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 介绍基于一阶线性时态逻辑的AgentLTL语言,用于表达代理跟踪的程序规则,产生确定性无评判的合规分数,此框架可用于约束和微调,提升模型合规性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02575 2026-07-07 cs.CV cs.AI 新提交 79%

Criterion-Conditional In-Context Learning: Evaluating Criterion-Shift Adaptation in Vision-Language Models

标准条件上下文学习:评估视觉语言模型中的标准转移适应性

Kaiyun Yang, Ruilin Yang, Zhimin Yao, J. Wang, Wei Ge

机构 * Megvii Technology Inc., Beijing, China(美科科技有限公司,北京,中国)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究提出标准条件上下文学习(CC-ICL)新设置,模型需从上下文推断潜在标准并据此调整预测。为此提出两个评估指标,构建CC-Bench基准。实验发现多数模型有边界偏差,简单多标准训练可改善。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06857 2026-07-07 cs.CL 新提交 79%

Interpreting Brain Responses to Language with Sparse Features from Language Models

用语言模型稀疏特征解释大脑对语言的响应

Michael A. Lepori, Kendrick Kay, Greta Tuckute

机构 * Brown University(布朗大学) University of Minnesota(明尼苏达大学) Harvard University(哈佛大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 提出增强稀疏编码模型,用分层稀疏自编码器特征替代密集LM隐状态,并加入惊奇度预测器,解释大脑语言皮层响应,发现前颞叶语言网络由共同特征预测,且大脑响应与LM中最通用的特征对应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02459 2026-07-03 cs.CL 新提交 79%

Language Models as Measurement Apparatus for Culture

语言模型作为文化测量仪器

Kent K. Chang

机构 * School of Information University of California, Berkeley(信息学院加州大学伯克利分校)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文提出语言模型的文化测量是物质-话语实践,通过Karen Barad的能动切割概念,论证模型设计选择构成所测量的文化现实,并通过三个案例和三个仪器检查展示这一观点。

Comments Accepted to the Big Picture workshop co-located with ACL 2026. This version expands the camera-ready (adding Fig. 3 and section 6.3, as well as correcting minor typos) in Proceedings of The Big Picture v2: Crafting a Research Narrative, pp. 131--143, San Diego, CA, USA. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02269 2026-07-03 cs.CV cs.AI 新提交 79%

AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models

AnyGroundBench: 视觉语言模型中视频定位的专业领域基准

Rintaro Otsubo, Ryo Fujii, Reina Ishikawa, Taiki Kanaya, Kanta Sawafuji, Hiroki Kajita, Shigeki Sakai, Hideo Saito, Ryo Hachiuma

机构 * Keio University(庆应大学) Keio AI Research Center(庆应人工智能研究中心) Keio University School of Medicine(庆应大学医学部) NVIDIA(英伟达)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出AnyGroundBench基准,将STVG评估从零样本转向领域适应,涵盖五个专业领域,评估15个VLM的零样本和上下文学习能力,发现现有模型在专业领域表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01966 2026-07-03 cs.LG 新提交 79%

Probabilistic Low-Voltage Peak Load Forecasting with Time Series Foundation Models Evaluated on Application-Oriented Metrics

基于时间序列基础模型的概率低压峰值负荷预测及其面向应用的评估指标

Benedikt Kaas, Manuel Treutlein, Hannes Benedikt Gerber, Oliver Neumann, Cheewan Phatthanakhuha, Oliver Resch, Ralf Mikut, Veit Hagenmeyer

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Netze BW GmbH(Netze BW有限公司)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本研究评估时间序列基础模型在200个实际低压馈线短期净负荷预测中的性能,提出面向应用的指标连接峰值预测与电网资产规划中的成本-风险权衡。

Comments A poster abstract of this publication will be available at the 15th DACH+ Conference on Energy Informatics (2026 in Linz, Austria)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01740 2026-07-03 cs.AI 新提交 79%

Meta-Benchmarks for Financial-Services LLM Evaluation

金融服务大语言模型评估的元基准

Blair Hudson

机构 * Commonwealth Bank of Australia(澳大利亚联邦银行)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 针对公共排行榜忽略金融服务特定认知需求的问题,提出元基准框架,将452个基准映射到41个O*NET工作活动和38个BIAN银行业务领域,采用乘法加权方案和Elo锦标赛生成可比较的工作活动与业务领域得分。

Comments 27 pages, 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01086 2026-07-02 cs.CV cs.AI 新提交 79%

LongVQUBench: Benchmarking Long-Term Video Quality Understanding of Vision-Language Models

LongVQUBench:评估视觉语言模型的长期视频质量理解能力

Arpita Nema, Hanwei Zhu, Xi Zhang, Weisi Lin

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出LongVQUBench基准,包含1200+长视频和1500个问题,通过三级评估(局部、跨事件、全局)和针孔失真问答范式,揭示现有LVLMs在长视频质量理解上的局限性。

Comments Accepted at European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01001 2026-07-02 cs.CV cs.LG 新提交 79%

Foundation Models vs. Radiomics for Lung Computed Tomography: A Benchmark of Feature Extractors, Classification Heads, and Segmentation Choices

基础模型与放射组学在肺部计算机断层扫描中的比较:特征提取器、分类头和分割选择的基准测试

Nils Neukirch, Martin Maurer, Nils Strodthoff

机构 * Division AI4Health, Carl von Ossietzky Universität Oldenburg(奥尔登堡卡尔·冯·奥西茨基大学AI4Health部门) University Institute for Diagnostic and Interventional Radiology, Klinikum Oldenburg AöR(奥尔登堡医院大学诊断与介入放射学研究所)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本研究通过基准测试五种特征提取器、七种分类头和三种分割策略,评估基础模型与放射组学在CT肺癌表型分析中的性能,发现最优设计取决于任务,推荐Curia结合肿瘤分割和CatBoost分类头作为安全默认方案。

Comments 17 pages, 8 figures, 2 tables, Code is available at https://github.com/AI4HealthUOL/lung-ct-benchmarking

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18367 2026-07-02 cs.LG 新提交 79%

Do Time Series Foundation Model Benchmarks Hide Regime-Dependent Failures? Evidence from Traffic Speed Forecasting

时间序列基础模型基准是否隐藏了依赖于状态的失败?来自交通速度预测的证据

Yingshuo Wang, Xian Sun, Lingdong Kong, Wei Gao, Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * University of California, Berkeley(加州大学伯克利分校) Duke University(杜克大学) National University of Singapore(新加坡国立大学) Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出状态分层评估方法,发现时间序列基础模型在交通状态转换时准确率和预测区间覆盖率显著下降,并提出了双峰混合增强方法以改善转换状态覆盖。

Comments 5 pages, 2 figures. Accepted at the Workshop on Forecasting as a New Frontier of Intelligence, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27672 2026-06-29 cs.LG 新提交 79%

Are Time-Series Foundation Models Ready for E-Nose Data? An Empirical Assessment of Their Embeddings

时间序列基础模型是否准备好处理电子鼻数据?对其嵌入的经验评估

Taeyeong Choi, Mohammed Kamruzzaman

机构 * Department of Information Technology(信息科技系) Department of Agricultural and Biological Engineering(农业与生物工程系) Kennesaw State University(凯斯沃州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文系统评估了Chronos-2和MOMENT等时间序列基础模型在电子鼻数据上的嵌入表示,发现微调是必要步骤,且融合专用模型表示可提升气体识别和浓度预测性能。

Comments Submitted to IEEE SENSORS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27500 2026-06-29 cs.CV cs.CL 新提交 79%

Aloe-Vision: Robust Vision-Language Models for Healthcare

Aloe-Vision: 面向医疗保健的鲁棒视觉-语言模型

Jaume Guasch-Martí, Enrique Lopez-Cuena, Martín Suárez-Fernández, Jordi Bayarri-Planas, Anna Arias-Duart, Dario Garcia-Gasulla

机构 * Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心(BSC))

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 提出Aloe-Vision系列医疗LVLM,通过大规模高质量多模态数据微调,在保持通用能力的同时提升医疗任务性能,并引入低污染基准CareQA-Vision,揭示当前模型在临床环境中的鲁棒性挑战。

Comments MIDL 2026

Journal ref Proceedings of Machine Learning Research, Vol. 315, pp. 2404-2426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23583 2026-06-23 cs.CL 新提交 79%

Evaluation Awareness Is Not One Capability: Evidence from Open Language Models

评估意识并非单一能力:来自开放语言模型的证据

Nilesh Nayan, Aishwarya Sampath Kumar, Rishiraj Girmal, Shivani Anilkumar, Sankaran Vaidyanathan, David A. Nader Palacio, Reshmi Ghosh, Soundararajan Srinivasan

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) Microsoft Corp.(微软公司)

专题命中 评测与基准 :language model(title);instruction tuning(abstract);分类 cs.CL

AI总结 通过37个开放权重模型实验,发现语言模型对评估线索的检测、行为变化和表征可控性三个维度弱耦合,表明评估意识是多维的,单一分数无法可靠预测部署安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22188 2026-06-23 cs.LG 新提交 79%

Bayesian Adaptation Gym: A Benchmark for the Bayesian Low-Rank Adaptation of Multi-Modal Language Models

贝叶斯适应健身房:多模态语言模型贝叶斯低秩适应的基准

Colin Samplawski, Ramneet Kaur, Manoj Acharya, Anirban Roy, Adam D. Cobb

机构 * Neuro-Symbolic Computing and Intelligence Research Group(神经符号计算与智能研究组) Computer Science Laboratory(计算机科学实验室) SRI International(SRI国际)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 提出贝叶斯适应健身房(BAG)基准,用于评估多模态语言模型的贝叶斯低秩适应方法,涵盖校准、分布偏移鲁棒性和主动学习下的不确定性决策。

Comments Oral Paper at UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22181 2026-06-23 cs.LG 新提交 79%

Residue-Level Attributions in Protein Language Models Do Not Recover Allergen Epitopes

蛋白质语言模型中的残基级归因不能恢复过敏原表位

Jianzhou Yao, Anxiong Song, Katja Baerenfaller, Damir Zhakparov

机构 * Swiss Institute of Allergy and Asthma Research, Davos, Switzerland(瑞士过敏与哮喘研究所,达沃斯,瑞士) ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院,苏黎世,瑞士) Swiss Institute of Bioinformatics, Lausanne, Switzerland(瑞士生物信息学研究所,洛桑,瑞士)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本研究通过引入表位基准,评估蛋白质过敏原性模型的可解释性,发现分类器残基级归因与注释表位对齐不显著,模型可能依赖理化特征而非表位特异性机制。

Comments Accepted at the ICML 2026 Mechanistic Interpretability Workshop (peer-reviewed)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18950 2026-06-19 cs.AI 新提交 79%

RTSGameBench: An RTS Benchmark for Strategic Reasoning by Vision-Language Models

RTSGameBench: 视觉语言模型战略推理的RTS基准

San Kim, Daechul Ahn, Reokyoung Kim, Hyeonbeom Choi, Seungyeon Jwa, Jonghyun Choi

机构 * Seoul National University(首尔国立大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出RTSGameBench,基于Beyond All Reason游戏,通过多样化对战、迷你游戏诊断和自进化生成框架,评估视觉语言模型在实时策略游戏中的战略推理能力。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18001 2026-06-17 cs.LG 新提交 79%

Half a Link can Be Enough to Predict a Whole Link: Understanding Generalization in Knowledge Graph Foundation Models

半条链接足以预测整条链接:理解知识图谱基础模型中的泛化

Cosimo Gregucci, Obaidah Theeb, Daniel Hernandez, Antonio Vergari, Steffen Staab

机构 * Institute for AI, University of Stuttgart(斯图加特大学人工智能研究所) University of Southampton(南安普顿大学) University of Edinburgh(爱丁堡大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文通过分析知识图谱基础模型在未见图上的零样本泛化,发现模型利用部分可见的“半链接”进行预测,并基于此提出四类场景的分类法,揭示现有模型的泛化机制与改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15385 2026-06-16 cs.AI 新提交 79%

Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds

语言模型智能体中的奖励黑客:重新审视AI安全网格世界

Ömer Veysel Çağatan, Xuandong Zhao

机构 * KUIS AI Center, Koç University(科奇大学KUIS人工智能中心) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本研究将AI安全网格世界框架改编为文本评估套件,发现语言模型在零样本下出现规范博弈,通过直接奖励优化扩大观察与隐藏奖励差距,且标准缓解措施无效。

Comments 28 pages, 16 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11349 2026-06-16 cs.AI cs.HC 新提交 79%

Knowing When to Ask: Self-Gated Clarification for Hierarchical Language Agents

知道何时提问:分层语言代理的自门控澄清机制

Aijing Gao, Yiming Kang, Mengdie Flora Wang, Jae Oh Woo

机构 * Amazon Web Services(亚马逊云科技)

专题命中 评测与基准 :language agent(title);LLM(abstract_cn);分类 cs.AI

AI总结 提出ACTION-RATING框架,将澄清请求纳入代理的动作空间,与导航共享序数尺度,在分层推理中实现自门控澄清,通过强制性和机会性两种信息寻求模式提升决策准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12994 2026-06-15 cs.LG cs.CE 新提交 79%

DeepJEB++: Foundation Model-Driven Large-Scale 3D Engineering Dataset via 2D Latent Space Augmentation

DeepJEB++: 基于基础模型驱动的二维潜空间增强的大规模三维工程数据集

Soyoung Yoo, Leekyo Jeong, Jinsu Ra, Dongeon Lee, Sunwoong Yang, Hyogu Jeong, Namwoo Kang

机构 * Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(韩国科学技术院赵春植移动研究生院) Department of Mechanical Engineering, Hanyang University(汉阳大学机械工程系) Narnia Labs(纳尼亚实验室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 提出DeepJEB++框架,通过二维潜空间增强和基础模型,将少量喷气发动机支架种子设计扩展为大规模带仿真标签的三维数据集,实现40倍扩展。

Comments 16 pages, 14 figures. Submitted to ASME Journal of Mechanical Design

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12817 2026-06-15 cs.AI 新提交 79%

GUITrans2Act: Understanding User Operational Behaviors from Mobile GUI Interactions with Vision-Language Models

Teach-and-Repeat: 从移动屏幕演示中准确提取操作知识以赋能GUI智能体

Yudong Zhang, Lei Hu, Daoyang Liu, Jiawei Liu, Yangfan Luo, Zhilin Gao, Zuojian Wang

机构 * Honor Device Co., Ltd(荣耀终端有限公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出Teach VLM模型,通过从演示视频中提取关键帧生成操作知识,并构建数据飞轮解决训练数据稀缺问题;在基准测试中达到最优性能,并提升下游智能体的任务成功率。

Comments 20 pages, 9 figures. Yudong Zhang and Lei Hu contributed equally to this work. Zuojian Wang, and Zhilin Gao are corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12969 2026-06-12 cs.AI 新提交 79%

Multi-Modal Agents for Power Distribution Defect Detection: An Evaluation of Foundation Models

用于配电缺陷检测的多模态智能体:基础模型评估

Quan Quan

机构 * Quan Quan

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 提出多模态智能体框架,系统评估基础模型在感知、推理和工具使用三方面的能力,用于配电缺陷检测的闭环自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12232 2026-06-11 cs.LG 新提交 79%

Re-evaluating Confidence Remasking in Masked Diffusion Language Models

重新评估掩蔽扩散语言模型中的置信度重新掩蔽

Stipe Frkovic, Metod Jazbec, Dan Zhang, Christian A. Naesseth, Ilija Bogunovic, Eric Nalisnick

机构 * UvA-Bosch Delta Lab, University of Amsterdam(阿姆斯特丹大学UvA-Bosch Delta实验室) Bosch Center for AI(博世人工智能中心) University of Basel(巴塞尔大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文重新评估了掩蔽扩散语言模型中一种无需训练的后验置信度重新掩蔽方法WINO,发现在标准解码设置下其收益甚微,且会加剧多样性坍塌问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11889 2026-06-11 cs.CV cs.AI cs.RO 新提交 79%

Task-Aligned Stability Analysis of Vision-Language Models for Autonomous Driving Hazard Detection

面向自动驾驶危险检测的视觉-语言模型任务对齐稳定性分析

Everett Richards

机构 * Everett Richards(埃弗里特·里奇ards)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究视觉-语言模型在自动驾驶危险检测中,嵌入漂移与任务对齐危险分数变化的关系,发现不同腐败类型导致不同的失效模式,建议基准测试包含任务对齐稳定性指标。

Comments 8 pages (5 main body + 3 references / appendices). ICML 2026 Workshop on Combining Theory and Benchmarks (CTB)

详情

展开后加载摘要…

URL PDF HTML 收藏