arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-08-28 至 2026-08-28 共收录 8
2608.27340 2026-08-28 cs.AI 新提交

Not All Eval-Awareness Is Equal: Capabilities Framing Predicts Compliance

并非所有评估感知都等同:能力框架预测合规性

Allison Zhuang, Santiago Aranguri

机构 * ENS Paris-Saclay(巴黎萨克雷高等师范学校) Goodfire AI

AI总结 该研究发现评估感知的框架类型会显著影响模型合规性,能力导向型框架的合规性远高于安全导向型,且评估感知并非行为均匀的单一量,总抑制率变化不代表安全相关部分同步变化。

Comments 5 pages (14 appendices), 5 figures, presented at 2026 ICML Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27286 2026-08-28 cs.LG 新提交

MM-Spectrum: Multimodal Multi-spectral Molecular Structural Elucidation with a Stable MoE Framework

MM-Spectrum:基于稳定MoE框架的多模态多光谱分子结构解析

Hai-tao Yu, Nan Min, Zheng Fang, Hongyu Zhan, Yusen Tan, Yuhan Wang, Jun Xia

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Southeast University(东南大学) Fudan University(复旦大学)

AI总结 针对多光谱序列直接连接的性能下降问题,提出MM-Spectrum稳定MoE框架,引入模态感知路由与异质专家,在分子结构解析的多模态设置下取得显著改进。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26676 2026-08-28 cs.CL cs.AI cs.LG 新提交

FOCUS & RePAIR: Mitigating Text Degeneration via Token-Level Guidance for Pruned Large Language Models

FOCUS与RePAIR:针对剪枝后的大语言模型,通过令牌级引导缓解文本退化问题

Junyoung Lee, Sehyeon Park, Shinhyoung Jang, Seonha Ryu, Hojeong Kim, Hyunsei Lee, Il Hong Suh, Yeseong Kim

机构 * POSTECH(浦项科技大学) Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院) Hanyang University(汉阳大学)

AI总结 该研究针对剪枝后大语言模型的文本退化问题,提出FOCUS与RePAIR两种令牌级引导微调方法,在两类生成任务上均有效减少重复并提升生成质量。

Comments Accepted to ICML 2026 as a Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26191 2026-08-28 cs.AI 新提交

Structured Evidence Routing for Incident Risk Prediction from Multimodal Longitudinal EHRs

面向多模态纵向电子健康记录(EHR)的事件风险预测的结构化证据路由

Animesh Agarwal, Meysam Ghaffari, Nina Fatehi, Carlos Morato

机构 * Optum AI(奥普姆人工智能部门) UnitedHealth Group(联合健康集团)

AI总结 该研究针对多模态纵向EHR的事件风险预测难题,提出结构化证据路由方法,经5项1年期诊断任务验证,其AUROC达到现有基线水平、AUPRC具竞争力,还可提供患者特定证据轨迹。

Comments Accepted at the ICML 2026 Workshop on Structured Data for Health (SD4H), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26142 2026-08-28 cs.CL cs.AI 新提交

Position Is All You Need: A Free Lunch Token Compression Strategy for MLLM-based Referring Expression Segmentation

位置即你所需:一种用于基于多模态大语言模型的指代表达分割的免费午餐式令牌压缩策略

Yuhan Liu, Yixiong Zou, Yuhua Li, Ruixuan Li

AI总结 针对基于多模态大语言模型的指代表达分割任务的计算开销瓶颈,提出仅依赖位置信息的即插即用无训练令牌压缩方法PAYN,性能优于现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26131 2026-08-28 cs.CL 新提交

Evaluating Language Models in Realistic Conversational Contexts

在真实对话语境中评估语言模型

Ilija Subasic, Andrew Rabinovich, Zhao Chen

AI总结 该研究针对现有对话评估框架的不足,推出UPHELD基准,开发混合评判者框架,提升了对话评估与人类判断的相关性,为LLM对话评估提供了稳健基础。

Comments International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26129 2026-08-28 cs.CL cs.AI cs.LG 新提交

FIRSTPASS: A Multi-Domain, Multi-Round Peer Review Dataset Grounded in Real Editorial Outcomes

FIRSTPASS:基于真实编辑结果的多领域多轮同行评审数据集

Prabhjot Singh, Somnath Luitel, Manmeet Singh, Josh Durkee

AI总结 该研究推出首个多领域多轮同行评审数据集FIRSTPASS,填补现有数据集学科单一的空白,为跨学科AI科学判断提供可复现的基准测试资源。

Comments Accepted at the AI for Science Workshop at the 43rd International Conference on Machine Learning (ICML 2026), 3 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26119 2026-08-28 cs.CL 新提交

DeflectBench: A Benchmark for Evaluating Rhetorical Fallacy Generation in LLMs

DeflectBench:评估大语言模型中修辞谬误生成的基准

Art Kanke

AI总结 DeflectBench评估四个前沿大语言模型在三种修辞谬误生成任务中的表现,发现拒绝率主要由提示框架和谬误类型决定,教育辩论教练提示可大幅降低拒绝率,且各模型的合规行为分布存在差异。

Comments 15 pages. Accepted at the CTB, FAGEN, and AI4GOOD workshops at ICML 2026 in Seoul, South Korea. Code and dataset: this https URL (https://github.com/ArtKanke/DeflectBench)

详情

展开后加载摘要…

URL PDF HTML 收藏