arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

共收录 11753
2601.22548 2026-06-24 cs.CL cs.AI cs.LG 版本更新

Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference Evaluations

LLM评估者真的是自恋者吗?对自我偏好评估的健全性检查

Dani Roytburg, Matthew Bozoukov, Matthew Nguyen, Jou Barzdukas, Mackenzie Puig-Hall, Narmeen Oozeer

机构 * Department of Machine Learning, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学机器学习系) Department of Computer Science and Engineering, University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校计算机科学与工程系) Department of Computer Science, University of Virginia, Charlottesville, VA, USA(弗吉尼亚大学计算机科学系) Martian Research, San Francisco, California, USA(火星研究公司) Apart Research, San Francisco, California, USA(Apart研究公司)

AI总结 通过比较评估者自我评价与评价其他模型时的投票分布,发现仅51%的先前结果具有统计显著性,表明自我偏好主要由评估者质量而非自恋驱动。

Comments ICML 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22879 2026-06-24 math.OC cs.LG 版本更新

Mixtures Closest to a Given Measure: A Semidefinite Programming Approach

最接近给定测度的混合:一种半定规划方法

Srećko Đurašinović, Jean-Bernard Lasserre, Victor Magron

机构 * College of Computing and Data Science, NTU, Singapore(新加坡国立大学计算与数据科学学院) LAAS-CNRS, Toulouse, France(法国图卢兹CNRS-Laas研究所) Toulouse School of Economics(图卢兹经济学院)

AI总结 针对仅知有限矩的目标测度,提出半定规划松弛层次法,用参数族混合逼近并最小化2-Wasserstein或全变差距离,渐近收敛且满足秩条件时有限收敛,可应用于聚类。

Comments 23 pages, 2 algorithms, 1 table, 4 figures

Journal ref ICML 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13087 2026-06-24 cs.LG cs.AI 版本更新

Graph Alignment for Benchmarking Graph Neural Networks and Learning Positional Encodings

图对齐:用于基准测试图神经网络和学习位置编码

Adrien Lagesse, Marc Lelarge

机构 * INRIA, École Normale Supérieure - PSL, Paris, France(INRIA,法国国家信息与自动化研究所,巴黎高等师范学院-巴黎理工学院,巴黎,法国)

AI总结 提出基于图对齐问题的GNN基准测试方法,通过自监督学习生成难度递增的数据集,发现各向异性模型表现更优,且预训练嵌入可作为位置编码用于图回归或高精度结构重建。

Comments International Conference on Machine Learning, Seoul, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02583 2026-06-24 cs.LG

Transformer-based Stagewise Decomposition for Large-Scale Multistage Stochastic Optimization

基于Transformer的分阶段分解用于大规模多阶段随机优化

Chanyeong Kim, Jongwoong Park, Hyunglip Bae, Woo Chang Kim

机构 * Department of Industrial and Systems Engineering, KAIST, Daejeon, Republic of Korea(韩国成均馆大学工业与系统工程系) NCSOFT Corporation, Seongnam, Republic of Korea(韩国水原NCSOFT公司)

AI总结 本文提出TranSDDP算法,利用Transformer结构改进传统SDDP,通过生成分段线性近似函数提升大规模多阶段随机优化问题的求解效率与精度。

Comments Accepted at ICML 2023 (Oral Presentation)

Journal ref Proceedings of the 40th International Conference on Machine Learning, PMLR 202:16747-16770, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23064 2026-06-23 eess.AS cs.SD 新提交

STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation

STAR-VAE: 结构化拓扑感知正则化用于音频重建与生成

Huadai Liu, Wen Wang, Kaicheng Luo, Qian Chen, Xiangang Li, Wei Xue

机构 * Hong Kong University of Science(香港科学大学) Tongyi Fun Team, Alibaba Group(通义Fun团队,阿里巴巴集团)

AI总结 针对连续VAE在压缩率、重建保真度和潜在空间拓扑之间的三难困境,提出结构化拓扑感知正则化(STAR),通过增长约束场重塑潜在空间几何,实现音频的高保真重建与生成。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22719 2026-06-23 q-fin.ST cs.AI 新提交

Leakage-Aware Benchmarking of LLM Forecasting: Real-Time Nowcasts as the Decision-Time Input for Macro Factor Ranking

泄露感知的LLM预测基准测试:实时预测作为宏观因子排序的决策时间输入

Mao Guan, Qian Chen

机构 * Independent Researcher(独立研究者)

AI总结 提出一种泄露控制的因子排序方法,使用检索增强的7B开源LLM预测器,在决策时间仅利用滞后宏观变量、近期事件摘要和实时通胀预测,实现中位数Spearman秩IC为+0.154,并验证了实时通胀信息和宏观相似检索对中位数信号的主导作用。

Comments 10 pages, 4 figures. Accepted at the ICML 2026 Workshop on AI Forecasting (Forecasting as a New Frontier of Intelligence). Non-archival. OpenReview: https://openreview.net/forum?id=mi8QiWomm3

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22239 2026-06-23 stat.ML cs.LG 新提交

Variance-Tilted Diffusion Models for Diverse Sampling

方差倾斜扩散模型用于多样化采样

Iskander Azangulov, Leo Zhang, Kianoosh Ashouritaklimi

机构 * Department of Statistics, University of Oxford, Oxford, UK(牛津大学统计学系)

AI总结 提出方差加权批分布,通过Doob h-变换导出交互粒子采样器,在扩散模型中实现多样化采样,具有透明概率目标。

Comments Accepted at SPIGM @ ICML workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23517 2026-06-23 cs.LG stat.ML 新提交

Collapsed Effective Operators for Higher-order Structures

高阶结构的塌缩有效算子

Maximilian Krahn, Lennart Bastian, Vikas Garg, Björn Schuller, Tolga Birdal

机构 * Department of Computing, Imperial College London(帝国理工学院计算系) Aalto University(阿尔托大学) Chair of Health Informatics, Technical University of Munich(慕尼黑工业大学健康信息学教席) Munich Center for Machine Learning(慕尼黑机器学习中心) YaiYai Ltd(YaiYai有限公司)

AI总结 提出通过Schur补将高阶拉普拉斯算子塌缩为顶点级算子,保留正半定性并降低系统能量,在谱聚类、信号平滑和神经网络位置编码中提升性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23206 2026-06-23 cs.CV cs.CL 新提交

CFPO: Counterfactual Policy Optimization for Multimodal Reasoning

CFPO:用于多模态推理的反事实策略优化

Zhangyuan Yu, Wanran Sun, Guangjing Yang, Xiaohu Wu, Qicheng Lao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 提出反事实策略优化框架,通过跨模态反事实增强机制强制视觉与文本推理的因果一致性,显著提升多模态推理的准确性。

Comments Accepted to ICML 2026. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23175 2026-06-23 cs.LG 新提交

Position: Correct Answer, Wrong Mechanism -- When AI Scientists Defend General Claims Their Own Data Contradicts

立场:正确答案,错误机制——当AI科学家用自身数据反驳其通用主张时

Steven Young Eulig

机构 * Department of Physics and Laboratory for Particle Physics and Cosmology (LPPC), Harvard University(哈佛大学物理系与粒子物理与宇宙学实验室(LPPC))

AI总结 本文通过编码代理在Geant4模拟中重新发现已知粒子识别可观测量的实验,指出仅以最终结果评估AI科学家系统不足,提出需分别衡量任务结果、机制保真度和认知诚实性,并发现正确答案但错误机制(CAWM)现象。

Comments 8 pages body plus 12 pages references and appendix, non-archival upload for ICML 2026 AI for Science workshop, selected as spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22914 2026-06-23 cs.LG 新提交

PromptDyG: Test-Time Prompt Adaptation on Dynamic Graphs

PromptDyG:动态图上的测试时提示自适应

Guoguo Ai, Chaoxi Niu, Hui Yan, Joey Tianyi Zhou, Yew-Soon Ong, Guansong Pang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Centre for Frontier AI Research (CFAR), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局前沿人工智能研究中心) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高性能计算研究所) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 提出PromptDyG框架,通过无监督测试时提示自适应在冻结骨干网络上最小化特征熵,在线建模动态图演化模式,理论保证正负样本对相似度间隔增大,实验在6个基准数据集上显著优于基线。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22768 2026-06-23 cs.LG cs.DC 新提交

Factored Gossip DiLoCo: Reducing Blocking Communication in DiLoCo

因式化Gossip DiLoCo:减少DiLoCo中的阻塞通信

Chamin Hewa Koneputugodage, Thalaiyasingam Ajanthan, Sameera Ramasinghe, Hadi Mohaghegh Dolatabadi, Shamane Siriwardhana, Gil Avraham, Violetta Shevchenko, Karol Pajak, James Snewin, Alexander Long

机构 * Pluralis Research

AI总结 提出因式化Gossip DiLoCo,通过非阻塞混合与阻塞混合分解同步,在低带宽环境下提升计算利用率并保持优化稳定性。

Comments Accepted at ICML 2026. 29 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22488 2026-06-23 cs.AI 新提交

SCOPE: Evolving Symbolic World for Planning in Open-Ended Environments

SCOPE:面向开放环境规划的演化符号世界

Yundaichuan Zhan, Minghe Gao, Zhongqi Yue, Wendong Bu, Wenqiao Zhang, Guoming Wang, Jisheng Dang, Juncheng Li, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Chalmers University of Technology(查尔姆斯理工大学) Lanzhou University(兰州大学)

AI总结 提出SCOPE框架,通过符号执行模拟器和自适应符号记忆模块,在开放环境中演化符号世界表示,提升规划完整性和鲁棒性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22462 2026-06-23 cs.LG 新提交

Adaptive Recurrent Message Passing for Test Time Computing on Graphs

自适应递归消息传递用于图上的测试时计算

Junshu Sun, Wanxing Chang, Qingming Huang, Shuhui Wang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院)

AI总结 针对图数据与固定架构不匹配的问题,提出自适应递归图模型AdaR,通过理论推导步依赖作为自适应收敛的充要条件,并利用归一化步信息和梯度监督实现灵活测试时计算,在归纳和直推设置中优于强基线。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22429 2026-06-23 cs.LG 新提交

Enhancing LLMs for Graph Tasks via Graph-aware LoRA Generation

通过图感知的LoRA生成增强LLMs的图任务能力

Junshu Sun, Wanxing Chang, Qingming Huang, Shuhui Wang

机构 * State Key Lab. of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院)

AI总结 提出GaRA模型,通过生成任务特定的低秩权重更新注入全图信息,避免信息损失,在零样本图学习任务上优于基线方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22181 2026-06-23 cs.LG 新提交

Residue-Level Attributions in Protein Language Models Do Not Recover Allergen Epitopes

蛋白质语言模型中的残基级归因不能恢复过敏原表位

Jianzhou Yao, Anxiong Song, Katja Baerenfaller, Damir Zhakparov

机构 * Swiss Institute of Allergy and Asthma Research, Davos, Switzerland(瑞士过敏与哮喘研究所,达沃斯,瑞士) ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院,苏黎世,瑞士) Swiss Institute of Bioinformatics, Lausanne, Switzerland(瑞士生物信息学研究所,洛桑,瑞士)

AI总结 本研究通过引入表位基准,评估蛋白质过敏原性模型的可解释性,发现分类器残基级归因与注释表位对齐不显著,模型可能依赖理化特征而非表位特异性机制。

Comments Accepted at the ICML 2026 Mechanistic Interpretability Workshop (peer-reviewed)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22164 2026-06-23 cs.LG 新提交

Drowning in Routine: Signal Dilution in Multi-Turn Agent Training

淹没在例行公事中:多轮智能体训练中的信号稀释

Yann Pernot, Vi Retault

机构 * Mila - Qu\'ebec AI Institute

AI总结 本文提出决策密度ρ的概念,揭示多轮智能体训练中例行轮次导致信号稀释,并推导出轨迹级信噪比与ρ^{-1/2}成比例,实验验证了该缩放关系。

Comments Accepted at the FAGEN Workshop at ICML 2026, Seoul, South Korea. 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22056 2026-06-23 cs.LG 新提交

Provably Efficient Policy-Reward Co-Pretraining for Adversarial Imitation Learning

对抗模仿学习的可证明高效策略-奖励联合预训练

Tian Xu, Zexuan Chen, Zhilong Zhang, Yi-Chen Li, Chenyang Wang, Lei Yuan, Yang Yu

机构 * National Key Laboratory for Novel Software Technology(计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

AI总结 针对对抗模仿学习(AIL)需大量在线交互的问题,提出基于奖励塑形分析的理论框架,设计策略-奖励联合预训练方法CoPT-AIL,首次从理论上证明预训练能提升AIL的模仿性能。

Comments Paper accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21830 2026-06-23 cs.LG 新提交

Mat-Pref: Verifiable-Reward Training Improves Compositional Reasoning in Inorganic Materials

Mat-Pref: 可验证奖励训练提升无机材料中的组合推理能力

Sarrah R. Mikhail Leung, Taehan Kim, Jeongbin Park

机构 * University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学)

AI总结 提出Mat-Pref基准,通过可验证奖励强化学习(GRPO)提升无机材料组合推理,在结构泛化和属性迁移上超越大模型。

Comments 10 pages, 4 figures, Accepted at ICML AI4Physics 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21821 2026-06-23 cs.LG cs.CL 新提交

Local Causal Attribution of Chain-of-Thought Reasoning

链式思维推理的局部因果归因

Dennis Wei, Yannis Belkhiter, Erik Miehling, Radu Marinescu

机构 * IBM Research(IBM研究院)

AI总结 提出AttriCoT算法,通过结构因果模型对链式思维推理中的单元进行局部因果归因,仅需O(U)次前向传播即可获得忠实于模型行为的归因结果。

Comments Camera-ready version for the Mechanistic Interpretability Workshop at ICML 2026. 37 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21776 2026-06-23 cs.LG 新提交

A Causal DAG Prior for Synthetic Time-Series Classification Datasets

用于合成时间序列分类数据集的因果DAG先验

Franco Martino O'Rourke, Ana Trisovic, Dimitris Bertsimas

机构 * Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院)

AI总结 提出一种因果DAG先验,从随机采样的有向无环图生成多变量、多类别的时间序列分类数据集,包含跨模态因果结构,微调TabPFN v2.5后在UCR/UEA数据集上显著优于基线。

Comments Accepted at the 2nd ICML 2026 Workshop on Foundation Models for Structured Data (FMSD). 4 pages (main text), 2 figures, plus references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21646 2026-06-23 cs.RO 新提交

Energy-based Compositional Diffusion Planning

基于能量的组合扩散规划

Tao Sun, Utkarsh Aashu Mishra, Jiaxin Lu, Danfei Xu, Iro Armeni

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 提出能量基组合扩散器(ECD),将全局轨迹建模为局部桥势之和的最小化,通过保守修正场和边界反应项改进启发式拼接,实现线性时间复杂度的马尔可夫分数近似,在OGBench任务中达到最优成功率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21238 2026-06-23 cs.DC cs.AI cs.LG 新提交

Recency/Frequency Adaptive KV Caching for Large Language Model Serving

面向大语言模型服务的近期/频率自适应KV缓存

Yang Shen, Meghana Madhyastha, Robert Underwood, Bogdan Nicolae, Randal Burns

机构 * Department of Computer Science, Johns Hopkins University, Baltimore, USA(约翰霍普金斯大学计算机科学系) Argonne National Laboratory, Lemont, USA(阿贡国家实验室) Parasail, Inc., San Mateo, USA(Parasail公司)

AI总结 针对LRU策略在多工作负载下缓存失效问题,提出自适应KV缓存,动态分配近期与高频KV块的空间,在合成文档问答中缓存命中率提升10.8%,首令牌时间降低12.6%。

Comments Accepted at the ICML 2026 Workshop on Resource-Adaptive Foundation Model Inference (AdaptFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20978 2026-06-23 cs.AI cs.HC 新提交

How Should Agents Read Demonstrations? Hierarchical Structure Beats Flat Action Logs

智能体应如何阅读演示?层级结构优于扁平动作日志

Honjar Xing, Jefferson Lin, Henry Lieberman

机构 * MIT Computer Science and Artificial Intelligence Laboratory (CSAIL)(麻省理工学院计算机科学与人工智能实验室(CSAIL))

AI总结 本文提出将演示中的动作序列组织为带标签的层级子目标,在85个Web自动化任务中,层级结构将模糊描述任务的通过率从76.7%提升至90.7%,而扁平结构改进不显著,消融实验表明子目标分组是唯一驱动因素。

Comments Accepted at the 5th Deep Learning for Code (DL4C) Workshop, ICML 2026. 8 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20961 2026-06-23 cs.LG cs.AI 新提交

Is Our Benchmark Enough? An Analysis of Continual Learning for MLLMs

我们的基准测试足够吗?多模态大语言模型持续学习分析

Van-Tuan Tran, Shruthi Gowda, Merim Dzaferagic, Marco Ruffini

机构 * School of Computer Science and Statistics, Trinity College Dublin(都柏林圣三一学院计算机科学与统计学院) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)

AI总结 本文质疑MR-LoRA方法对MLLM路由器的依赖,提出无训练无重放的简单原型路由方法RePRo,并指出共享专家无益,揭示MLLM-CL基准的任务高度可分离和固定顺序导致评估偏差,从而提出新基准设计。

Comments ICML 2026 Workshop "Continual Adaptation at Scale: Towards Sustainable AI"

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20922 2026-06-23 cs.CR 新提交

Think Twice Before You Act: Protecting LLM Agents Against Tool Description Poisoning via Isolated Planning

三思而后行:通过隔离规划保护LLM代理免受工具描述投毒攻击

Shanghao Shi, Xiao Wang, Chaoyu Zhang, Hao Li, Wenjing Lou, Thomas Hou, Yevgeniy Vorobeychik, Chongjie Zhang, Ning Zhang

AI总结 提出Tool-Guard系统级防御,通过隔离规划机制将可疑工具调用隔离到受感染列表,阻断投毒描述持续影响,在AgentDojo和ASB基准上显著降低攻击成功率并保持任务效用。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20867 2026-06-23 cs.CV cs.AI 新提交

FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation

FOCA: 面向未来的条件化用于数据高效的视觉-语言-动作适应

Duc Minh Nguyen, Nghiem Tuong Diep, Binh Gia Nguyen, Trong-Bao Ho, Doanh Le, Tan Q. Nguyen, Thien-Loc Ha, Nhiem Tran, Bao Thach, Nhat X. Tran, Tuan A. Tran, Artur Habuda, Philip Lund Møller, Tran Nguyen Le, Daniel Sonntag, Matthias Niepert, Khoa D. Doan, Vu Duong, Hung Ngo, Minh N. Vu, Duy M. H. Nguyen, An Thai Le, Ngo Anh Vien

机构 * Center for AI Research, VinUniversity, Vietnam University of Utah, USA German Research Center for Artificial Intelligence (DFKI) Technical University of Denmark, Denmark University of Oldenburg, Germany University of Stuttgart, Germany Max Planck Research School for Intelligent Systems (IMPRS-IS), Germany

AI总结 提出FOCA框架,结合未来交互嵌入预测与目标观测隐式对齐,实现数据高效的VLA少样本适应,在LIBERO、RoboCasa和真实机器人上取得新最优结果。

Comments Accepted at ICML 2026. Project page: https://focavla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20776 2026-06-23 cs.SE cs.AI cs.NE 新提交

Formally Verified Code Synthesis for Structured Data Translation in a Medical Internet of Things

医疗物联网中结构化数据翻译的形式化验证代码合成

Colin Samplawski, Adam D. Cobb

机构 * Computer Science Laboratory, SRI International(SRI国际计算机科学实验室)

AI总结 提出一种基于LLM的进化代码合成系统,集成形式化验证步骤,用于医疗物联网中结构化数据翻译,确保生成代码满足预定义需求,并以脉搏血氧仪集成案例展示其低开销生成正确翻译的能力。

Comments Spotlight Paper at the Workshop on Structured Data for Health at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20769 2026-06-23 cs.CL cs.AI cs.LG 新提交

FirstPass: Grounding AI Scientific Judgment in Multi-Round Editorial Outcomes

FirstPass: 在多轮编辑结果中奠定AI科学判断的基础

Prabhjot Singh, Somnath Luitel, Manmeet Singh, Josh Durkee

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) RediMinds Inc.(RediMinds公司) Disaster Science Operations Center, Western Kentucky University(西肯塔基大学灾害科学运营中心)

AI总结 针对同行评审AI在领域覆盖、对话建模和评估标准上的不足,提出FirstPass数据集和微调模型,利用Nature Communications多轮评审对话,通过响应损失掩码实现80.5%的编辑结果预测准确率,并生成接近人类长度的评审意见。

Comments Accepted at the AI for Science Workshop at the 43rd International Conference on Machine Learning (ICML 2026). 9 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20668 2026-06-23 cs.CR cs.AI cs.LG 新提交

BELLS-O: Evaluating the Operational Trade-offs of LLM Supervision Systems

BELLS-O:评估LLM监督系统的运营权衡

Leonhard Waibl, Felix Michalak, Hadrien Mariaccia

机构 * University of Graz, Graz, Austria(格拉茨大学) Supervised Program for Alignment Research (SPAR)(对齐研究监督计划 (SPAR)) Centre pour la Sécurité de l'IA (CeSIA), Paris, France(人工智能安全研究中心 (CeSIA),巴黎,法国)

AI总结 提出首个独立运营基准BELLS-O,评估28个LLM监督系统在检测率、误报率、延迟和成本上的权衡,发现专用护栏在内容审核中占优,而前沿通用模型在越狱检测中表现更好但成本更高。

Comments Accepted at the ICML 2026 Workshop on Trustworthy AI for Good (AI4GOOD). 2 figures; main text plus appendices

详情

展开后加载摘要…

URL PDF HTML 收藏