arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

NeurIPS

Conference on Neural Information Processing Systems · 会议 · Machine Learning

共收录 17318
2605.25297 2026-05-29 cs.CL cs.AI cs.LG

Eureka: Intelligent Feature Engineering for Enterprise AI Cloud Resource Demand Prediction

Eureka:面向企业AI云资源需求预测的智能特征工程

Hangxuan Li, Renjun Jia, Xuezhang Wu, Yunjie Qian, Zeqi Zheng, Xianling Zhang

机构 * Alibaba Cloud Computing Co. Ltd, Hangzhou, China(阿里云计算有限公司,杭州,中国) School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机学院,上海,中国) School of Computer Science and Technology, Tongji University, Shanghai, China(同济大学计算机科学与技术学院,上海,中国) Independent Researcher, United States(独立研究员,美国)

AI总结 提出Eureka框架,将特征工程视为智能体代码生成问题,通过专家代理、LLM特征工厂和自演化对齐引擎三阶段,自动生成可执行特征代码,在医疗、金融、社交等7个公开基准及阿里云GPU资源需求预测中显著提升性能。

Comments accepted at NeurIPS 2025 Workshop, DASFAA 2026 (International Conference on Database Systems for Advanced Applications)

Journal ref Database Systems for Advanced Applications (DASFAA 2026), Lecture Notes in Computer Science, vol. 16540, pp. 528-540, Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07707 2026-05-29 cs.AI

Hierarchical Task Network Planning with LLM-Generated Heuristics

基于LLM生成启发式的层次任务网络规划

Felipe Meneguzzi, Alexandre Buchweitz, Augusto B. Corrêa, Victor Scherer Putrich, André Grahl Pereira

机构 * University of Aberdeen, UK(爱丁堡大学(英国)) PUCRS, Brazil(巴西普埃布拉联邦大学) University of Oxford, UK(牛津大学(英国)) Saarland University, Germany(萨尔大学(德国)) Universidade Federal do Rio Grande do Sul, Brazil(巴西里约格兰德 do 南大学)

AI总结 研究利用大语言模型为层次任务网络规划生成搜索启发式,通过Pytrich规划器在六个基准领域评估,结果表明LLM生成的启发式在覆盖度上接近最优HTN规划器,并在83%的共享问题上显著减少搜索开销。

Comments 9 pages, 3 figures; submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17208 2026-05-29 cs.LG physics.atm-clus

Active Learning for Machine Learning Driven Molecular Dynamics

主动学习驱动的分子动力学机器学习

Kevin Bachelor, Sanya Murdeshwar, Daniel Sabo, Razvan Marinescu

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) GiwoTech Inc.(GiwoTech公司)

AI总结 针对机器学习粗粒化势函数在模拟中因采样不足而性能退化的问题,提出基于RMSD的主动学习框架,通过在线查询Oracle生成数据,在保持粗粒化效率的同时修正覆盖缺口,使Chignolin蛋白模型的TICA空间W1指标提升33.05%。

Comments 9 pages, 4 figures, for Neurips Workshop: Machine Learning and the Physical Sciences 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21996 2026-05-29 cs.CV cs.AI

VRAG: Learning World Models for Interactive Video Generation

VRAG:面向交互式视频生成的世界模型学习

Taiye Chen, Xun Hu, Zihan Ding, Chi Jin

机构 * Peking University(北京大学) University of Oxford(牛津大学) Princeton University(普林斯顿大学)

AI总结 针对自回归视频生成中累积误差和记忆机制不足的问题,提出视频检索增强生成(VRAG)方法,通过显式全局状态条件降低长期累积误差并提升时空一致性。

Comments Published at NeurIPS 2025. Project page: https://sites.google.com/view/vrag

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28111 2026-05-28 cs.LG

Chreode: A Cell World Model for One-Step Temporal Dynamics and Perturbation Prediction

Chreode: 用于一步时间动态和扰动预测的细胞世界模型

Mufan Qiu, Genhui Zheng, Yinuo Xu, Ruichen Zhang, Ying Ding, Qi Long, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Pennsylvania(宾夕法尼亚大学)

AI总结 提出Chreode,一种基于结构化残差转移算子的单步细胞世界模型,通过预训练和微调实现发育轨迹与扰动预测的统一,在多个基准上取得性能提升。

Comments 25 pages, 3 figures, 14 tables. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27465 2026-05-28 cs.CV cs.AI

AdaMerge: Salience-Aware Adaptive Token Merging for Training-Free Acceleration of Vision Transformers

AdaMerge: 面向视觉Transformer无训练加速的显著性感知自适应令牌合并

Semi Lee, Hyejin Go, Hyesong Choi

机构 * Electronic Engineering(电子工程) Soongsil University(顺斯大学)

AI总结 提出AdaMerge框架,通过显著性加权相似度和自适应合并强度两个互补机制,在无训练条件下提升令牌合并的精度-计算量帕累托前沿。

Comments 11 pages, 3 figures, 5 tables. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17720 2026-05-28 cs.LG physics.ao-ph

PEAR: Equal Area Weather Forecasting on the Sphere

PEAR:球面上的等面积天气预报

Hampus Linander, Tage Tykesson, Pietro Rosso, Christoffer Petersson, Daniel Persson, Jan E. Gerken

机构 * VERSES AI Department of Mathematical Sciences(数学科学系) Chalmers University of Technology(楚姆勒斯技术大学) University of Gothenburg(哥德堡大学) Department of Computer Science and Engineering(计算机科学与工程系) Department of Physics and Astronomy(物理与天文学系) Recohere

AI总结 针对球面等角网格在极地分辨率过高的问题,提出基于HEALPix等面积网格的Transformer模型PEAR,实现无计算开销的全球天气预报性能提升。

Comments Extended version of manuscript published in the AI for Science workshop (NeurIPS 2025), 11 pages, 15 pages supplemental

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21046 2026-05-28 cs.CV cs.RO

CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification

CogVLA: 通过指令驱动路由与稀疏化实现认知对齐的视觉-语言-动作模型

Wei Li, Renshan Zhang, Rui Shao, Jie He, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院)

AI总结 提出CogVLA框架,通过指令驱动路由和稀疏化机制,在LIBERO基准和真实机器人任务上以2.5倍训练成本降低和2.8倍推理延迟降低实现97.4%和70.0%的成功率。

Comments Accepted to NeurIPS 2025, Project Page: https://jiutian-vl.github.io/CogVLA-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09344 2026-05-27 cs.CV cs.LG

DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data

DreamSim: 使用合成数据学习人类视觉相似性的新维度

Stephanie Fu, Netanel Tamir, Shobhita Sundaram, Lucy Chai, Richard Zhang, Tali Dekel, Phillip Isola

机构 * MIT(麻省理工学院) Weizmann Institute of Science(魏茨曼科学研究所) Adobe Research(Adobe研究)

AI总结 本文提出DreamSim指标,通过合成数据训练,在图像布局、对象姿态和语义内容等中高层面上对齐人类感知,并在检索和重建任务中优于现有指标。

Comments Website: https://dreamsim-nights.github.io/ Code: https://github.com/ssundaram21/dreamsim

Journal ref Advances in Neural Information Processing Systems 36 (NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23082 2026-05-26 stat.ML cs.AI cs.LG

KAPLAN: Kolmogorov-Arnold Prognostic Learnable Activation Networks for Survival Analysis

KAPLAN: 用于生存分析的Kolmogorov-Arnold可预测可学习激活网络

Stelios Boulitsakis Logothetis, Angela Wood, Pietro Liò

机构 * University of Cambridge(剑桥大学)

AI总结 提出KAPLAN-HR模型,利用B样条Kolmogorov-Arnold网络非参数估计条件风险函数,通过深层架构自动捕捉交互和时变效应,并证明其收敛速率仅依赖于表示平滑性,从而缓解维度灾难,在六个临床数据集上达到或超越现有方法。

Comments 9 pages, 3 figures, 13 supplementary pages. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12850 2026-05-26 cs.CL cs.AI cs.CR cs.LG

Persona-Model Collapse in Emergent Misalignment

涌现性失调中的人格模型崩溃

Davi Bastos Costa, Renato Vicente

机构 * TELUS Digital Research Hub(TELUS数字研究中心) Center for Artificial Intelligence and Machine Learning(人工智能与机器学习中心) Institute of Mathematics, Statistics and Computer Science(数学、统计与计算机科学研究所) University of São Paulo(圣保罗大学)

AI总结 提出人格模型崩溃假说,通过道德易感性(S)和道德稳健性(R)两个指标,证明在有害数据上微调大语言模型会导致模型模拟、区分和维持一致角色的内部能力恶化,从而引发涌现性失调。

Comments 23 pages, 7 figures, 7 tables; NeurIPS 2026 submission; Corrected code repository URL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02171 2026-05-26 cs.SD cs.AI eess.AS

Go witheFlow: Real-time Emotion Driven Audio Effects Modulation

Go witheFlow:实时情感驱动音频效果调制

Edmund Dervakos, Spyridon Kantarelis, Vassilis Lyberatos, Jason Liartis, Giorgos Stamou

机构 * Artificial Intelligence and Learning Systems Laboratory(人工智能与学习系统实验室) National Technical University of Athens(希腊国家技术大学)

AI总结 提出witheFlow系统,通过生物信号和音频特征实时自动调制音频效果,增强音乐表演中的人机协作。

Comments Accepted at NeurIPS Creative AI Track 2025: Humanity

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24045 2026-05-26 cs.LG cs.AI

A Large-Scale Dataset and Benchmark: Do Protein-Ligand Models Learn Binding Sites or Just Binding Likelihood?

大规模数据集与基准:蛋白质-配体模型学习的是结合位点还是仅仅结合可能性?

Zhaohan Meng, Zhen Bai, Ke Yuan, Iadh Ounis, Zaiqiao Meng, Hao Xu, Joseph Loscalzo

机构 * School of Computing Science(计算科学学院) School of Cancer Sciences(癌症科学学院) School of Life Science and Technology(生命科学与技术学院) Institute of Science Tokyo(东京科学研究院) Cancer Research UK Scotland Institute(英国癌症研究会苏格兰研究所) Language Technology Lab(语言技术实验室) Department of Medicine, Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院内科部,布里格斯妇女医院) The Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所)

AI总结 针对现有基准无法评估模型是否定位结合位点的问题,提出包含约10万对蛋白质-配体的InteractBind数据集和细粒度基准,通过结合位点定位任务揭示模型在强二元预测下定位能力有限。

Comments Under Review for the NeurIPS 2026 Conference, Track on Evaluations and Datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08150 2026-05-26 cs.CL

Verbalized Algorithms: Classical Algorithms are All You Need (Mostly)

言语化算法:经典算法就是你所需要的(大部分)

Supriya Lall, Christian Farrell, Hari Pathanjaly, Marko Pavic, Sarvesh Chezhian, Masataro Asai

机构 * MIT CSAIL(MIT 计算与人工智能实验室) MIT-IBM Watson AI Lab(MIT-IBM 沃森人工智能实验室) IBM Infrastructure(IBM 基础设施) Marist University(马里斯特大学) UC Irvine(加州大学尔湾分校) IBM Research Cambridge, USA(IBM 英国剑桥研究中心)

AI总结 提出言语化算法(VA)范式,将LLM作为可靠的基本操作(如字符串比较)集成到经典算法中,以提升推理的准确性和效率。

Comments Accepted in NeurIPS 2025 Workshop on Efficient Reasoning; Submitted to Position Paper Track at Neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13878 2026-05-26 cs.LG cs.CL

InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models

InfiFPO:通过偏好优化实现大型语言模型的隐式模型融合

Yanggan Gu, Yuanyi Wang, Zhaoyi Yan, Yiming Zhang, Qi Zhou, Fei Wu, Hongxia Yang

机构 * The Hong Kong Polytechnic University (PolyU)(香港理工大学) Zhejiang University(浙江大学) PolyU-Daya Bay Technology and Innovation Research Institute(香港理工大学-大亚湾技术与创新研究院)

AI总结 提出InfiFPO方法,通过将DPO中的参考模型替换为融合源模型,在序列级别合成多源概率,实现隐式模型融合,从而在偏好对齐阶段有效融合多个LLM并提升性能。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23464 2026-05-25 cs.LG

Unextractable Protocol Models: Collaborative Training and Inference without Weight Materialization

不可提取协议模型:无需权重物化的协作训练与推理

Alexander Long, Chamin Hewa Koneputugodage, Thalaiyasingam Ajanthan, Yan Zuo, Gil Avraham, Violetta Shevchenko, Hadi Mohaghegh Dolatabadi, Sameera Ramasinghe

机构 * Pluralis Research(Pluralis研究)

AI总结 提出不可提取协议模型(UPMs),通过分片模型和时变随机可逆变换,实现去中心化协作训练与推理,同时防止任何参与者获取完整权重集。

Comments Accepted at NeurIPS 2025. 34 pages, 6 figures (5 in main body, 1 in appendix). Alexander Long and Chamin Hewa Koneputugodage contributed equally

Journal ref Advances in Neural Information Processing Systems 38, pp. 18677-18713 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01088 2026-05-25 cs.LG math.OC

CRONOS: Enhancing Deep Learning with Scalable GPU Accelerated Convex Neural Networks

CRONOS: 利用可扩展的GPU加速凸神经网络增强深度学习

Miria Feng, Zachary Frangella, Mert Pilanci

机构 * Stanford University(斯坦福大学)

AI总结 提出CRONOS算法用于两层神经网络的凸优化,并扩展为CRONOS-AM以训练任意架构的多层网络,在ImageNet等大规模数据集上实现与主流深度学习优化器相当或更优的验证精度。

Journal ref Advances in Neural Information Processing Systems 37 (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21948 2026-05-22 cs.LG

SCI-Defense: Defending Manipulation Attacks from Generative Engine Optimization

SCI-Defense: 防御生成引擎优化的操纵攻击

Xucheng Yu, Haibo Jin, Huimin Zeng, Haohan Wang

机构 * Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学与数据科学学院) School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院) Amazon topcited.ai(亚马逊topcited.ai)

AI总结 本文提出SCI-Defense框架,通过检测困惑度、语义完整性评分和跨候选检测三种组件,有效识别生成引擎优化攻击,实现了高精度和低误报率,同时揭示了现有防御方法的局限性及未来研究方向。

Comments 20 pages, NeurIPS 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16552 2026-05-22 cs.NE cs.AI cs.CV

QKFormer: Hierarchical Spiking Transformer using Q-K Attention

QKFormer: 基于Q-K注意力的分层脉冲变换器

Chenlin Zhou, Han Zhang, Zhaokun Zhou, Liutao Yu, Liwei Huang, Xiaopeng Fan, Li Yuan, Zhengyu Ma, Huihui Zhou, Yonghong Tian

机构 * Pengcheng Laboratory(鹏城实验室) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

AI总结 本文提出QKFormer,一种基于Q-K注意力的分层脉冲变换器,通过引入新的脉冲形式Q-K注意力机制、分层结构和灵活的补丁嵌入模块,提升了脉冲神经网络在图像分类任务中的性能,实现了在ImageNet-1K数据集上85.65%的top-1准确率。

Comments Accepted by NeurIPS 2024 (Spotlight). Code and Model: https://github.com/zhouchenlin2096/QKFormer

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20978 2026-05-21 cs.LG

Point Cloud Sequence Encoding for Material-conditioned Graph Network Simulators

用于材料条件化图网络模拟器的点云序列编码

Philipp Dahlinger, Balázs Gyenes, Niklas Freymuth, Luca Geminiani, Tobias Würth, Johannes Mitsch, Nadja Klein, Luise Kärger, Gerhard Neumann

机构 * Autonomous Learning Robots(自主学习机器人) Methods for Big Data(大数据方法) Institute of Vehicle System Technology(车辆系统技术研究所)

AI总结 本文提出PEACH框架,通过点云序列编码实现对未知物理属性的适应,提高了模拟到现实的零样本转移精度,并在实际部署中更具实用性。

Comments 9 pages + appendix, 7 figures. Submitted to the 40th Conference on Neural Information Processing Systems (NeurIPS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19705 2026-05-20 math.OC

i-DEQ: A stable inertial deep equilibrium model for image restoration

i-DEQ:一种稳定的惯性深度均衡模型用于图像修复

Antonin Clerc, Marien Renaud, Baudouin Denis De Seneville, Nicolas Papadakis

AI总结 本文提出i-DEQ,一种稳定的惯性深度均衡模型,用于图像修复,通过在深度均衡框架内学习显式的非凸正则化,提高了收敛性和加速率,并在训练稳定性方面优于传统DEQ。

Comments main paper 12 pages, 37 pages with appendix, 3 figures in main, 9 figures in total, 2 tables in main, 5 tables in total, submitted at Neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19284 2026-05-20 cs.CL cs.LG

Language models struggle with compartmentalization

语言模型在 compartmentalization 方面遇到困难

Thomas Vincent Howe, David Wingate

机构 * Department of Computer Science(计算机科学系) Brigham Young University

AI总结 研究探讨了大型语言模型在处理统一概念的不同表达方式时的 compartmentalization 问题,发现模型在不同表达方式之间无法有效共享统计信息,导致模型容量浪费和样本效率降低。

Comments 9 pages, 8 figures, plus 9 pages of appendices. Submitted to NeurIPS 2026. Code: https://github.com/vinhowe/compartmentalization. Eval data: https://doi.org/10.5281/zenodo.20171021

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18464 2026-05-20 cs.CV

PERL: Parameter Efficient Reasoning in CLIP Latent Space

PERL:在CLIP潜在空间中实现参数高效的推理

Simone Carnemolla, Salvatore Calcagno, Daniela Giordano, Concetto Spampinato, Matteo Pennisi

机构 * University of Catania(卡塔尼亚大学)

AI总结 本文提出PERL,一种在CLIP潜在空间中通过迭代潜在推理实现参数高效适应的框架,该方法在多个基准测试中表现出最佳的参数-性能权衡,仅需约6K可训练参数即可实现强的新型类别准确率和竞争性的迁移性能。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01126 2026-05-20 cs.LG cs.NA math.NA math.OC math.ST stat.TH

Stochastic Regret Guarantees for Online Zeroth- and First-Order Bilevel Optimization

在线零阶和一阶双层优化的随机遗憾保证

Parvin Nazari, Bojian Hou, Davoud Ataee Tarzanagh, Li Shen, George Michailidis

机构 * Amirkabir University of Technology(阿姆斯泰尔大学) University of Pennsylvania(宾夕法尼亚大学) Samsung SDS Research America(三星SDS美国研究部) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本文提出了一种新的搜索方向,证明了利用该方向的零阶和一阶随机在线双层优化算法能够在不使用窗口平滑的情况下实现亚线性随机双层遗憾。此外,该框架通过减少超梯度估计中的oracle依赖、同时更新内层和外层变量以及使用基于零阶的Hessian、雅可比和梯度估计来提高效率。

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21698 2026-05-20 cs.CL

GRAB: A Risk Taxonomy--Grounded Benchmark for Unsupervised Topic Discovery in Financial Disclosures

GRAB:一种风险分类——面向财务披露中无监督主题发现的基准测试

Ying Li, Tiejun Ma

机构 * The University of Edinburgh, UK(爱丁堡大学)

AI总结 本文提出GRAB,一个专门针对财务披露中无监督主题发现的基准测试,通过结合FinBERT词注意力、YAKE关键词信号和基于分类法的短语匹配,生成无需人工标注的句子标签,从而评估无监督主题模型。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: NeurIPS 2025 Workshop on Generative AI in Finance

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20218 2026-05-19 cs.LG

Fine-grained List-wise Alignment for Generative Medication Recommendation

细粒度列表级对齐用于生成性药物推荐

Chenxiao Fan, Chongming Gao, Wentao Shi, Yaxin Gong, Zihao Zhao, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出FLAME框架,通过细粒度列表级对齐方法,利用大语言模型生成药物列表,以提高药物推荐的准确性和安全性,同时考虑药物间的相互作用和潜在不良反应。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17564 2026-05-19 cs.CV

A Conditional U-Net Pipeline with Pre- and Post-Processing for Aerial RGB-to-Thermal Image Translation

具有预处理和后处理的条件U-Net管道用于航空RGB到热图像转换

Tseten Sherpa, Sikandar Ali, Shubham Parab, Haoyun Feng, Matthew Dennis, Keenan Gibbons, Verrah Otiende, Geoffrey H. Siwo

机构 * Department of Data Science, University of Michigan, Ann Arbor, MI, USA(数据科学系,密歇根大学,安阿伯,MI,美国) Department of Information Science, University of Michigan, Ann Arbor, MI, USA(信息科学系,密歇根大学,安阿伯,MI,美国) Department of Computer Science, University of Michigan, Ann Arbor, MI, USA(计算机科学系,密歇根大学,安阿伯,MI,美国) Arcknow, New York, USA(Arcknow,纽约,美国) School of Environmental Sustainability, University of Michigan, Ann Arbor, MI, USA(可持续环境学院,密歇根大学,安阿伯,MI,美国) SmithGroup, Ann Arbor, MI, USA(SmithGroup,安阿伯,MI,美国) Michigan Institute for Data and AI in Society (MIDAS), University of Michigan, Ann Arbor, MI, USA(密歇根数据与人工智能社会研究院(MIDAS),密歇根大学,安阿伯,MI,美国) United States International University (USIU), Nairobi, Kenya(美国国际大学(USIU),内罗毕,肯尼亚) Department of Learning Health Sciences, University of Michigan Medical School, Ann Arbor, MI, USA(学习健康科学系,密歇根大学医学院,安阿伯,MI,美国) Department of Pharmacology, University of Michigan Medical School, Ann Arbor, MI, USA(药理学系,密歇根大学医学院,安阿伯,MI,美国) Center for Global Health Equity, University of Michigan, Ann Arbor, MI, USA(全球健康公平中心,密歇根大学,安阿伯,MI,美国)

AI总结 本文提出了一种基于条件U-Net的简单架构,结合天气数据和针对性预处理与后处理技术,以提高航空RGB到热图像转换的性能,实验结果显示其在PSNR、SSIM和LPIPS指标上优于现有方法。

Comments 8 pages, 7 figures, NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21265 2026-05-19 cs.CL cs.LG cs.SE

ToolMATH: A Diagnostic Benchmark for Long-Horizon Tool Use under Systematic Tool-Catalog Constraints

ToolMATH: 一种用于在系统性工具目录约束下评估长周期工具使用的诊断基准

Hyeonje Choi, Jeongsoo Lee, Hyojun Lee, Jay-Yoon Lee

机构 * Seoul National University(首尔国立大学)

AI总结 本文提出ToolMATH,一种基于数学的诊断基准,用于评估在可控工具目录条件下长周期工具使用的性能,通过将分步MATH解决方案转换为可重用的Python工具,并配对需要顺序工具使用、中间输出重用和逻辑连接工具调用链的问题,从而评估模型在不同工具目录条件下的适应性、鲁棒性和工具连接性。

Comments Submitted to NeurIPS Evaluation & Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17144 2026-05-19 cs.RO cs.AI cs.LG

Contrastive Conceptor Activation Steering (COAST): Unlocking Vision-Language-Action Models through Hidden States

对比性概念激活引导(COAST):通过隐藏状态解锁视觉-语言-动作模型

Miranda Muqing Miao, Subin Kim, Brandon Yang, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出COAST方法,通过识别成功子空间来提升视觉-语言-动作模型在机器人任务中的性能,其核心方法是利用概念投射来引导模型向成功分布发展,从而提高任务成功率。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17028 2026-05-19 cs.CL cs.AI

PARALLAX: Separating Genuine Hallucination Detection from Benchmark Construction Artifacts

PARALLAX:区分真实幻觉检测与基准构建人工制品

Khizar Hussain, Murat Kantarcioglu

机构 * Virginia Tech(弗吉尼亚理工大学)

AI总结 本文研究了大型语言模型幻觉检测中的基准构建人工制品问题,提出DRIFT作为对比方法,发现大部分基线方法在控制条件下表现接近随机,而SAPLMA和DRIFT作为上层隐藏状态的监督探针表现出例外。

Comments Preprint to Neurips 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏