Optimize Your Sampling: Tuned Diffusion Sampling with Bayesian Optimization
优化你的采样:基于贝叶斯优化的调优扩散采样
机构 * Cornell University(康奈尔大学)
AI总结 本研究提出OYS方法,将扩散模型采样的时间步长选择作为黑盒优化问题,用贝叶斯优化直接优化目标指标,可提升多类图像生成任务性能,大幅降低推理成本且无需额外训练。
高校专区
优化你的采样:基于贝叶斯优化的调优扩散采样
机构 * Cornell University(康奈尔大学)
AI总结 本研究提出OYS方法,将扩散模型采样的时间步长选择作为黑盒优化问题,用贝叶斯优化直接优化目标指标,可提升多类图像生成任务性能,大幅降低推理成本且无需额外训练。
情节淡化:文学摘要中的一致性与线性性
机构 * Cornell University(康奈尔大学) ; Aarhus University(奥胡斯大学)
AI总结 该研究构建小说摘要与原作章节映射数据集,测量摘要线性性与一致性,明确文学作品与摘要的情节表达差异。
VLCP:用于机器人操纵的视觉语言控制策略闭环代码重规划
机构 * University of Monastir(莫纳斯提尔大学) ; St. Mildred’s-Lightbourn School(圣米尔德雷德-莱特本学校) ; Cornell University(康奈尔大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Silverstream AI(银流人工智能公司) ; Mila -- Quebec AI Institute(米拉-魁北克人工智能研究所)
AI总结 VLCP是一种无需训练的机器人操纵策略,通过在单回合内每K步由VLM重写控制代码闭合循环,在57项任务的评估中综合成功率达35.1%,较开环策略提升十倍。
注意力流动:通过故事摘要追踪LLM概念性参与
机构 * Cornell University(康奈尔大学) ; Aarhus University(奥胡斯大学)
AI总结 研究通过比较人类与LLM生成的故事摘要,分析模型在文本中的概念性参与模式,发现模型更关注文本结尾,揭示了摘要生成任务的复杂性。
Comments Error found in data creation pipeline
视频分割的实时交互训练
机构 * Cornell University(康奈尔大学)
AI总结 本文提出LIT框架,通过实时学习用户反馈提升视频分割性能,LIT-LoRA在挑战性任务中减少18-34%的修正,且训练开销低。
Comments CVPR 2026
费米-狄拉克热测量:量子假设检验和半定规划的框架
机构 * Institute of Natural Sciences, Shanghai Jiao Tong University, Shanghai 200240, China(自然科学院,上海交通大学,上海) ; School of Mathematical Sciences, Shanghai Jiao Tong University, Shanghai, 200240, China(数学科学学院,上海交通大学,上海) ; Ministry of Education Key Laboratory in Scientific and Engineering Computing, Shanghai Jiao Tong University, Shanghai 200240, China(教育部科学与工程计算重点实验室,上海交通大学,上海) ; Global College, Shanghai Jiao Tong University, Shanghai 200240, China(全球学院,上海交通大学,上海) ; School of Electrical and Computer Engineering, Cornell University, Ithaca, New York 14850, USA(电气与计算机工程学院,康奈尔大学,纽约)
AI总结 该研究提出费米-狄拉克热测量作为量子假设检验和半定规划的新框架,通过热力学方法优化量子测量,构建了费米-狄拉克机模型。
Comments v2: 36 pages, 3 figures, various technical corrections introduced
TabImpute: 通用零样本填补表格数据
机构 * Industrial Engineering \& Operations Research, Columbia University, New York, USA ; Department of Statistics, Columbia University, New York, USA ; Operations Research \& Information Engineering, Cornell Tech, New York, USA
AI总结 TabImpute通过预训练Transformer实现通用零样本表格数据填补,采用高效特征化和合成数据生成提升填补速度与准确性。
GeoPose:通过投影空间校准实现患者无关的CTA到DSA配准
机构 * Weill Cornell Medicine, Cornell Tech(威尔康奈尔医学院、康奈尔理工学院) ; Technical University of Munich(慕尼黑工业大学)
AI总结 本研究提出经人群训练的GeoPose框架,通过投影空间校准实现患者无关的CTA到DSA配准,无需患者特定适配,在配准精度和速度上均优于基线方法,可为下游血管重建提供几何对应关系。
天生不连贯?大型语言模型的道德自我一致性研究
机构 * Cornell University(康奈尔大学) ; Cornell Tech(康奈尔科技学院) ; Nanyang Technological University(南洋理工大学)
AI总结 本研究针对GPT、Mistral、Llama等LLM,在义务论等三大伦理框架下,发现其道德推理存在最高78%的矛盾率,内部不连贯是AI对齐的必要前提。
Comments 88 pages; pages 16 to 88 are the appendix
受鳗鱼启发的软体机器人的执行器控制与健康实时估计器(REACH)
机构 * Cornell University(康奈尔大学) ; University of California San Diego(加利福尼亚大学圣迭戈分校)
AI总结 针对受鳗鱼启发的软体游泳机器人,本文提出REACH算法,结合软体机器人模型、sigma点滤波器和统计假设检验,可在不同传感器配置、游动步态下准确估计执行器健康,实验验证其在噪声数据和制造差异下的有效性。
鳗鱼启发式软机器人的建模与控制及其设计优化
机构 * Cornell University(康奈尔大学)
AI总结 本文建立鳗鱼启发式软机器人仿真模型,结合有限元法与流体力模型验证控制方法有效性,发现略不对称设计兼具相当速度与更强机动性,可指导机器人设计优化。
超越Pass@k:衡量智能体代码生成的可靠性与安全性
机构 * Stevens Institute of Technology(史蒂文斯理工学院) ; Cornell University(康奈尔大学)
AI总结 该研究指出AI编码智能体基准误用Pass@k指标,提出正确的Reliability@k及安全调整版,通过实验验证误用指标的偏差,还在SWE-bench试点中发现真实场景下的核心问题。
提示的价值:一种大语言模型(LLM)相对柯尔莫哥洛夫复杂度的方法
机构 * Cornell Tech(康奈尔科技学院) ; Technion(以色列理工学院) ; TAU(特拉维夫大学)
AI总结 该研究提出LLM相对的概率性Levin–柯尔莫哥洛夫复杂度pKt,将提示价值定义为相对于pKt的算法互信息,可高效估算,且提示价值b位对应无提示时复制z的中位数token成本为有提示时的2^b倍。
跨模态分类与预测的稀疏原型编码
机构 * Hebrew University(希伯来大学) ; The Racah Institute of Physics(拉卡物理研究所) ; Edmond and Lily Safra Center for Brain Sciences(埃德蒙和莉莉·萨夫拉脑科学中心) ; Cornell Tech, Cornell University(康奈尔大学科技校区) ; Center for Brain Science, Harvard University(哈佛大学脑科学中心)
AI总结 该研究揭示跨模态AI模型分类任务存在通用表征几何,推导平均场理论准确预测分类准确率,发现分类由稀疏质心对齐结构支配,关联稀疏特征提取方法。
Comments 33 pages, 13 figures, 14 tables
QUASAR:通过损失感知重构降低量化感知训练的损失下限
机构 * Together AI ; Cornell University(康奈尔大学)
AI总结 QUASAR是一种QAT方法,通过训练循环中轻量级损失感知重构降低大语言模型量化损失下限,在2-4比特下优于现有方法,提升了低比特模型准确率。
Comments 39 pages
从视觉-语言-动作模型(VLA)表征中解码任务进度
机构 * Cornell University(康奈尔大学)
AI总结 该研究利用机制可解释性探究VLA的π₀.₅残差流,发现任务进度可从激活值线性读取,基于此构建的探测器可作为无标签OOD检测器,性能接近最先进方法,为监控部署的视觉运动策略提供轻量可解释路径。
ReconSpan:重建引导的自适应隐式分词
机构 * Cornell University(康奈尔大学)
AI总结 本文提出ReconSpan,一种重建引导的自适应隐式分词方法,可将文本划分为特定块并保留前缀码作为隐式token,在匹配平均长度下其边界比随机边界保留更多文本,能可靠传递主题信息但难以提取精确细节。
Comments 16 pages, 3 figures
哪个地点,以及何时:基于免费卫星数据的喜马拉雅冰川湖溃决、滑坡与冰洪测试
机构 * Cornell University(康奈尔大学) ; Institute of Engineering, Tribhuvan University(特里布万大学工程学院) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; University of Bristol(布里斯托大学)
AI总结 该研究利用免费卫星数据,构建模型预测喜马拉雅地区冰川湖溃决、滑坡等三类灾害的易感性地点与触发时间,发现简单梯度提升基线模型表现优于多数深度学习模型,还给出了尼泊尔灾害预警优先级清单。
代理神经符号协作用于数学发现:组合设计的一个案例研究
机构 * Algorithms and Complexity Group, TU Wien(算法与复杂性组,维也纳技术大学) ; Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)
AI总结 本文通过代理神经符号协作方法,在组合设计理论中发现了一个新的紧下界,展示了人类与AI协作在数学发现中的有效性。
先验意识记忆:一种区分记忆与泛化在大语言模型中的高效度量标准
机构 * Cornell University(康奈尔大学) ; Boston University(波士顿大学) ; NVIDIA(英伟达)
AI总结 本文提出Prior-Aware Memorization,一种基于模型先验的轻量级度量标准,用于区分大语言模型中的真实记忆与统计上常见序列,揭示低频率不足以证明记忆,强调需考虑模型先验以评估数据泄露风险。
Comments COLM 2026 Camera Ready
像素空间扩散变换器
机构 * Peking University(北京大学) ; Nanjing University(南京大学) ; Stanford University(斯坦福大学) ; Cornell University(康奈尔大学) ; University of Oulu(奥卢大学)
AI总结 本文探讨像素空间扩散变换器,针对潜在扩散模型的局限,研究直接对原始像素建模的像素空间扩散方法,介绍其在高维建模中的挑战与多模态建模优势,从多方面回顾pDiTs,总结方法、识别挑战并展望未来方向。
CASE框架:用于管控企业智能体AI的多学科控制架构
机构 * Cornell University(康奈尔大学) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; AI71
AI总结 针对企业智能体AI管控的“涌现缺口”问题,提出含四层架构的CASE框架,经实证验证可提升治理有效性,满足欧盟AI法案要求。
Comments 34 pages in total, 4 figures, 2 tables, code at https://github.com/srinivastelukunta/case_framework_arxiv_codes
评估AI代理在神经科学数据到发现流程中的案例研究
机构 * Cornell University(康奈尔大学) ; HHMI Janelia Research Campus(霍华德·休斯医学研究所贾雷尔研究园区)
AI总结 本研究评估通用编码代理在果蝇光遗传学数据到发现流程中的表现,发现代理能解决单个阶段任务,但端到端流程仍超出其能力,主要挑战包括缺乏预定义迭代标准和科学判断能力。
Comments Peer-reviewed conference paper
Journal ref Third Conference on Language Modeling (COLM 2026)
小纵向队列的验证合成患者生成:妊娠期间的凝血动力学
机构 * Robert F. Smith School of Chemical and Biomolecular Engineering, Cornell University(康奈尔大学罗伯特·F·史密斯化学与生物分子工程学院) ; Department of Biochemistry, The Robert Larner, M.D. College of Medicine, University of Vermont Medical Center(佛蒙特大学医学中心罗伯特·拉纳医学院生物化学系) ; Department of Obstetrics, Gynecology, and Reproductive Sciences, The Robert Larner, M.D. College of Medicine, University of Vermont Medical Center(佛蒙特大学医学中心罗伯特·拉纳医学院妇产科与生殖科学系)
AI总结 本文提出基于Hopfield网络理论的多重加权随机注意机制,用于生成小纵向队列的合成患者,通过Langevin动力学在连续能景中插值存储模式,保留原始队列的几何结构,并在推理时放大罕见临床亚组,验证了其在凝血动力学中的有效性。
套娃语言模型套件
机构 * Cornell University(康奈尔大学)
AI总结 该研究提出Matryoshka训练框架,将尺寸递增的子模型堆叠为端到端嵌套架构,训练含5亿、15亿、30亿参数子模型的套件,其性能与基线相当,训练计算量减少36%,推测解码吞吐量提升14-26%。
并非所有视觉 token 都可安全移除:后果敏感型视觉 token 压缩
机构 * The University of Sydney(悉尼大学) ; Tongji University(同济大学) ; University of Surrey(萨里大学) ; Nankai University(南开大学) ; Cornell University(康奈尔大学) ; City University of Hong Kong(香港城市大学)
AI总结 该研究针对视觉语言模型提出后果敏感型视觉 token 压缩方法,可在相同总 token 预算下降低高风险错误,还能减少代价加权错误并降低延迟,泛化性良好。
HOPPER:用于线性化图序列模型的可学习跳提取方法
机构 * Carnegie Mellon University(卡内基梅隆大学) ; UC Berkeley(加州大学伯克利分校) ; Cornell University(康奈尔大学)
AI总结 HOPPER是LGSM的可学习扩展,可提取跳序列以实现自适应图传播,在ECHO-Synth基准表现最优或具竞争力,调整结构记忆窗口可优化LRIM基准准确率,为长距离图表示学习提供灵活方法。
Comments 24 pages, 1 figure, 4 tables
结构化参数环境下用于鲁棒导航策略的课程生成
机构 * Cornell University(康奈尔大学)
AI总结 本文针对结构化参数环境提出重参数化课程生成框架,结合分布偏移正则化,在OpenAI Gym的两类连续控制环境中,显著优于多种基线方法,提升了导航策略的鲁棒性。
Comments 22 pages, 5 figures
PINNACLE:一种用于经典和量子PINN的开源计算框架
机构 * Faculty of Mechanical Engineering, Technion Israel Institute of Technology, Haifa, Israel(技术学院机械工程系,以色列技术学院,海法,以色列) ; Andrew and Erna Viterbi Faculty of Electrical & Computer Engineering, Technion Israel Institute of Technology, Haifa, Israel(安德鲁和伊尔纳·维特比电气与计算机工程学院,技术学院,海法,以色列) ; Helen Diller Quantum Center, Technion Israel Institute of Technology, Haifa, Israel(海伦·迪尔量子中心,技术学院,海法,以色列) ; Faculty of Electrical and Computer Engineering, Cornell University, Ithaca, NY, USA(电气与计算机工程学院,康奈尔大学,纽约州伊萨克,美国)
AI总结 PINNACLE框架整合了现代训练策略和混合量子经典架构,通过统一模块化工作流系统评估PINN在不同基准问题中的性能,支持多种增强方法并提供全面的基准研究。
从词语到小部件:可控制的LLM生成
机构 * Cornell University(康奈尔大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Loyola University Maryland(路易斯安那大学马里兰分校)
AI总结 本文提出Malleable Prompting技术,通过将自然语言提示中的偏好转化为可视化的小部件,使用户能更精确地控制LLM生成,提升可控性和透明度。
Comments UIST 2026