arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Columbia University(哥伦比亚大学)

2026-09-01 至 2026-09-01 共收录 14
2608.31079 2026-09-01 cs.LG 新提交

Sycophantic Agreement Transfers with Neutral Data via Contrastive Preference Optimization

通过对比偏好优化实现的基于中性数据的谄媚式一致性转移

Camila Blank, Zhuofan Ying, Christopher Potts, Peter Hase, Jing Huang

机构 * Stanford University(斯坦福大学) Columbia University(哥伦比亚大学)

AI总结 本研究发现对比偏好优化会导致教师模型的谄媚式一致性向学生模型转移,且该信号分散于中性偏好数据中,现有过滤方法难以缓解,揭示了对齐训练的意外有害行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31057 2026-09-01 cs.AI 新提交

Measure Before You Manage: Evaluating Agent Working Memory in Coding Agents

先测量再管理:评估编码智能体的工作记忆

Le Chen, Zishen Wan, Baixi Sun, Xiaolong Ma, Chih-Hsuan Yang, Feng Yan, Sheng Di, Franck Cappello, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) Columbia University(哥伦比亚大学) University of Houston(休斯顿大学)

AI总结 本研究针对编码智能体工作记忆的语义异质性,提出两种语义感知记忆管理策略,发现校准增益难迁移、相同token预算效果不同等问题,表明评估记忆管理策略需考虑更多维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30369 2026-09-01 cs.AI cs.HC 新提交

Augmenting Human Performance with an XR Agent Learning from Online Behavior and BCI Evidence

利用从在线行为和BCI证据学习的XR智能体增强人类表现

Ziheng Li, Xichen He, Haoyan Chen, Charlie Zou, Sheng Bai, Benjamin Yang, Mengyuan Wu, Jake Ledner, Yi-Jie Cheng, Akito Yamauchi, Dishita G Turakhia, Steven Feiner, Paul Sajda

机构 * Columbia University(哥伦比亚大学) Emory University(埃默里大学)

AI总结 研究人员提出OLIVE框架,通过融合EEG与XR游戏行为信号,适配基础模型生成实时辅助智能体,在目标切换时收敛更快,可提升用户目标检测能力且不依赖个人技能。

Comments To appear in ACM UIST 2026. 30 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30352 2026-09-01 cs.AI cs.HC 新提交

Co-Annotator: Expert-Distilled ViT and VLM for Visual and Documentation Guidance in Age-Related Macular Degeneration

Co-Annotator:用于年龄相关性黄斑变性视觉与文档指导的专家蒸馏ViT及VLM

Ziheng "Leo" Li, Benjamin Freeman, Akshay Raman, Kavin Aravindhan Rajkumar, Xinxin Fang, Rishabh Srivastava, Steven Feiner, Kaveri A. Thakoor

机构 * Columbia University(哥伦比亚大学)

AI总结 本研究提出Co-Annotator,将专家注视与口述提炼为AOI指导的ViT和生物标志物预填充的VLM,在AMD诊断中联合应用可显著提升效率且不降低准确率。

Comments 23 pages, 11 figures. To appear in UIST '26: Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology, November 02-05, 2026, Detroit, MI, USA. DOI: 10.1145/3830398.3830722

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30067 2026-09-01 cs.LG cs.AI cs.CL 新提交

How do World Models and Policies Compose in LLM Agents? A Joint Spectral and Behavioral Account

世界模型与策略如何在大语言模型智能体中结合?一种联合谱分析与行为学解释

Ruize Xu, Xiao Yu, Yujin Tang, Chenming Shang, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院) Columbia University(哥伦比亚大学)

AI总结 该研究通过受控实验探究LLM智能体中世界模型与策略的结合机制,从几何与行为角度揭示二者的互补特性,并提出提升策略训练保留世界知识能力的方法。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30050 2026-09-01 cs.AI 新提交

Spec2Twin-Chain: Orchestrating Bi-Level Optimization with LLMs for Blockchain Digital Twin Construction

Spec2Twin-Chain:利用大型语言模型编排双层优化以构建区块链数字孪生

Haoting Zhang, Haoxian Chen, Jiayuan Sheng, Donglin Zhan, Zeyu Zheng, David D. Yao, Wenpin Tang

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校) Columbia University(哥伦比亚大学)

AI总结 Spec2Twin-Chain框架将区块链数字孪生构建转化为双层优化问题,利用LLM与仿真优化器迭代协作,经多类实验验证可构建准确孪生体并支持下游决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29456 2026-09-01 cs.CV 新提交

Text-Guided Diffusion-Based Adversarial Attacks on Chest X-Ray Images

基于文本引导扩散模型的胸部X射线图像对抗攻击

Basudha Pal, Arjun Narayanan, Neha Ajith, Vikas R Bhat, Muhammad Umair

机构 * The Johns Hopkins University(约翰斯·霍普金斯大学) Manipal Institute of Technology(马尼帕尔理工学院) Manipal Academy of Higher Education(马尼帕尔高等教育学院) The Johns Hopkins Hospital(约翰斯·霍普金斯医院) Columbia University Irving Medical Center(哥伦比亚大学欧文医学中心)

AI总结 该研究提出文本引导扩散对抗框架攻击胸部X射线分类模型,在多架构上验证其能显著降低分类性能,同时发现人机判读存在重要差异,凸显需扩展医疗AI鲁棒性评估方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28433 2026-09-01 cs.AI cs.LO cs.MA 版本更新

Prove2Me: An Open Collaborative Platform for Scaling Math Formalization

Prove2Me:用于规模化数学形式化的开源协作平台

Shuze Chen, Kunal Marwaha, Xiaoyang Lu, Henry Yuen, Tianyi Peng

机构 * Columbia University(哥伦比亚大学) University of Chicago(芝加哥大学) Purdue University(普渡大学)

AI总结 Prove2Me是支持人类与AI智能体协作的开源数学形式化平台,可降低大规模数学形式化的门槛,实现众包式规模化形式化验证。

Comments https://prove2.me

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26178 2026-09-01 cs.CL 版本更新

DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking Dialogues

DuplexGen:人机交替对话的自适应合成

Takyoung Kim, Kang-wook Kim, Sang Hoon Woo, Julia Hirschberg, Gunhee Kim, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Seoul National University(首尔大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院)

AI总结 DuplexGen框架通过将LLM预测与少量槽级人类偏好标注校准,生成场景自适应交替发言对话,契合人类偏好的效果优于未校准方法,证明人类校准对交替发言合成场景特定性的关键作用。

Comments EMNLP 2026; Project website: https://duplexgen.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19313 2026-09-01 cs.LG cs.AI 版本更新

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information

脱离上下文的广义信赖域策略优化算法:利用特权信息学习解决难题

Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Boris Vidolov, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi

机构 * Meta AI Columbia University(哥伦比亚大学)

AI总结 研究利用特权信息解决强化学习难题,提出脱离上下文的广义信赖域策略优化算法(OC - GRPO),通过引导展开和重要性校正目标避免训练不匹配,在标准数学推理基准上比普通GRPO有显著提升且成本低。

Comments 24 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21894 2026-09-01 cs.SE cs.AI 版本更新

Skills for the future software profession: beyond agentic AI!

未来软件职业的技能:超越智能体AI!

Abhik Roychoudhury, Sungmin Kang, Baishakhi Ray

机构 * National University of Singapore(新加坡国立大学) Columbia University(哥伦比亚大学)

AI总结 本文通过2026年在纽约和新加坡举行的两场圆桌会议,总结未来软件工程师所需的核心技能,强调验证与确认在智能体处理实现时的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01113 2026-09-01 cs.CL 版本更新

CARE: Privacy-Compliant Agentic Reasoning with Evidence Discordance

CARE:具有证据不一致性的隐私合规代理推理

Haochen Liu, Weien Li, Rui Song, Zeyu Li, Chun Jason Xue, Xiao-Yang Liu, Sam Nallaperuma-Herzberg, Xue Liu, Ye Yuan

机构 * University of Cambridge(剑桥大学) McGill University(麦吉尔大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Columbia University(哥伦比亚大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所)

AI总结 针对医疗领域中症状与体征矛盾的问题,CARE框架通过多阶段隐私合规的代理推理,在不访问敏感数据的情况下提升冲突证据处理能力。

Comments Accepted as a Findings paper at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07019 2026-09-01 stat.ME cs.AI stat.AP stat.ML 版本更新

Latency-Response Theory Model: Evaluating Large Language Models via Response Accuracy and Chain-of-Thought Length

延迟-响应理论模型:通过响应准确性和思维链长度评估大语言模型

Zhiyu Xu, Jia Liu, Yixin Wang, Yuqi Gu

机构 * Department of Statistics, Columbia University(哥伦比亚大学统计系) Department of Statistics, University of Michigan(密歇根大学统计系)

AI总结 针对大语言模型评估问题,提出延迟-响应理论(LaRT)模型,联合考虑响应准确性和思维链长度,通过引入关键参数建模,推导高效算法估计参数,经理论和模拟研究验证其优势,实际数据评估中表现优于项目反应理论(IRT)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08311 2026-09-01 cs.SE cs.AI 版本更新

Understanding Automated Program Repair Agents Through the Lens of Traceability: An Empirical Study

通过可追溯性视角理解自动化程序修复智能体:一项实证研究

Ira Ceka, Hailie Mitchell, Saurabh Pujar, Luca Buratti, Shyam Ramji, Junfeng Yang, Gail Kaiser, Baishakhi Ray

机构 * Columbia University(哥伦比亚大学) IBM Research(IBM研究院)

AI总结 本文通过追踪五个最先进的自动化程序修复智能体在500个真实世界修复任务中的决策流程,揭示了它们在逻辑密集型错误修复、测试生成和回归测试选择方面的关键局限性,并提出了改进方向。

Comments Accepted for publication (ISSTA '26). Camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏