arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

2026-09-01 至 2026-09-01 共收录 9
2608.30724 2026-09-01 cs.LG cs.AI 新提交

BAITBENCH: Measuring Agent Reward Hacking with Optional Shortcuts Planted in ML Tasks

BAITBENCH:通过植入ML任务中的可选捷径测量智能体的奖励黑客行为

Pradyumna Shyama Prasad, Meiri Anto, Leon Eshuijs, Julian Moncarz, Kaustubh Kislay, Juan J. Vazquez

机构 * National University of Singapore(新加坡国立大学) MIT(麻省理工学院) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Toronto(多伦多大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Arb Research(Arb研究机构)

AI总结 BAITBENCH是含三个合成表格型ML任务的基准,用于测量智能体利用可选捷径获得虚高分的奖励黑客行为,实验显示57.1%的运行存在该行为,发布相关资源作为缓解措施评估测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28784 2026-09-01 cs.CV 新提交

ClearText-Video: A Large-Scale Text-Centric Video Dataset Bridging Video Restoration and Scene-Text Enhancement

ClearText-Video:连接视频修复与场景文本增强的大规模以文本为中心的视频数据集

Jinlong Li, Jiaming Ding, Dingfu Lu, Malcolm Hsiu, Chuang Ke, Kangning Yang, Bochen Guan, Lan Fu, Jie Cai, Huiming Sun, Zibo Meng

机构 * OPPO US AI Center(OPPO美国人工智能中心) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California San Diego(加利福尼亚大学圣迭戈分校)

AI总结 研究团队推出ClearText-Video数据集,评估发现视觉增强未必提升文本推理,仅OCR管道远逊于多模态推理,为相关系统提供基础。

Comments This paper is accepted by 2026 Proceedings of the European Conference on Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28631 2026-09-01 cs.AI cs.CE cs.CY 新提交

CrossAudit: A Git-Native, Cross-Vendor Audit Loop for Agentic Science

CrossAudit:面向智能体科学的原生Git跨供应商审计循环

Zhaohe Dong, Yuhao Chen

机构 * University of Cambridge(剑桥大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 CrossAudit是面向智能体科学的原生Git跨供应商审计协议,通过不同供应商智能体按人类规则审计工作,试验显示不同供应商对规则解读有差异,其自身审计记录为核心证据。

Comments 19 pages, 4 figures, 3 tables, 22 references. Reference implementation, audit ledger, and experiment artefacts: https://github.com/dongzhaohe321418-lab/crossaudit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29507 2026-09-01 cs.LG cs.AI math.OC 新提交

Denoising as Projection: Constrained Optimization with Gradient-Guided Diffusion

去噪即投影:带梯度引导扩散的约束优化

Runyu Zhang, Jiawei Zhang, Gioele Zardini, Saurabh Amin, Asuman Ozdaglar

机构 * MIT(麻省理工学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出一种将目标梯度融入去噪步骤的投影梯度引导扩散更新方法,用于结构化可行集上的约束优化,在三类设置中保证收敛,实验验证其平衡目标下降与几何保留的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18560 2026-09-01 cs.HC cs.CV 版本更新

SemanticSlider3D: Training-Free Continuous Semantic Editing for 3D Objects

SemanticSlider3D:无需训练的3D物体连续语义编辑

Ru Wang, Rahul Jain, Koichiro Niinuma, Aakar Gupta

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Purdue University(普渡大学) Fujitsu Research of America(富士通美国研究所)

AI总结 SemanticSlider3D是一种无需训练的3D物体连续语义编辑技术,通过在先进3D生成模型潜空间构建语义编辑方向,在技术验证与用户研究中均表现优于基线方法,可作为现有3D创作工作流的有效补充。

Comments UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21803 2026-09-01 cs.CL 版本更新

Test-Time Training with Next-Token Prediction

基于下一个词预测的测试时训练

Xuan Ouyang, Zefan Cai, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 提出TTT-NTP方法,利用预训练语言模型自身的下一个隐藏状态作为自监督信号进行测试时训练,无需重新设计骨干网络,在多个长上下文基准上显著提升性能。

Comments 17 pages, 2 figures, 6 tables. Accepted to Findings of EMNLP 2026. Code: https://github.com/yancyou/TTT-NTP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28791 2026-09-01 cs.CL cs.AI 版本更新

Skill-Conditioned Gated Self-Distillation for LLM Reasoning

技能条件门控自蒸馏用于大语言模型推理

Jiazhen Huang, Xiao Chen, Xiao Luo, Yong Dai, Senkang Hu, Yuzhi Zhao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) City University of Hong Kong(香港城市大学) Huazhong University of Science and Technology(华中科技大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 提出技能条件门控自蒸馏(SGSD),通过从经验技能库中检索技能-错误对构建多教师池,并利用验证器验证教师极性,以鲁棒门控目标蒸馏信息性师生差异,在弱先验信息假设下提升数学推理性能。

Comments Accepted by EMNLP 2026 Findings. Code is available at https://github.com/walawalagoose/SGSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15994 2026-09-01 cs.AI 版本更新

ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

ReactBench: 一种用于在化学反应图上进行拓扑推理的MLLMs基准测试

Qiang Xu, Shengyuan Bai, Yu Wang, He Cao, Leqing Chen, Yuanyuan Liu, Bin Feng, Zijing Liu, Yu Li

机构 * International Digital Economy Academy(国际数字经济学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 ReactBench通过化学反应图揭示MLLMs在拓扑推理中的局限性,包含1618个专家标注的问答对,评估17种MLLMs显示锚定任务与整体结构推理任务存在超过30%的性能差距。

Comments Accepted By EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24192 2026-09-01 cs.CV cs.AI 版本更新

Talk in Pieces, See in Whole: Disentangled and Hierarchical Representation Learning in Language-based Object Detection

分段对话,整体感知:面向语言型目标检测的解耦分层表示学习

Sojung An, Kwanyong Park, Yong Jae Lee, Donghyun Kim

机构 * Korea University(韩国大学) University of Seoul(首尔大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 针对视觉-语言模型难以处理复杂语言查询的问题,提出TaSe框架,构建分层合成字幕数据集与三组件解耦模块,在OmniLabel基准上实现24%的性能提升。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏