arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-08-25 至 2026-08-25 共收录 21
2608.23564 2026-08-25 cs.CL cs.AI cs.SE 新提交

SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?

SWE Refactor Bench:编码智能体能完成长周期的全仓库栈迁移吗?

Deyao Hong, Yizhe Chi, Wenyi Li, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai Na

机构 * Navers Lab(Navers实验室) Tsinghua University(清华大学)

AI总结 本研究推出SWE Refactor Bench基准,通过三阶段评估发现前沿编码智能体仅5.4%能完成全仓库迁移,且迁移完整性与行为正确性是不同能力,该基准可作为可靠全仓库迁移编码智能体的测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23353 2026-08-25 cs.CL cs.NE 新提交

FormuEvo: LLM-Guided Evolution for Discovering Solver-Efficient Mixed-Integer Programming Formulations

FormuEvo:大语言模型引导的进化算法用于发现求解器高效的混合整数规划模型

Haofeng Yuan, Jianing Peng, Jieyi Bi, Ni Zhang, Shiji Song, Zhiguang Cao

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) Tsinghua University(清华大学)

AI总结 FormuEvo是LLM引导的进化框架,将MIP模型设计转化为符号空间的进化优化,结合求解器感知诊断与结构化内存,发现的MIP模型性能远超专家设计及现有LLM方法,求解加速最高达5.5倍且知识可跨场景迁移。

Comments 27 pages, 6 figures, and 9 tables. To appear in the Proceedings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23200 2026-08-25 cs.CL 新提交

LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks

LongWoF-Bench:评估用于可验证长工作流任务的EvoMap基因

Xiao Zhang, Qumeng Sun, Jihao Li, Yiming Ren, Xiang Liu, Haoyang Zhang, Junjie Wang

机构 * EvoMap Tsinghua University(清华大学)

AI总结 该研究提出LongWoF-Bench基准,发现通过EvoMap将验证的执行轨迹转化为可复用的Gene,能显著提升多模型在长工作流任务上的表现,且优于Skill和参考蒸馏的Gene。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23098 2026-08-25 cs.AI 新提交

Jiuge-Tuiqiao: An Interpretable Human-AI System for Classical Chinese Poetry Refinement

九歌-推敲:一款面向古典诗词润色的可解释人机协作系统

Yufeng Han, Lifan Deng, Cunliang Kong, Wenhao Li, Xin Cong, Yuzhuo Bai, Kangyang Luo, Maosong Sun

机构 * Tsinghua University(清华大学) Beijing National Research Center For Information Science And Technology(北京信息科学与技术国家研究中心) Institute for Artificial Intelligence, Tsinghua University(清华大学人工智能国际研究院) Rixin College, Tsinghua University(清华大学日新书院) Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系) Jiangsu Normal University(江苏师范大学)

AI总结 针对现有AI诗词系统削弱用户创作能动性的问题,提出人机协作系统Jiuge-Tuiqiao,通过三元模型实现可控可解释的诗词润色,提升了创作相关性能。

Comments Accepted to the System Demonstrations Program at EMNLP 2026. Code and demo: this https URL (https://github.com/jiangli-va/Jiuge-Tuiqiao)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22971 2026-08-25 cs.AI cs.CV 新提交

ParallelWorld: Test-Time Scaling for Embodied Reasoning

ParallelWorld:具身推理的测试时缩放方法

Min Chen, Shengjun Zhang, Yuxin Li, Zhang Zhang, Xin Fei, Chong Xia, Yueqi Duan

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

AI总结 本文针对具身推理现有方法缺乏长程规划的局限,提出ParallelWorld多步测试时缩放框架,通过验证器引导的树搜索实现并行多步轨迹模拟,在ESI-Bench上显著提升了主动感知与推理性能。

Comments Project Page: this https URL (https://chen-min-22.github.io/ParallelWorld-page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22916 2026-08-25 cs.CL 新提交

Knowing Isn't Always Saying: When Do Spatial Encodings Reach Answers in Vision-Language Models?

知晓并非总能表达:视觉语言模型中空间编码何时能抵达答案?

Zeyu Wang, Xinming Xu

机构 * Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本研究针对视觉语言模型的空间编码何时能抵达答案的问题,采用方向干预方法,揭示了因果影响仅出现在中深层、文本思维链与视觉接地提示的不同作用等传输模式,为解决编码-接地差距提供了新视角。

Comments Accepted to appear in the EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22906 2026-08-25 cs.CV 新提交

AquaFlow: A Monocular Gaussian Splatting SLAM for Underwater Streaming Reconstruction

AquaFlow:用于水下流式重建的单目高斯溅射SLAM

Yingxiang Xu, Kerui Ren, Wenqi Guo, Changjian Jiang, Tao Lu, Linning Xu, Mulin Yu

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对水下场景视觉退化导致的SLAM难题,提出AquaFlow框架,通过微调3D视觉基础模型等技术实现更优的水下重建,在62条水下轨迹数据集上相较WaterSplat-SLAM性能显著提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22806 2026-08-25 cs.CL 新提交

DIAG: Diagnostic Iterative Alignment and Generation for Data-Efficient Mathematical Preference Distillation

DIAG:面向数据高效数学偏好蒸馏的诊断式迭代对齐与生成

Guhan Chen, Songtao Tian, Bohan Li, Hejin Wang, YeXin Xie, Zixiong Yu

机构 * Tsinghua University(清华大学) Kyoto University(京都大学) Nanjing University(南京大学)

AI总结 DIAG是一种自适应调整训练分布的框架,通过诊断偏好对产出与生成针对性训练数据,提升数学推理任务中偏好监督的信息价值,在同等训练预算下增强模型性能。

Comments Accepted by EMNLP 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22793 2026-08-25 cs.CL cs.AI 新提交

TRACE: A Self-Evolving Skill Bank for Consistent, Limit-Aware LLM Agents

TRACE:面向一致性、极限感知的自进化技能库

Wenhao Wu, Menghao Zhang, Xin Wang, Zhi Wang, Kun Shao, Jian Luan

机构 * Xiaomi Inc.(小米公司) Nanjing University(南京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

AI总结 TRACE是一种无需修改模型权重的自进化技能库方法,通过轨迹对比进化优化技能,在CAR-bench任务上显著提升LLM智能体的一致性性能,缩小潜在与可靠性能的差距。

Comments 9 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22757 2026-08-25 cs.CV cs.AI 新提交

Object-Uni: A Unified Model for Object-Centric Spatial Understanding and Controllable Generation

Object-Uni:面向以物体为中心的空间理解与可控生成的统一模型

Mining Tan, Yinuo Wang, Ziqi Zhou, Weize Quan, Sifei Li, Jingdong Chen, DanDan Zheng, Libin Wang, Weiming Dong

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与 mobility学院) Ant Group(蚂蚁集团)

AI总结 提出Object-Uni统一模型,通过视角方向抽象与UniSpatial-80K基准,实现以物体为中心的空间理解与可控生成,提升位姿理解及可控生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22591 2026-08-25 cs.RO 新提交

WorldToken: Time-First Sequence Modeling for Robotic Imitation Learning

WorldToken:面向机器人模仿学习的时间优先序列建模

Chunkai Yang, Andong Yang, Chao Gao

机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感信息工程学院) Tsinghua University(清华大学) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院)

AI总结 该研究提出时间优先序列建模方法WorldToken,融合多类观测生成世界token序列,结合因果时间Transformer与扩散动作头,在机器人模仿学习任务上验证了其可行性及数据缩放、时间上下文特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22483 2026-08-25 cs.CL 新提交

Claim-Level Confidence Calibration for Reliable Decision Making with Large Language Models

面向大型语言模型可靠决策的声明级置信度校准

Toghrul Abbasli, Kentaroh Toyoda, Yuan Wang, Li Chen

机构 * Tsinghua University(清华大学) Vulcan Research(伏尔坎研究院) AIFT Keio Global Research Institute (KGRI)(庆应全球研究所(KGRI)) China Mobile Research Institute(中国移动研究院) Zhongguancun Laboratory(中关村实验室)

AI总结 该研究针对大型语言模型的幻觉及置信度与事实不匹配问题,提出黑箱场景下的声明级置信度校准框架,在TriviaQA等数据集上降低了事实问题的预期校准误差。

Comments In Proceedings of The 5th Workshop on Uncertainty Reasoning and Quantification in Decision Making (held in conjunction with ACM SIGKDD 2026), Jeju, Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22278 2026-08-25 cs.RO 新提交

DreamMimic: Learning Visuomotor Whole-Body Loco-Manipulation via World Model

DreamMimic:通过世界模型学习视觉运动全身移动操作

Jie Yin, Xingyu Lai

机构 * Tsinghua University(清华大学)

AI总结 DreamMimic 框架通过世界模型辅助蒸馏,将特权教师策略提炼为基于视觉的人形机器人控制器,引入 PCG 平衡引导与探索,在 OMOMO 和 BEHAVE 上提升了视觉移动操作性能。

Comments accepted to IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22174 2026-08-25 cs.CV 新提交

When Does Visual Generation Help Visual Understanding in Unified Multimodal Models?

统一多模态模型中视觉生成何时能助力视觉理解?

Yubo Zhu, Zhehan Kan, Jingyi Yang, Miaolin Chen, Jinbo Xing, Kai Zhu, Zijian Wang, Sheng Zhong, Wei Tong

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Fudan University(复旦大学)

AI总结 本研究提出VGAU-Diag评估框架,发现统一多模态模型的视觉生成仅在简单任务上助益理解,瓶颈多在理解侧,有效生成需瞄准理解瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22064 2026-08-25 cs.CV 新提交

Competitive Memory Readout for Robust Video Object Segmentation: 2nd Place Technical Report for the MOSEv2 Track of the 8th LSVOS Challenge

用于鲁棒视频目标分割的竞争性记忆读出:第8届LSVOS挑战赛MOSEv2赛道第2名技术报告

Mingqi Gao, Sijie Li, Jungong Han

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机学院) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本研究针对第8届LSVOS挑战赛MOSEv2赛道提出基于SAM~3的改进方法,通过竞争性记忆读出机制提升鲁棒视频目标分割性能,获该赛道第2名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22055 2026-08-25 cs.AI 新提交

GenCoord: Skill-Path Commitments under Private Information

Peng He, Junning Zhu, Haohan Yuan, Jianpeng Liang

机构 * Tsinghua University(清华大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) University of California San Diego(加利福尼亚大学圣迭戈分校)

Comments 25 pages, 10 figures, and 23 tables, including supplementary material. Peng He and Junning Zhu contributed equally. Paper source and compact evidence: this https URL (https://github.com/JulianZJN/GenCoord)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21883 2026-08-25 cs.CV 新提交

VIG: Visual Information Gain as a Reward Signal for Multimodal Chain-of-Thought Compression

VIG:作为多模态思维链压缩奖励信号的视觉信息增益

Wen Luo, Xiaohan Yi, Xiaotao Huang, Liqun Huang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Tsinghua University(清华大学)

AI总结 该研究提出VIG奖励机制,通过提升视觉信息密度优化多模态CoT的准确率与效率权衡,无需额外资源,在多类基准及不同规模模型上均有效。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21833 2026-08-25 cs.AI cs.CL 新提交

GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?

GameXpert-Bench:编码智能体距离专家级游戏开发还有多远?

Kun Chen, Haorong Hong, Peizhong Gao, Jianfeng Lin, Tongxu Luo, Yuxuan Xie, Chenxu Liu, Jieling He, Zhongyuan Liu, Zeno Zeng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Lightspeed Studios, Tencent(腾讯光速工作室)

AI总结 GameXpert-Bench是覆盖游戏开发全生命周期的基准,含三个赛道,测评显示当前编码智能体在生成可玩游戏基础上表现较好,在缺陷发现等方面仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21778 2026-08-25 cs.RO 新提交

Vision Guided Target Conditioned Control for Autonomous Excavation

面向自主挖掘的视觉引导目标条件控制

Shuai Zhao, Ji-An Pan, Junwei Li, Xun Tang, Fansen Xi, Qing Xu, Keqiang Li, Jianqiang Wang

机构 * Liaoning University(辽宁大学) Northeastern University(东北大学) Tsinghua University(清华大学)

AI总结 该研究针对自主挖掘问题,提出结合视觉目标条件与配对演示的掩码条件动作块Transformer框架,在模拟任务中显著提升挖掘成功率与堆料清理效率,为挖掘机自动化提供实用方案。

Comments 5 pages, 3 figures, 3 tables. Accepted at ISCSIC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21450 2026-08-25 cs.CV 新提交

Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering

超越视觉相似度:面向基于知识的视觉问答的实体对齐检索

Hangrui Xu, Zhengxian Wu, Yunyao Yu, Zhuohong Chen, Rui Cong, Xiangwen Deng, Zhifang Liu, Peng Jiao, Haoqian Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) University of Arizona(亚利桑那大学)

AI总结 针对KB-VQA现有检索范式忽略实体语义对齐的缺陷,提出首个MLLM嵌入检索器KBMR,结合语义判别器与连续语义蒸馏目标,在Recall@1和VQA准确率上较CLIP基线实现显著提升。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21410 2026-08-25 cs.RO cs.HC 新提交

Position: Robot Privacy as Embodied Boundary Work. Connecting Capabilities, Contexts, and Design Responses in Everyday Robotics

位置:机器人隐私作为具身边界工作——连接日常机器人中的能力、情境与设计响应

Liwen He, Shuning Zhang, Chengwen Zhang, Xin Yi, Chun Yu, Jihong Jeung, Xin Tong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本研究提出具身边界隐私框架,结合机器人7种能力与5种部署情境分析其隐私风险,给出具身隐私机制设计启示,呼吁HRI领域关注机器人具身行动的隐私意义。

Comments 8 pages, 1 figure, 3 tables. Accepted for publication in UbiComp Companion '26

详情

展开后加载摘要…

URL PDF HTML 收藏