arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-08-28 至 2026-08-28 共收录 12
2608.27370 2026-08-28 cs.CL cs.LG 新提交

Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090

Puro-2B:Poor Lab基于RTX 5090训练的Qwen2-1.5B模型,训练成本低于5090美元

Kairong Luo, Jiarui Cui, Yaorui Yin, Shengqi Chen, Yiming Yang, Linxiang Gao, Yanmohan Wang, Mingzhe Zhang, Kaiyue Wen, Kaifeng Lyu, Wenguang Chen

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室)

AI总结 该研究提出开源预训练方案,在RTX 5090上低成本训练出Puro-2B模型,推导出成本缩放定律并开展数据课程影响下游性能的案例研究,完整方案已开源。

Comments 62 pages, 20 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27365 2026-08-28 cs.CV cs.AI 新提交

KnockGS:interaction-Grounded Calibrationof Physical Gaussian Representations

KnockGS:基于交互的物理高斯表示校准

Chenchen Ge, Hanwen Shen, Bowen Jing, Jiyuan Cai, Xiaofeng Wang, Hongsen Lei, Weitao Zhou, Dandan Zhang, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) Southeast University(东南大学) Stevens Institute of Technology(史蒂文斯理工学院) Tsinghua University(清华大学) Simple AI Imperial College London(伦敦帝国学院) Shanghai Jiao Tong University(上海交通大学) GigaAI Sun Yat-sen University(中山大学) The University of Hong Kong(香港大学)

AI总结 KnockGS是基于交互-响应的PhysicalGS框架,可从三维高斯物体动力学中校准材料尺度,在参数恢复与响应保真度上优于对比方法,为交互式PhysicalGS系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27348 2026-08-28 cs.CL 新提交

INTENT-AS-A-TOOL Makes it Easy to Track Agentic Misalignment

意图作为工具:轻松追踪智能体失配问题

Yutong Zhang, Jianshuo Dong, Peng Xu, Long Wang, Jie Zhang, Tianwei Zhang, Xiaoping Zhang, Han Qiu

机构 * Tsinghua University(清华大学) MatrixOrigin(矩阵起源) SiliconProspect AI(硅景人工智能) Nanyang Technological University(南洋理工大学)

AI总结 本研究针对智能体失配问题,提出INTENT-AS-A-TOOL方法,通过添加意图专用工具追踪智能体推理过程中的意图变化,补充CoT监控,为智能体安全追踪提供细粒度信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27203 2026-08-28 cs.LG 新提交

Common Geodesics Do Not Guarantee Fisher Consistency of the Structured SVM: Minimal Counterexamples and a Tree-Metric Classification

公共测地线无法保证结构化支持向量机的费希尔一致性:最小反例与树度量分类

Jintao Fei, Jiangying Luo

机构 * Tsinghua University(清华大学)

AI总结 本文针对结构化SVM,通过构造最小反例,证明公共测地线条件无法保证其费希尔一致性,并对树度量分类得出argmax一致性仅当树为路径的结论。

Comments 14 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27086 2026-08-28 cs.AI cs.MA cs.SE 新提交

A Contract-Centered Architecture for Scalable and Manageable Agentic Runtimes

面向可扩展且可管理的智能体运行时的以契约为中心的架构

Yaxiao Liu, Pengbo Liu, Yiwen Liu, Yihua Guan, Zhenghe Hou, Jiaxing Song

机构 * PwC China AI Center(普华永道中国AI中心) Tsinghua University(清华大学)

AI总结 针对企业AI部署的协调问题,本文提出以契约为中心的智能体运行时架构,含Skill等四个责任对象及P1假设,还提出可证伪的测量协议,目前无已完成的实现、实验等结果。

Comments 48 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26872 2026-08-28 cs.CV 新提交

Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

Self-OPD:无需教师模型的流匹配模型的在线策略蒸馏

Shiyi Zhang, Mushui Liu, Yunze Tong, Wanggui He, Siyu Zou, Jinlong Liu, Yunlong Yu, Jian Song, Hao Jiang, Pipei Huang, Bo Zheng

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出Self-OPD,一种无需教师模型的流匹配模型在线策略蒸馏框架,通过分支SDE候选与奖励比较优化速度场,在基准测试中优于现有无教师的RL和OPD方法。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26766 2026-08-28 cs.RO 新提交

MeshPriorDiT: Hierarchical Modeling for Action-Conditioned Cloth Dynamics

MeshPriorDiT:面向动作条件布料动力学的分层建模

Zihang Wang, Jianming Hu, Shang Su, Hao Huang, Mengkai Shi, Jun Gao, Shuo Feng

机构 * Tsinghua University(清华大学) Dense-AI University of Michigan(密歇根大学)

AI总结 本文提出MeshPriorDiT分层动力学模型,结合网格GNN与残差DiT,在布料操作任务的15步自回归滚动预测中,显著降低了全局均方误差,同时保持了良好的边缘应变性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26714 2026-08-28 cs.CV cs.AI 新提交

LiveVVT: High-Fidelity Video Virtual Try-On in Real Time

LiveVVT:高保真实时视频虚拟试穿

Yushe Cao, Shikun Feng, Ruxiang Duan, Liyong Wang, Dianxi Shi, Chun Yu, Junliang Xing

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) South China University of Technology(华南理工大学) Beijing Jiaotong University(北京交通大学)

AI总结 LiveVVT是一种滚动式流式扩散框架,通过保留双向建模与互补内存维持一致性,结合渐进式蒸馏优化,实现了比同等规模模型延迟降26倍、吞吐量提11倍的高保真实时视频虚拟试穿。

Comments 16 pages, 13 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26583 2026-08-28 cs.RO 新提交

SOLO: Stable Omni-terrain Long-Horizon Perceptive Humanoid Locomotion

SOLO:稳定全地形长视距感知类人机器人运动

Pihai Sun, Gang Han, Jingkai Sun, Jiahao Ma, Zeran Su, Zelin Tao, Peiran Liu, Shuai Shi, Wei Cui, Zifan Wang, Jialin Yu, Wen Zhao, Kangning Yin, Jiaxu Wang, Jiahang Cao, Lingfeng Zhang, Hao Cheng, Jian Tang, Yijie Guo, Qiang Zhang

机构 * Artificial General Intelligence Institute, University of Science and Technology of China(中国科学技术大学通用人工智能研究院) X-Humanoid(X-人形机器人) The University of Hong Kong(香港大学) The Australian National University(澳大利亚国立大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

AI总结 SOLO是解决长视距类人机器人运动脆弱性的统一框架,通过QR与TA-MSE蒸馏提升地形感知与策略学习,仿真及实际测试中通行成功率显著优于基线方法,可零样本完成长距离复杂地形任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26563 2026-08-28 cs.CL 新提交

SPT: Skills as Pre-Training Data for Agentic Language Models

SPT:将技能作为智能体语言模型的预训练数据

Yufei Sun, Yudong Li, Yiming Cheng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

AI总结 本研究提出技能预训练(SPT)方法,将公开技能包作为训练数据,结合参考感知组装策略,可提升智能体语言模型的工具使用性能,同时保留通用性能,验证了技能包作为预训练数据源的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26517 2026-08-28 cs.CV 新提交

HUG-VIS: A Multimodal Benchmark for Human-centered Understanding and Generation in Visual Intelligence

HUG-VIS:面向视觉智能中以人为中心的理解与生成的多模态基准

Fei Ma, Zebang Cheng, Minghui Li, Hongbo Xu, Yuyong Tan, Yihua Shao, Hanling Wang, Zhou Liu, Yuqing Gao, Dong Wang, Long Ma, Laizhong Cui, Nicu Sebe, Qi Tian

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen University(深圳大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) Tongji University(同济大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) University of Trento(特伦托大学) Huawei(华为)

AI总结 该研究构建了HUG-VIS多模态基准,包含30名演员的8400段同步多模态视频等数据,评估了四类任务的模型,揭示了情感识别、生成等任务的关键特性与现存问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26431 2026-08-28 cs.SD eess.AS 新提交

AudioSpan: Spanning the Duration and Depth of Audio Comprehension

AudioSpan:覆盖音频理解的时长与深度

Wen Huang, Yunfei Chu, Meng Gao, Haolin He, Jin Xu

机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究提出覆盖10分钟至2小时音频的基准AudioSpan,含3240个分三认知层级的问题,评估12个大型音频-语言模型,发现从长音频提取相关事实是核心难点,该基准可公开获取。

详情

展开后加载摘要…

URL PDF HTML 收藏