arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-01-16 至 2026-01-16 共收录 14
2601.10332 2026-01-16 cs.CV

Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM Encoders

思考-然后-生成:基于LLM编码器的推理感知文本到图像扩散模型

Siqi Kou, Jiachun Jin, Zetong Zhou, Ye Ma, Yugang Wang, Quan Chen, Peng Jiang, Xiao Yang, Jun Zhu, Kai Yu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技) Tsinghua University(清华大学)

AI总结 本文提出基于LLM编码器的推理感知文本到图像扩散模型,通过推理重写提示提升生成质量,达到接近GPT-4的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10323 2026-01-16 cs.CV cs.CL

ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding

ROMA: 实时多模态助手与交互式流式理解

Xueyun Tian, Wei Li, Bingbing Xu, Heng Dong, Yuanzhuo Wang, Huawei Shen

机构 * CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国)

AI总结 ROMA通过实时多模态处理和交互式流式理解,实现统一的反应性和主动性交互,展现强大的多模态处理能力。

Comments Our project page is available at https://eureka-maggie.github.io/ROMA_show

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00423 2026-01-16 cs.LG cs.AI cs.RO

Bootstrap Off-policy with World Model

通过世界模型进行Bootstrap离策略学习

Guojian Zhan, Likun Wang, Xiangteng Zhang, Jiaxin Gao, Masayoshi Tomizuka, Shengbo Eben Li

机构 * College of AI & School of Vehicle and Mobility, Tsinghua University(人工智能学院与车辆与移动系统学院,清华大学) Berkeley AI Research (BAIR), UC Berkeley(伯克利人工智能研究(BAIR),加州大学伯克利分校)

AI总结 BOOM通过整合规划与离策略学习,利用世界模型和无参数动作分布提升策略性能,在高维控制任务中实现训练稳定性和最终性能的突破。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10236 2026-01-16 cs.HC cs.AI

Who Owns the Text? Design Patterns for Preserving Authorship in AI-Assisted Writing

谁拥有文本?面向AI辅助写作中作者身份保护的设计模式

Bohan Zhang, Chengke Bu, Paramveer S. Dhillon

机构 * University of Michigan(密歇根大学) Tsinghua University(清华大学)

AI总结 本文研究了AI辅助写作中作者身份保护的问题,通过实验发现风格个性化能部分恢复作者身份,提出五种设计模式以指导保护作者身份的写作工具。

Comments Preprint; 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10180 2026-01-16 cs.LG cs.NI

Bias in the Shadows: Explore Shortcuts in Encrypted Network Traffic Classification

阴影中的偏差:探索加密网络流量分类中的捷径

Chuyi Wang, Xiaohui Xie, Tongze Wang, Yong Cui

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

AI总结 本文提出BiasSeeker,一种半自动化的框架,用于检测加密网络流量分类中的数据集特定捷径特征,通过统计相关性分析和类别特定验证策略减少偏差,提升模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10137 2026-01-16 cs.LG cs.AI stat.ML

Step-by-Step Causality: Transparent Causal Discovery with Multi-Agent Tree-Query and Adversarial Confidence Estimation

逐步因果:基于多智能体树查询和对抗性置信度估计的透明因果发现

Ziyi Ding, Chenfei Ye-Hao, Zheyuan Wang, Xiao-Ping Zhang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院) Zhili College, Tsinghua University, Beijing, China(清华大学哲利学院)

AI总结 本文提出Tree-Query框架,通过多专家LLM和对抗性置信度估计,实现透明、可解释的因果发现,提升数据自由环境下的因果推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10117 2026-01-16 cs.CV

Beyond Single Prompts: Synergistic Fusion and Arrangement for VICL

超越单一提示:协同融合与排列用于VICL

Wenwen Liao, Jianbo Yu, Yuansong Wang, Shifu Yan, Xiaofeng Yang

机构 * College of Intelligent Robotics and Advance Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学) School of Microelectronics, Fudan University(微电子学院,复旦大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ByteDance Ltd.(字节跳动有限公司)

AI总结 本文提出一种端到端的VICL框架,通过自适应融合模块和排列特定MLP,解决单一提示选择和结构信息利用的问题,提升跨任务的修复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10108 2026-01-16 cs.CL cs.AI cs.MM

SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature

SIN-Bench:在长上下文多模态科学交织文献中追踪原生证据链

Yiming Ren, Junjie Wang, Yuxin Meng, Yihang Shi, Zhiqiang Lin, Ruihang Chu, Yiran Xu, Ziming Li, Yunfei Zhao, Zihan Wang, Yu Qiao, Ruiming Tang, Minghao Liu, Yujiu Yang

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) KuaiShou Inc.(快手公司) Stanford University(斯坦福大学) Harvard University(哈佛大学)

AI总结 SIN-Bench 通过构建科学交织语料库和四个逐步任务,评估多模态模型在长上下文科学文献中追踪证据链的能力,揭示接地是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10107 2026-01-16 cs.CV

Enhancing Visual In-Context Learning by Multi-Faceted Fusion

通过多维融合增强视觉上下文学习

Wenwen Liao, Jianbo Yu, Yuansong Wang, Qingchao Jiang, Xiaofeng Yang

机构 * College of Intelligent Robotics and Advance Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学) School of Microelectronics, Fudan University(微电子学院,复旦大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)

AI总结 本文提出多组合协作融合框架,通过生成三个上下文表示分支提升视觉上下文学习的多维融合能力,实现更准确的跨任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10098 2026-01-16 cs.CV

InfoSculpt: Sculpting the Latent Space for Generalized Category Discovery

InfoSculpt: 通过潜在空间雕刻实现通用类别发现

Wenwen Liao, Hang Ruan, Jianbo Yu, Yuansong Wang, Qingchao Jiang, Xiaofeng Yang

机构 * College of Intelligent Robotics and Advance Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) School of Microelectronics, Fudan University(复旦大学微电子学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Information Science and Engineering, East China University of Science and Technology(东华大学信息科学与工程学院)

AI总结 InfoSculpt通过信息论方法雕刻潜在空间,实现对已知和新类别的有效发现与分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10064 2026-01-16 cs.CL

Long-Chain Reasoning Distillation via Adaptive Prefix Alignment

通过自适应前缀对齐实现长链推理蒸馏

Zhenghao Liu, Zhuoyang Wu, Xinze Li, Yukun Yan, Shuo Wang, Zulong Chen, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系) Alibaba Group, China(阿里巴巴集团)

AI总结 通过自适应前缀对齐方法提升学生模型的推理能力,有效蒸馏教师生成的长推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11594 2026-01-16 cs.LG cs.AI cs.AR cs.CV cs.PF

SageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-Bit Training

SageAttention3: 微缩放FP4注意力用于推理及8位训练的探索

Jintao Zhang, Jia Wei, Pengle Zhang, Xiaoming Xu, Haofeng Huang, Haoxu Wang, Kai Jiang, Jianfei Chen, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech.(计算机科学与技术系) Institute for AI(人工智能研究院) BNRist Center(BNRist中心) THBI Lab(THBI实验室) Tsinghua-Bosch Joint ML Center(清华大学-博世联合机器学习中心) Tsinghua University(清华大学)

AI总结 SageAttention3通过FP4和8位注意力提升推理与训练效率,实现5倍加速和无损微调性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06072 2026-01-16 cs.LG math.OC math.PR

Projection-based Lyapunov method for fully heterogeneous weakly-coupled MDPs

基于投影的Lyapunov方法用于完全异质的弱耦合马尔可夫决策过程

Xiangcheng Zhang, Yige Hong, Weina Wang

机构 * Weiyang College, Tsinghua University(清华大学韦阳学院) Computer Science Department, Carnegie Mellon University(卡内基梅隆大学计算机科学系)

AI总结 本文提出基于投影的Lyapunov方法,解决了完全异质弱耦合马尔可夫决策过程的渐近最优性问题。

Comments 37 pages; full version for NeurIPS proceeding paper; fixed some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19531 2026-01-16 cs.CL

MiLe Loss: a New Entropy-Weighed Loss for Mitigating the Bias of Learning Difficulties in Large Language Models

MiLe Loss:一种新的熵加权损失,用于减轻大语言模型在学习困难方面的偏差

Zhenpeng Su, Xing Wu, Xue Bai, Zijia Lin, Hui Chen, Guiguang Ding, Wei Zhou, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Kuaishou Technology(快手科技) Tsinghua University(清华大学)

AI总结 MiLe Loss通过熵加权机制减轻大语言模型在学习困难方面的偏差,提升模型对难学标记的关注度,从而在下游任务中取得更好的表现。

Comments This paper has been accepted by NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏