arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-01-06 至 2026-01-06 共收录 30
2601.02256 2026-01-06 cs.CV cs.LG

VAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressive Generation

VAR RL Done Right: 解决视觉自回归生成中的异步策略冲突

Shikun Sun, Liao Qu, Huichao Zhang, Yiheng Liu, Yangyang Song, Xian Li, Xu Wang, Yi Jiang, Daniel K. Du, Xinglong Wu, Jia Jia

机构 * Tsinghua University(清华大学)

AI总结 本文提出了一种新的框架,通过显式管理异步策略冲突来增强组相对策略优化,从而提升视觉自回归生成模型的样本质量和目标对齐。

Comments Project page: https://github.com/ByteVisionLab/NextFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02204 2026-01-06 cs.CV cs.AI

NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation

NextFlow:统一的序列建模激活多模态理解和生成

Huichao Zhang, Liao Qu, Yiheng Liu, Hang Chen, Yangyang Song, Yongsheng Dong, Shikun Sun, Xian Li, Xu Wang, Yi Jiang, Hu Ye, Bo Chen, Yiming Gao, Peng Liu, Akide Liu, Zhipeng Yang, Qili Deng, Linjie Xing, Jiyang Liu, Zhao Wang, Yang Zhou, Mingcong Liu, Yi Zhang, Qian He, Xiwei Hu, Zhongqi Qi, Jie Shao, Zhiye Fu, Shuai Wang, Fangmin Chen, Xuezhi Chai, Zhihua Wu, Yitong Wang, Zehuan Yuan, Daniel K. Du, Xinglong Wu

机构 * TsingHua University(清华大学) Monash University(墨尔本大学)

AI总结 NextFlow通过统一的自回归架构实现多模态理解和生成,以高效生成高分辨率图像并提升视觉质量。

Comments Project page: https://github.com/ByteVisionLab/NextFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02145 2026-01-06 physics.geo-ph cs.LG

Feature-based Inversion of 2.5D Controlled Source Electromagnetic Data using Generative Priors

基于特征的2.5维可控源电磁数据 inversion 使用生成先验

Hongyu Zhou, Haoran Sun, Rui Guo, Maokun Li, Fan Yang, Shenheng Xu

机构 * Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(电子工程系,北京信息科学与技术国家研究中心(BNRist),清华大学) Faculty of Math and Computer Science, Weizmann Institute of Science(数学与计算机科学学院,魏兹曼科学研究所)

AI总结 本文提出利用生成先验进行特征基于的2.5维可控源电磁数据反演,通过变分自编码器学习导电率分布先验信息,结合高斯牛顿法实现模型更新,提升重建精度与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02121 2026-01-06 cs.SI cs.AI

Inferring Network Evolutionary History via Structure-State Coupled Learning

通过结构-状态耦合学习推断网络进化史

En Xu, Shihe Zhou, Huandong Wang, Jingtao Ding, Yong Li

机构 * Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

AI总结 本文提出CS$^2$方法,通过结构-状态耦合学习,利用网络稳态动力学推断进化史,提升了边优先级和全局顺序一致性,展示了稳态作为独立信号的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01984 2026-01-06 cs.CV

Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation

基于蓝图的思考:通过结构化物体表示协助视觉-语言模型进行空间推理

Weijian Ma, Shizhao Sun, Tianyu Yu, Ruiyu Wang, Tat-Seng Chua, Jiang Bian

机构 * National University of Singapore(新加坡国立大学) Microsoft Research, Asia(微软亚洲研究院) Tsinghua University(清华大学) University of Toronto(多伦多大学)

AI总结 通过结构化物体表示提升视觉-语言模型的空间推理能力,引入蓝图嵌入推理轨迹、蓝图意识奖励和反捷径数据增强技术。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24015 2026-01-06 cs.CV

On Exact Editing of Flow-Based Diffusion Models

关于基于流的扩散模型的精确编辑

Zixiang Li, Yue Song, Jianing Peng, Ting Liu, Jun Huang, Xiaochao Qu, Luoqi Liu, Wei Wang, Yao Zhao, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(信息科学学院,北京交通大学) Visual Intelligence +X International Cooperation Joint Laboratory of MOE(视觉智能+X国际合作联合实验室) MT Lab, Meitu Inc(美图实验室,美图公司) Tsinghua University(清华大学)

AI总结 CVC通过双视角速度转换机制改进基于流的扩散编辑,实现更稳定的潜在动态和更准确的图像转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23239 2026-01-06 cs.CV

RS-Prune: Training-Free Data Pruning at High Ratios for Efficient Remote Sensing Diffusion Foundation Models

RS-Prune: 无需训练的数据裁剪以高比例提升高效遥感扩散基础模型

Fan Wei, Runmin Dong, Yushan Lai, Yixiang Yang, Zhaoyang Luo, Jinxiao Zhang, Miao Yang, Shuai Yuan, Jiyao Zhao, Bin Luo, Haohuan Fu

机构 * Department of Earth System Science, Tsinghua University(清华大学地球系统科学系) School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) National Supercomputing Center in Shenzhen(深圳国家超算中心) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院) Department of Geography, The University of Hong Kong(香港大学地理系) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

AI总结 RS-Prune提出一种无需训练的高比例数据裁剪方法,通过局部信息与全局多样性结合,提升遥感扩散模型的收敛性和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14244 2026-01-06 cs.CL cs.AI

From Context to EDUs: Faithful and Structured Context Compression via Elementary Discourse Unit Decomposition

从上下文到EDUs:通过基本话语单元分解实现忠实且结构化的上下文压缩

Yiqing Zhou, Yu Lei, Shuzheng Si, Qingyan Sun, Wei Wang, Yifei Wu, Hao Wen, Gang Chen, Fanchao Qi, Maosong Sun

机构 * DeepLang AI Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Jiaotong University(北京交通大学)

AI总结 本文提出EDU-based Context Compressor,通过基本话语单元分解实现结构化上下文压缩,提升模型在长文档问答和复杂搜索任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02115 2026-01-06 cs.CR cs.AI

Coward: Collision-based Watermark for Proactive Federated Backdoor Detection

Coward: 基于碰撞的水印用于主动联邦后门检测

Wenjie Li, Siying Gu, Yiming Li, Kangjie Chen, Zhili Chen, Tianwei Zhang, Shu-Tao Xia, Dacheng Tao

机构 * Tsinghua University(清华大学) East China Normal University(华东师范大学) Nanyang Technological University(南洋理工大学)

AI总结 Coward通过多后门碰撞效应提出主动检测方法,利用分布外数据的双映射学习注入水印,有效缓解OOD偏见并提升检测性能。

Comments 13-page main body and 4-page appendix. Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18773 2026-01-06 cs.AR cs.AI cs.CL cs.PF

BitDecoding: Unlocking Tensor Cores for Long-Context LLMs with Low-Bit KV Cache

BitDecoding: 通过低精度KV缓存解锁Tensor Cores用于长上下文LLM

Dayou Du, Shijie Cao, Jianyi Cheng, Luo Mai, Ting Cao, Mao Yang

机构 * University of Edinburgh(爱丁堡大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

AI总结 BitDecoding通过协同利用CUDA核心和Tensor Core,实现低精度KV缓存的高效解码,提升长上下文LLM的解码速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01872 2026-01-06 cs.RO

CausalNav: A Long-term Embodied Navigation System for Autonomous Mobile Robots in Dynamic Outdoor Scenarios

CausalNav: 一种面向动态户外场景的自主移动机器人长期具身导航系统

Hongbo Duan, Shangyi Luo, Zhiyuan Deng, Yanbo Chen, Yuanhao Chiang, Yi Liu, Fangming Liu, Xueqian Wang

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(人工智能与机器人中心,深圳国际研究生院,清华大学) Peng Cheng Laboratory(鹏城实验室)

AI总结 CausalNav是一种基于场景图的语义导航框架,通过构建多级语义场景图实现动态户外环境中的稳健导航与远距离规划。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01865 2026-01-06 cs.CV

RRNet: Configurable Real-Time Video Enhancement with Arbitrary Local Lighting Variations

RRNet: 可配置的实时视频增强与任意局部光照变化

Wenlong Yang, Canran Jin, Weihang Yuan, Chao Wang, Lifeng Sun

机构 * Tsinghua University(清华大学)

AI总结 RRNet通过轻量级框架实现实时视频增强,支持任意局部光照变化,提升低光和眩光处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01501 2026-01-06 cs.LG

Advanced Global Wildfire Activity Modeling with Hierarchical Graph ODE

基于分层图微分方程的先进全球野火活动建模

Fan Xu, Wei Gong, Hao Wu, Lilan Peng, Nan Wang, Qingsong Wen, Xian Wu, Kun Wang, Xibin Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) Southwest Jiaotong University(西南交通大学) Beijing Jiaotong University(北京交通大学) Tencent(腾讯) Nanyang Technological University(南洋理工大学)

AI总结 本文提出分层图微分方程框架HiGO,用于建模全球野火活动的多尺度连续动态,通过多级图结构和自适应信息传递机制提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01459 2026-01-06 cs.SD eess.AS

OV-InstructTTS: Towards Open-Vocabulary Instruct Text-to-Speech

OV-InstructTTS: 向开放词汇指令文本到语音迈进

Yong Ren, Jiangyan Yi, Jianhua Tao, Haiyang Sun, Zhengqi Wen, Hao Gu, Le Xu, Ye Bai

机构 * The State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

AI总结 OV-InstructTTS通过开放词汇指令和推理驱动框架提升文本到语音的指令遵循和表达性

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01454 2026-01-06 cs.CV

PartImageNet++ Dataset: Enhancing Visual Models with High-Quality Part Annotations

PartImageNet++数据集:通过高质量部分标注增强视觉模型

Xiao Li, Zilong Liu, Yining Liu, Zhuhong Li, Na Dong, Sitian Qin, Xiaolin Hu

机构 * Department of Computer Science and Technology, BNRist, Institute for Artificial Intelligence, IDG/McGovern Institute for Brain Research, Tsinghua University(计算机科学与技术系,BNRist,人工智能研究所,IDG/McGovern脑科学研究所,清华大学) School of Computer Science and Technology, Shandong University(计算机科学与技术学院,山东大学) Harbin Institute of Technology(哈尔滨工业大学) Duke University(杜克大学) Beijing Institute of Technology(北京理工大学) Chinese Institute for Brain Research(中国脑科学研究所)

AI总结 PartImageNet++数据集通过高质量部分标注提升视觉模型,提出多尺度部分监督模型并验证其在下游任务中的有效性。

Comments arXiv admin note: substantial text overlap with arXiv:2407.10918

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01425 2026-01-06 cs.CV

DreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer

DreamID-V:弥合图像到视频的差距,通过扩散变换器实现高保真的面部交换

Xu Guo, Fulong Ye, Xinghui Li, Pengqi Tu, Pengze Zhang, Qichao Sun, Songtao Zhao, Xiangwang Hou, Qian He

机构 * Tsinghua University(清华大学) Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

AI总结 DreamID-V通过扩散变换器框架实现高保真视频面部交换,结合新型数据管道和强化学习策略,提升身份一致性和视觉真实性。

Comments Project: https://guoxu1233.github.io/DreamID-V/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01373 2026-01-06 cs.SD cs.AI eess.AS

UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models

UltraEval-Audio: 一个用于音频基础模型全面评估的统一框架

Qundong Shi, Jie Zhou, Biyuan Lin, Junbo Cui, Guoyang Zeng, Yixuan Zhou, Ziyang Wang, Xin Liu, Zhen Luo, Yudong Wang, Zhiyuan Liu

机构 * ModelBest Inc.(ModelBest公司) Tsinghua University(清华大学)

AI总结 UltraEval-Audio提出一个统一框架,解决音频模型评估的统一性、编解码器评估和中文基准问题,提供多语言支持和实时排行榜。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01204 2026-01-06 cs.CV

XStreamVGGT: Extremely Memory-Efficient Streaming Vision Geometry Grounded Transformer with KV Cache Compression

XStreamVGGT: 极其内存高效的流式视觉几何 grounded Transformer 与 KV 缓存压缩

Zunhai Su, Weihao Ye, Hansen Feng, Keyu Fan, Jing Zhang, Dahai Yu, Zhengwu Liu, Ngai Wong

机构 * Shenzhen International Graduate School Tsinghua University(清华大学深圳国际研究生院) Institute of Artificial Intelligence Xiamen University(厦门大学人工智能研究院) China Star Optoelectronics Technology(中国星电科技) TCL Corporate Research (HK) Co Ltd.(TCL香港企业研发中心) Department of Electrical and Electronic Engineering The University of Hong Kong(香港大学电子与电气工程系)

AI总结 XStreamVGGT通过剪枝和量化技术,实现了内存高效的流式3D视觉几何推断,显著降低内存消耗并提升推断速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01156 2026-01-06 cs.CL

DHI: Leveraging Diverse Hallucination Induction for Enhanced Contrastive Factuality Control in Large Language Models

DHI: 利用多样化幻觉诱导提升大语言模型对比事实性控制

Jiani Guo, Xiangke Zeng, Jie Wu, Zuchao Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

AI总结 DHI通过多样化幻觉诱导提升大语言模型对比事实性控制,有效减少幻觉生成。

Comments ICONIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01153 2026-01-06 cs.CL

SongSage: A Large Musical Language Model with Lyric Generative Pre-training

SongSage:一种具有歌词生成预训练的大型音乐语言模型

Jiani Guo, Jiajia Li, Jie Wu, Zuchao Li, Yujiu Yang, Ping Wang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Information Management, Wuhan University(武汉大学信息管理学院) Tsinghua University(清华大学) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

AI总结 SongSage是一种通过歌词生成预训练的大型音乐语言模型,专为提升歌词理解和播放列表推荐能力而设计,同时具备一般知识理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24712 2026-01-06 cs.RO cs.AI

LSRE: Latent Semantic Rule Encoding for Real-Time Semantic Risk Detection in Autonomous Driving

LSRE: 隐式语义规则编码用于自动驾驶中的实时语义风险检测

Qian Cheng, Weitao Zhou, Cheng Jing, Nanshan Deng, Junze Wen, Zhaoyang Liu, Kun Jiang, Diange Yang

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)

AI总结 LSRE通过隐式语义规则编码实现自动驾驶中的实时语义风险检测,以10 Hz速度提供高效准确的危险预判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24617 2026-01-06 cs.LG cs.AI

Dynamic Large Concept Models: Latent Reasoning in an Adaptive Semantic Space

动态大概念模型:在适应性语义空间中的潜在推理

Xingwei Qu, Shaowen Wang, Zihao Huang, Kai Hua, Fan Yin, Rui-Jie Zhu, Jundong Zhou, Qiyang Min, Zihao Wang, Yizhi Li, Tianyu Zhang, He Xing, Zheng Zhang, Yuxuan Song, Tianyu Zheng, Zhiyuan Zeng, Chenghua Lin, Ge Zhang, Wenhao Huang

机构 * University of Manchester(曼彻斯特大学) Mila - Quebec AI Institute(魁北克人工智能研究所) Tsinghua University(清华大学)

AI总结 动态大概念模型通过层次压缩和压缩感知扩展定律,在适应性语义空间中提升推理效率,实现零样本基准上的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21887 2026-01-06 cs.RO cs.AI

Aerial World Model for Long-horizon Visual Generation and Navigation in 3D Space

空域世界模型用于3D空间中的长视距视觉生成与导航

Weichen Zhang, Peizhi Tang, Xin Zeng, Fanhang Man, Shiquan Yu, Zichao Dai, Baining Zhao, Hongjin Chen, Yu Shang, Wei Wu, Chen Gao, Xinlei Chen, Xin Wang, Yong Li, Wenwu Zhu

机构 * Tsinghua University(清华大学)

AI总结 ANWM是一种空域导航世界模型,通过预测未来视觉观察来提升无人机在大规模3D空间中的长视距导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23541 2026-01-06 cs.CV

OVSeg3R: Learn Open-vocabulary Instance Segmentation from 2D via 3D Reconstruction

OVSeg3R: 通过3D重建从2D学习开放词汇实例分割

Hongyang Li, Jinyuan Qu, Lei Zhang

机构 * South China University of Technology(南方科技大学) International Digital Economy Academy (IDEA)(国际数字经济学院) Tsinghua University(清华大学)

AI总结 OVSeg3R通过3D重建技术,从2D模型学习开放词汇3D实例分割,提升模型性能和类别平衡性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06084 2026-01-06 cs.CV

AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance

AdaptInfer: 用于视觉-语言模型推理的自适应令牌剪枝与动态文本引导

Weichen Zhang, Zhui Zhu, Ningbo Li, Shilong Tao, Kebin Liu, Yunhao Liu

机构 * Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心) Department of Automation, Tsinghua University(清华大学自动化系) School of Computer Science, Peking University(北京大学计算机科学系)

AI总结 AdaptInfer通过动态文本引导和自适应令牌剪枝,有效降低视觉-语言模型推理成本,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14697 2026-01-06 cs.CV

GTPBD: A Fine-Grained Global Terraced Parcel and Boundary Dataset

GTPBD:一种细粒度的全球梯田地块和边界数据集

Zhiwei Zhang, Zi Ye, Yibin Wen, Shuai Yuan, Haohuan Fu, Jianxi Huang, Juepeng Zheng

机构 * Sun Yat-Sen University(中山大学) The University of Hong Kong(香港大学) Tsinghua University(清华大学) National Supercomputing Center in Shenzhen(深圳国家超算中心) Southwest Jiaotong University(西南交通大学) China Agricultural University(中国农业大学)

AI总结 本文提出GTPBD数据集,用于细粒度梯田地块分析,涵盖全球多地形区域,支持语义分割、边缘检测、地块提取及无监督领域适应等任务。

Comments 40 pages, 40 figures, Accepted to the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23019 2026-01-06 cs.RO

Stairway to Success: An Online Floor-Aware Zero-Shot Object-Goal Navigation Framework via LLM-Driven Coarse-to-Fine Exploration

通往成功的阶梯:一种通过LLM驱动的粗到细探索的在线楼层感知零样本物体-目标导航框架

Zeying Gong, Rong Li, Tianshuai Hu, Ronghe Qiu, Lingdong Kong, Lingfeng Zhang, Guoyang Zhao, Yiyi Ding, Junwei Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

AI总结 本文提出ASCENT框架,通过LLM驱动的粗到细探索实现在线楼层感知零样本物体-目标导航,无需预建地图或重新训练,适用于多楼层环境。

Comments Accepted to IEEE Robotics and Automation Letters (RAL). Project Page at https://zeying-gong.github.io/projects/ascent

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08658 2026-01-06 cs.RO cs.AI

Knowledge-data fusion dominated vehicle platoon dynamics modeling and analysis: A physics-encoded deep learning approach

基于知识-数据融合的车辆编队动力学建模与分析:一种物理编码深度学习方法

Hao Lyu, Yanyong Guo, Pan Liu, Shuo Feng, Weilin Ren, Quansheng Yue

机构 * School of Transportation, Southeast University, Nanjing, China, 211189(东南大学交通学院) Jiangsu Key Laboratory of Urban ITS, Nanjing, China, 210096(江苏省城市智能交通重点实验室) Jiangsu Collaborative Innovation Center of Modern Urban Traffic Technologies, Nanjing, China, 210096(江苏省现代城市交通技术协同创新中心) Department of Automation, Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University, Beijing, China, 100084(自动化系,北京信息科学与技术国家研究中心(BNRist),清华大学)

AI总结 本文提出PeMTFLN模型,通过物理编码深度学习方法实现车辆编队动力学建模与分析,提升预测精度和稳定性。

Journal ref Information Fusion, Vol. 126, 103622, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03104 2026-01-06 cs.AI

ChatTS: Aligning Time Series with LLMs via Synthetic Data for Enhanced Understanding and Reasoning

通过合成数据对齐时间序列,利用大语言模型进行增强的理解与推理

Zhe Xie, Zeyan Li, Xiao He, Longlong Xu, Xidao Wen, Tieying Zhang, Jianjun Chen, Rui Shi, Dan Pei

机构 * Tsinghua University(清华大学)

AI总结 ChatTS通过合成数据生成方法,首次实现了多变量时间序列的多模态大语言模型,显著提升了时间序列的理解与推理性能。

Comments accepted by VLDB' 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01850 2026-01-06 cs.LG cs.RO

ManiBox: Enhancing Embodied Spatial Generalization via Scalable Simulation Data Generations

ManiBox: 通过可扩展的模拟数据生成增强具身空间泛化

Hengkai Tan, Xuezhou Xu, Chengyang Ying, Xinyi Mao, Zeyuan Wang, Songming Liu, Xingxing Zhang, Zhizhong Su, Hang Su, Jun Zhu

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Horizon Robotics

AI总结 ManiBox通过可扩展的模拟数据生成提升具身智能体的空间泛化能力,有效减少仿真到现实的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏