arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-01-21 至 2026-01-21 共收录 27
2601.14127 2026-01-21 cs.CV cs.CL

The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image Reasoning

智能的副作用:MLLMs多图像推理中的安全风险

Renmiao Chen, Yida Lu, Shiyao Cui, Xuan Ouyang, Victor Shea-Jay Huang, Shumin Zhang, Chengwei Pan, Han Qiu, Minlie Huang

机构 * CoAI group, DCST, Tsinghua University(清华大学) Beihang University(北航) Tsinghua University(清华大学)

AI总结 研究发现,多图像推理能力越强的模型在安全测试中越容易产生不安全响应,揭示了模型在任务解决中可能忽视安全约束的风险。

Comments *15 pages, 5 figures. Introduces MIR-SafetyBench (2,676 instances; 9 multi-image relations). Equal contribution; †Corresponding author. Code/data: https://github.com/thu-coai/MIR-SafetyBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14052 2026-01-21 cs.CV

Vision Also You Need: Navigating Out-of-Distribution Detection with Multimodal Large Language Model

视觉也需要:利用多模态大语言模型进行分布外检测导航

Haoran Xu, Yanlin Liu, Zizhao Tong, Jiaze Li, Kexue Fu, Yuyang Zhang, Longxiang Gao, Shuaiguang Li, Xingyu Li, Yanran Xu, Changwei Wang

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(教育部计算电力网络与信息安全重点实验室,山东计算机科学中心(国家超算中心济南中心),齐鲁工业大学(山东科学院)) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science(山东省计算电力互联网与服务计算重点实验室,山东省计算机科学基础研究中心) University of Electronic Science and Technology of China(电子科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) RWTH Aachen University(亚琛工业大学)

AI总结 本文提出MM-OOD方法,利用多模态大语言模型的推理能力,通过多轮对话增强分布外检测,提升近远OOD任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13644 2026-01-21 cs.CL cs.LG

Towards Token-Level Text Anomaly Detection

迈向词级文本异常检测

Yang Cao, Bicheng Yu, Sikun Yang, Ming Liu, Yujiu Yang

机构 * Great Bay University(大湾大学) Tsinghua University(清华大学) Shenzhen University(深圳大学) Dongguan Key Laboratory for AI and Dynamical Systems(东莞人工智能与动力系统重点实验室) Deakin University(德肯大学)

AI总结 本文提出词级文本异常检测方法,通过多层级统一框架实现精准定位,提升文本异常识别的细粒度分析能力。

Comments WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05839 2026-01-21 cs.CV

GeoSurDepth: Harnessing Foundation Model for Spatial Geometry Consistency-Oriented Self-Supervised Surround-View Depth Estimation

GeoSurDepth:利用基础模型实现以空间几何一致性为导向的自监督周围视图深度估计

Weimin Liu, Wenjun Wang, Joshua H. Meng

机构 * State Key Laboratory of Intelligent Green Vehicle and Mobility, School of Vehicle and Mobility, Tsinghua University, Beijing 100084, China(1 智能绿色车辆与移动国家重点实验室,车辆与移动学院,清华大学,北京100084,中国) California PATH, University of California, Berkeley, CA, United States(2 加州PATH,加州大学伯克利分校,加州,美国)

AI总结 GeoSurDepth通过利用基础模型和几何一致性,实现了更鲁棒的自监督周围视图深度估计,验证了其在自动驾驶中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19546 2026-01-21 cs.CV

ActAvatar: Temporally-Aware Precise Action Control for Talking Avatars

ActAvatar: 时空感知的精确动作控制用于对话虚拟角色

Ziqiao Peng, Yi Chen, Yifeng Ma, Guozhen Zhang, Zhiyao Sun, Zixiang Zhou, Youliang Zhang, Zhengguang Zhou, Zhaoxin Fan, Hongyan Liu, Yuan Zhou, Qinglin Lu, Jun He

机构 * Renmin University of China(中国人民大学) Tencent Hunyuan(腾讯文yne) Tsinghua University(清华大学)

AI总结 ActAvatar通过文本引导实现对话虚拟角色的相位级动作控制,引入相位感知交叉注意力、渐进式音频-视觉对齐和双阶段训练策略,提升动作控制精度和视觉质量。

Comments Project Page: https://ziqiaopeng.github.io/ActAvatar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18817 2026-01-21 cs.CV

Disc3D: Automatic Curation of High-Quality 3D Dialog Data via Discriminative Object Referring

Disc3D:通过判别性对象指称自动校准高质量3D对话数据

Siyuan Wei, Chunjie Wang, Xiao Liu, Xiaosheng Yan, Zhishan Zhou, Rui Huang

机构 * PICO, ByteDance, Beijing(字节跳动北京研究院) Tsinghua University(清华大学)

AI总结 Disc3D通过自动化流程生成高质量3D对话数据,解决视角和对象指称模糊性问题,提升多模态大语言模型性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04419 2026-01-21 cs.LG cs.AI cs.CL

Towards a Unified View of Large Language Model Post-Training

迈向大规模语言模型后训练的统一视角

Xingtai Lv, Yuxin Zuo, Youbang Sun, Hongyi Liu, Yuntian Wei, Zhekai Chen, Xuekai Zhu, Kaiyan Zhang, Bingning Wang, Ning Ding, Bowen Zhou

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) WeChat AI Code(微信AI代码)

AI总结 本文提出混合后训练算法,通过统一的优化过程整合在线与离线数据,实现稳定探索与有效利用演示,提升大规模语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01038 2026-01-21 eess.IV cs.CV cs.HC

An Integrated AI-Enabled System Using One Class Twin Cross Learning (OCT-X) for Early Gastric Cancer Detection

一种利用单类双交叉学习(OCT-X)的集成AI系统用于早期胃癌检测

Xian-Xian Liu, Yuanyuan Wei, Mingkun Xu, Yongze Guo, Hongwei Zhang, Huicong Dong, Qun Song, Qi Zhao, Wei Luo, Feng Tien, Juntao Gao, Simon Fong

机构 * Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) Department of Biomedical Engineering, The Chinese University of Hong Kong(香港中文大学生物医学工程系) Department of Neurology, David Geffen School of Medicine, University of California(加州大学洛杉矶分校神经医学系) Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Center for Brain-Inspired Computing Research (CBICR), Department of Precision Instrument, Tsinghua University(清华大学脑启发计算研究中心) Department of Gastroenterology, Affiliated Hospital of Hebei University of Engineering(河北工程大学附属医院消化内科) Institute of Artificial Intelligence, Chongqing Technology and Business University(重庆理工大学人工智能学院) Cancer Centre, Institute of Translational Medicine, Faculty of Health Sciences, University of Macau(澳门大学医学翻译中心癌症中心) MoE Frontiers Science Center for Precision Oncology, University of Macau(澳门教育暨青年事务局精准肿瘤学前沿科学中心) The director of the Institute of Clinical Medicine, The First People’s Hospital of Foshan(佛山第一人民医院临床医学研究所主任) Hebei Key Laboratory of Medical Data Science, Institute of Biomedical Informatics, School of Medicine, Hebei University of Engineering(河北工程大学医学数据科学重点实验室) The Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(清华大学北京信息科学与技术国家研究中心)

AI总结 本研究提出一种集成AI系统,利用OCT-X算法实现高准确率的早期胃癌检测,准确率达99.70%。

Comments 26 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12904 2026-01-21 cs.CL cs.AI

From Prefix Cache to Fusion RAG Cache: Accelerating LLM Inference in Retrieval-Augmented Generation

从前缀缓存到融合RAG缓存:加速检索增强生成中的LLM推理

Jiahao Wang, Weiyu Xie, Mingxing Zhang, Boxing Zhang, Jianwei Dong, Yuening Zhu, Chen Lin, Jinqi Tang, Yaochen Han, Zhiyuan Ai, Xianglin Chen, Yongwei Wu, Congfeng Jiang

机构 * Hangzhou Dianzi University(杭州电子科技大学) Tsinghua University(清华大学)

AI总结 FusionRAG通过优化RAG的预处理和重处理阶段,在保持生成质量的同时提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12762 2026-01-21 cs.SE cs.AI

Teaching LLMs to Learn Tool Trialing and Execution through Environment Interaction

通过环境交互教授LLMs学习工具尝试与执行

Xingjie Gao, Pengcheng Huang, Zhenghao Liu, Yukun Yan, Shuo Wang, Zulong Chen, Chen Qian, Ge Yu, Yu Gu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Alibaba Group(阿里巴巴集团) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 ToolMaster通过环境交互主动学习工具使用,提升LLMs在新工具上的泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12761 2026-01-21 cs.CV

Moaw: Unleashing Motion Awareness for Video Diffusion Models

Moaw:释放视频扩散模型中的运动感知

Tianqi Zhang, Ziyi Wang, Wenzhao Zheng, Weiliang Chen, Yuanhui Huang, Zhengyang Huang, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Beihang University(北航)

AI总结 Moaw通过训练视频扩散模型进行运动感知,实现零样本运动迁移,推动生成建模与运动理解的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12742 2026-01-21 cs.RO cs.AI

AirHunt: Bridging VLM Semantics and Continuous Planning for Efficient Aerial Object Navigation

AirHunt: 通过融合视觉语言模型语义与连续规划实现高效空中物体导航

Xuecheng Chen, Zongzhuo Liu, Jianfa Ma, Bang Du, Tiantian Zhang, Xueqian Wang, Boyu Zhou

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Mechanical and Energy Engineering, Southern University of Science and Technology(南方科技大学机械与能源工程系) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) Department of Physics, Southern University of Science and Technology(南方科技大学物理系)

AI总结 AirHunt通过融合视觉语言模型语义与连续规划,实现高效空中物体导航,提升开放集物体定位的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12428 2026-01-21 cs.RO cs.CV

ReWorld: Multi-Dimensional Reward Modeling for Embodied World Models

ReWorld:面向具身世界模型的多维奖励建模

Baorui Peng, Wenyao Zhang, Liang Xu, Zekun Qi, Jiazhao Zhang, Hongsi Liu, Wenjun Zeng, Xin Jin

机构 * Eastern Institute of Technology(东部技术研究所) Georgia Institute of Technology(佐治亚理工学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

AI总结 ReWorld通过多维奖励建模提升具身世界模型的物理真实性和任务完成能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12317 2026-01-21 cs.LG cs.AI

Explanova: Automatically Discover Data Insights in N \times M Table via XAI Combined LLM Workflow

Explanova:通过XAI结合LLM工作流自动在N×M表格中发现数据洞察

Yiming Huang

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-罗克Quantin 国家信息与自动化研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室)

AI总结 Explanova通过结合XAI和LLM工作流,在N×M表格中实现更经济的自动数据洞察发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12710 2026-01-21 cs.CV

RIS-FUSION: Rethinking Text-Driven Infrared and Visible Image Fusion from the Perspective of Referring Image Segmentation

RIS-FUSION: 重新思考基于文本的红外和可见图像融合:从指代图像分割的角度

Siju Ma, Changsiyu Gong, Xiaofeng Fan, Yong Ma, Chengjie Jiang

机构 * Central University of Finance and Economics(中央财经大学) Tsinghua University(清华大学)

AI总结 RIS-FUSION通过联合优化融合与指代图像分割,提升基于文本的红外和可见图像融合性能,实现mIoU指标的显著提升。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16869 2026-01-21 cs.GR cs.CV

Controllable Video Generation: A Survey

可控视频生成:综述

Yue Ma, Kunyu Feng, Zhongyuan Hu, Xinyu Wang, Yucheng Wang, Mingzhe Zheng, Bingyuan Wang, Qinghe Wang, Xuanhua He, Hongfa Wang, Chenyang Zhu, Hongyu Liu, Yingqing He, Zeyu Wang, Zhifeng Li, Xiu Li, Sirui Han, Yike Guo, Wei Liu, Dan Xu, Linfeng Zhang, Qifeng Chen

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology(Guang Zhou)(香港科技大学(广州)) Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Tencent(腾讯)

AI总结 本文综述了可控视频生成领域,探讨了视频扩散模型中的控制机制及不同控制信号类型的方法分类。

Comments project page: https://github.com/mayuelala/Awesome-Controllable-Video-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13308 2026-01-21 cs.LG cs.AI cs.CL

Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space

在黑暗中寻求:通过测试时实例级策略梯度进行潜在空间推理

Hengli Li, Chenxi Li, Tong Wu, Xuekai Zhu, Yuxuan Wang, Zhaoxin Yu, Eric Hanchen Jiang, Song-Chun Zhu, Zixia Jia, Ying Nian Wu, Zilong Zheng

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) NLCo Lab, Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院NLCo实验室) Department of Automation, Tsinghua University(清华大学自动化系) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 LatentSeek通过测试时实例级策略梯度在潜在空间中提升LLM推理能力,展现高效且可扩展的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08341 2026-01-21 cs.AI cs.MA q-bio.GN

Benchmarking AI scientists for omics data driven biological discovery

对驱动生物发现的生物信息学数据的AI科学家进行基准测试

Erpai Luo, Jinmeng Jia, Yifan Xiong, Xiangyu Li, Xiaobo Guo, Baoqi Yu, Minsheng Hao, Lei Wei, Xuegong Zhang

机构 * MOE Key Laboratory of Bioinformatics(生物信息学国家重点实验室) Bioinformatics Division of BNRIST, Department of Automation(生物信息学部) Tsinghua University(清华大学) School of Software Engineering(软件学院) Beijing Jiaotong University(北京交通大学) Department of Physiology and Pathophysiology, School of Basic Medical Sciences(基础医学学院生理与病理生理学系) Capital Medical University(首都医科大学) Center for Synthetic and Systems Biology, School of Life Sciences and School of Medicine(合成与系统生物学中心,生命科学学院,医学院)

AI总结 BAISBench通过评估AI科学家在单细胞转录组数据上的表现,推动生物发现的AI研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12277 2026-01-21 cs.RO

An Efficient and Multi-Modal Navigation System with One-Step World Model

一种高效且多模态的导航系统与一步世界模型

Wangtian Shen, Ziyang Meng, Jinming Ma, Mingliang Zhou, Diyun Xiang

机构 * Tsinghua University(清华大学) Xiaomi (China)(小米(中国))

AI总结 本文提出了一种高效多模态导航系统,通过一步世界模型和3D U-Net骨干网络,提升导航效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12019 2026-01-21 cs.CL cs.AI

Acting Flatterers via LLMs Sycophancy: Combating Clickbait with LLMs Opposing-Stance Reasoning

通过LLMs的趋炎附势行为进行煽动性行为:用LLMs的对立立场推理对抗软文

Chaowei Zhang, Xiansheng Luo, Zewei Zhang, Yi Zhu, Jipeng Qiang, Longwei Wang

机构 * Yangzhou University(扬州大学) Auburn University(亚伯拉罕大学) University of South Dakota(南达科他大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗quentourt研究所) Rajiv Gandhi University(拉贾夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

AI总结 本文提出利用LLMs的趋炎附势行为生成对立立场推理,以提升软文检测的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11977 2026-01-21 cs.LG cs.AI

One-Shot Price Forecasting with Covariate-Guided Experts under Privacy Constraints

具有隐私约束的协变量引导专家的单次价格预测

Ren He, Yinliang Xu, Jinfeng Wang, Jeremy Watson, Jian Song

机构 * Tsinghua University(清华大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Ltd.(有限公司) Guangdong Power Grid Co.(广东电网公司) University of Canterbury(坎特伯雷大学) Department of Electrical(电气工程系) Department of Electrical Engineering(电气工程系)

AI总结 本文提出MoE编码器模块,通过引入稀疏混合专家层,提升电力系统中多变量预测的准确性和隐私保护能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11954 2026-01-21 cs.LG

Data-centric Prompt Tuning for Dynamic Graphs

面向动态图的数据导向提示微调

Yufei Peng, Cheng Yang, Zhengjie Fan, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

AI总结 DDGPrompt通过数据导向的提示框架优化动态图节点嵌入,提升在少样本和冷启动场景下的适应性与性能。

Comments CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11637 2026-01-21 cs.CV

Evaluating Self-Correcting Vision Agents Through Quantitative and Qualitative Metrics

通过定量和定性指标评估自我纠正的视觉代理

Aradhya Dixit

机构 * The Thørväld Group(Thørväld集团) Inria Paris-Rocquencourt(巴黎-罗克琴堡Inria) Rajiv Gandhi University Doimukh(拉贾·甘地大学多伊穆克) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒姆研究实验室) The Kumquat Consortium(昆夸特联盟)

AI总结 本文提出诊断微基准测试,通过量化和定性指标评估视觉代理的自我纠正能力,揭示语义漂移是主要瓶颈,并定义可重复的框架以提升多模态代理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08626 2026-01-21 cs.CL

How Order-Sensitive Are LLMs? OrderProbe for Deterministic Structural Reconstruction

大语言模型对顺序敏感性如何?OrderProbe用于确定性结构重建

Yingjie He, Zhaolu Kang, Kehan Jiang, Qianyuan Zhang, Jiachen Qian, Chunlei Meng, Yujie Feng, Yuan Wang, Jiabao Dou, Aming Wu, Leqi Zheng, Pengxiang Zhao, Jiaxin Liu, Zeyu Zhang, Lei Wang, Guansu Wang, Qishi Zhan, Xiaomin He, Meisheng Zhang, Jianyuan Ni

机构 * Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) City University of Hong Kong(香港城市大学) Fudan University(复旦大学) The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Marquette University(马凯特大学) Juniata College(朱尼阿特学院)

AI总结 研究通过OrderProbe基准评估大语言模型对输入顺序的敏感性,发现即使在前沿模型上,结构重建仍面临挑战,且语义能力与结构鲁棒性存在脱节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06474 2026-01-21 cs.CV cs.AI

SparseOccVLA: Bridging Occupancy and Vision-Language Models via Sparse Queries for Unified 4D Scene Understanding and Planning

SparseOccVLA: 通过稀疏查询弥合占用与视觉语言模型之间的鸿沟,实现统一的4D场景理解和规划

Chenxu Dang, Jie Wang, Guang Li, Zhiwen Hou, Zihan You, Hangjun Ye, Jie Ma, Long Chen, Yan Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

AI总结 SparseOccVLA通过稀疏查询整合视觉语言模型与语义占用,实现统一的4D场景理解和规划,提升自动驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21046 2026-01-21 cs.AI

A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence

自我进化代理的综述:何时、何地、如何进化以实现人工超级智能

Huan-ang Gao, Jiayi Geng, Wenyue Hua, Mengkang Hu, Xinzhe Juan, Hongzhang Liu, Shilong Liu, Jiahao Qiu, Xuan Qi, Yiran Wu, Hongru Wang, Han Xiao, Yuhang Zhou, Shaokun Zhang, Jiayi Zhang, Jinyu Xiang, Yixiong Fang, Qiwen Zhao, Dongrui Liu, Qihan Ren, Cheng Qian, Zhenhailong Wang, Minda Hu, Huazheng Wang, Qingyun Wu, Heng Ji, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Princeton AI Lab(普林斯顿人工智能实验室) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) University of Sydney(悉尼大学) Shanghai Jiao Tong University(上海交通大学) Pennsylvania State University(宾夕法尼亚州立大学) University of Michigan(密歇根大学) Oregon State University(俄勒冈州立大学) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The University of Hong Kong(香港大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California San Diego(加州大学圣地亚哥分校) University of Edinburgh(爱丁堡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文综述了自我进化代理的现状,探讨了进化机制、适应方法及挑战,为实现人工超级智能提供路线图。

Comments 77 pages, 9 figures, Transactions on Machine Learning Research (01/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16396 2026-01-21 cs.CV

VRP-UDF: Towards Unbiased Learning of Unsigned Distance Functions from Multi-view Images with Volume Rendering Priors

VRP-UDF: 向多视图图像中通过体积渲染先验实现无偏的无符号距离函数学习

Wenyuan Zhang, Chunsheng Wang, Kanle Shi, Yu-Shen Liu, Zhizhong Han

机构 * School of Software, Tsinghua University(清华大学软件学院) China Telecom Wanwei Information Technology Co., Ltd.(中国电信万维信息技术有限公司) Kuaishou Technology(快手技术) Department of Computer Science, Wayne State University(韦恩州立大学计算机科学系)

AI总结 VRP-UDF通过引入体积渲染先验,解决多视图图像中无偏学习无符号距离函数的问题,提升表面重建的鲁棒性和可扩展性。

Comments Accepted by TPAMI 2026 and ECCV 2024. Project page: https://wen-yuan-zhang.github.io/VolumeRenderingPriors/ . v1 is the conference version, and v2 is the journal extension version

详情

展开后加载摘要…

URL PDF HTML 收藏