arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3167
2608.18063 2026-08-19 cs.CV 新提交

EDITBRIDGE: Towards Faithful and Efficient Ultra-High-Resolution Image Editing

EditBridge:迈向忠实且高效的超高清图像编辑

Jiayi Song, Shijie Huang, Fangtai Wu, Yubo Huang, Zhenxiong Tan, Songhua Liu, Jiaming Liu, Ruihua Huang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) National University of Singapore(新加坡国立大学)

AI总结 针对现有扩散图像编辑模型无法高效处理超高清图像的问题,提出EditBridge扩散桥框架,通过先验引导的块级稀疏注意力机制实现4K高保真编辑,速度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18034 2026-08-19 cs.CV 新提交

Deep Academic Survey: Stateful Agentic Closed-Loop Paradigm for Academic Survey Automation

深度学术调查:用于学术调查自动化的有状态智能体闭环范式

Zhikai Xu, Zhucun Xue, Teng Hu, Yabiao Wang, Yong Liu, Jiangning Zhang

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究提出DAS框架,通过状态智能体闭环实现学术调查自动化,在DAS-Bench基准测试中,其在引用质量等四维度得分及专家评估中均优于现有系统。

Comments Project page: this https URL (https://zhikaixu24.github.io/projects/DAS/) | Code: this https URL (https://github.com/ZhikaiXu24/DAS) | Data: this https URL (https://huggingface.co/datasets/ZhikaiXu24/DAS-2M)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17995 2026-08-19 cs.CV 新提交

AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation

AViTS:用于高效动态分辨率生成的自适应时空令牌选择

Haoran Qin, Zhengan Yan, Shikang Zheng, Xiaobing Tu, Jiacheng Liu, Yuqi Lin, Chang Zou, JinShan Liu, Peiliang Cai, Xiantao Zhang, Jinkui Ren, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Terminal Intelligent Computing Division, Alibaba Cloud(阿里云终端智能计算事业部) Jilin University(吉林大学) Xi’an Jiaotong University(西安交通大学)

AI总结 该研究针对扩散变换器动态分辨率采样的冗余计算问题,提出AViTS框架,通过时空重要性感知的选择性上采样减少冗余,在FLUX等模型上实现显著加速且与其他优化技术兼容

Comments Accepted to ECCV 2026. 20 pages including appendix. Code: this https URL (https://github.com/QHR69/AViTS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17973 2026-08-19 cs.CV 新提交

LinCa: Accelerating Diffusion Models via Learnable Decomposed Feature Caching

LinCa:基于可学习分解特征缓存的扩散模型加速方法

Jinshan Liu, Haoran Qin, Xiaobing Tu, Jiacheng Liu, Jiahui Hu, Zhengan Yan, Yukun Xie, Kerui Shen, Jinkui Ren, Yuqi Lin, Xiantao Zhang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Terminal Intelligent Computing Division, Alibaba Cloud(阿里云终端智能计算事业部) South China University of Technology(华南理工大学) Jilin University(吉林大学)

AI总结 本文提出LinCa框架,通过可学习可逆网络分解缓存特征并差异化预测,仅需少量额外参数即可在5-7倍加速下使扩散模型保持近无损质量,性能优于现有方法。

Comments Accepted to ECCV 2026. 28 pages including appendix. Code: this https URL (https://github.com/QHR69/LinCa)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17911 2026-08-19 cs.CL 新提交

CABLE: Extending the Reach of Memory Retrieval via Complementary Antecedent-Based Linking and Expansion

CABLE:通过基于互补前项的链接与扩展扩展记忆检索的覆盖范围

Zheling Tan, Jin Gao, Dequan Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 CABLE是一种插件式记忆检索增强模块,通过构建互补关联扩展检索覆盖范围,在多个模型和数据集上的系统级评估中提升了证据可及性的LLM评判分数。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17535 2026-08-19 cs.CV 新提交

GroupForward: Building Referable 3D Scenes via Instance-Grouped Feed-Forward Gaussian Splatting

GroupForward:通过实例分组前馈高斯溅射构建可参考的3D场景

Qijian Tian, Zimeng Wu, Xuhong Wang, Lizhuang Ma, Xin Tan

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

AI总结 GroupForward是一种实例分组前馈高斯溅射模型,可从稀疏多视图图像重建3D场景,结合RSRF实现复杂3D参考推理,提升了语义重建与参考推理的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17468 2026-08-19 cs.AI 新提交

SAGE: Self-Evolving Storyboard Skills via Attribution-Guided Rule Evolution

SAGE:基于归因引导规则演化的自演进分镜脚本技能

Maolin Ran, Xiaoyang Lu, Jiaqi Liu, Jian Wang, Weiwen Liu, Jianghao Lin, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) CreativeFitting(创意拟合)

AI总结 针对分镜脚本制作的工业瓶颈,提出SAGE框架,通过归因引导规则演化实现导演知识的自演进,在测试中表现接近专业导演,部署后大幅提升制作效率,还发布了首个相关公开数据集PROSE

Comments 11 pages, 9 figures, 4 tables. Dataset available at this https URL (https://github.com/creDreams/PROSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17420 2026-08-19 cs.CV 新提交

SPVC: Structured and Panoptic Video Fixing for Cross-Dataset Driving Scene Rendering

SPVC:面向跨数据集驾驶场景渲染的结构化全景视频修复

Gen Li, Shu Han, Yun Xi Qiao, Hua Chen, Xuyang Dai, Bohan Li, Hao Zhao, Chaojian Li

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Zhejiang University(浙江大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Great Wall Motor Company Limited(长城汽车股份有限公司) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出SPVC框架,通过结构化、全景、视频及跨数据集修复原则,训练两阶段可控视频扩散模型,解决驾驶场景渲染的伪影问题,实现跨数据集的高效修复。

Comments Project page: this https URL (https://li00147.github.io/SPVC-Project-Page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17209 2026-08-19 cs.RO cs.AI cs.CV cs.LG 新提交

Teach and Grow: An Agent-Centered Architecture for General Robot Learning

教学与成长:面向通用机器人学习的智能体中心架构

Chang Nie, Zhe Liu, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

AI总结 该研究提出TGL智能体中心架构,通过将演示转化为可复用技能块,无需特定任务再训练即可实现通用机器人学习,在LIBERO评估中达SOTA性能,还提出相关缩放定律假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20784 2026-08-19 cs.CV 版本更新

GeoRect4D: Geometry-Compatible Generative Rectification for Dynamic Sparse-View 3D Reconstruction

GeoRect4D:几何兼容的生成性矩形化用于动态稀疏视角3D重建

Zhenlong Wu, Zihan Zheng, Xuanxuan Wang, Lei Huang, Hongwei Hu, Xiaoyun Zhang, Qiang Hu, Wenjun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出GeoRect4D框架,通过闭环优化结合显式3D一致性与生成性细化,解决动态稀疏视角3D重建中的几何崩溃和漂移问题,提升重建精度与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04061 2026-08-19 quant-ph cond-mat.stat-mech cs.LG 版本更新

Fermi-Dirac thermal measurements: A framework for quantum hypothesis testing and semidefinite optimization

费米-狄拉克热测量:量子假设检验和半定规划的框架

Nana Liu, Mark M. Wilde

机构 * Institute of Natural Sciences, Shanghai Jiao Tong University, Shanghai 200240, China(自然科学院,上海交通大学,上海) School of Mathematical Sciences, Shanghai Jiao Tong University, Shanghai, 200240, China(数学科学学院,上海交通大学,上海) Ministry of Education Key Laboratory in Scientific and Engineering Computing, Shanghai Jiao Tong University, Shanghai 200240, China(教育部科学与工程计算重点实验室,上海交通大学,上海) Global College, Shanghai Jiao Tong University, Shanghai 200240, China(全球学院,上海交通大学,上海) School of Electrical and Computer Engineering, Cornell University, Ithaca, New York 14850, USA(电气与计算机工程学院,康奈尔大学,纽约)

AI总结 该研究提出费米-狄拉克热测量作为量子假设检验和半定规划的新框架,通过热力学方法优化量子测量,构建了费米-狄拉克机模型。

Comments v2: 36 pages, 3 figures, various technical corrections introduced

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15455 2026-08-19 cs.MM cs.AI 版本更新

M3TR: Temporal Retrieval Enhanced Multi-Modal Micro-video Popularity Prediction

M3TR: 增强型多模态微视频流行度预测框架

Jiacheng Lu, Weijian Wang, Mingyuan Xiao, Yang Hua, Tao Song, Bo Peng, Cheng Hua, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) Queen's University Belfast(女王大学贝尔法斯特分校) Purdue University(普渡大学)

AI总结 M3TR通过结合精细时序建模与新颖的时序感知检索过程,提升微视频流行度预测的准确性与长期预测能力。

Comments Accepted by MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16765 2026-08-18 cs.CV cs.AI 新提交

TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation

TRACE-Bench:多参考图像生成的分解与诊断

Haoran Wang, Chaofan Ma, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 研究针对多参考图像生成基准的缺陷,构建TRACE-Bench基准,采用算子分解方法评估9个主流模型,发现解耦与属性绑定是核心瓶颈,最优模型属性保真度仅0.74

Comments Accepted to ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16756 2026-08-18 cs.CV 新提交

Binarized High-Efficiency RAW Video Restoration and Beyond

二值化高效RAW视频恢复及拓展

Tianyu Zhu, Ying Fu, Hesong Li, Gengchen Zhang, Xin Yuan, Yulun Zhang

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Chinese Aeronautical Establishment(中国航空研究院) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出二值化RAW视频恢复框架BinRVR,通过BIIM和DAB-Conv实现96%计算量与参数缩减,仅4%性能下降,在多项RAW视频恢复任务上表现具竞争力,还可拓展至下游视频应用。

Comments Accepted by TPAMI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16745 2026-08-18 cs.CV 新提交

VicEdit: Learning to Edit Videos from Visual In-Context Examples

VicEdit:从视觉上下文示例学习编辑视频

Yuji Wang, Teng Hu, Yuheng Chen, Ran Yi, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) Zhejiang University(浙江大学)

AI总结 针对文本指令视频编辑难以传达细粒度视觉信息的问题,提出视觉上下文编辑新范式,构建VicEdit-400K数据集,开发VicEdit框架,在VicEditBench上实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16717 2026-08-18 cs.CV 新提交

PersonaShot: Benchmarking Person-Centric Narrative Continuity in Multi-Shot Video Generation

PersonaShot:多镜头视频生成中以人为中心的叙事连续性基准

Yuji Wang, Yuheng Chen, Teng Hu, Ran Yi, Yijia Hong, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) Zhejiang University(浙江大学)

AI总结 该研究针对多镜头视频生成中角色叙事连续性评估的不足,推出PersonaShot基准,设计三类特定评估器,发现先进模型感知质量与跨镜头连续性存在差距,评估器与人类专家判断一致性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16465 2026-08-18 cs.AI 新提交

JailbreakSkill: Scaling Automated Red-Teaming with Reusable and Ever-Evolving Skills

JailbreakSkill:通过可复用且不断演进的技能扩展自动化红队测试

Xiaoyu Wen, Jiajia Li, Zhida He, Peng Yu, Chenxu Wang, Han Qi, Ziyuan Zhou, Cheng Jin, Ying Wen, Xingcheng Xu, Shuyue Hu, Tianhang Zheng, Chaochao Lu, Qiaosheng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 本研究提出以技能为核心的JailbreakSkill框架,将攻击策略打包为可复用技能,通过攻击与学习的闭环演进技能,大幅提升攻击成功率,且技能可泛化至未见过的提示词与目标模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16259 2026-08-18 cs.CV cs.AI 新提交

Defake-o3: From Speculative Rationales to Verifiable Evidence for Explainable AIGI Detection

Defake-o3:从推测性理由到可验证证据的可解释AIGI检测

Bowen Deng, Jiahui Zhan, Yikun Ji, Haozhen Yan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

AI总结 Defake-o3是结合交互式视觉搜索与证据验证器的可解释AIGI检测器,构建了GroundFake数据集和FakeFrontier基准,在多基准上同时提升了AIGI检测准确率与解释质量。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16234 2026-08-18 cs.CV 新提交

GaussianDWM++: Language-Grounded 3D Gaussian Driving World Model for Unified Scene Understanding, Editing, and Multi-Modal Generation

GaussianDWM++:用于统一场景理解、编辑与多模态生成的语言接地3D高斯驾驶世界模型

Tianchen Deng, Xuefeng Chen, Shuang Wu, Qu Chen, Jiajun Zhu, Bo Dai, Jianfei Yang, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Tsinghua University(清华大学) Chongqing Afari Intelligent Drive Co., Ltd.(重庆阿法瑞智能驾驶有限公司) Nanyang Technological University(南洋理工大学)

AI总结 该研究提出GaussianDWM++,通过基础特征高斯分词器等模块构建统一框架,在多类驾驶任务中实现场景理解、编辑与多模态生成,性能达当前最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16195 2026-08-18 cs.RO 新提交

RoboStriker: Latent-Space Strategic Games for Autonomous Humanoid Boxing

RoboStriker:用于自主人形机器人拳击的隐空间策略博弈

Kangning Yin, Kaige Liu, Zhe Cao, Wentao Dong, Weishuai Zeng, Tianyi Zhang, Qiang Zhang, Jingbo Wang, Jiangmiao Pang, Yang Li, Ming Zhou, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Huazhong University of Science and Technology(华中科技大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本研究提出RoboStriker框架,将人形拳击任务形式化为隐空间零和马尔可夫博弈,通过分层结构解耦推理与执行,实现了优于原始动作空间方法的战术性能并成功部署到现实人形机器人。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16164 2026-08-18 cs.AI cs.RO 新提交

Trajectory-Level Automatic Curriculum Learning for Legged Locomotion on Unstructured Terrain

非结构化地形四足机器人运动的轨迹级自动课程学习

Rocky Liu, Tengyu Liu, Baoxiong Jia, Fangwei Zhong, Xinyi Tong, Hongzhao Xie, Siyuan Huang

机构 * National Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室(BIGAI)) Beijing Normal University(北京师范大学) Communication University of China(中国传媒大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究针对非结构化地形四足机器人运动,提出轨迹级自动课程学习框架,通过生成地形轨迹任务形成闭环课程,显著提升了运动策略的轨迹成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16071 2026-08-18 cs.CL cs.IR 新提交

Skill2Query: Exploiting Skill Structure to Generate Pseudo-Queries for Agent Skill Retrieval

Skill2Query:利用技能结构生成智能体技能检索的伪查询

Lihui Ding, Zihan Guo, Bingwei Lu, Chenyu Zhou, Yuanjian Zhou, Weinan Zhang, Jianghao Lin, Dongdong Ge

机构 * Fudan University(复旦大学) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学)

AI总结 Skill2Query是利用技能知识图谱生成伪查询的框架,可提升多类检索性能,生成的训练数据表现最优,还能提高智能体任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16018 2026-08-18 cs.LG cs.AI 新提交

RagGAD: Rationale-Aware Conditional Gaussian Mixture Normalizing Flow for Unsupervised Graph Anomaly Detection

RagGAD:用于无监督图异常检测的依据感知条件高斯混合归一化流

Junxin Lu, Jing Zhao, Shiliang Sun

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) State Key Laboratory of Submarine Geoscience, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学海洋地质国家重点实验室、自动化与智能传感学院)

AI总结 针对现有图异常检测方法依赖同质性假设、鲁棒性不足的问题,提出RagGAD框架,通过依据解缠与混合建模提升性能,在多基准数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16008 2026-08-18 cs.CV 新提交

Spatial Temporal Synergy: Balancing Change and Invariance in Text Driven 3D Human Motion Editing

时空协同:文本驱动的三维人体动作编辑中变化与不变性的平衡

Shaohui Lin, Zhenwu Shi, Jingyu Gong, Jiao Xie, Yu Zhou, Baochang Zhang, Lizhuang Ma, Chia-Wen Lin

机构 * East China Normal University(华东师范大学) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) School of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海教育人工智能研究院) School of Statistics, East China Normal University(华东师范大学统计学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

AI总结 针对文本驱动3D人体动作编辑中变化与不变性难以平衡的问题,提出CIME框架,通过空间姿态和时间节奏维度的解耦实现最优性能,相关成果已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15636 2026-08-18 cs.RO cs.AI 新提交

Algorithm-Architecture Co-Design for Efficient VLA Inference via Speculative Inference and Verification

结合推测推理与验证的高效VLA推理的算法-架构协同设计

Chunyu Qi, Zhuoran Song, Jian Weng, Haozhe Jiang, Xueyuan Liu, Naifeng Jing, Guanghui He, Xiaoyao Liang, Haibing Guan

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Computer Science, King Abdullah University of Science and Technology(阿卜杜拉国王科技大学计算机科学学院)

AI总结 针对VLA模型推理延迟高、动作长度有限的问题,提出SpecVLA算法-架构协同框架,通过状态感知推理、sVLA验证模型与异构架构,在保持任务成功率的同时降低延迟,实现高效可靠的实时机器人操控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15522 2026-08-18 cs.CV 新提交

Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention

基于同步感知跨模态稀疏注意力的高效视听生成

Shengchuan Gao, Teng Hu, Bohao Feng, Luchen Li, Wenqiang Wang, Hongqian Deng, Ran Yi

机构 * Alibaba Group(阿里巴巴集团) Alibaba Cloud Computing(阿里巴巴云计算) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出同步感知加速框架,通过受保护的稀疏注意力策略在保留视听生成质量与同步性的同时提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15296 2026-08-18 cs.CV 新提交

FMReward: Aligning and Evaluating Audio-Driven 3D Facial Animation with Human Preferences

FMReward:基于人类偏好的音频驱动三维面部动画对齐与评估框架

Sijing Wu, Yunhao Li, Zhilin Gao, Huiyu Duan, Yucheng Zhu, Guangtao Zhai, Patrick Le Callet

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) USC-SJTU Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学 USC-文化创意产业学院) Institut Universitaire de France (IUF)(法国大学研究院) University of Nantes(南特大学)

AI总结 本文构建首个音频驱动三维面部动画人类偏好数据集FMPair,提出FMReward奖励模型与FMFL微调算法,可更好对齐人类偏好,提升该类动画的感知质量。

Comments Accepted for publication in IEEE TVCG, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15060 2026-08-18 cs.CV cs.RO 新提交

EgoTac: In-the-wild Tactile Prediction from Egocentric Vision

EgoTac:从第一视角视觉实现野外环境下的触觉预测

Wenkang Zhang, Chengbo Yuan, Zicheng Zhang, Zhengxue Cheng, Yang Gao

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Fudan University(复旦大学)

AI总结 本文提出EgoTac模型,利用超570万组图像-触觉对训练,可从第一视角视觉预测触觉,在域内及域外测试中性能优于现有方法,能为机器人学习提供触觉先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14783 2026-08-18 cs.CV cs.GR 新提交

MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling

MegaParts:通过令牌高效自回归建模将部件感知三维物体生成扩展至300个部件

Manwen Liao, Xinyu Lian, Jian Mao, Kaixu Chen, Li Luo, Jinghao Yan, Wanshui Gan, Qiao Yu, Weitian Zhang, Chunhua Shen, Guang Chen, Bo Dai, Xudong Xu, Zhaoyang Lyu

机构 * The University of Hong Kong(香港大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Tongji University(同济大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 MegaParts提出结合结构化序列建模与令牌高效矢量量化形状令牌化器的自回归框架,将部件感知3D生成扩展至300个部件,性能优于基线模型,为大规模部件感知3D生成提供新方案。

Comments 12 pages, 6 pages appendix, 13 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14683 2026-08-18 cs.LG 新提交

One Score, Two Decisions: Selective Prediction on the Rare-Disease Tail

一个分数,两个决策:针对罕见疾病尾部的选择性预测

Zhaoyang Jiang, Zhizhong Fu, Yunsoo Kim, Zicheng Li, Xuanqi Peng, Fei Teng, Jiacong Mi, Honghan Wu

机构 * School of Health & Wellbeing, University of Glasgow(格拉斯哥大学健康与福祉学院) Shanghai Sixth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第六人民医院) School of Life Science and Technology, University of Electronic Science and Technology of China(电子科技大学生命科学与技术学院)

AI总结 针对罕见疾病尾部的选择性预测,研究发现现有小型开放权重LLM在超罕见疾病上表现受限,前两位边际可提升部分病例选择性准确率,且仅未标记分数无法确定边际切换是否有益。

详情

展开后加载摘要…

URL PDF HTML 收藏