arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-04-17 至 2026-04-17 共收录 12
2604.15309 2026-04-17 cs.CV cs.AI cs.CL

MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation

MM-WebAgent:一种用于网页生成的分层多模态网络代理

Yan Li, Zezi Zeng, Yifan Yang, Yuqing Yang, Ning Liao, Weiwei Guo, Lili Qiu, Mingxi Cheng, Qi Dai, Zhendong Wang, Zhengyuan Yang, Xue Yang, Ji Li, Lijuan Wang, Chong Luo

机构 * Shanghai Jiao Tong University(上海交通大学) Xi'an Jiaotong University(西安交通大学) Tongji University(同济大学) Microsoft Corporation(微软公司)

AI总结 本文提出MM-WebAgent,一种分层多模态网页生成框架,通过分层规划和迭代自反思协调AIGC元素生成,提升网页全局布局与视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15188 2026-04-17 cs.CV cs.AI

VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models

VisPCO:通过预算感知的帕累托前沿学习实现视觉令牌修剪配置优化

Huawei Ji, Yuanhao Sun, Yuan Jin, Cheng Deng, Jiaxin Ding, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学)

AI总结 本文提出VisPCO框架,通过将视觉令牌修剪问题建模为帕累托配置优化问题,自动识别最优配置。实验表明,该方法在8个视觉基准上有效逼近帕累托前沿,并在不同修剪方法和VLM架构中泛化良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14965 2026-04-17 cs.RO

POMDP-based Object Search with Growing State Space and Hybrid Action Domain

基于增长状态空间和混合动作域的POMDP目标搜索

Yongbo Chen, Hesheng Wang, Shoudong Huang, Hanna Kurniawati

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Shanghai, 200240, People's Republic of China(自动化与智能感知学院,上海交通大学,上海,200240,中华人民共和国) School of Computing, Australian National University (ANU), Canberra, ACT, 2601, Australia(计算学院,澳大利亚国立大学(ANU),堪培拉,ACT,2601,澳大利亚) Key Laboratory of System Control and Information Processing, Ministry of Education of China, Shanghai, 200240, People's Republic of China(系统控制与信息处理重点实验室,中华人民共和国教育部,上海,200240,中华人民共和国) Robotics Institute, University of Technology Sydney, Australia(机器人研究所,悉尼技术大学,澳大利亚)

AI总结 本文提出GNPF-kCT算法,通过结合神经过程网络和k中心聚类,解决复杂室内环境中移动机器人高效定位目标物体的问题,实验证明其在目标搜索任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14922 2026-04-17 cs.LG cs.CL

LongAct: Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning

LongAct:利用内在激活模式促进长上下文强化学习

Bowen Ping, Zijun Chen, Tingfeng Hui, Qize Yu, Chenxuan Li, Junchi Yan, Baobao Chang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文提出LongAct方法,通过利用长上下文推理中的稀疏结构,改进大语言模型的训练,提升长上下文处理能力与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12389 2026-04-17 cs.AI cs.CL

Evolving Beyond Snapshots: Harmonizing Structure and Sequence via Entity State Tuning for Temporal Knowledge Graph Forecasting

超越快照:通过实体状态调谐实现结构与序列的和谐统一以进行时间知识图谱预测

Siyuan Li, Yunjia Wu, Yiyong Xiao, Pingyang Huang, Peize Li, Ruitong Liu, Yan Wen, Te Sun

机构 * Dalian University of Technology(大连理工大学) Shenzhen University of Advanced Technology(深圳先进技术大学) King’s College London(伦敦大学国王学院) Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Entity State Tuning框架,通过维持全局状态缓冲区和闭环设计,实现时间知识图谱预测中的持久化和持续进化实体状态,提升长周期预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15066 2026-04-17 cs.LG cs.AI cs.MM

Time-RA: Towards Time Series Reasoning for Anomaly Diagnosis with LLM Feedback

Time-RA:面向时间序列推理的异常诊断方法:基于LLM反馈

Yiyuan Yang, Zichuan Liu, Lei Song, Kai Ying, Zhiguang Wang, Tom Bamford, Svitlana Vyetrenko, Jiang Bian, Qingsong Wen

机构 * University of Oxford(牛津大学) Nanjing University(南京大学) MSRA(微软研究院) SJTU(上海交通大学) Abel AI Outsampler University of Strasbourg(斯特拉斯堡大学) Squirrel Ai Learning(Squirrel AI学习)

AI总结 本文提出Time-RA,通过引入RATs40K多模态数据集,改进时间序列异常检测的生成式推理方法,提升诊断准确性和解释性,实现可解释的多模态时间序列分析。

Comments ACL 2026 Findings. 27 pages, 11 figures, 15 tables. Code and dataset are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14885 2026-04-17 cs.CL cs.AI

RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding

RACER:检索增强的上下文快速推测解码

Zihong Zhang, Zuchao Li, Lefei Zhang, Ping Wang, Hai Zhao

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Computer Science, Wuhan University(武汉大学计算机学院) School of Information Management, Wuhan University(武汉大学信息管理学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院)

AI总结 RACER通过整合检索的精确模式与logit驱动的未来提示,提升大语言模型的推理效率,实现超过2倍的加速,优于现有无训练方法。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14847 2026-04-17 cs.AI

TrigReason: Trigger-Based Collaboration between Small and Large Reasoning Models

TrigReason:基于触发的大小推理模型协作

Yi Zhao, Yajuan Peng, Cam-Tu Nguyen, Zuchao Li, Xiaoliang Wang, Xiaoming Fu, Hai Zhao

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(AGI研究院,计算机科学学院,上海交通大学,上海,中国) Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering, Shanghai Jiao Tong University, Shanghai, China(上海市教育委员会智能交互与认知工程重点实验室,上海交通大学,上海,中国) Shanghai Key Laboratory for Intelligent Information Processing, Fudan University(上海市智能信息处理重点实验室,复旦大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Wuhan University(人工智能学院,武汉大学) Institute of Computer Science, University of Göttingen, Göttingen, Germany(计算机科学研究所,哥廷根大学,哥廷根,德国)

AI总结 本文提出TrigReason框架,通过触发机制将大部分推理任务交给小型模型,仅在必要时调用大模型,提升推理效率与准确性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14795 2026-04-17 cs.RO

Keep It CALM: Toward Calibration-Free Kilometer-Level SLAM with Visual Geometry Foundation Models via an Assistant Eye

保持冷静:通过视觉几何基础模型实现无校准的千米级SLAM

Tianjun Zhang, Fengyi Zhang, Tianchen Deng, Lin Zhang, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, and Shanghai Key Laboratory of Navigation and Location Based Services, Shanghai Jiao Tong University(自动化与智能感知学院,导航与位置服务上海市重点实验室,上海交通大学) School of Electrical Engineering and Computer Science, The University of Queensland(电气工程与计算机科学学院,昆士兰大学) School of Computer Science and Technology, Tongji University(计算机科学与技术学院,同济大学)

AI总结 本文提出CAL2M框架,通过引入'助手眼'消除尺度模糊,利用epipolar引导模型修正内参和姿态,结合锚点传播实现全局一致的映射,解决传统方法在千米级SLAM中的精度问题。

Comments 19 pages, 8 figures, submitted to IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14560 2026-04-17 cs.CV

DVFace: Spatio-Temporal Dual-Prior Diffusion for Video Face Restoration

DVFace:时空双先验扩散用于视频面部修复

Zheng Chen, Bowen Chai, Rongjun Gao, Mingtao Nie, Xi Li, Bingnan Duan, Jianping Fang, Xiaohong Liu, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiaotong University(上海交通大学)

AI总结 本文提出DVFace,一种单步扩散框架,通过时空双代码本设计提取互补的空间和时间面部先验,提升视频面部修复的质量、时间一致性和身份保持。

Comments Code is available at: https://github.com/zhengchen1999/DVFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10548 2026-04-17 cs.RO

Simple but Stable, Fast and Safe: Achieve End-to-end Control by High-Fidelity Differentiable Simulation

简单但稳定、快速且安全:通过高保真可微模拟实现端到端控制

Fanxing Li, Shengyang Wang, Yuxiang Huang, Fangyu Sun, Shuyu Wu, Yufei Yan, Danping Zou, Wenxian Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Kunshan Duke University(昆山杜克大学)

AI总结 本文提出一种端到端策略,通过可微模拟直接将深度图像映射为低级身体速率指令,提升四旋翼飞行器的避障能力与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24284 2026-04-17 cs.AI

MCP-Flow: Facilitating LLM Agents to Master Real-World, Diverse and Scaling MCP Tools

MCP-Flow:帮助LLM代理掌握现实世界、多样且可扩展的MCP工具

Wenhao Wang, Peizhi Niu, Zhao Xu, Zhaoyu Chen, Jian Du, Yaxin Du, Xianghe Pang, Keduan Huang, Yanfeng Wang, Qiang Yan, Siheng Chen

机构 * TikTok Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Illinois at Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 MCP-Flow通过自动化流程提升LLM在现实世界MCP环境中的能力,通过大规模服务器发现、数据合成和模型训练,生成高质量指令-功能调用对和轨迹,推动代理任务性能提升。

Comments ACL 2026 Main, Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏