arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-04-09 至 2026-04-09 共收录 13
2604.06777 2026-04-09 cs.CV

Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization

行走与言说:通过多模态代理策略优化弥合图像推理与行动之间的差距

Wenhao Yang, Yu Xia, Jinlong Huang, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Yuchen Zhou, Xiaobo Xia, Yuanyu Wan, Lijun Zhang, Tat-Seng Chua

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) AI Business, Alibaba Group(阿里巴巴集团智能计算研究院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, China(上海交通大学自动化与智能感知学院) School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China(中山大学智能工程学院(深圳)) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院) School of Software Technology, Zhejiang University, China(浙江大学软件学院) School of Computing, National University of Singapore, Singapore, Singapore(新加坡国立大学计算机学院)

AI总结 本文提出MAPO方法,通过强制生成视觉内容的显式文本描述,结合语义对齐与任务奖励,提升多模态推理能力,实验表明其在多个视觉推理基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06695 2026-04-09 cs.AI

Reasoning Fails Where Step Flow Breaks

推理在步骤流断裂处失效

Xiaoyu Xu, Yulan Pan, Xiaosong Yuan, Zhihong Shen, Minghao Su, Yuanhao Su, Xiaofeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fuzhou University(福州大学) Jilin University(吉林大学)

AI总结 研究提出StepFlow方法,通过修复信息流提升多步骤数学、科学和编码任务的推理准确性,揭示了浅层锁定和深层衰减两种信息流失效模式。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06694 2026-04-09 cs.SD

AudioKV: KV Cache Eviction in Efficient Large Audio Language Models

AudioKV: 在高效大音频语言模型中实现KV缓存淘汰

Yuxuan Wang, Peize He, Xiyan Gui, Xiaoqian Liu, Junhao He, Xuyang Liu, Zichen Wen, Xuming Hu, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Xidian University(西安电子科技大学) HKUST (GZ)(香港科技大学(广州))

AI总结 本文提出AudioKV框架,通过硬件友好的语义-音频对齐机制优先处理音频关键注意力头,结合Spectral Score Smoothing技术提升缓存效率,实验表明其在压缩比40%时保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06612 2026-04-09 math.NA cs.LG cs.NA

Neural parametric representations for thin-shell shape optimisation

神经参数表示用于薄壳形状优化

Xiao Xiao, Fehmi Cirak

机构 * Shanghai Jiao Tong University(上海交通大学) University of Cambridge(剑桥大学)

AI总结 本文提出神经参数表示(NRep)用于薄壳结构的形状优化,通过梯度优化方法解决结构合规性问题,展示了其在复杂晶格皮肤结构中的潜力。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06393 2026-04-09 cs.CL

ART: Attention Replacement Technique to Improve Factuality in LLMs

ART:通过注意力替换技术提升大语言模型的事实性

Ziqin Luo, Yihao Quan, Xiaofeng Zhang, Xiaosong Yuan, Chen Shen

机构 * Department of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知系) Fudan University(复旦大学) Alibaba Cloud Computing(阿里云计算)

AI总结 本文提出ART技术,通过替换大语言模型浅层的均匀注意力模式为局部注意力模式,减少幻觉问题,适用于多种LLM架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06370 2026-04-09 cs.DC cs.LG

ForkKV: Scaling Multi-LoRA Agent Serving via Copy-on-Write Disaggregated KV Cache

ForkKV: 通过写时复制的 disaggregated KV 缓存实现多LoRA代理服务的扩展

Shao Wang, Rui Ren, Lin Gui

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 ForkKV通过写时复制机制解耦KV缓存,解决多LoRA代理服务中的内存瓶颈问题,提升吞吐量3倍且不影响生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06231 2026-04-09 cs.DB cs.AI cs.CL cs.IR cs.SE

Automating Database-Native Function Code Synthesis with LLMs

利用大型语言模型自动合成数据库原生函数代码

Wei Zhou, Xuanhe Zhou, Qikang He, Guoliang Li, Bingsheng He, Quanqing Xu, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出DBCooker系统,通过多模块协同解决数据库原生函数合成难题,实现更高精度的自动代码生成,实验显示在SQLite、PostgreSQL和DuckDB上准确率提升34.55%。

Comments Please visit our homepage at: https://code4db.github.io/hi-opencook/. The code is available at: https://github.com/weAIDB/OpenCook

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02721 2026-04-09 cs.CV cs.MM

Robust Mesh Saliency Ground Truth Acquisition in VR via View Cone Sampling and Manifold Diffusion

通过视锥采样和流形扩散在VR中实现鲁棒的网格显著性真实值获取

Guoquan Zheng, Jie Hao, Huiyu Duan, Long Tang, Shuo Yang, Yucheng Zhu, Yongming Han, Liang Yuan, Patrick Le Callet, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Chemical Technology(北京化工大学) Nantes University(南特大学)

AI总结 本文提出一种鲁棒框架,通过视锥采样和混合流形-欧几里得约束扩散算法,解决VR中3D网格显著性真实值获取的鲁棒性问题,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19433 2026-04-09 cs.CV

dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models

dMLLM-TTS:用于扩散多模态大语言模型的自验证和高效测试时间扩展

Yi Xin, Siqi Luo, Tianxiang Xu, Qi Qin, Haoxing Chen, Kaiwen Zhu, Zhiwei Zhang, Yangfan He, Rongchao Zhang, Jinbin Bai, Shuo Cao, Bin Fu, Junjun He, Yihao Liu, Yuewen Cao, Xiaohong Liu

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出dMLLM-TTS框架,通过轨迹探索扩展和迭代细化扩展两个互补的扩展轴,提升生成多样性和稳定性,同时通过自验证机制提高效率,实验表明在GenEval基准上生成质量显著提升且效率提高6倍。

Comments Project page: https://github.com/Alpha-VLLM/Lumina-DiMOO

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11663 2026-04-09 cs.LG cs.AI

SpecQuant: Spectral Decomposition and Adaptive Truncation for Ultra-Low-Bit LLMs Quantization

SpecQuant:基于频域分解和自适应截断的超低比特LLM量化

Zhixiong Zhao, Fangxin Liu, Junjie Wang, Chenyang Guan, Zongwu Wang, Li Jiang, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出SpecQuant框架,通过频域分解和自适应截断实现超低比特LLM量化,提升模型压缩效率与精度,实现4比特量化,准确率损失仅1.5%,推理速度提升2倍,内存使用降低3倍。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08409 2026-04-09 cs.AI

Faithful-First Reasoning, Planning, and Acting for Multimodal LLMs

多模态大语言模型中的忠实优先推理、规划与行动

Junxian Li, Xinyue Xu, Sai Ma, Di Zhang, Sichao Li

机构 * Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学) The Australian National University(澳大利亚国立大学) Fudan University(复旦大学) University of Sydney(悉尼大学)

AI总结 本文提出Faithful-First RPA框架,通过逐步监督提升多模态推理的忠实度,实验表明其在多个基准上提升了24%的感知忠实度,且不降低任务准确性。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07335 2026-04-09 cs.RO

TAMEn: Tactile-Aware Manipulation Engine for Closed-Loop Data Collection in Contact-Rich Tasks

TAMEn:用于接触密集任务闭环数据收集的触觉感知操作引擎

Longyan Wu, Jieji Ren, Chenghang Jiang, Junxi Zhou, Shijia Peng, Ran Huang, Guoying Gu, Li Chen, Hongyang Li

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) OpenDriveLab at The University of Hong Kong(香港大学OpenDriveLab) Shanghai Jiao Tong University(上海交通大学) East China University of Science and Technology(华东理工大学)

AI总结 本文提出TAMEn,通过双模采集管道和触觉-视觉学习框架,提升机器人双臂操作任务的闭环策略优化效果,实验表明任务成功率从34%提升至75%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.01574 2026-04-09 cs.CV

A Robust 3D Registration Method via Simultaneous Inlier Identification and Model Estimation

一种通过同时识别内点和模型估计的鲁棒3D配准方法

Xianyun Qian, Fei Wen, Peilin Liu

机构 * School of Information Science and Electronic Engineering / School of Integrated Circuits, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院/集成电路学院)

AI总结 本文提出了一种基于截断损失的鲁棒3D配准方法,通过同时识别内点和模型估计,降低拟合残差,采用交替最小化算法和半正定松弛方法提升鲁棒性,实验显示在高噪声和多异常情况下性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏