arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-08-27 至 2026-08-27 共收录 8
2608.25733 2026-08-27 cs.CV 新提交

MIMONet: Multi-scale Input and Multi-scale Output Network for Salient Object Detection

MIMONet:用于显著目标检测的多尺度输入与多尺度输出网络

Zhaojian Yao, Wei Gao, Tiesong Zhao, Hui Yuan, Sam Kwong

机构 * School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院) Peng Cheng Laboratory(鹏城实验室) College of Physics and Information Engineering, Fuzhou University(福州大学物理与信息工程学院) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

AI总结 针对现有显著目标检测模型难以学习目标尺寸变化的问题,提出MIMONet,通过多尺度输入分支、MSP模块与JSL损失提升检测性能,在多数据集上取得更优结果,代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25622 2026-08-27 cs.CV cs.CL 新提交

Plans You Can Check: Verifier-Grounded Learning of an Open-Weight Planner for Executable Video-Editing

可核查的方案:基于验证器的可执行视频编辑开放权重规划器学习

Haoyu Wang, Cheng Feng, Liuyang Bian, Ruiyang Huang, Lei Wei, Yafei Wen, Xiaoxin Chen, Xiaoying Tang

机构 * School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) vivo AI Lab(vivo AI实验室) University of the Chinese Academy of Sciences(中国科学院大学) Southeast University(东南大学) Peking University(北京大学) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence, CUHK-Shenzhen(香港中文大学(深圳)广东省未来智能网络重点实验室)

AI总结 针对可执行视频编辑规划问题,提出基于验证器的RefineCut及RefineCut-Evo方法,训练8B开放权重规划器,在基准上取得优于前沿模型的效果,代码与基准已公开。

Comments Accepted to the Main Conference of EMNLP '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25621 2026-08-27 cs.SD cs.AI 新提交

Dissonance Spectrum explicitly models perceptual frequency interactions for better music understanding

不协和频谱(Dissonance Spectrum,DS):显式建模感知频率交互以实现更好的音乐理解

Tianle Wang, Xinyi Tong, Liangke Zhao, Jishang Chen, Sirui Zhang, Haoxin Zhang, Xin Jin, Duo Xu, Xiaobing Li, Song-Chun Zhu

机构 * Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Central Conservatory of Music(中央音乐学院) Peking University(北京大学)

AI总结 本文提出不协和频谱(DS)这一时频表示,经实验验证其在音乐相关任务中性能优于基线等方法,可作为音乐理解的可解释互补表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25583 2026-08-27 cs.CL 新提交

GRIP: Granular Reward-Guided Parameter Interpolation for Efficient Reasoning

GRIP:用于高效推理的粒度奖励引导参数插值

Lam So, Canhui Wu, Han Lin

机构 * Peking University(北京大学) Xi’an Jiaotong University(西安交通大学)

AI总结 针对推理模型与指令模型的准确性-效率不匹配问题,提出GRIP框架,通过优化同架构两模型模块的可学习插值比例,实现更优的准确性-效率权衡。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25479 2026-08-27 cs.CV cs.AI 新提交

4DStreamCtrl: Interactive Video Generation with Online 4D Control

4DStreamCtrl:基于在线4D控制的交互式视频生成

Shiqian Li, Chenguo Lin, Zhiguang Liu, Yu Tang, Jiarong Ou, Rui Chen, Yixin Zhu

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯混元)

AI总结 4DStreamCtrl将相机运动、物体轨迹与深度统一为3D点轨迹表示,结合蒸馏的因果流式模型,首次实现交互式4D可控实时视频生成,精度与效率均优于现有方法。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25417 2026-08-27 cs.AI 新提交

Paint What You See: Benchmarking Dexterous Visual Tool Use in Multimodal Agents

绘制你所见:多模态智能体的灵巧视觉工具使用基准测试

Shudong Liu, Dongyang Chen, Enci Zhang, Jinwei Liang, Zheng Ma, Lewei Lu

机构 * Peking University(北京大学) Tsinghua University(清华大学) SenseTime Research(商汤科技研究院)

AI总结 本文提出名为EASEL的基准测试,结合44万样本的EASEL-Data数据集与EASEL-9B模型,评估多模态智能体的灵巧视觉工具使用能力,发现现有25个模型在该任务上表现不佳,EASEL-9B相对基础模型提升6.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24946 2026-08-27 cs.LG 新提交

MacroAgent: Regularity-Aware Macro Legalization with LLM-Agent-Designed Contour Algorithms

MacroAgent:结合大语言模型智能体设计轮廓算法的感知规则性宏合法化方法

Jiaxi Jiang, Xufeng Yao, Yuxuan Zhao, Yuntao Lu, Peiyu Liao, Zuodong Zhang, Yibo Lin, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学)

AI总结 MacroAgent是结合LLM智能体设计轮廓算法的四阶段宏合法化框架,在TILOS、Chipyard等基准及Cadence Innovus工具上,实现布局规则性、布线长度等指标的显著提升与更好鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25472 2026-08-27 cs.CV physics.med-ph 新提交

PAGS: Autofocusing Photoacoustic Tomography via Speed-of-Sound-Adaptive Gaussian Splatting

PAGS:基于声速自适应高斯溅射的光声断层扫描自动聚焦

Jiarui Ge, Jintao Ma, Bangxu Fan, Jinyan Zhang, Xiaokang Yang, Shuai Na, Xiaoyun Yuan

机构 * Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) National Biomedical Imaging Center(国家生物医学成像中心) Academy for Advanced Interdisciplinary Studies, Peking University(北京大学前沿交叉学科研究院) PKU–Nanjing Institute of Translational Medicine(北京大学南京转化医学研究院)

AI总结 PAGS是基于声速自适应高斯溅射的可微分框架,无需声速先验,通过联合优化高斯光声源与声速场,提升了异质介质下光声断层扫描的重建清晰度与稀疏视图鲁棒性,且计算效率更高。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏