arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2025-12-05 至 2025-12-05 共收录 11
2512.04864 2025-12-05 cs.AI

Are Your Agents Upward Deceivers?

您的代理是向上欺骗者吗?

Dadi Guo, Qingyu Liu, Dongrui Liu, Qihan Ren, Shuai Shao, Tianyi Qiu, Haoran Li, Yi R. Fung, Zhongjie Ba, Juntao Dai, Jiaming Ji, Zhikai Chen, Jialing Tao, Yaodong Yang, Jing Shao, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Alibaba Group(阿里巴巴集团)

AI总结 研究发现基于LLM的代理可能通过欺骗行为隐瞒失败,需加强缓解策略以确保安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04857 2025-12-05 cs.CV

Autoregressive Image Generation Needs Only a Few Lines of Cached Tokens

自回归图像生成只需少量缓存的token

Ziran Qin, Youru Lv, Mingbao Lin, Zeren Zhang, Chanfan Gan, Tieyuan Chen, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Rakuten Peking University(北京大学)

AI总结 LineAR通过行级缓存压缩技术,在自回归图像生成中实现内存节省和吞吐量提升,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04837 2025-12-05 cs.CV

A Sanity Check for Multi-In-Domain Face Forgery Detection in the Real World

多域现实世界面部伪造检测的 sanity 检查

Jikang Cheng, Renye Yan, Zhiyuan Yan, Yaozhong Gan, Xueyi Zhang, Zhongyuan Wang, Wei Peng, Ling Liang

机构 * Peking University(北京大学) Nanjing University(南京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Wuhan University(武汉大学) Stanford University(斯坦福大学)

AI总结 本文提出多域现实世界面部伪造检测范式,通过DevDet框架提升真实伪造区分能力,实现在无域指定条件下的准确判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04830 2025-12-05 cs.CV

FreeGen: Feed-Forward Reconstruction-Generation Co-Training for Free-Viewpoint Driving Scene Synthesis

FreeGen: 用于自由视角驾驶场景合成的前馈重建-生成协同训练

Shijie Chen, Peixi Peng

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

AI总结 FreeGen通过重建-生成协同训练框架,提升自由视角驾驶场景合成的插值一致性与外推真实感,实现最先进的性能。

Comments Novel View Synthesis, Driving Scene, Free Trajectory, Image Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04711 2025-12-05 cs.SD cs.AI

Large Speech Model Enabled Semantic Communication

基于大语音模型的语义通信

Yun Tian, Zhijin Qin, Guocheng Lv, Ye Jin, Kaibin Huang, Zhu Han

机构 * School of Electronics, Peking University(北京大学电子学院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) Department of Computer Science and Engineering, Kyung Hee University(庆熙大学计算机科学与工程系)

AI总结 本文提出基于大语音模型的语义通信系统,利用Mimi编解码器和LoRA微调技术,实现适应性压缩与鲁棒传输,支持低带宽下的高质量语音传输。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04680 2025-12-05 cs.SE cs.AI cs.HC

Generative AI for Self-Adaptive Systems: State of the Art and Research Roadmap

生成式人工智能在自适应系统中的应用:现状与研究路线图

Jialong Li, Mingyue Zhang, Nianyu Li, Danny Weyns, Zhi Jin, Kenji Tei

机构 * Waseda University(早稻田大学) Southwest University(西南大学) Zhongguancun Laboratory(中关村实验室) Peking University(北京大学) Tokyo Institute of Technology(东京技术大学)

AI总结 本文探讨生成式人工智能在自适应系统中的应用现状与研究方向,分析其提升系统自主性和人机交互的潜力及挑战。

Comments Accepted by ACM Transactions on Autonomous and Adaptive Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04597 2025-12-05 cs.CV cs.AI cs.LG cs.RO

When Robots Should Say "I Don't Know": Benchmarking Abstention in Embodied Question Answering

机器人何时应说'我不知道':身体化问答中退避的基准测试

Tao Wu, Chuhao Zhou, Guangyu Zhao, Haozhi Cao, Yewen Pu, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学)

AI总结 本文研究了身体化问答中退避机制的重要性,通过构建AbstainEQA数据集,发现人类在退避任务中表现优异,而模型退避能力有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04515 2025-12-05 cs.CV

EgoLCD: Egocentric Video Generation with Long Context Diffusion

EgoLCD:基于长上下文扩散的自体视频生成

Liuzhou Zhang, Jiarui Ye, Yuanlei Wang, Ming Zhong, Mingju Cao, Wanke Xia, Bowen Zeng, Zeyu Zhang, Hao Tang

机构 * Peking University(北京大学) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学)

AI总结 EgoLCD通过结合长时稀疏KV缓存和LoRA扩展的注意力机制,实现了高效稳定的自体长上下文视频生成,提升了感知质量和时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04135 2025-12-05 cs.LG

Decoding Large Language Diffusion Models with Foreseeing Movement

通过预见性移动解码大语言扩散模型

Yichuan Mo, Quan Chen, Mingjie Li, Zeming Wei, Yisen Wang

机构 * State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室,智能科学与技术学院,北京大学) School of Mathematical Sciences, Peking University(数学学院,北京大学) CISPA Helmholtz Center for Information Security, Germany(信息安全赫尔姆霍兹中心,德国) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

AI总结 本文提出FDM和FDM-A方法,通过整合局部和全局考虑,提升大语言扩散模型的解码效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18533 2025-12-05 cs.CV

DE-KAN: A Kolmogorov Arnold Network with Dual Encoder for accurate 2D Teeth Segmentation

DE-KAN:一种带有双编码器的 Kolmogorov Arnold 网络用于准确的 2D 牙齿分割

Md Mizanur Rahman Mustakim, Jianwu Li, Sumya Bhuiyan, Mohammad Mehedi Hasan, Bing Han

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) National Engineering Research Center of Oral Biomaterials and Digital Medical Devices(口腔生物材料与数字医疗设备国家工程研究中心) Department of Statistics and Data Science, Jahangirnagar University(Jahangirnagar大学统计与数据科学系) Faculty of Information Technology, Beijing University of Technology(北京理工大学信息学院) Department of Orthodontics, Peking University School and Hospital of Stomatology, National Center for Stomatology, National Clinical Research Center for Oral Diseases, National Engineering Research Center of Oral Biomaterials and Digital Medical Devices(北京大学口腔医学院附属口腔医院、口腔疾病国家临床医学研究中心、口腔生物材料与数字医疗设备国家工程研究中心)

AI总结 DE-KAN 通过双编码器 Kolmogorov Arnold 网络实现高精度 2D 牙齿分割,实验显示其在 Dice 系数上比现有方法提升达 4.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01903 2025-12-05 cs.SD eess.AS

MelTok: 2D Tokenization for Single-Codebook Audio Compression

MelTok:单代码本音频压缩的2D分token化

Jingyi Li, Zhiyuan Zhao, Zhisheng Zhang, Yunfei Liu, Lijian Lin, Ye Zhu, Jiahao Wu, Qiuqiang Kong, Yu Li

机构 * International Digital Economy Academy (IDEA)(国际数字经济学院) Chinese University of Hong Kong(香港中文大学) Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院)

AI总结 MelTok通过二维分token化和基于分token的vocoder,实现单代码本下的高效音频压缩与高质量重建。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏