arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-09-01 至 2026-09-01 共收录 25
2608.31068 2026-09-01 cs.AI 新提交

Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores

错误预测,正确答案:从崩溃的大语言模型序列得分中恢复证据

Qiyao Yan, Chenpeng Wang, Liangming Pan

机构 * Peking University(北京大学) YiXin-AILab(艺心人工智能实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 该研究发现大语言模型推理失败多为表达缺陷而非逻辑缺失,提出无目标标签的加性校正方法,可恢复Qwen等模型的推理准确率,为基准评估提供更严谨解读。

Comments 20 pages, 4 figures, and 43 appendix tables. Research paper on language-model interpretability, reasoning evaluation, output-scoring bottlenecks, and label-free calibration. The paper evaluates controlled three-way logical reasoning tasks, ProofWriter, ANLI, and FOLIO using Qwen3.5, OLMo-2-1B, Llama-3.1-8B, and Pythia checkpoints

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30908 2026-09-01 cs.LG 新提交

Fine-Tuning Low-Bit Models with Gradient in Quantized Code Space

在量化代码空间中利用梯度微调低比特模型

Shiguang Wu, Zhouchen Lin, Quanming Yao

机构 * Tsinghua University(清华大学) Peking University(北京大学)

AI总结 该研究针对低比特模型微调的效率与部署适配问题,提出GradCodes方法,通过代码代理梯度加速优化并以引导搜索保证部署适配,在多任务上实现低比特模型微调性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30821 2026-09-01 cs.CV cs.AI 新提交

Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling

Lucida:用于可组合真实到仿真场景建模的解析、生成与放置

Minghan Qin, Yuang Wang, Xiuyu Yang, Yushi Long, Yujian Zhang, Ruihuan Wang, Kai Ye, Yangang Zhang, Hang Li

机构 * ByteDance Seed(字节跳动Seed) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 Lucida是一种可组合真实到仿真场景建模方法,通过重新分配流程要求,在三个步骤中利用真实采集的可靠信息,结合GizmoAct策略提升了场景建模相关任务的性能。

Comments Project Page: https://lucida-r2s.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30704 2026-09-01 cs.CV 新提交

TUE-Detector: A Tool-Using Expert MLLM-Based Detector for AI-Generated Videos

TUE-Detector:一种基于使用工具的专家多模态大语言模型(MLLM)的AI生成视频检测器

Yichen Wu, Haoxuan Qu, Yongxing Dai, Yan Bai, Yihang Lou, Yuqi Lin, Hossein Rahmani, Jun Liu

机构 * University of Nottingham(诺丁汉大学) Lancaster University(兰卡斯特大学) Peking University(北京大学)

AI总结 本研究针对AI生成视频检测中识别细微非自然伪影的挑战,提出TUE-Detector框架,将通用MLLM训练为使用工具的专家检测器,通过调用工具收集证据推理检测,经大量实验验证其有效性。

Comments 32 pages, 7 figures, 28 tables; includes supplementary material. Code: https://github.com/Louis-YW/TUE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30689 2026-09-01 cs.CV 新提交

CANVAS: Consistency-Aware Navigation via Visual Adaptive Sampling for Long-Context Text-to-SVG Generation

CANVAS:面向长上下文文本到SVG生成的一致性感知视觉自适应采样导航

Yichen Wu, Haoxuan Qu, Yihang Lou, Hossein Rahmani, Jun Liu

机构 * University of Nottingham(诺丁汉大学) Lancaster University(兰卡斯特大学) Peking University(北京大学)

AI总结 本文提出无训练的CANVAS框架,通过视觉自适应采样提升长上下文文本到SVG生成的全局一致性,无需额外训练即可在多基准上取得良好效果。

Comments 30 pages (including supplementary material), 9 figures, 10 tables. Code: https://github.com/Louis-YW/CANVAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30517 2026-09-01 cs.AI cs.CL 新提交

ScienceArena: Benchmarking LLMs on Latest Scientific Olympiad Competitions

ScienceArena:在最新科学奥林匹克竞赛上对大语言模型(LLM)进行基准测试

Guangxiang Zhao, Qilong Shi, Xusen Xiao, Wenpu Liu, Yaoming Li, Linfeng Hao, Shuyang Hou, Zijian Guo, Xinrui Zhang, Yuntian Zhao, Zhengyang Wang, Wenrui Liu, Yuhan Wu, Tong Yang, Lin Sun, Xiangzheng Zhang

机构 * Qiyuan Tech(奇安信科技) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Peking University(北京大学)

AI总结 本研究推出ScienceArena基准,涵盖多类科学竞赛,经专家审核构建并校准LLM评判者,评估14个LLM发现顶尖模型获奖牌级分数,化学与长程一致性仍为瓶颈。

Comments 18 pages, EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30498 2026-09-01 cs.AI 新提交

CM2: Multimodal Cultural Reasoning via an Integrated Multi-Agent Framework

CM2:基于集成多智能体框架的多模态文化推理

Qi Li, Zhaojie Kang, Yingjie He, Zheng Lin, Hao Zhang, Guangxin Wu, Yan Gong, Rong Fu, Jianyuan Ni

机构 * Lanzhou University(兰州大学) Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

AI总结 针对多模态大语言模型(MLLM)跨学科文化推理不足的问题,提出基于人类文化解释认知路径的CM2多智能体框架,在CM2D数据集上较CoT等范式取得一致提升,各模块贡献及跨模态仲裁能力均得到验证。

Comments Accepted to the 23rd Pacific Rim International Conference on Artificial Intelligence (PRICAI 2026) as a short paper. 11 pages, 4 figures. Code and dataset are available at https://github.com/GitHub-12138/CM2-Multimodal-Cultural-Reasoning-via-an-Integrated-Multi-Agent-Framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30478 2026-09-01 cs.CL 新提交

Agents in the Large: Perception-Centered Architecture for Persistent Agents

大型智能体:面向持久智能体的感知中心架构

Shihan Dou, Haoxiang Jia, Shichun Liu, Feng Chen, Chenhao Huang, Yujiong Shen, Shaofan Liu, Jiayi Chen, Jiahang Lin, Honglin Guo, Qianyu He, Minghao Guo, Ziyi Ye, Pluto Zhou, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Tencent(腾讯)

AI总结 该研究提出面向持久智能体的感知中心架构(Pera),用于刻画、组织和指导持久AI智能体的发展,类比软件工程的小型到大型编程,推动语言智能体向长期自适应智能系统演进。

Comments 41 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30396 2026-09-01 cs.AI cs.RO 新提交

Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation

将基础模型搭建为物理世界智能体以推动长时程导航前沿

Zixing Lei, Gengze Zhou, Xiong-Hui Chen, Jiazhao Zhang, Yiyang Huang, Hang Yin, Haoqi Yuan, Qi Wu, Weixin Li, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Inc(阿里巴巴集团) Zhongguancun Academy(中关村学院) Adelaide University(阿德莱德大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出NavMCP框架,结合VLM推理智能体与NFM执行器实现长时程导航,在多个具身问答基准及Unitree Go2机器人上取得优于基线的性能,验证了该方法的有效性。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30322 2026-09-01 cs.AI cs.CL 新提交

Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents

无知还是无能?构建面向大语言模型智能体的知识门控可验证任务

Hanlin Tian, Minhao Li, Yu Mi, Sihan Zhu, Zhao Yang, Yuxiang Wang, Hongquan Zhu, Qiufei Hu

机构 * DataGrids Shanghai University(上海大学) Peking University(北京大学) Northwestern Polytechnical University(西北工业大学) Nanyang Technological University(南洋理工大学) East China Normal University(华东师范大学)

AI总结 该研究针对大语言模型智能体任务缺乏对约定访问控制的问题,提出知识门控任务构建协议,经实验验证其有效性并发布部分任务套件与工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30241 2026-09-01 cs.CL cs.CV 新提交

PaperBanana-Interact: Scientific Diagram Refinement with Multi-Turn Human Feedback

PaperBanana-Interact:基于多轮人类反馈的科学图表优化

Xueqing Wu, Ashwin Balasubramanian, Bingxuan Li, Dawei Zhu, Kai-Wei Chang, Yale Song, Yiwen Song, Rui Meng, Tomas Pfister, Nanyun Peng

机构 * Google(谷歌公司) Peking University(北京大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 该研究针对科学图表多轮优化的空白,构建了多轮图表生成基准MTPaperBananaBench,提出多智能体系统PaperBanana-Interact,解决基线系统的质量漂移与遗忘问题,显著提升图表优化效果。

Comments https://shirley-wu.github.io/PaperBanana-Interact/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30214 2026-09-01 cs.AI 新提交

SPARK: Skeleton-Guided Reasoning Synthesis from Large-Scale Scientific Literature

SPARK:基于大规模科学文献的骨架引导推理合成

Yu Li, Wei Li, Xin Gao, Mengyuan Sun, Xiaoyang Wang, Qizhi Pei, Lijun Wu

机构 * Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学) Peking University(北京大学) Renmin University of China(中国人民大学)

AI总结 针对开源模型科学推理数据不足的问题,提出基于Sci-Base的SPARK框架构建Spark-234K科学推理数据集,该数据集难度与多样性更优,仅需更少训练样本即可实现更强性能。

Comments 24 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30184 2026-09-01 cs.CV 新提交

ATGS: Anchored Temporal Gaussian Splatting for Long Volumetric Video Representation

ATGS:用于长体积视频表示的锚定时间高斯溅射

Jiahao Wu, Jie Liang, Die Hu, Jiayu Yang, Kaiqiang Xiong, Xiang Li, Xiaoyun Zheng, Chao Wang, Ronggang Wang

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Pengcheng Laboratory(鹏城实验室)

AI总结 针对长序列体积视频的时间不稳定问题,提出基于高斯溅射的ATGS框架,通过时间条件锚点组织高斯、时间窗口策略及多级锚点特征约束,实现更优的长序列体积视频重建性能。

Comments ACM ToG(SIGGRAPH'2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29896 2026-09-01 cs.RO 新提交

EMERGE-Policy: A Robot Mind Emerges Beyond a Single Policy

EMERGE-Policy:超越单一策略的机器人心智涌现

Zhirui Fang, Qingchi Yu, Ziyang Chen, Longfei Li, Haoran Ma, Keru Zhou, Xinrun Xu, Samith Va, Yuxuan Hu, Peixuan Song, Qiang Du, Bin Qian, Yongkang Deng, Xin Li, Yezhen Wang, Zhe Li, Hao Luo, Shuyan Li, Ziwei Wang, Weijian Deng, Xiu Li

机构 * Tsinghua University(清华大学) Nanjing University of Science and Technology(南京理工大学) Xi’an Jiaotong University(西安交通大学) Xidian University(西安电子科技大学) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学)

AI总结 EMERGE-Policy是一种图结构智能体框架,通过多角色子智能体协作划分功能子任务,无需额外微调即可在公开基准和真实机器人实验中实现出色性能,扩展了机器人策略的应用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29616 2026-09-01 cs.CL 新提交

JPO: Juris Policy Optimization for Structured Legal Reasoning in Criminal Judgment Prediction

JPO:用于刑事判决预测中结构化法律推理的司法策略优化

Zhaolu Kang, Yantao Liu, Tailong Luo, Leqi Zheng, Lei Wei, Chenghua Zhu, Junhao Gong, Jiachen Qian, Eric Hanchen Jiang, Jiaxin Liu, Yuan Wang, Hao Zhang, Zixia Wang, Rong Fu, Zheng Lin, Richeng Xuan, Zhichao Hu

机构 * Tencent(腾讯) Peking University(北京大学) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) University of California(加利福尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Zhejiang University(浙江大学) University of Hong Kong(香港大学)

AI总结 JPO是用于中国刑事判决预测的后训练框架,通过监督四步推理过程与带复合奖励的强化学习,提升判决预测及推理质量。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29605 2026-09-01 cs.CL 新提交

Hindsight Memory-PRM: Supervising Memory Management with Auditable Hindsight Credit

事后记忆-PRM:通过可审计的事后信用监督记忆管理

Haoxuan Jia, Yang Liu, Yingguang Yang, Yancheng Chen, Chongyang Zhang, Hao Zheng, Qian Li, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Hao Peng, Junyu Lu, Du Cheng, Philip S. Yu, Bin Chong

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Fullive-AI Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Beijing Institute of Technology, Zhuhai(北京理工大学珠海学院) Northeastern University(东北大学) University of Illinois Chicago(芝加哥大学伊利诺伊分校)

AI总结 该研究提出Hindsight Memory-PRM,利用轨迹审计轨迹训练记忆效用评判器并确定代理奖励,在LoCoMo、LongMemEval数据集上的性能优于基线系统,实现高效的长视野LLM智能体记忆管理监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29494 2026-09-01 cs.LG 新提交

Learning Human Health and Diseases from 24-hour Wrist Movement

从24小时腕部运动中学习人类健康与疾病

Yong Wang, Dylan McGagh, Katya Broomberg, Zizheng Zhang, Jonathan Carter, Junayed Naushad, Laura Brocklebank, Yang Sun, George Nicholson, Dianjianyi Sun, Canqing Yu, Jun Lv, Maxim Barnard, Hubert Lam, Andrew Steptoe, David W. Eyre, Liming Li, Zhengming Chen, Naomi Wray, Spiros Denaxas, Gary S. Collins, Huaidong Du, Aiden Doherty, Hang Yuan

机构 * Big Data Institute, University of Oxford(牛津大学大数据研究所) Nuffield Department of Orthopaedics, Rheumatology and Musculoskeletal Sciences, University of Oxford(牛津大学纳菲尔德骨科、风湿病学与肌肉骨骼科学系) Oxford University Hospitals(牛津大学医院) Nuffield Department of Population Health, University of Oxford(牛津大学纳菲尔德人口健康系) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Statistics, University of Oxford(牛津大学统计系) Department of Epidemiology and Biostatistics, School of Public Health, Peking University Health Science Center(北京大学医学部公共卫生学院流行病学与生物统计学系) Peking University Center for Public Health and Epidemic Preparedness and Response(北京大学公共卫生与疫情防控中心)

AI总结 该研究提出自监督基础模型Sensori,从24小时原始三轴腕部运动学习通用健康表征,经多人群队列验证,可跨场景泛化,结合临床协变量显著提升多种疾病的分类与风险预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29322 2026-09-01 cs.CV 新提交

Test-Time Scaling for Video Diffusion Models via Diagnosis-Guided Candidate Recycling

基于诊断引导候选回收的视频扩散模型测试时缩放

Hangzhou He, Lunhao Duan, Shanshan Zhao, Kaiwen Li, Qing-Guo Chen, Weihua Luo, Yanye Lu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

AI总结 该研究针对视频扩散模型测试时缩放的“生成-丢弃”范式缺陷,提出无需训练的 GEARS 框架,通过阶段感知调度器与候选回收器提升轻量模型性能,在 VBench 上使 13 亿参数模型得分接近 140 亿参数模型。

Comments Accepted by ACM TOG (SIGGRAPH Asia 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29304 2026-09-01 cs.LG 新提交

MEL: Coordinate-Preserving EEG Tokenization for fMRI Translation

MEL:用于fMRI转换的坐标保留型EEG分词

Xiangyu Liu, Zeting Yan, Zhitong Yin, Boyang Li, Xi Zhang

机构 * Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) The University of Hong Kong(香港大学) Peking University(北京大学)

AI总结 本研究提出坐标保留型EEG表示框架MEL,通过结构化EEG表示解决EEG到fMRI转换中的表示接口不匹配问题,在基准数据集上相比NeuroBOLT基线提升了预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29278 2026-09-01 cs.CL 新提交

Modality Fault Lines: Structural Corruptions Reveal Fragile Omni-Modal Reasoning

模态断层线:结构损坏揭示脆弱的全模态推理

Zhaolu Kang, Meixin Wu, Yu Xue, Yingjie He, Qiming Shi, Lei Wei, Yidi Wang, Richeng Xuan, Zhichao Hu

机构 * Tencent(腾讯) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 本研究提出SCEval诊断评估协议,通过结构损坏揭示全模态模型的脆弱推理,发现文本-视觉损坏是最稳定的共享断层线,多模态退化非相加性,干净准确率不代表结构不可靠时仍可靠。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29133 2026-09-01 cs.CL 新提交

AI Historian: Helping historians organize and verify person-centred temporal clues from dispersed historical narratives

AI历史学家:帮助历史学家从分散的历史叙事中整理和验证以人为中心的时间线索

Yifeng Lu, Zijie Yang, Jie Li, Qingkai Min, Yue Zhang

机构 * Westlake University(西湖大学) Peking University(北京大学)

AI总结 研究提出AIH智能体系统,可从分散历史叙事中整理验证时间线索,在《史记》案例中表现优于人类及大语言模型,已应用于多国历史材料并降低整理成本。

Comments 37 pages, 21 figures. Code: https://github.com/YiFengLu1999/AI-Historian

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28693 2026-09-01 cs.RO cs.CV 新提交

RoboGesture: Real-Time Semantic-aligned Co-Speech Gestures Generation for Humanoid Interaction

RoboGesture:面向人形机器人交互的实时语义对齐式伴随语音手势生成

Zifan Wang, Ziang Ren, Pengyang Shi, Zirui Wang, Chenghuai Lin, Tianze Wang, Zekun Qi, Liangliang Zhao, He Wang, Li Yi

机构 * Tsinghua University(清华大学) Galbot Inc.(Galbot公司) Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学) Shanghai Qi Zhi Institute(上海智知研究院)

AI总结 本研究提出 RoboGesture 框架,构建专属数据集并设计相关算法,使人形机器人可实时生成语义对齐的伴随语音手势,在 Unitree G1 机器人上的实验表明其性能优于现有最优方法。

Comments Accepted at ECCV 2026. Project page: https://RoboGesture.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28660 2026-09-01 cs.CL cs.AI cs.LG 新提交

Test-Time Scaling for Scientific Equation Discovery

科学方程发现的测试时缩放

Haowei Lin, Hubert Lim, Xiangyu Wang, Letian Huang, Di He

机构 * Peking University(北京大学)

AI总结 本文将测试时缩放(TTS)应用于开放场景的自动方程发现,建模迭代搜索过程并在固定预算下对比控制器,发现搜索宽度是主导分配参数,为缩放LLM基方程发现提供了核心思路。

Journal ref EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28619 2026-09-01 cs.CL cs.AI cs.HC 新提交

From GenAI Virtual Patient Dialogue Logs to Teacher-Interpretable Process Evidence: A Learning Analytics Study in Higher Education

从生成式AI虚拟患者对话日志到教师可解释的过程证据:一项高等教育中的学习分析研究

Xinyu Li, Zijian Li, Mengyu Xia, Luzhen Tang, Naping Chen, Changmin Lin, Danijela Gasevic, Dragan Gasevic, Yizhou Fan

机构 * Monash University(莫纳什大学) Peking University(北京大学) Shantou University Medical College(汕头大学医学院) The University of Hong Kong(香港大学)

AI总结 该研究通过分析210名医学生的1030条GenAI VP胸痛病例对话,采用三层分析揭示高分临床推理的过程模式,为医学教育提供教师可解释的过程证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28610 2026-09-01 cs.AI 新提交

TPvG: A Moral Decision Framework for Large Language Models from One-Shot to Sequential Feedback

TPvG:基于一次性反馈到序列反馈的大语言模型道德决策框架

Fangyuan Zhang, Dong Yu, Pengyuan Liu

机构 * Beijing Language and Culture University(北京语言大学) Peking University(北京大学)

AI总结 本研究提出TPvG道德决策框架,通过含结果反馈的任务评估发现,LLM道德决策受决策形式和接收者反馈影响,且与人类决策模式存在差异,需评估其高风险交互下的道德稳定性。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏