Large Language Model-Powered Query-Driven Event Timeline Summarization in Industrial Search
工业搜索中基于大语言模型的查询驱动事件时间线摘要
机构 * Baidu Inc.(百度公司)
AI总结 提出QDET系统,通过多任务微调和强化学习实现查询驱动的事件时间线摘要,在百度搜索中显著提升用户参与度。
Comments Accepted at KDD 2026
大厂专区
工业搜索中基于大语言模型的查询驱动事件时间线摘要
机构 * Baidu Inc.(百度公司)
AI总结 提出QDET系统,通过多任务微调和强化学习实现查询驱动的事件时间线摘要,在百度搜索中显著提升用户参与度。
Comments Accepted at KDD 2026
CodecCap: 高保真度编解码器启发的残差建模用于密集视频字幕生成
机构 * ERNIE Team, Baidu(百度ERNIE团队) ; College of Artificial Intelligence, Inner Mongolia University(内蒙古大学人工智能学院)
AI总结 提出CodecCap框架,通过关键帧和残差字幕模拟视频编解码器,在保持细粒度视觉证据的同时减少冗余,并引入VidCapQA基准验证其高保真度。
Comments 11 pages, 4 figures
面向自回归多维度作文评分的特质感知策略优化
机构 * Peking University(北京大学) ; Baidu Inc.(百度公司)
AI总结 提出特质感知策略优化(TAPO)框架,通过分解样本和特质维度的奖励并结合增强提示,提升自回归多维度作文评分性能。
分离跳跃链接与$R$-探针:解耦特征聚合与梯度传播用于MLLM OCR
机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,PKU-Anker LLM实验室,软件与硬件协同人工智能系统北京重点实验室,北京大学,北京,中国) ; Tsinghua University, Beijing, China(清华大学,北京,中国) ; Baidu Inc, Beijing, China(百度公司,北京,中国)
AI总结 针对多模态大语言模型在OCR任务中因梯度干扰导致细粒度视觉信息丢失的问题,提出分离跳跃链接(Detached Skip-Links)以解耦前向特征聚合与反向梯度传播,并引入$R$-探针($R$-Probe)诊断视觉令牌的可重构性,从而提升OCR及通用多模态任务性能。
Comments Accepted by ICML 2026. Ziye Yuan and Ruchang Yao contributed equally to this work (co-first authors, listed in random order)
一个工具就够了:面向仓库级LLM智能体的强化学习
机构 * National Key Laboratory for Multimedia Information Processing, Peking University(信息处理国家级重点实验室,北京大学) ; School of Computer Science, Peking University(北京大学计算机科学学院) ; Zhongguancun Institute of Artificial Intelligence (ZGCI)(中关村人工智能研究院(ZGCI)) ; Baidu Inc(百度公司)
AI总结 提出RepoNavigator,一个仅配备单一执行感知工具(跳转到调用符号定义)的LLM智能体,通过强化学习端到端训练,在仓库级问题定位中达到最先进性能。
SketchAssist:一种用于语义编辑和精确局部重绘的实用助手
机构 * Global Business Unit, Baidu Inc.(百度公司全球业务部)
AI总结 提出SketchAssist,一种结合指令引导编辑和线条引导区域重绘的交互式草图助手,通过可控数据生成管道和基于DiT的统一框架(集成任务引导的混合专家模块)实现高效、可控的草图操作,在语义和结构一致性上达到最先进性能。