arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Tencent(腾讯)

2026-04-28 至 2026-04-28 共收录 11
2604.24625 2026-04-28 cs.CV cs.AI cs.LG cs.MM

Meta-CoT: Enhancing Granularity and Generalization in Image Editing

Meta-CoT:提升图像编辑的粒度与泛化能力

Shiyi Zhang, Yiji Cheng, Tiankai Hang, Zijin Yin, Runze He, Yu Xu, Wenxun Dai, Yunlong Lin, Chunyu Wang, Qinglin Lu, Yansong Tang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Hunyuan, Tencent(腾讯 Hunyuan)

AI总结 Meta-CoT通过双重分解提升图像编辑的粒度和泛化能力,通过任务-目标-理解能力三元组分解和五元基本元任务训练策略,显著提高编辑性能。

Comments Accepted by CVPR2026, Project Page: https://shiyi-zh0408.github.io/projectpages/Meta-CoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19652 2026-04-28 cs.CV

Self-Rewarding Vision-Language Model via Reasoning Decomposition

通过推理分解实现自奖励视觉-语言模型

Zongxia Li, Wenhao Yu, Chengsong Huang, Zhenwen Liang, Rui Liu, Fuxiao Liu, Jingxi Che, Dian Yu, Jordan Boyd-Graber, Haitao Mi, Dong Yu

机构 * Tencent AI Seattle Lab(腾讯AI西雅图实验室) University of Maryland(马里兰大学) Washington University in St. Louis(圣路易斯华盛顿大学)

AI总结 本文提出Vision SR1,通过分解视觉与语言推理,提升视觉推理能力,减少视觉幻觉和语言捷径依赖,效率优于需外部视觉奖励模型的方法。

Comments 16 pages, two figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24186 2026-04-28 cs.CL cs.AI

MultiDx: A Multi-Source Knowledge Integration Framework towards Diagnostic Reasoning

MultiDx: 一个面向诊断推理的多源知识整合框架

Yimin Deng, Zhenxi Lin, Yejing Wang, Guoshuai Zhao, Pengyue Jia, Zichuan Fu, Derong Xu, Yefeng Zheng, Xiangyu Zhao, Li Zhu, Xian Wu, Xueming Qian

机构 * Xi’an Jiaotong University(西安交通大学) City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯 Jarvis实验室) Westlake University(西湖大学)

AI总结 本文提出MultiDx框架,通过多源知识整合提升诊断推理能力,结合网络搜索、病例数据库等多视角证据,生成最终预测。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24175 2026-04-28 cs.CL cs.AI

AdapTime: Enabling Adaptive Temporal Reasoning in Large Language Models

AdapTime:在大语言模型中实现自适应时间推理

Yimin Deng, Yejing Wang, Zhenxi Lin, Zichuan Fu, Guoshuai Zhao, Derong Xu, Yefeng Zheng, Xiangyu Zhao, Xian Wu, Li Zhu, Xueming Qian

机构 * Xi’an Jiaotong University(西安交通大学) City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯 Jarvis实验室) Westlake University(西湖大学)

AI总结 本文提出AdapTime方法,通过动态执行推理步骤提升大语言模型的时间推理能力,采用重构、重写和复核三步策略,无需外部工具即可增强模型对时间信息的处理能力。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24020 2026-04-28 cs.CR cs.AI

Poster: ClawdGo: Endogenous Security Awareness Training for Autonomous AI Agents

Poster: ClawdGo: 内生安全意识训练用于自主AI代理

Jiaqi Li, Yang Zhao, Bin Sun, Yang Yu, Jian Chang, Lidong Zhai

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Network Management Center, China Mobile Group Liaoning Company Limited(中国移动集团辽宁公司网络管理中心) Tencent Security Xuanwu Lab(腾讯安全宣武实验室) China Unicom Online Information Technology Co., Ltd.(中国联通在线信息技术有限公司)

AI总结 本文提出ClawdGo框架,通过内生训练提升自主AI代理的安全意识,引入TLDT、ASAT、CSMA和SACP四种贡献,实验显示ASAT在16次会话中提升TLDT得分,CSMA保持完整收益,SACP在高训练代理中观察到精度-召回权衡。

Comments 4 pages, including 1 poster page. Poster abstract and poster version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23623 2026-04-28 cs.AI

Tandem: Riding Together with Large and Small Language Models for Efficient Reasoning

Tandem: 大小语言模型协同以实现高效的推理

Zichuan Fu, Xian Wu, Guojing Li, Yejing Wang, Yijun Chen, Zihao Zhao, Yixuan Luo, Hanyu Yan, Yefeng Zheng, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Renmin University of China(中国人民大学) Westlake University(西湖大学)

AI总结 Tandem通过结合大语言模型和小语言模型,减少计算成本并提升推理质量,实验表明其在数学推理和代码生成任务中性能优越。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10708 2026-04-28 cs.SD cs.AI cs.CV cs.MM

Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing

Audio-Omni: 扩展多模态理解到多功能音频生成与编辑

Zeyue Tian, Binxin Yang, Zhaoyang Liu, Jiexuan Zhang, Ruibin Yuan, Hubery Yin, Qifeng Chen, Chen Li, Jing Lyu, Wei Xue, Yike Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) WeChat Vision, Tencent Inc(微信视觉,腾讯公司) Peking University(北京大学)

AI总结 Audio-Omni提出首个端到端框架,统一音频生成与编辑,结合多模态理解能力,通过冻结的多模态大语言模型与可训练的扩散变换器实现高保真合成,并构建大规模数据集提升音频编辑性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17092 2026-04-28 cs.CV

SPAGS: Sparse-View Articulated Object Reconstruction from Single State via Planar Gaussian Splatting

SPAGS:基于单一状态的稀疏视角关节物体重建(通过平面高斯溅射)

Di Wu, Liu Liu, Xueyu Yuan, Wenxiao Chen, Lijun Yue, Liuzhu Chen, Yiming Tang, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Tencent RoboticsX(腾讯机器人院)

AI总结 本文提出一种无需多视角观测的关节物体重建方法,通过平面高斯溅射实现稀疏视角下的高精度重建,结合视觉-语言模型实现开放词汇部分分割与参数估计。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11334 2026-04-28 cs.CV

MARRS: Masked Autoregressive Unit-based Reaction Synthesis

MARRS:基于掩码自回归单元的反应合成

Yabiao Wang, Shuo Wang, Jiangning Zhang, Jiafu Wu, Qingdong He, Yong Liu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学控制系统研究所) Tencent Youtu Lab(腾讯优图实验室)

AI总结 本文提出MARRS框架,通过单元区分运动变分自编码器、动作条件融合和互单元调制,生成协调精细的反应动作,解决传统VQ方法的量化损失和计算复杂性问题。

Comments Accepted to IEEE TVCG 2026. Project page: https://aigc-explorer.github.io/MARRS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10185 2026-04-28 cs.CV

Detecting and Evaluating Medical Hallucinations in Large Vision Language Models

在大型视觉语言模型中检测和评估医学幻觉

Jiawei Chen, Dingkang Yang, Tong Wu, Yue Jiang, Xiaolu Hou, Mingcheng Li, Shunli Wang, Dongling Xiao, Ke Li, Lihua Zhang

机构 * Academy for Engineering and Technology, Fudan University(复旦大学工程与技术学院) Tencent Youtu Lab(腾讯优图实验室) Cognition and Intelligent Technology Laboratory(认知与智能技术实验室)

AI总结 本文提出Med-HallMark基准,用于医疗多模态领域中的幻觉检测与评估,引入MediHall Score和MediHallDetector,通过多任务训练提升模型可靠性,实验表明其在医疗应用中更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16637 2026-04-28 cs.CL cs.AI cs.LG

SSR-Zero: Simple Self-Rewarding Reinforcement Learning for Machine Translation

SSR-Zero:用于机器翻译的简单自我奖励强化学习

Wenjie Yang, Mao Zheng, Mingyang Song, Zheng Li, Sitong Wang

机构 * Tencent Hunyuan(腾讯文元) Columbia University(哥伦比亚大学)

AI总结 本文提出SSR-Zero框架,通过自评奖励实现无参考、在线训练,优于现有MT特定LLM和通用LLM,在英中翻译任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏