arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Tencent(腾讯)

共收录 2192
2609.04128 2026-09-04 cs.AI 新提交

Environment Evolution for Terminal Agents

终端智能体的环境演化

Zhiyuan Fan, Tinghao Yu, Yuanjun Cai, Jiang Zhou, Jiangtao Guan, Jincheng Liu, Yun Yang, Dingxin Hu, Zhuo Han, Xing Wu, Feng Zhang, Lilin Wang

机构 * Hunyuan Team, Tencent(腾讯混元团队)

AI总结 针对现有协同演化方法的不足,提出环境演化方法,通过off-policy逐代提升环境难度,在Terminal-Bench 2.1上显著提升Qwen系列模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04018 2026-09-04 cs.LG stat.AP stat.ME 新提交

A location-invariant estimator of extremal quantile treatment effects for heavy-tailed distributions

针对重尾分布的极值分位数处理效应的位置不变估计量

Xin Yu, Shuwei Huang, Jicheng Liu, Jielin Tang, Bolin Wang, Yunxiao Zhang, Tian Zhao

机构 * Huazhong University of Science and Technology(华中科技大学) Tencent(腾讯)

AI总结 针对重尾分布极值QTE估计量的位置偏移不不变问题,通过适配位置不变EVI估计量并替换外推方案,提出位置不变的极值QTE估计量,经模拟验证其性质良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03952 2026-09-04 cs.CV 新提交

WorldReward: Reward Modeling for Camera-Conditioned World Models

WorldReward:面向相机条件世界模型的奖励建模

Yibin Wang, Zehan Wang, Junshu Tang, Zhimin Li, Yujie Zhou, Jiazi Bu, Pengyang Ling, Feng Han, Zhixiong Zhang, Long Xing, Shengyuan Ding, Ziang Li, Cheng Jin, Yuhang Zang, Jiaqi Wang, Tianyu Pang

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯混元) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 该研究提出WorldReward,一种基于VLM的成对偏好奖励模型,解决相机条件世界模型现有奖励函数的缺陷,在WorldReward-Bench上超GPT-5.5,还提升了HY-WorldPlay 1.5的动作与视觉质量。

Comments Website: https://codegoat24.github.io/WorldReward

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03445 2026-09-04 cs.CV 新提交

OCR-EDR: Rendering-Aware Diagnosis and Repair for Closed-Loop OCR Improvement

OCR-EDR:面向闭环OCR改进的渲染感知诊断与修复

Linnan Zhao, Kang Liu, Hao Yu, Jiabo Zhan, Chong Sun, Chen Li

机构 * WeChat Vision, Tencent(腾讯微信视觉)

AI总结 提出OCR-EDR框架,构建OCRErrBench数据集与DocEDR模型,实现OCR错误的细粒度诊断与迭代修复,提升OCR在公式等场景的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03241 2026-09-04 cs.LG cs.AI 新提交

FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience

FlowBalance:基于验证器的在线策略推理经验自改进方法

Zixun Huang, Kishan Panaganti, Haitao Mi, Leowei Liang

机构 * Tencent HY LLM Frontier(腾讯HY大模型前沿(机构)) University of Pennsylvania(宾夕法尼亚大学)

AI总结 FlowBalance是基于验证器的在线策略推理经验自改进方法,通过校准轨迹级自指导分数实现结果校准的自指导,在数学推理任务中其性能、训练速度及稳定性均优于FlowRL,且策略多样性更高。

Comments 28 pages, 7 figures, 10 tables. Code and blog available

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24302 2026-09-04 cs.AI 版本更新

VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models

VideoHarness-RSI:基于冻结视觉语言模型的长视频理解的递归 harness 自改进方法

Guoyang Xu, Hao Chen

机构 * Tencent(腾讯)

AI总结 该研究提出 VIDEOHARNESS-RSI,通过递归搜索可执行上下文构建程序,在冻结 VLM 上实现长视频理解的改进,且所选 harness 可迁移至其他长视频基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10581 2026-09-04 cs.CL cs.SD eess.AS 版本更新

ParaBridge: Bridging Paralinguistic Perception and Dialogue Behavior in Speech Language Models

ParaBridge: 弥合语音语言模型中的副语言感知与对话行为

Yuxiang Wang, Qinke Ni, Shengbo Cai, Wan Lin, Liqiang Zhang, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tencent Hunyuan(腾讯混元) Shenzhen Loop Area Institute(深圳河套学院) Amphion Technology Co., Ltd.(Amphion科技有限公司) Tsinghua University(清华大学)

AI总结 提出ParaBridge,一种在线自我蒸馏方法,将推理阶段的副语言指令支架转化为稳定的模型行为,无需人工标注或外部奖励,显著提升语音语言模型对副语言线索的响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20923 2026-09-04 cs.CL

KaLM-Embedding-V2: Superior Training Techniques and Data Inspire A Versatile Embedding Model

Xinping Zhao, Xinshuo Hu, Zifei Shan, Shouzheng Huang, Yao Zhou, Xin Zhang, Zetian Sun, Zhenyu Liu, Dongfang Li, Xinyuan Wei, Youcheng Pan, Yang Xiang, Meishan Zhang, Haofen Wang, Jun Yu, Baotian Hu, Min Zhang

机构 * Shenzhen Loop Area Institute (SLAI)(深圳环湖区研究所) Tencent(腾讯)

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01423 2026-09-03 cs.CV 版本更新

MegaStyle++: Scaling Image Style Space through Hierarchical Style Definition

MegaStyle++:通过分层风格定义扩展图像风格空间

Junyao Gao, Sibo Liu, Jiaxing Li, Yanan Sun, Weidong Zhang, Jun Zhang, Cairong Zhao

机构 * Tongji University(同济大学) Tencent(腾讯) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对图像风格缺乏统一定义的问题,提出分层风格定义,构建含多类数据的大规模风格数据集MegaStyle++-8M,扩展了风格空间并提供研究图像风格的可扩展基础。

Comments The dataset and code will be updated at https://github.com/Tencent/MegaStyle, 10pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22230 2026-09-03 cs.CL 版本更新

Whitewashing Hate, Smearing Harmless Content: Annotator-Style Rebuttal Attacks on LLM-Based Moderation

洗白仇恨内容、抹黑无害内容:针对基于大语言模型的内容审核的标注者式反驳攻击

Junyu Lu, Kaiyuan Liu, Jingyi Kang, Deyi Ji, Hailong Zhang, Lanyun Zhu, Qi Zhu, Bo Xu, Liang Yang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Tencent(腾讯) Tongji University(同济大学)

AI总结 该研究针对LLMs内容审核提出标注者式反驳攻击,发现洗白仇恨内容与抹黑无害内容的攻击效果存在模型特异性不对称性,防御措施无法完全消除攻击影响,凸显需定向防御与反馈鲁棒性评估。

Comments We identified errors in the experimental setup and analysis that affect several key results and conclusions. As substantial re-analysis is required and the conclusions may change, we respectfully request withdrawal of the current version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24780 2026-09-03 cs.AI 版本更新

LivingArena: Do LLMs Know What Other LLMs Don't? Peer-Probing as Scalable Evaluation

LivingArena:大语言模型知道其他大语言模型所不知道的吗?作为可扩展评估的对等探测

Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

AI总结 研究大语言模型能否利用其他模型的未知进行评估,提出自动化抗污染评估框架LivingArena,模型轮流提问,经评审验证,能产生稳定排行榜,可衡量事实严谨性等,与人类偏好相关性弱,提供低成本持续评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21144 2026-09-03 cs.CL cs.AI 版本更新

AdaMem: Learning What to Remember with Adaptive Memory Policies for Personalized Agents

AdaMem: 学习为个性化长时程LLM代理记住什么

Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

AI总结 针对长时程LLM代理中记忆膨胀导致QA准确率下降的问题,提出AdaMem方法,通过角色特定的记忆策略和基于反馈的轻量级自反思步骤,学习为每个用户记住重要信息,在减少9%记忆量的同时提升QA准确率最高9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16767 2026-09-03 cs.CV 版本更新

Make-It-Poseable: Feed-forward Latent Posing Model for 3D Characters

让其可塑形:用于3D角色的前馈潜在姿态模型

Zhiyang Guo, Ori Zhang, Jax Xiang, Alan Zhao, Zhenxun Yuan, Wengang Zhou, Houqiang Li

机构 * EEIS Department University of Science(电子信息科学系中国科学技术大学) Tencent PCG Shenzhen China(腾讯PCG深圳中国) Tencent PCG New York USA(腾讯PCG纽约美国) Tencent PCG Beijing China(腾讯PCG北京中国) University of Science(中国科学技术大学) Tencent PCG(腾讯PCG)

AI总结 本文提出Make-It-Poseable模型,通过将角色姿态问题转化为无皮肤的潜在空间转换,解决传统方法在皮肤权重、网格拓扑和姿态适应性上的不足,提升3D角色姿态重建质量。

Comments Accepted to SIGGRAPH Asia 2026. Project page: https://jasongzy.github.io/Make-It-Poseable/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03619 2026-09-03 cs.CL 版本更新

Learning Query-Specific Rubrics from Human Preferences for DeepResearch Report Generation

从人类偏好中学习查询特定评分标准用于DeepResearch报告生成

Changze Lv, Jie Zhou, Wentao Zhao, Jingwen Xu, Shihan Dou, Zisu Huang, Muzhao Tian, Xiaohua Wang, Zhengkang Guo, Yang Liu, Pluto Zhou, Tao Gui, Le Tian, Xiao Zhou, Xiaoqing Zheng, Xuanjing Huang, Jie Zhou

机构 * Tencent(腾讯) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 提出一种通过强化学习训练查询特定评分标准生成器的流水线,以解决DeepResearch长报告生成中缺乏可验证奖励信号的问题,并在人类偏好测试和下游任务中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01560 2026-09-02 cs.CV cs.AI 新提交

H3-World: Turning Language Understanding into World Control

H3-World:将语言理解转化为世界控制

Danze Chen, Zeqing Wang, Ziyue Lin, Xingyi Yang, Yeying Jin

机构 * Tencent(腾讯) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 H3-World是复用大型视频生成器语义表示的高效框架,仅需少量样本与参数,即可将语言接口转化为精确的交互式世界控制,且能泛化到未见场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00967 2026-09-02 cs.AI 新提交

CoBRA: Learning Tool-Use Boundaries via Counterfactual Margins

CoBRA:通过反事实边际学习工具使用边界

Wenhao Zou, Xianglong Liu, Wendong Bi, Hanjie Wang, Simin Zhao, Gong Zhi

机构 * WeChat, Tencent Inc(腾讯公司微信业务部) University of Chinese Academy of Sciences(中国科学院大学) Wuhan University(武汉大学)

AI总结 针对大型语言模型工具调用决策问题,提出CoBRA框架,通过构建双专家、估计奖励边际优化边界,在Qwen3-4B上提升工具使用效率与边界敏感型答案准确率。

Comments Acceptedy by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00762 2026-09-02 cs.LG 新提交

Frozen Cores Need Task Signal: Fisher-Whitened Cross-Covariance for Low-Resource LLM Adaptation

冻结核心需要任务信号:用于低资源大语言模型适配的Fisher白化交叉协方差

Wentao Ye, Zhanming Shen, Zhiqing Xiao, Yao Ding, Haobo Wang, Gang Chen

机构 * Zhejiang University(浙江大学) Hunyuan, Tencent(腾讯混元)

AI总结 该研究提出FCCA方法,通过固定权重矩阵基并优化小尺寸核心,在低资源预算下实现大语言模型高效适配,在多任务多模型上表现优异,参数规模远低于LoRA、DoRA等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00667 2026-09-02 cs.IR cs.CV 新提交

From Saliency to Discriminability: Rank-Preserving Visual Token Pruning for VLM Rerankers

从显著性到判别性:面向VLM重排序器的秩保持视觉令牌剪枝

Siyi Liu, Hanjun Yang, Chenchen Zhang, Xiaorong Zhu, Xinyu Zuo, Lisheng Duan, Haijin Liang, Jin Ma, Junfu Pu, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent Yuanbao(腾讯元宝) ARC Lab, Tencent(腾讯ARC实验室)

AI总结 针对VLM重排序器的令牌剪枝偏差问题,提出无需训练的RaDiCal框架,在多检索基准和VLM架构上实现高效剪枝,降低计算量并提升速度,同时保持排序性能。

Comments EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00646 2026-09-02 cs.AI 新提交

DramaChain Bench: An End-to-End Benchmark for Short-Drama Generation

DramaChain Bench:面向短剧生成的端到端基准测试集

Haoyuan Shi, Mingtao Chen, Shuo Jiang, Ziyan Chen, Xuyi Sheng, Yiming Liu, Ying Zhang, Miao Wang, Jianxiang Lu, Fanyang Lu, Songyuanyi Lu, Xiele Wu, Zhichao Hu, Yuhong Liu, Richeng Xuan

机构 * Hunyuan, Tencent(腾讯混元) Beijing Film Academy(北京电影学院) Peking University(北京大学) Shenzhen University(深圳大学)

AI总结 本研究提出首个评估短剧全制作链条各阶段的基准测试集DramaChain Bench,构建配套系统实现模型公平比较与自动评分,证实上游缺陷会级联影响最终剧集质量,为短剧生成研究提供端到端评估支撑。

Comments 50 pages, 19 figures, 19 tables. Technical report. Haoyuan Shi and Mingtao Chen contributed equally. Project lead: Zhichao Hu. Corresponding author: Richeng Xuan

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00061 2026-09-02 cs.LG cs.AI cs.CV 新提交

ReNFT: Repairing Mode Collapse in Reward Post-Training via Internal Probability-Mass Recalibration

ReNFT:通过内部概率质量重新校准修复奖励后训练中的模式崩溃

Yuchen Bao, Chao Wen, Haowei Wang, Ruoxin Chen, Donghao Luo, Jiahui Zhan, Wenjian Huang, Shen Chen, Yiting Wang, Taiping Yao, Chengjie Wang, Shouhong Ding, Jianguo Zhang

机构 * Southern University of Science and Technology(南方科技大学) Tencent Youtu Lab(腾讯优图实验室)

AI总结 ReNFT 是一种从扩散生成器内部修复奖励后训练模式崩溃的方法,在保留 NFT 高奖励的同时显著提升了 DreamSim-Div,为外部干预提供互补方案。

Comments 17 pages, 13 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31075 2026-09-02 cs.AI 版本更新

Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

超越人类监督扩展大型推理模型:通往超级智能的路径

Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu, Yonggang Zhang, Kainan Cao, Zizhuo Zhang, Chenxin Li, Ruibin Yuan, Jiahao Pan, Jiankai Sun, Zhenyuan Zhang, Yibo Li, Yunlong Lin, Jing Xiong, Sida Lin, Bo Han, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院) Xi’an Jiaotong University(西安交通大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Hong Kong Baptist University(香港浸会大学) Hunyuan Tencent(腾讯混元) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学)

AI总结 本文研究人类监督逐步退出时大型推理模型(LRMs)的扩展路径,提出五级阶梯框架,分析自主化带来的风险,围绕策略能力等开展评估,为开发通往超级智能的自我维持学习系统提供结构化方案。

Comments 72pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22156 2026-09-02 cs.CL 版本更新

InComeS: Integrating Compression and Selection Mechanisms into LLMs for Efficient Model Editing

InComeS: 将压缩与选择机制整合到LLMs中以实现高效的模型编辑

Shuaiyi Li, Zhisong Zhang, Yang Deng, Chenlong Deng, Tianqing Fang, Hongming Zhang, Haitao Mi, Dong Yu, Wai Lam

机构 * The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Tencent AI Lab(腾讯AI实验室) Singapore Management University(新加坡管理学院)

AI总结 InComeS通过整合压缩和选择机制,提升LLMs处理多编辑任务的效率和性能。

Comments Main conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31038 2026-09-01 cs.CL 新提交

Type-Balanced Contextual Learning for Incremental Named Entity Recognition

用于增量命名实体识别的类型平衡上下文学习

Duzhen Zhang, Yahan Yu, Xiuyi Chen, Chenxing Li, Dong Yu

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Kyoto University(京都大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent, AI Lab(腾讯人工智能实验室)

AI总结 针对增量命名实体识别中基于伪标签方法的偏差上下文问题,提出含句子对学习方案和上下文一致性损失的TBCL方法,经多数据集多设置实验验证有效。

Comments Accepted by IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31014 2026-09-01 cs.CL 新提交

Evidence-Bounded Mental Health Reasoning from Heterogeneous Speech Protocols

基于异构语音协议的证据受限心理健康推理

Chengyuan Gao, Jiang Wu, Tao Lu, Jiayan Guo, Mingkun Xu, Tianyi Zang, Shangyang Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Harbin Institute of Technology(哈尔滨工业大学) Renyixun Health Technology Co., Ltd.(仁医讯健康科技有限公司) GDIIST(广东省智能制造研究所) Tencent(腾讯)

AI总结 本研究针对现有心理健康筛查模型的证据边界问题,提出协议感知的证据控制框架EviBound,在抑郁症筛查任务中达到0.8658的AUROC,且实现零宣称违规。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30478 2026-09-01 cs.CL 新提交

Agents in the Large: Perception-Centered Architecture for Persistent Agents

大型智能体:面向持久智能体的感知中心架构

Shihan Dou, Haoxiang Jia, Shichun Liu, Feng Chen, Chenhao Huang, Yujiong Shen, Shaofan Liu, Jiayi Chen, Jiahang Lin, Honglin Guo, Qianyu He, Minghao Guo, Ziyi Ye, Pluto Zhou, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Tencent(腾讯)

AI总结 该研究提出面向持久智能体的感知中心架构(Pera),用于刻画、组织和指导持久AI智能体的发展,类比软件工程的小型到大型编程,推动语言智能体向长期自适应智能系统演进。

Comments 41 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30461 2026-09-01 cs.CL 新提交

From Final Artifacts to Trajectories: Retrospective Process Supervision for Evidence-Grounded Long-Form Generation

从最终产物到轨迹:面向证据支撑的长文本生成的回溯过程监督

Junjie Huang, Jiarui Qin, Di Yin, Weiwen Liu, Yong Yu, Xing Sun, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室)

AI总结 针对开放式长文本生成任务轨迹数据稀缺的问题,提出RetroGen框架,利用预训练数据中丰富的高质量最终产物重构轨迹,训练模型以提升证据支撑等任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30398 2026-09-01 cs.CL cs.IR 新提交

Beyond Polarization: The Generative Constraint of Chain-of-Thought in Pointwise Reranking

超越极化:点式重排序中思维链的生成约束

Xiaoyang Chen, Jie Liu, Haijin Liang, Haibo Shi, Jin Ma, Ben He, Yingfei Sun, Dezhi Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent(腾讯)

AI总结 本研究针对点式重排序中思维链模型性能弱于直接评分模型的问题,通过实证研究及多种干预措施,发现排序差距源于离散文本传递连续相关性语义的瓶颈,而非易解决的训练偏差。

Comments Accepted at EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29715 2026-09-01 cs.LG cs.AI cs.CL 新提交

Higher-Dimensional Rotary Position Embedding

高维旋转位置嵌入

Yixing Li, Ruobing Xie, Yudong Zhang, Yushi Bai, Samm Sun, Yu Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent Hunyuan(腾讯混元) Tsinghua University(清华大学) University of Macau(澳门大学)

AI总结 针对RoPE跨通道混合与鲁棒性不足的问题,提出HD-RoPE,通过扩展至高维旋转并引入Paley-I正交基,在无额外参数的情况下提升性能,获基准测试显著改善。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29616 2026-09-01 cs.CL 新提交

JPO: Juris Policy Optimization for Structured Legal Reasoning in Criminal Judgment Prediction

JPO:用于刑事判决预测中结构化法律推理的司法策略优化

Zhaolu Kang, Yantao Liu, Tailong Luo, Leqi Zheng, Lei Wei, Chenghua Zhu, Junhao Gong, Jiachen Qian, Eric Hanchen Jiang, Jiaxin Liu, Yuan Wang, Hao Zhang, Zixia Wang, Rong Fu, Zheng Lin, Richeng Xuan, Zhichao Hu

机构 * Tencent(腾讯) Peking University(北京大学) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) University of California(加利福尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Zhejiang University(浙江大学) University of Hong Kong(香港大学)

AI总结 JPO是用于中国刑事判决预测的后训练框架,通过监督四步推理过程与带复合奖励的强化学习,提升判决预测及推理质量。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29607 2026-09-01 cs.CV cs.IR 新提交

SnapBench: Benchmarking Snap-and-Ask Multimodal Retrieval for Mobile Interactions

SnapBench:面向移动交互的抓拍提问多模态检索基准测试

Zirong Chen, Fuda Ye, Kuan Zhang, Enjun Du, Junfu Pu, Xinlei Wang, Xinyu Zuo, Lisheng Duan, Jin Ma, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent Yuanbao(腾讯元宝) Tsinghua University(清华大学) ARC Lab, Tencent(腾讯ARC实验室) The University of Hong Kong(香港大学)

AI总结 本研究推出首个鲁棒抓拍提问多模态检索配对基准SnapBench,评估16种多模态检索器,发现图像损坏严重影响检索,还提出自适应融合方法MOOR,凸显模态校准的必要性。

Comments 37 pages. Yuanbao Technical Report. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏