arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

共收录 9630 篇
2609.38106 2026-09-30 cs.SD cs.CL 新提交

Pruning for Efficiency, Paying in Fairness: Demographic Disparities in Pruned Speech-LLMs

为效率剪枝,以公平为代价:剪枝后的语音-大语言模型中的群体差异

Ganesh Pavan Kartikeya Bharadwaj Kolluri, Michael Kampouridis, Ravi Shekhar

机构 * University of Essex(埃塞克斯大学)

AI总结 本研究系统评估剪枝对语音-LLM在不同人口群体上的影响,发现剪枝加剧群体间WER差距,并建议部署时以最差群体错误率为明确标准。

Comments Accepted to IMPACT-SPEECH@EMNLP'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.37577 2026-09-30 cs.CL 新提交

Pair Difficulty Matters: Rethinking Pairwise LLM-as-a-Judge Evaluation and Consistency

配对难度至关重要:重新思考成对LLM-as-a-Judge评估与一致性

Bruno Brocai, Maria Becker

机构 * Heidelberg University(海德堡大学)

AI总结 本研究指出成对LLM评估中代理指标受近距离配对主导而失真,提出应基于排名差距条件化指标评估法官,并通过模拟和人工语料验证了该观点。

Comments Accepted as an EMNLP 2026 short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.37543 2026-09-30 cs.CL 新提交

RunyaNER: Auxiliary Language Selection for Runyankore NER

RunyaNER:Runyankore命名实体识别的辅助语言选择

Prosper Arineitwe Asiimwe, Francois Meyer, Jan Buys

机构 * University of Cape Town(开普敦大学)

AI总结 针对低资源语言Runyankore,我们构建了首个公开NER基准RunyaNER,并系统研究辅助语言选择策略,发现基于嵌入的度量比传统语言特征更能预测迁移性能,为多语言迁移提供实用指导。

Comments Accepted to the 6th Workshop on Multilingual Representation Learning (MRL 2026) at EMNLP 2026. Camera-ready version. 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.37361 2026-09-30 cs.CL 新提交

SemOPT: Fixing Semantic Errors in LLM-based Optimization Modeling via Reward-Guided Search

SemOPT:通过奖励引导搜索修复基于LLM的优化建模中的语义错误

Zetong Zhou, Wentao Zhang, Jingyuan Wang, Yifan Yang, Zizhuo Wang, Shixi Hu

机构 * Beihang University(北京航空航天大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Cardinal Operations Technology Co.(卡达克科技有限公司)

AI总结 SemOPT通过语义奖励模型和分层奖励引导搜索,修复LLM优化建模中的语义错误,在七个基准上平均准确率提升7.6%。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.37121 2026-09-30 cs.CL 新提交

Cross-Linguistic Effects in Bilingual Phoneme BabyLMs

双语音素BabyLM中的跨语言效应

Nikitas Theodoropoulos, Maria Lymperaiou, Giorgos Filandrianos

机构 * National Technical University of Athens(雅典国立技术大学) ; Instituto de Telecomunicações(电信研究所)

AI总结 本研究训练以音素输入的双语BabyLM,固定英语为二语,变化一语为德语、瑞典语、波斯语和巴斯克语,发现音素输入下语法学习轨迹的跨语言效应更强,早期词汇差异与音素库相似性相关。

Comments 13 pages, 8 figures, 3 tables; Accepted at the 2nd BabyLM Workshop at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.36987 2026-09-30 cs.CL 新提交

CypherTurn: A Multi-Turn Benchmark for Conversational Text-to-Cypher Evaluation and the Autonomy Divergence

CypherTurn:面向对话式文本到Cypher评估的多轮基准与自主性分歧

Yuzhe Zhang, Weijie Zhu, Haolin Yang, Ziyun Zhang, Xianwei Xue, Mengke Chen, Qiutong Pan, Huaqian Cai

机构 * Peking University(北京大学) ; National Key Lab of Data Space Technology and System(数据空间技术与系统全国重点实验室) ; Baidu Inc.(百度公司)

AI总结 本文提出CypherTurn,首个对话式文本到Cypher多轮基准,含721个会话,评估15个模型,发现最佳执行准确率仅64.7%,并揭示自主性分歧现象。

Comments Accepted as an oral paper at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.36748 2026-09-30 cs.AI 新提交

Generalizable Lifelong Model Editing via Preference Optimization

可泛化的终身模型编辑:基于偏好优化

Dahyun Jung, Suhyune Son, Heuiseok Lim

机构 * Korea University(高丽大学)

AI总结 针对终身模型编辑中知识泛化下降问题,提出结合偏好优化、回放编辑与梯度约束的GLIME方法,在保持编辑性能的同时显著提升知识泛化能力。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.36617 2026-09-30 cs.CL 新提交

Generating Edit-Inducing Questions for AI Research Manuscripts

为AI研究手稿生成引发编辑的问题

Sebastian Joseph, Zichao Wang, Jennifer Healey, Alexa Siu, Junyi Jessy Li, Ani Nenkova

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Adobe Research(Adobe研究院)

AI总结 本研究比较GPT模型与人类审稿人生成的问题对论文改进的效用,发现GPT问题虽多且覆盖广,但引发编辑的比例较低,并揭示长上下文关注可能削弱推理模型的表现。

Comments Accepted at the DocInsights Workshop @ EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.36534 2026-09-30 cs.CL cs.CY cs.IR 新提交

Retrieval Sensitivity to Identity Signals in Queries

查询中身份信号对检索的敏感性

Andrew Tang, Nicholas Deas, Kathleen McKeown, Vishal Misra

机构 * Columbia University(哥伦比亚大学)

AI总结 本研究探讨密集检索器对查询中身份信号(政治倾向和方言)的敏感性,发现检索结果存在偏见,可能加剧极化与健康差距。

Comments EMNLP 2026 camera-ready, with a correction to Fig. 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.36477 2026-09-30 cs.LG cs.AI 新提交

Guard Models Are Overconfident Where Base Models Are Uncertain

Guard模型在基础模型不确定的输入上过度自信

Jonghyun Hong, MinJae Jung, Minwoo Kim

机构 * DATUMO INC.(DATUMO公司)

AI总结 本文发现Guard模型在基础模型不确定的输入上过度自信,对抗攻击使其校准度大幅下降,但基础模型的不确定性信号仍可用来识别错误,揭示了Guard置信度与基础模型不确定性之间的不匹配。

Comments Accepted at EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.35824 2026-09-30 cs.CL stat.ME 新提交

Reliable but Design-Sensitive: Instrument Uncertainty in LLM Annotation

可靠但对设计敏感:LLM标注中的工具不确定性

Thomas Reiter, Christoph Kern, Fedor Miasnikov, Sofiia Nikolenko, Rob Chew, Stephanie Eckman, Frauke Kreuter

机构 * Amazon(亚马逊) ; Ludwig Maximilian University of Munich(慕尼黑大学) ; RTI International(RTI国际) ; University of Maryland(马里兰大学)

AI总结 本研究揭示LLM标注在不同任务设计下标签不稳定,提出工具不确定性概念,并证明仅靠重复设置或置信度分数无法替代跨设计比较来评估可靠性。

Comments Accepted to "3rd Workshop on Uncertainty-Aware NLP" @ EMNLP 2026 (archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.35810 2026-09-30 cs.CL cs.AI 新提交

TRACE: Deployable Tree-Relational Structure Enhancement for Oncology LLMs

TRACE:面向肿瘤学大语言模型的可部署树关系结构增强框架

Jizheng Lai, Yingyun Li, Ying Qin, Haiyang Qian

机构 * Pharmaron(康龙化成) ; AI Starfish

AI总结 TRACE通过可更新的树关系结构增强肿瘤学大语言模型,分离离线学习与在线推理,在零样本下提升分类与问答性能,优于RAG和GraphRAG,并支持可解释的临床推理证据路径。

Comments 18 pages, 2 figures, 19 tables. Accepted to the EMNLP 2026 Industry Track for oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.35809 2026-09-30 cs.CL cs.AI 新提交

Can Multimodal Large Language Models Generate and Detect Multimodal Social Media Fake News?

多模态大语言模型能否生成和检测多模态社交媒体假新闻?

Jiyao Yang, Yang Liu, Zhenyue Qin, Qingyu Chen, Xiuzhen Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) ; RMIT University(皇家墨尔本理工大学) ; Yale University(耶鲁大学)

AI总结 本研究提出多智能体框架生成多模态假新闻,并基准测试16个MLLM的检测能力,发现多数模型远低于人类水平,尤其在图像真实性识别上失败,为防御假新闻奠定基础。

Comments 15 pages, 6 figures. Accepted for publication in the Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.35807 2026-09-30 cs.CL cs.AI cs.DB 新提交

Environment Steering: Using Data Flow Control to Improve Agent Utility and Safety

环境引导:利用数据流控制提升智能体效用与安全性

Charlie Summers, Prajwal Raghunath, Aaditya Pai, Mayur Kulkarni, Zhuo Zhang, Oliver Kennedy, Eugene Wu

机构 * Columbia University(哥伦比亚大学) ; University at Buffalo(布法罗大学)

AI总结 提出环境引导方法,通过将智能体执行状态建模为数据库表并运行时检查数据流策略,在违规时提供反馈引导安全轨迹,在AgentDyn上实现0%攻击成功率并提升任务成功率。

Comments 9 pages, 11 figures, REALM Workshop, EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.35794 2026-09-30 cs.CL cs.LG 新提交

Sieve and Sage: Efficient Distraction Filtering for Reliable RALM Abstention

筛与智:面向可靠 RALM 弃权的高效干扰过滤

Jongbin Won, Sung Geun An, Jay-yoon Lee

机构 * Seoul National University(首尔大学)

AI总结 该研究提出Sieve和Sage框架,通过分解检索失败为不可回答和分心状态,用轻量模块筛选干扰证据,再调用LLM生成与弃权,显著提升准确率、F1并加速。

Comments 20 pages, 6 figures, accepted at EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.06076 2026-09-30 cs.LG 版本更新

Beyond Retraining-Free MoE Compression: A Cost-Normalized Study of Post-Compression Adjustment

超越免重训练的MoE压缩:压缩后调整的成本归一化研究

Sieun Hyeon, Jaeyoung Do

机构 * Seoul National University(首尔大学)

AI总结 本研究提出压缩后调整观点,通过小数据预算下的微调或KD,在多个MoE模型和基准上验证了其能显著恢复压缩损失,且全参数微调成本效益最佳。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29616 2026-09-30 cs.CL 版本更新

JPO: Juris Policy Optimization for Structured Legal Reasoning in Criminal Judgment Prediction

JPO:用于刑事判决预测中结构化法律推理的司法策略优化

Zhaolu Kang, Yantao Liu, Tailong Luo, Leqi Zheng, Lei Wei, Chenghua Zhu, Junhao Gong, Jiachen Qian, Eric Hanchen Jiang, Jiaxin Liu, Yuan Wang, Hao Zhang, Zixia Wang, Rong Fu, Zheng Lin, Richeng Xuan, Zhichao Hu

机构 * Tencent(腾讯) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; City University of Hong Kong(香港城市大学) ; University of California(加利福尼亚大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Zhejiang University(浙江大学) ; University of Hong Kong(香港大学)

AI总结 JPO是用于中国刑事判决预测的后训练框架,通过监督四步推理过程与带复合奖励的强化学习,提升判决预测及推理质量。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28405 2026-09-30 cs.CL cs.CY 版本更新

CultureConverse: A Multilingual Multi-turn Simulation Harness for Culturally Grounded Assistance in East and Southeast Asia

CultureConverse:面向东亚与东南亚文化适配助手的多语言多轮模拟工具包

Bryan Chen Zhengyu Tan, Weihua Zheng, Thong T. Doan, Bich Ngoc Doan, Jia Wang Peh, Xiaoyuan Yi, Jing Yao, Xing Xie, Nancy F. Chen, Zhengyuan Liu, JinYeong Bak, Wafi Shamdi, Soo Kai Chie, Liew Yu Siong, Aina Azyyati Binti Mohamad Rezal, Lew Yan Yan Vanessa, Huadan Wu, Dylan Raharja, Nadya Yuki Wangsajaya, Akane Fukushige, Kazushi Kato, Koji Inoue, Tatsuya Kawahara, Jaehyung Seo, Dongjun Kim, Seungyoon Lee, Zi Haur Pang, Rui Yang Tan, Charibeth Ko Cheng, Maria Regina Justina Estuar, Jann Railey Montalan, Pham Minh Duc, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学) ; Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) ; École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) ; Microsoft Research Asia (MSRA)(微软亚洲研究院) ; Sungkyunkwan University (SKKU)(成均馆大学) ; Universiti Brunei Darussalam (UBD)(文莱大学) ; China University of Petroleum (East China)(中国石油大学(华东)) ; Nanyang Technological University (NTU)(南洋理工大学) ; Kyoto University(京都大学) ; Konkuk University(建国大学) ; Upstage AI

AI总结 本研究推出CultureConverse多语言多轮模拟工具包,构建含14610个基准回合的数据集,评估18个模型发现GPT-5 mini表现最优,微调后模型在文化相关任务上性能提升。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18083 2026-09-30 cs.CL 版本更新

Entity tracking emerges in sub-billion parameter language models and exceeds human performance in naturalistic narratives

实体追踪在亚十亿参数规模的语言模型中出现,且在自然叙事中超越人类表现

Karolina Drożdż, Micha Heilbron

机构 * IDEAS Research Institute(IDEAS研究所) ; Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) ; University of Amsterdam(阿姆斯特丹大学)

AI总结 本研究发现4.1亿参数的语言模型已具备人类水平的实体追踪能力,且随规模提升而改善,远超人类表现,该能力在远小于预期的模型规模时出现。

Comments Accepted to EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29985 2026-09-30 cs.CL 版本更新

Are We Measuring Strategy or Phrasing? The Gap Between Surface- and Approach-Level Diversity in LLM Math Reasoning

我们是在衡量策略还是措辞?LLM数学推理中表面多样性与方法层面多样性的差距

Sangmook Lee, Minbeom Kim, Jeonghye Kim, Dohyung Kim, Sojeong Rhee, Kyomin Jung

机构 * Seoul National University(首尔国立大学) ; KAIST(韩国科学技术院)

AI总结 提出方法层面多样性概念,发现现有多样性指标无法反映策略差异,且多样性感知强化学习会降低方法多样性,直接优化方法多样性仍具挑战。

Comments Accepted to EMNLP 2026 and ICML 2026 Ai4Math Workshop (Honorable Mention). Code at this https URL (https://github.com/helmsman12/LLM_reasoning_diversity)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28013 2026-09-30 cs.CL 版本更新

KSAFE-MM: A Multimodal Safety Benchmark via Localized Contextualization for Korean Cultural Risks

KSAFE-MM:通过本地化语境化实现韩国文化风险的多模态安全基准

Yongwoo Kim, Sojung An, Yunjin Park, Jungwon Yoon, Dujin Lee, HyunBeom Cho, Jaewon Lee, Wonhyuk Lee, Youngchol Kim, JeongYeop Kim, Donghyun Kim

机构 * Korea University(韩国大学) ; KT Corporation(KT公司)

AI总结 针对多模态大语言模型在安全评估中缺乏文化特异性问题,提出KSAFE-MM基准,通过语言和视觉语境化构建通用与韩国文化特有的多模态安全测试集,揭示模型对文化攻击的脆弱性及安全性与过度拒绝之间的权衡。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29637 2026-09-30 cs.CL 版本更新

Evaluating Cross-lingual Knowledge Consistency in Code-Mixed vis-a-vis Indian Languages using IndicKLAR

评估混合语码与印度语言中的跨语言知识一致性:基于IndiKLAR

Debajyoti Mazumder, Divyansh Pathak, Prashant Kodali, Aditya Joshi, Akshay Agarwal, Jasabanta Patro

机构 * Indian Institute of Science Education and Research(印度科学教育与研究学院) ; Microsoft Corporation(微软公司) ; UNSW Sydney(新南威尔士大学悉尼分校)

AI总结 本文通过构建IndiKLAR基准,评估大语言模型在英语、混合语码和印度本土语言上的知识召回一致性,发现混合语码输入能显著缩小与英语的性能差距,并识别出从本土语言到混合语码的“翻转点”。

Comments Accepted EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21965 2026-09-30 cs.AI 版本更新

Read the Paper, Write the Code: Agentic Reproduction of Social-Science Results

读论文,写代码:社会科学结果的代理重生产

Benjamin Kohler, David Zollikofer, Johanna Einsiedler, Alexander Hoyle, Elliott Ash

机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Basel(巴塞尔大学)

AI总结 本文提出了一种代理重生产系统,通过提取论文中的方法描述,在不接触原始代码和数据的情况下复现社会科学结果,并通过误差溯源分析识别根本原因。

Comments This extended version of the paper forthcoming at EMNLP provides additional detail and discussion for a social science audience

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12054 2026-09-30 cs.MA 版本更新

REGREACT: Self-Correcting Multi-Agent Pipelines for Structured Regulatory Information Extraction

REGREACT:用于结构化监管信息提取的自校正多智能体流程

Mohammed Ali, Abdelrahman Abdallah, Adam Jatowt

AI总结 REGREACT通过自校正多智能体框架,将监管信息提取分解为七个阶段,每个阶段包含观察-诊断-修复循环,以提高结构化合规标准提取的准确性和完整性。

Comments Accepted to EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21305 2026-09-30 cs.CL 版本更新

Sycophancy Is Not One Thing: Causal Separation of Sycophantic Behaviors in LLMs

阿谀并非一物:在大型语言模型中因果分离阿谀行为

Daniel Vennemeyer, Phan Anh Duong, Tiffany Zhan, Tianyu Jiang

机构 * Department of Computer Science, University of Cincinnati(卡内基梅隆大学计算机科学系) ; School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

AI总结 研究通过分解阿谀行为为阿谀同意与阿谀赞美,揭示其在潜在空间中的独立表示结构,表明不同阿谀行为可通过独立方式调控。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14733 2026-09-30 cs.CV 版本更新

A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding

一种具备技能的代理框架和多视频理解基准

Yue Zhang, Liqiang Jing, Jia Li, Yapeng Tian, Xinya Du, Yunhui Guo, Vibhav Gogate

AI总结 本文提出MVX-Bench多视频跨维基准和SAMA框架,通过整合视觉工具和技能实现结构化推理,实验显示其在多视频理解任务中优于现有基线模型。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14035 2026-09-30 cs.AI 版本更新

FloCA: Towards Faithful and Logically Consistent Flowchart Reasoning

FloCA: 向忠实且逻辑一致的流程图推理迈进

Jinzi Zou, Bolin Wang, Shuo Zhang, Nuo Xu, Junzhou Zhao

机构 * MoE KLINNS Lab, Xi’an Jiaotong University, Xi’an 710049, P. R. China(西安交通大学) ; China Mobile Group Shaanxi Co., Ltd.(中国移动集团陕西公司)

AI总结 FloCA通过结合LLM和外部工具实现流程图推理,解决现有方法在流程图拓扑表示和幻觉问题上的不足,提升对话系统的准确性和一致性。

Comments Accepted to the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05385 2026-09-30 cs.CL 版本更新

IESR:Efficient MCTS-Based Modular Reasoning for Text-to-SQL with Large Language Models

IESR:基于MCTS的高效模块化推理用于文本到SQL with大型语言模型

Tao Liu, Jiafan Lu, Bohan Yu, Pengcheng Wu, Liu Haixin, Guoyu Xu, Li Xiangheng, Lixiao Li, Jiaming Hou, Zhao Shijun, Xinglin Lyu, Kunli Zhang, Yuxiang Jia, Hongyin Zan

机构 * Zhengzhou University(郑州大学) ; Tianjin University(天津大学) ; Zhongshan University(中山大学)

AI总结 IESR提出一种基于MCTS的高效模块化推理框架,用于文本到SQL任务,通过信息增强和结构化推理提升复杂查询处理能力。

Comments Accepted as EMNLP Main (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08626 2026-09-30 cs.CL 版本更新

How Order-Sensitive Are LLMs? OrderProbe for Deterministic Structural Reconstruction

大语言模型对顺序敏感性如何?OrderProbe用于确定性结构重建

Zhaolu Kang, Yingjie He, Kehan Jiang, Leqi Zheng, Jiachen Qian, Qianyuan Zhang, Chunlei Meng, Yujie Feng, Yuan Wang, Stephen Dou, Aming Wu, Pengxiang Zhao, Jiaxin Liu, Guansu Wang, Zeyu Zhang, Lei Wang, Qishi Zhan, Xiaomin He, Meisheng Zhang, Jianyuan Ni, Richeng Xuan

机构 * Peking University(北京大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; City University of Hong Kong(香港城市大学) ; Fudan University(复旦大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) ; Marquette University(马凯特大学) ; Juniata College(朱尼阿特学院)

AI总结 研究通过OrderProbe基准评估大语言模型对输入顺序的敏感性,发现即使在前沿模型上,结构重建仍面临挑战,且语义能力与结构鲁棒性存在脱节。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23140 2026-09-30 cs.CL 版本更新

TagPR: Tag-Guided Process Supervision for Personalization Reasoning in Large Language Models

标记思维:通过强化学习释放个性化推理能力

Song Jin, Juntian Zhang, Ruyu Lyu, Yong Liu, Xun Zhang, Yufei Zhang, Fei Jiang, Guojun Yin, Wei Lin, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) ; Meituan(美团) ; Wuhan University(武汉大学)

AI总结 针对LLM个性化推理不足,提出TagPR框架,通过语义标注推理链、SFT与多阶段RL及PRMU复合奖励实现用户逻辑对齐,并在LaMP等数据集上取得SOTA。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
↑