arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing

2026-09-01 至 2026-09-01 共收录 388
2608.30662 2026-09-01 cs.CL 新提交

MURANO: Design, Run, and Reproduce Mechanistic Interpretability Experiments as Composable Pipelines

MURANO:将机械可解释性实验设计、运行与复现作为可组合流水线

Alireza Bayat Makou, Emirhan Böge, Phu Gia Hoang, Federico Tiblias, Jingcheng Niu, Subhabrata Dutta, Richard Eckart de Castilho, Iryna Gurevych

机构 * Technical University of Darmstadt(达姆施塔特工业大学) Cluster of Excellence “Reasonable Artificial Intelligence” (RAI)(“合理人工智能”卓越集群) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心ATHENE) Zuse School ELIZA(楚思学校ELIZA) Ubiquitous Knowledge Processing (UKP) Lab(普适知识处理实验室)

AI总结 本文提出开源框架Murano,将大语言模型机械可解释性研究的五类操作封装为可组合步骤,可复现相关研究并开展案例分析,解决了多库适配的问题。

Comments Accepted to the EMNLP 2026 System Demonstrations Track. 11 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30661 2026-09-01 cs.CL 新提交

SwarmBench: Can Large Language Models Act as Agent Swarm Orchestrators?

SwarmBench:大语言模型能否充当智能体群的编排者?

Jinshan Gao, Zhuoran Jin, Tianyi Men, Kang Liu, Jun Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 该研究针对大语言模型作为智能体群编排者的评估需求,提出多维度基准SwarmBench,发现模型编排能力存在显著差异,并通过SwarmExp方法有效提升了编排性能。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30649 2026-09-01 cs.CL cs.CV 新提交

Where Identity Lives: Localized, Retain-Free Identity Unlearning in Multimodal Large Language Models

身份信息的留存位置:多模态大语言模型中无保留集的本地化身份遗忘

Kangwook Ko, Jaehyuk Jang, Wonjun Lee, Hee-Seon Kim, Changick Kim

机构 * KAIST(韩国科学技术院)

AI总结 该研究针对多模态大语言模型身份遗忘需依赖难获取保留集的问题,提出PAVA方法,定位解码器早期到中期MLPs并结合遗忘损失与视觉属性锚定,在基准上取得良好遗忘-保留权衡。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30646 2026-09-01 cs.CL cs.AI cs.LG 新提交

BiG-SURE - Bipartite Graph for Semantic Uncertainty and Reliability Estimation of LLMs

BiG-SURE - 用于大语言模型语义不确定性与可靠性估计的二分图

Debarpan Bhattacharya, Malay Phadke, Sriram Ganapathy

机构 * Indian Institute of Science(印度科学学院)

AI总结 BiG-SURE是一种基于跨温度语义一致性的二分图方法,用于黑盒LLMs/VLMs的语义不确定性与可靠性估计,在多类问答任务上提升了弃权AUROC性能。

Comments 22 pages, 9 figures

Journal ref EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30632 2026-09-01 cs.CL cs.AI cs.LG 新提交

GMTS: Gradient Magnitude-based Token Selection Improves RLVR Training for LLM Reasoning

GMTS:基于梯度幅度的令牌选择改进用于大语言模型推理的RLVR训练

Outongyi Lv, Yuanwei Zhang, Xiaoqun Zhang

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) Institute of Natural Sciences, Shanghai Jiao Tong University(上海交通大学自然科学研究院)

AI总结 本研究针对RLVR训练中高熵令牌重要性机制不明的问题,提出GMTS方法量化令牌重要性,实验显示其在多领域、多模型规模下性能优于熵基选择。

Comments Findings of the 2026 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30621 2026-09-01 cs.CV cs.AI 新提交

Cost-efficient Active Learning for Referring Image Segmentation and Grounding

用于指称图像分割与指称的高成本效益主动学习

Junbeom Hong, Seonghoon Yu, Hyung Rok Jung, Sundong Kim, Jeany Son

机构 * Meissa KAIST(韩国科学技术院) GIST(光州科学技术院) POSTECH(浦项科技大学)

AI总结 该研究针对视觉指称的标注瓶颈,提出结合基础模型生成辅助区域-文本对与指称区域模糊度获取函数的主动学习框架,在RIS、REC基准及用户研究中均实现更优性能与更快标注速度。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30619 2026-09-01 cs.CL cs.AI 新提交

Hidden Threat in Synthetic Data: Covert Targeted Bias Injection through Benign Text

合成数据中的隐藏威胁:通过良性文本注入隐蔽的针对性偏见

Minkyung Cho, Jihyo Kim, SeungWoo Song, Junghun Yuk, Minjoon Kee, Hoyun Song, KyungTae Lim

机构 * KAIST(韩国科学技术院) Dankook University(檀国大学)

AI总结 该研究发现可通过语义良性的合成数据,利用潜意识学习机制向对齐LLM注入针对性社会偏见,同时保留模型通用任务能力,揭示了合成数据训练LLM的新安全风险,提出基于对数线性的评分或可用于筛查此类数据。

Comments To be published in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30614 2026-09-01 cs.CL 新提交

TaxCE : A Framework for Automated Taxonomy Construction and Evaluation at Scale

TaxCE:大规模自动分类法构建与评估框架

Sandeep Sricharan Mukku, Albert Aristotle Nanda, Rohit Pyati

机构 * Amazon(亚马逊)

AI总结 针对大规模非结构化反馈文本分类法构建的挑战,本文提出TaxCE框架,结合EEG指标的闭环迭代优化机制,在分类法质量上优于现有基线方法。

Comments EMNLP 2026 - Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30609 2026-09-01 cs.CL cs.AI cs.LG 新提交

Reading the News: Adapting Large Language Models to Swedish Journalism Through Continued Pre-Training

阅读新闻:通过持续预训练使大型语言模型适配瑞典新闻业

Lukas Borggren, Jenny Kunz, Marco Kuhlmann

机构 * Linköping University(林雪平大学) Bonnier News(邦尼尔新闻)

AI总结 本研究通过整理新闻数据集对大型语言模型进行持续预训练,结合经验回放缓解遗忘,提升了模型在瑞典新闻领域的生成质量与事实知识,且需针对性评估适配效果。

Comments Accepted at EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30597 2026-09-01 cs.LG cs.CL 新提交

PLC-DPO: Posterior Label Correction in Noisy and Ambiguous Preference Optimization

PLC-DPO:带噪声与歧义偏好优化中的后验标签修正

Boryeong Cho, Sumyeong Ahn, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能学院) KENTECH(韩国世宗国立大学(原韩国科学技术研究院世宗校区))

AI总结 PLC-DPO针对DPO假设偏好全可靠的缺陷,提出后验标签修正方法,经57个数据集-模型-基准单元验证,其平均胜率优于DPO及次优方法,且在各类测试中表现稳定。

Comments Findings of EMNLP 2026; Code is available at https://github.com/VennTum99/PLC-DPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30583 2026-09-01 cs.CL 新提交

Language Proficiency Assessment from Eye Movements in Naturalistic Passage Reading

基于自然段落阅读眼动的语言能力评估

Shachar Frenkel, Ido Falah, Omer Shubi, Yevgeni Berzak

机构 * Faculty of Data and Decision Sciences(数据与决策科学学院) Technion - Israel Institute of Technology(以色列理工学院)

AI总结 本研究将眼动预测语言能力的方法扩展至自然段落阅读等场景,提出评分去偏差方法,验证其有效性、可靠性及去偏差效果,为相关评估技术提供更扎实的实证基础。

Comments Accepted to EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30564 2026-09-01 cs.LG cs.AI 新提交

Q-Strata: Hierarchical Bit Allocation for Mixed-Precision Quantization of Mixture-of-Experts LLMs

Q-Strata:混合专家大型语言模型混合精度量化的分层比特分配

Deokjae Lee, Sihun Chu, Hyun Oh Song

机构 * Seoul National University(首尔大学) Neural Processing Research Center(神经处理研究中心)

AI总结 Q-Strata是一种双层分配器,通过为混合专家MoE大型语言模型的每个模块设置一个预算,优化模型级目标以实现混合精度量化,在低比特 regime 下优于GPTQ、MxMoE和GEMQ。

Comments EMNLP 2026 Long Paper - Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30563 2026-09-01 cs.CV 新提交

Modality Disentangled Learning for Incomplete Multimodal Emotion Recognition: A Primitive Memory Distillation Perspective

面向不完整多模态情感识别的模态解耦学习:一种原语记忆蒸馏视角

Jiaqi Zhang, Zheng Pang, Mengting Li, Yiqi Wang, Guangyuan Dong, Chao Xue, Yusen Wu, Zihao Li, Huy Phan, Sicheng Zhao, Björn W. Schuller, Jiachen Luo

机构 * Jiangsu University(江苏大学) Griffith University(格里菲斯大学) National University of Singapore(新加坡国立大学) University of New South Wales(新南威尔士大学) Fujian University of Technology(福建理工大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) Tsinghua University(清华大学) Technical University of Munich(慕尼黑工业大学) Imperial College London(伦敦帝国学院) Queen Mary University of London(伦敦玛丽女王大学)

AI总结 本文针对不完整多模态情感识别中现有方法忽略模态异质性的问题,提出PriMD框架,通过解耦语义与原语构建记忆库,在多数据集上实现SOTA性能与更强鲁棒性。

Comments 19 Pages, 8 Figures, 13 Tables. Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30559 2026-09-01 cs.SD 新提交

SPHERE: Automatic Music Upmixing via Audio Language Model Post-Training with Spatial Heuristic Rewards

SPHERE:通过结合空间启发式奖励的音频语言模型后训练实现自动音乐上混

Zixun Guo, Calvin Murdock, Sanjeel Parekh, W Owen Brimijoin, Simon Dixon, Joshua Reiss, Ishwarya Ananthabhotla

机构 * Meta Reality Labs(元宇宙实验室) Queen Mary University of London(伦敦玛丽女王大学)

AI总结 该研究提出基于音频语言模型后训练的自动音乐上混方法,设计含6个子奖励的Sphere奖励套件,证明领域知识可蒸馏入语言模型实现该任务。

Journal ref EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30556 2026-09-01 cs.AI 新提交

AdaPath: Query-Adaptive Path-Finding via Path-Bank for Multi-Hop Implicit Biomedical KGQA

AdaPath:基于路径库的查询自适应路径查找用于多跳隐式生物医学知识图谱问答

Jun Hyeong Kim, Dongki Kim, Yinhua Piao, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

AI总结 本文针对生物医学KGQA的两个挑战,提出AdaPath框架,通过Path-Bank检索查询自适应元路径,发布BioStrat-QA基准,在多个生物医学KGQA基准上性能优于基线。

Comments 25 pages, 6 figures, 30 tables

Journal ref EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30553 2026-09-01 cs.IR cs.AI 新提交

Preference Shapes Relevance: Cross-component Hierarchical Semantic Alignment for Personalized Generative Retrieval

偏好塑造相关性:面向个性化生成式检索的跨组件分层语义对齐

Gaoming Zhang, Angqing Jiang, Jianchun Song, Kena Qi, Dayao Chen, Wei Lin, Defu Lian

AI总结 针对生成式检索的语义鸿沟、未建模用户行为及推理延迟问题,提出CHAP框架,通过分层语义对齐等机制实现高效个性化检索,在多数据集及在线测试中表现优异。

Comments Findings of EMNLP 2026. 22 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30541 2026-09-01 cs.CL 新提交

Seeing the Unseen: Visual Similarity for Pixel Language Model Adaptation

看见不可见之处:面向像素语言模型适配的视觉相似性

Ran Zhang, Miryam de Lhoneux, Wessel Poelman

机构 * KU Leuven(KU Leuven(天主教鲁汶大学))

AI总结 本研究以藏语为案例,针对像素语言模型适配低资源语言的问题,提出四个渲染级视觉文字相似性指标,发现正字法邻近度可增强语义迁移,且多语言预训练的PIXEL-M4与混合文字的单语言模型PIXEL的适配表现存在不对称性。

Comments EMNLP 2026: Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30530 2026-09-01 cs.CL cs.SE 新提交

WebWorld: The Browser as a World Model for Self-Improving Web Code

WebWorld:将浏览器作为自改进网页代码的世界模型

Jiajun Wu, Jian Yang, Yaxin Du, Wei Zhang, Haowen Wang, Junhang Cheng, Yuxuan Zhang, Tuney Zheng, Xianglong Liu, Ming Zhou

机构 * Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学) IQuest Research(IQuest研究院) Langboat

AI总结 本研究提出WebWorld,将浏览器作为VLM无法欺骗的网页代码世界模型,通过浏览器签发合格证书的机制实现VLM自主交互与监督,使WebWorld-27B在两个基准任务上实现显著性能提升,达到强前沿系统水平。

Comments EMNLP Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30528 2026-09-01 cs.LG 新提交

PAC: Progress-Augmented Advantage Curriculum for Multi-Task Reinforcement Learning of LLMs

PAC:面向大语言模型多任务强化学习的进度增强优势课程

Yuanqiang Yu, Yanzhao Zheng, Zhentao Zhang, Tianze Xu, Chao Ma, Jihuai Zhu, Jiashun Liu, Xinle Deng, Baohua Dong, Hangcheng Zhu, Ruohui Huang

机构 * Alibaba Group(阿里巴巴集团)

AI总结 该研究针对LLM多任务RL后训练的任务分配问题,提出PAC方法结合优势与奖励增益信号,经多场景验证可提升样本效率与最终性能。

Comments Accepted at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30517 2026-09-01 cs.AI cs.CL 新提交

ScienceArena: Benchmarking LLMs on Latest Scientific Olympiad Competitions

ScienceArena:在最新科学奥林匹克竞赛上对大语言模型(LLM)进行基准测试

Guangxiang Zhao, Qilong Shi, Xusen Xiao, Wenpu Liu, Yaoming Li, Linfeng Hao, Shuyang Hou, Zijian Guo, Xinrui Zhang, Yuntian Zhao, Zhengyang Wang, Wenrui Liu, Yuhan Wu, Tong Yang, Lin Sun, Xiangzheng Zhang

机构 * Qiyuan Tech(奇安信科技) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Peking University(北京大学)

AI总结 本研究推出ScienceArena基准,涵盖多类科学竞赛,经专家审核构建并校准LLM评判者,评估14个LLM发现顶尖模型获奖牌级分数,化学与长程一致性仍为瓶颈。

Comments 18 pages, EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30485 2026-09-01 cs.CL cs.CY cs.LG 新提交

Two Centuries of Sexism in British Parliament: A Computational Analysis of Women's Representation in the Hansard Corpus

英国议会两百年的性别歧视:对Hansard语料库中女性代表性的计算分析

Mohammad Omar Khursheed, Mandira Sawkar, Ashiqur R. KhudaBukhsh

机构 * Rochester Institute of Technology(罗切斯特理工学院)

AI总结 本研究通过分析英国Hansard语料库的6531篇议会演讲,利用大语言模型发现反对女性参政的演讲性别歧视比例更高,支持选举权的性别歧视多为善意,且男女议员支持女性权利的比例存在差距,验证了矛盾性别歧视理论。

Comments Accepted at EMNLP 2026 (Main Conference Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30480 2026-09-01 cs.CV cs.LG 新提交

VisER: Visual Evidence and Reliance for Object Hallucination Detection in LVLMs

VisER:用于大视觉语言模型(LVLMs)中物体幻觉检测的视觉证据与依赖关系

Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, Sarah Erfani

机构 * School of Computing and Information Systems(计算与信息系统学院) The University of Melbourne(墨尔本大学)

AI总结 VisER 是一种无训练双向指标,通过视觉证据与视觉依赖两个互补视角检测 LVLMs 的物体幻觉,在 AUROC、AUPR 指标上优于多个基线方法。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30462 2026-09-01 cs.CL cs.AI 新提交

Enhancing Low-Resource Language Reasoning via High-Resource Language Feature Transfer

通过高资源语言特征迁移提升低资源语言推理能力

Minju Song, Hyeon Hwang, Junhyun Lee, Jaewoo Kang

机构 * Korea University(高丽大学) Hankuk University of Foreign Studies(韩国外国语大学) Noah’s Farm(诺亚农场) AIGEN Sciences(AIGEN科学公司)

AI总结 该研究提出跨语言特征迁移机制框架,通过分离高资源语言的任务推理特征注入低资源语言,以提升低资源语言的推理能力,将部分跨语言推理差距归因于机制引出失败。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30437 2026-09-01 cs.CL 新提交

Graph Evidence Is Not Enough: Diagnosing Native Decoder Use in Graph-Augmented LLMs

仅靠图证据是不够的:诊断图增强大型语言模型中的原生解码器使用情况

Xiaoyu Guo, Pengcheng Chen, Jiong Yu, Yi Lu, Yaohua Wang, Ziyang Li

AI总结 该研究针对图增强LLM检验图证据可被原生解码器使用的假设,通过HopQA诊断任务发现现有模型无法有效利用图证据,提出S²GE方法在多个数据集上大幅提升性能,并揭示了相关 regimes。

Comments 18 pages, 4 figures, ccepted at EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30429 2026-09-01 cs.AI cs.CL 新提交

EvoSkill Injection: Red-Teaming Autonomous Skill Generation and Evolution in Self-Evolving Agents

EvoSkill注入:针对自进化智能体中自主技能生成与进化的红队测试

Doyun Kim, Chanwoo Kim, Sugyeong Eo, Yeo-Chan Yoon, Chanjun Park

机构 * Soongsil University(崇实大学) Yonsei University(延世大学) Jeju National University(济州国立大学)

AI总结 本文定义了针对自进化智能体自主技能进化流程的EvoSkill注入威胁模型,提出SARGE红队测试框架,构建相关基准并验证其可诱导恶意技能形成与持久激活,凸显能力损坏风险。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30425 2026-09-01 cs.CL 新提交

Generative Models Enhanced by Sequence Labelling and Aspect-Code Switching Improve Cross-lingual Aspect-Based Sentiment Analysis

结合序列标注与方面代码切换增强的生成模型改进跨语言方面级情感分析

Jakub Šmíd, Pavel Přibáň, Pavel Král

机构 * University of West Bohemia in Pilsen(比尔森西波希米亚大学) NTIS – New Technologies for the Information Society(NTIS——信息社会新技术研究院) Faculty of Applied Sciences(应用科学学院)

AI总结 本文提出SeqLab框架结合序列标注与方面代码切换技术,在11种语言、3个领域的跨语言ABSA任务中超越SOTA,还评估了多语言对并拓展至更具挑战的TASD任务。

Comments Accepted for The 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30413 2026-09-01 cs.AI 新提交

DERELAB: Probing Defeasible Reasoning and Confirmation Bias in LLMs with a Generative Benchmark

DERELAB:用生成式基准测试探究大型语言模型中的可废止推理与确认偏差

Jayanta Sadhu, Sayem Shahad, Kenneth Marino

机构 * University of Utah(犹他大学) Bangladesh University of Engineering and Technology(孟加拉工程技术大学)

AI总结 本研究推出DeReLab生成式基准框架,评估9种大型语言模型,发现其普遍存在确认偏差,即易接受一致证据、抵制不一致更新,部分模型能识别弱化更新却不修正结论。

Comments Accepted at the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30405 2026-09-01 cs.AI 新提交

Dense Clinical Contrasts Enhance Medical Knowledge Updating in Large Language Models

密集临床对比可增强大型语言模型中的医学知识更新

Yangmin Huang, Shu Quan, He Geng, Xin Ye, Qianyun Du, Zhiyang He, Jiaxue Hu, Xiaodong Tao

机构 * Xunfei Healthcare Technology Co., Ltd.(讯飞医疗科技股份有限公司)

AI总结 该研究提出SEER-Bench基准,对比四种监督形式后发现EMQ在相同预算下可提升大型语言模型的医学知识更新效果,4B模型在该监督下于SEER-Bench取得64.8%答案准确率,证明医学知识更新与监督形式相关。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30398 2026-09-01 cs.CL cs.IR 新提交

Beyond Polarization: The Generative Constraint of Chain-of-Thought in Pointwise Reranking

超越极化:点式重排序中思维链的生成约束

Xiaoyang Chen, Jie Liu, Haijin Liang, Haibo Shi, Jin Ma, Ben He, Yingfei Sun, Dezhi Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent(腾讯)

AI总结 本研究针对点式重排序中思维链模型性能弱于直接评分模型的问题,通过实证研究及多种干预措施,发现排序差距源于离散文本传递连续相关性语义的瓶颈,而非易解决的训练偏差。

Comments Accepted at EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30395 2026-09-01 cs.CL 新提交

When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models

当大语言模型遇到树搜索:大语言模型中作为搜索的推理的系统视角

Jiaqi Wei, Xiang Zhang, Yuejin Yang, Wenxuan Huang, Juntai Cao, Sheng Xu, Xiang Zhuang, Zhangyang Gao, Muhammad Abdul-Mageed, Laks VS Lakshmanan, Chenyu You, Wanli Ouyang, Siqi Sun

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) University of British Columbia(不列颠哥伦比亚大学) Stony Brook University(石溪大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本综述将大语言模型的推理视为搜索,系统化基于树搜索的推理进展,引入统一设计空间并倡导标准化计算报告,以优化推理权衡。

Comments Accepted by EMNLP'2026

详情

展开后加载摘要…

URL PDF HTML 收藏