arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-27 至 2025-11-27 共收录 70 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 4 篇

2412.15287 2025-11-27 cs.CL cs.AI cs.LG 67%

Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models

为大型语言模型的最佳-N采样进行推理感知微调

Yinlam Chow, Guy Tennenholtz, Izzeddin Gur, Vincent Zhuang, Bo Dai, Sridhar Thiagarajan, Craig Boutilier, Rishabh Agarwal, Aviral Kumar, Aleksandra Faust

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种推理感知微调方法,通过改进最佳-N采样策略提升大型语言模型的性能和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18477 2025-11-27 cs.IR cs.AI cs.LG 62%

Personalized Image Generation for Recommendations Beyond Catalogs

推荐超越目录的个性化图像生成

Gabriel Patron, Zhiwei Xu, Ishan Kapnadak, Felipe Maia Polo

机构 * University of Michigan(密歇根大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 REBECA通过直接学习隐含反馈信号实现高效个性化图像生成,无需微调扩散模型,提升大规模用户群体的个性化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21185 2025-11-27 cs.CV cs.AI 57%

Progress by Pieces: Test-Time Scaling for Autoregressive Image Generation

分块进展:用于自回归图像生成的测试时扩展

Joonhyung Park, Hyeongwon Jang, Joowon Kim, Eunho Yang

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 GridAR通过网格分区逐步生成和布局指定提示重述策略,在有限测试时扩展下提升视觉自回归模型的生成质量与编辑效果。

Comments Project page: https://grid-ar.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20677 2025-11-27 cs.CL cs.DB 57%

Prompt Engineering Techniques for Context-dependent Text-to-SQL in Arabic

针对阿拉伯语上下文依赖文本到SQL的提示工程技术

Saleh Almohaimeed, May Alsofyani, Saad Almohaimeed, Mansour Al Ghanim, Liqiang Wang

机构 * Department of Computer Science University of Central Florida Orlando, Florida, USA(计算机科学系 佛罗里达中央大学 奥兰多分校)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 本文提出Ar-SParC数据集及GAT corrector方法,通过提示工程技术提升阿拉伯语文本到SQL任务的性能。

Comments Accepted at IJCNN 2025 (to appear in IEEE/IJCNN proceedings). This arXiv submission corresponds to the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 8 篇

2511.21402 2025-11-27 cs.CL 85%

Text-to-SQL as Dual-State Reasoning: Integrating Adaptive Context and Progressive Generation

文本到SQL作为双状态推理:整合自适应上下文和渐进生成

Zhifeng Hao, Qibin Song, Ruichu Cai, Boyan Xu

机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机科学学院) College of Science, Shantou University(汕头大学科学学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 DSR-SQL通过双状态推理框架整合自适应上下文和渐进生成,提升文本到SQL的执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19900 2025-11-27 cs.CV cs.AI 83%

Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning

Agent0-VL: 探索自我进化代理用于工具集成的视觉-语言推理

Jiaqi Liu, Kaiwen Xiong, Peng Xia, Yiyang Zhou, Haonian Ji, Lu Feng, Siwei Han, Mingyu Ding, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 复杂问题求解 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 Agent0-VL通过工具集成推理实现自我进化,无需人类标注或外部奖励,提升视觉-语言推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21689 2025-11-27 cs.CL cs.AI cs.LG cs.MA 67%

ToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestration

ToolOrchestra:通过高效模型和工具协同提升智能

Hongjin Su, Shizhe Diao, Ximing Lu, Mingjie Liu, Jiacheng Xu, Xin Dong, Yonggan Fu, Peter Belcak, Hanrong Ye, Hongxu Yin, Yi Dong, Evelina Bakhturina, Tao Yu, Yejin Choi, Jan Kautz, Pavlo Molchanov

机构 * NVIDIA University of Hong Kong(香港大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ToolOrchestra通过高效模型和工具协同提升智能,实现更高效且更有效的工具增强推理系统。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13380 2025-11-27 cs.CL cs.IR cs.LG 62%

The Structure-Content Trade-off in Knowledge Graph Retrieval

知识图谱检索中的结构与内容权衡

Valentin Six, Evan Dufraisse, Gaël de Chalendar

机构 * Université Paris-Saclay - CEA Palaiseau - France(巴黎-萨克雷大学-CEA帕莱索-法国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了知识图谱检索中结构与内容的权衡,通过混合检索函数发现平衡两者可提升LLM的推理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20662 2025-11-27 cs.CL 57%

Democratizing LLM Efficiency: From Hyperscale Optimizations to Universal Deployability

让大语言模型效率普及:从超大规模优化到通用部署

Hen-Hsen Huang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出通过改进LLM的效率方法,使其在有限资源和专业知识下仍能有效运作,以实现更广泛的部署和公平性。

Comments 8 pages, accepted as a Blue Sky Talk in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21250 2025-11-27 cs.CL 57%

ReSCORE: Label-free Iterative Retriever Training for Multi-hop Question Answering with Relevance-Consistency Supervision

ReSCORE:无标签迭代检索器训练用于多跳问答的 relevancy-一致性监督

Dosung Lee, Wonjun Oh, Boyoung Kim, Minyoung Kim, Joonsuk Park, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(韩国大学计算机科学与工程系) NAVER AI Lab(NAVER AI实验室) NAVER Cloud(NAVER云) University of Richmond(里奇蒙大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 ReSCORE通过无标签数据训练密集检索器,提升多跳问答的检索与回答性能。

Comments 9 pages, 3 figures, ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19278 2025-11-27 cs.CV 50%

ReMatch: Boosting Representation through Matching for Multimodal Retrieval

ReMatch: 通过匹配提升表示以实现多模态检索

Qianying Liu, Xiao Liang, Zhiqiang Zhang, Zhongfei Qing, Fengfan Zhou, Yibo Chen, Xu Tang, Yao Hu, Paul Henderson

机构 * University of Glasgow(格拉斯哥大学) Xiaohongshu Inc.(小红书公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 ReMatch通过生成匹配阶段提升多模态检索的表示能力,利用端到端训练和细粒度嵌入生成,在MMEB基准上取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06283 2025-11-27 cs.CV 50%

TinyChemVL: Advancing Chemical Vision-Language Models via Efficient Visual Token Reduction and Complex Reaction Tasks

TinyChemVL:通过高效视觉标记减少和复杂反应任务推进化学视觉-语言模型

Xuanle Zhao, Shuxin Zeng, Xinyuan Cai, Xiang Cheng, Duzhen Zhang, Xiuyi Chen, Bo Xu

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 TinyChemVL通过高效视觉标记减少和复杂反应任务提升化学视觉-语言模型的效率和推理能力,实现更高效的化学任务处理。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理评测 22 篇

2511.20701 2025-11-27 cs.AI cs.LG 92%

Cross Domain Evaluation of Multimodal Chain-of-Thought Reasoning of different datasets into the Amazon CoT Framework

跨领域评估不同数据集的多模态链式推理在Amazon CoT框架中的表现

Nitya Tiwari, Parv Maheshwari, Vidisha Agarwal

机构 * Indian Institute of Technology Bombay(印度理工学院孟买学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.AI、cs.LG

AI总结 本文评估了多模态链式推理在不同数据集上的表现,发现视觉整合减少幻觉但不同问题类型对推理有效性影响显著,为多模态推理系统改进提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02890 2025-11-27 cs.CL cs.AI 86%

Reasoning Transfer for an Extremely Low-Resource and Endangered Language: Bridging Languages Through Sample-Efficient Language Understanding

为极低资源和濒危语言进行推理迁移:通过高效样本的语言理解连接语言

Khanh-Tung Tran, Barry O'Sullivan, Hoang D. Nguyen

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出英语引导的Co T训练方法,通过监督微调提升极低资源语言的推理能力,并发布首个爱尔兰语数学任务基准测试,展示多语言推理的可行路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20471 2025-11-27 cs.AI 85%

Universe of Thoughts: Enabling Creative Reasoning with Large Language Models

思想宇宙:通过大语言模型实现创造性推理

Yuto Suzuki, Farnoush Banaei-Kashani

机构 * Department of Computer Science and Engineering University of Colorado Denver(计算机科学与工程系科罗拉多大学丹佛分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 通过引入思想宇宙框架,UoT提出了三种创造性推理范式,以提升大语言模型在复杂问题中的创造性解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20680 2025-11-27 cs.CL cs.AI 84%

Cognitive bias in LLM reasoning compromises interpretation of clinical oncology notes

大语言模型的认知偏差影响临床肿瘤学笔记的解读

Matthew W. Kenaston, Umair Ayub, Mihir Parmar, Muhammad Umair Anjum, Syed Arsalan Ahmed Naqvi, Priya Kumar, Samarth Rawal, Aadel A. Chaudhuri, Yousef Zakharia, Elizabeth I. Heath, Tanios S. Bekaii-Saab, Cui Tao, Eliezer M. Van Allen, Ben Zhou, YooJung Choi, Chitta Baral, Irbaz Bin Riaz

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示了大语言模型在肿瘤学笔记解读中因推理缺陷导致的临床安全隐患,并提出了一种可推广的推理错误分类框架。

Comments 24 pages, 6 figures, 1 supplementary figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20399 2025-11-27 cs.CL cs.AI 84%

BengaliFig: A Low-Resource Challenge for Figurative and Culturally Grounded Reasoning in Bengali

BengaliFig:一种低资源挑战,用于孟加拉语中的隐喻和文化相关推理

Abdullah Al Sefat

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 BengaliFig通过孟加拉语隐喻和文化相关推理的低资源挑战,评估LLM在文化特定推理中的表现,并推动包容性NLP评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21581 2025-11-27 cs.LG 83%

Learning When to Stop: Adaptive Latent Reasoning via Reinforcement Learning

学习何时停止:通过强化学习实现自适应潜在推理

Alex Ning, Yen-Ling Kuo, Gabe Gomes

机构 * University of Virginia(弗吉尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文提出通过强化学习优化潜在推理长度,实现更高效的推理压缩,实验显示推理长度减少52%且准确性无损失。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20994 2025-11-27 cs.CV cs.AI cs.CR 79%

GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervision

GuardTrace-VL: 通过迭代安全监督检测不安全的多模型推理

Yuxiao Xiang, Junchi Chen, Zhenchao Jin, Changtao Miao, Haojie Yuan, Qi Chu, Tao Gong, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络安全学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 GuardTrace-VL通过联合图像-文本分析监控多模态推理全过程,有效检测不安全推理内容,实现93.1%的F1分数提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15974 2025-11-27 cs.AI 79%

KRAL: Knowledge and Reasoning Augmented Learning for LLM-assisted Clinical Antimicrobial Therapy

KRAL: 用于LLM辅助临床抗菌治疗的知识与推理增强学习

Zhe Li, Yehan Qiu, Yujie Chen, Xiang Zhou

机构 * Information Center, State Key Laboratory of Complex Severe and Rare Diseases, Peking Union Medical College Hospital(信息中心、复杂严重罕见疾病国家重点实验室、北京友谊医院) Department of Critical Care Medicine, State Key Laboratory of Complex Severe and Rare Diseases, Peking Union Medical College Hospital, Peking Union Medical College and Chinese Academy of Medical Sciences(重症医学科、复杂严重罕见疾病国家重点实验室、北京友谊医院、北京友谊医院和中国医学科学院) Medical Intensive Care Unit, State Key Laboratory of Complex Severe and Rare Diseases, Peking Union Medical College Hospital, Peking Union Medical College and Chinese Academy of Medical Sciences(医疗重症病房、复杂严重罕见疾病国家重点实验室、北京友谊医院、北京友谊医院和中国医学科学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 KRAL通过知识与推理增强学习提升LLM在临床抗菌治疗中的诊断能力,以低成本高效方式优化医疗决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18955 2025-11-27 cs.AI cs.CR cs.SE 79%

Co-PatcheR: Collaborative Software Patching with Component(s)-specific Small Reasoning Models

Co-PatcheR: 基于组件特定小推理模型的协作软件修补

Yuheng Tang, Hongwei Li, Kaijie Zhu, Michael Yang, Yangruibo Ding, Wenbo Guo

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 Co-PatcheR通过组件特定的小推理模型实现协作软件修补,提升修补效率并减少训练资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15848 2025-11-27 cs.AI cs.CL cs.SD 73%

Step-Audio-R1 Technical Report

Step-Audio-R1 技术报告

Fei Tian, Xiangyu Tony Zhang, Yuxin Zhang, Haoyang Zhang, Yuxin Li, Daijiao Liu, Yayue Deng, Donghang Wu, Jun Chen, Liang Zhao, Chengyuan Yao, Hexin Liu, Eng Siong Chng, Xuerui Yang, Xiangyu Zhang, Daxin Jiang, Gang Yu

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 Step-Audio-R1 是首个实现音频领域推理能力的模型,通过MGRD框架生成基于声音特征的推理链,超越Gemini 2.5 Pro并达到Gemini 3 Pro水平。

Comments 22 pages, 5 figures. Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21444 2025-11-27 cs.AI physics.ao-ph 70%

EWE: An Agentic Framework for Extreme Weather Analysis

EWE:极端天气分析的代理框架

Zhe Jiang, Jiong Wang, Xiaoyu Yue, Zijie Guo, Wenlong Zhang, Fenghua Ling, Wanli Ouyang, Lei Bai

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Sydney(悉尼大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 EWE是首个用于极端天气分析的智能代理框架,通过知识引导的规划和闭环推理实现自动化诊断,提供首个该领域基准测试,推动科学发现民主化进程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21298 2025-11-27 cs.CV 67%

PathMamba: A Hybrid Mamba-Transformer for Topologically Coherent Road Segmentation in Satellite Imagery

PathMamba: 一种混合Mamba-Transformer模型用于卫星图像中拓扑一致的道路分割

Jules Decaestecker, Nicolas Vigne

机构 * Thales CortAIx Labs(泰勒斯 CortAIx 实验室)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 PathMamba通过结合Mamba和Transformer的优势,实现了卫星图像中高精度且拓扑连续的道路分割,同时保持计算效率。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20937 2025-11-27 cs.AI cs.CL cs.CV cs.RO 62%

ENACT: Evaluating Embodied Cognition with World Modeling of Egocentric Interaction

ENACT:通过视角交互的世界建模评估具身认知

Qineng Wang, Wenlong Huang, Yu Zhou, Hang Yin, Tianwei Bao, Jianwen Lyu, Weiyu Liu, Ruohan Zhang, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) UCLA(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ENACT通过视角交互的世界建模评估具身认知,揭示VLMs在长周期交互中与人类表现差距扩大,且模型在逆向任务中表现更优。

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20736 2025-11-27 cs.CY cs.AI cs.CL 62%

Large Language Models' Complicit Responses to Illicit Instructions across Socio-Legal Contexts

大语言模型在社会法律情境中对非法指令的共谋回应

Xing Wang, Huiyuan Xie, Yiyan Wang, Chaojun Xiao, Huimin Chen, Holli Sargeant, Felix Steffek, Jie Shao, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学) University of Cambridge(剑桥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨大语言模型在社会法律情境中对非法指令的共谋回应,揭示其在不同情境下的安全性和易感性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19858 2025-11-27 cs.CL cs.AI 62%

A Systematic Analysis of Large Language Models with RAG-enabled Dynamic Prompting for Medical Error Detection and Correction

基于RAG动态提示的大型语言模型系统分析:用于医疗错误检测与纠正

Farzad Ahmed, Joniel Augustine Jerome, Meliha Yetisgen, Özlem Uzuner

机构 * George Mason University(乔治·马歇尔大学) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于RAG动态提示的医疗错误检测与纠正方法,通过对比不同提示策略,发现RDP在准确率、召回率和纠错可靠性方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06998 2025-11-27 cs.CV cs.AI cs.LG 62%

Not All Splits Are Equal: Rethinking Attribute Generalization Across Unrelated Categories

并非所有分割都平等:重新思考跨无关类别的属性泛化

Liviu Nicolae Fircă, Antonio Bărbălau, Dan Oneata, Elena Burceanu

机构 * Bitdefender University of Bucharest(布加勒斯特大学) National University of Science and Technology Politehnica Bucharest(布加勒斯特技术科学国家大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究模型在跨无关类别间进行属性泛化的鲁棒性,通过改进的分割策略评估属性预测性能,发现聚类方法在减少相关性的同时保持学习能力,揭示了当前表示的局限性。

Comments Accepted at NeurIPS 2025 Workshop: CauScien - Uncovering Causality in Science and NeurIPS 2025 Workshop: Reliable ML from Unreliable Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10507 2025-11-27 cs.CL 57%

AdvancedIF: Rubric-Based Benchmarking and Reinforcement Learning for Advancing LLM Instruction Following

AdvancedIF:基于规则的基准测试与强化学习以推进大语言模型指令跟随

Yun He, Wenzhe Li, Hejia Zhang, Songlin Li, Karishma Mandyam, Sopan Khosla, Yuanhao Xiong, Nanshu Wang, Xiaoliang Peng, Beibin Li, Shengjie Bi, Shishir G. Patil, Qi Qi, Shengyu Feng, Julian Katz-Samuels, Richard Yuanzhe Pang, Sujan Gonugondla, Hunter Lang, Yue Yu, Yundi Qian, Maryam Fazel-Zarandi, Licheng Yu, Amine Benhalloum, Hany Awadalla, Manaal Faruqui

机构 * Meta Superintelligence Labs(Meta超智能实验室) Princeton University(普林斯顿大学)

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 本研究提出AdvancedIF基准和RIFL方法,通过规则生成和奖励塑造提升大语言模型的指令跟随能力,在AdvancedIF上实现6.7%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21568 2025-11-27 cs.CL 57%

RoParQ: Paraphrase-Aware Alignment of Large Language Models Towards Robustness to Paraphrased Questions

RoParQ:面向抗 paraphrased 问题的大型语言模型对齐

Minjoon Choi

机构 * Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 RoParQ 通过引入 XParaCon 指标和基于推理的 SFT 策略,提升 LLM 在 paraphrased 问题上的鲁棒性与一致性。

Comments 12 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏