arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-09 至 2026-01-09 共收录 100 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 17 篇

2601.04531 2026-01-09 cs.IR cs.AI 57%

Self-MedRAG: a Self-Reflective Hybrid Retrieval-Augmented Generation Framework for Reliable Medical Question Answering

Self-MedRAG:一种用于可靠医学问答的自反思混合检索增强生成框架

Jessica Ryan, Alexander I. Gumilang, Robert Wiliam, Derwin Suhartono

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 Self-MedRAG通过混合检索与自反思机制提升医学问答的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04458 2026-01-09 cs.LG 57%

Using Large Language Models to Detect Socially Shared Regulation of Collaborative Learning

利用大语言模型检测协作学习中的社会共享调节

Jiayi Zhang, Conrad Borchers, Clayton Cohn, Namrata Srivastava, Caitlin Snyder, Siyuan Guo, Ashwin T S, Naveeduddin Mohammed, Haley Noh, Gautam Biswas

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学) Vanderbilt University(范德堡大学) University of Detroit Mercy(底特律默克大学) New York University(纽约大学)

专题命中 复杂问题求解 :planning(abstract);分类 cs.LG

AI总结 本文利用大语言模型检测协作学习中的社会共享调节行为,通过嵌入方法提升学习分析的预测能力。

Comments Short research paper accepted at Learning Analytics and Knowledge (LAK '26)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 23 篇

2601.05076 2026-01-09 cs.AI 89%

Chain-of-Sanitized-Thoughts: Plugging PII Leakage in CoT of Large Reasoning Models

链式净化思维:在大推理模型的CoT中消除PII泄露

Arghyadeep Das, Sai Sreenivas Chintha, Rishiraj Girmal, Kinjal Pandey, Sharvi Endait

专题命中 推理评测 :reasoning(title,abstract);CoT(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出PII-CoT-Bench,通过部署干预措施减少大推理模型中链式思维推理的PII泄露,证明隐私优先推理可在不牺牲性能的情况下实现。

Comments 12 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10095 2026-01-09 cs.CL cs.AI 86%

Cognitive-Mental-LLM: Evaluating Reasoning in Large Language Models for Mental Health Prediction via Online Text

认知-心理-大语言模型:通过在线文本评估大语言模型在心理健康预测中的推理能力

Avinash Patil, Amardeep Kour Gedhu

机构 * Ira A. Fulton Schools of Engineering Arizona State University Tempe, USA(伊拉·A·福林工程学校亚利桑那州立大学Tempe分校) Department of Psychology Santa Clara University Santa Clara, USA(心理学系圣克拉拉大学Santa Clara分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过评估链式思维等推理技术,改进了大语言模型在心理健康预测中的分类性能,发现推理增强技术在复杂案例中表现更优,但存在数据集特定的限制。

Comments 8 pages, 4 Figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04714 2026-01-09 cs.AI 85%

ThinkDrive: Chain-of-Thought Guided Progressive Reinforcement Learning Fine-Tuning for Autonomous Driving

ThinkDrive: 基于链式推理的渐进强化学习微调框架用于自动驾驶

Chang Zhao, Zheming Yang, Yunqing Hu, Qi Guo, Zijian Wang, Pengcheng Li, Wen Ji

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 ThinkDrive通过结合显式推理与难度感知的自适应策略优化,提升了自动驾驶中的决策透明度和泛化能力,实验显示其在多个指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04758 2026-01-09 cs.CL cs.AI 81%

PILOT-Bench: A Benchmark for Legal Reasoning in the Patent Domain with IRAC-Aligned Classification Tasks

PILOT-Bench:一个以专利领域法律推理为核心的基准,包含与IRAC对齐的分类任务

Yehoon Jang, Chaewon Lee, Hyun-seok Min, Sungchul Choi

机构 * Pukyong National University(浦项国立大学) Tomocube Inc.(Tomocube公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 PILOT-Bench通过IRAC对齐的分类任务评估专利领域法律推理能力,揭示闭源与开源模型在推理性能上的显著差异。

Comments Accepted at the NLLP Workshop at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04577 2026-01-09 cs.AI cs.LG 81%

Sci-Reasoning: A Dataset Decoding AI Innovation Patterns

Sci-Reasoning:一个解码AI创新模式的数据集

Jiachen Liu, Maestro Harmon, Zechen Zhang

机构 * Orchestra Research(Orchestra研究)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 Sci-Reasoning数据集通过分析AI研究中的15种思维模式,揭示了高影响力论文的创新机制,为训练下一代AI研究代理提供结构化推理轨迹。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05073 2026-01-09 cs.LG 79%

Milestones over Outcome: Unlocking Geometric Reasoning with Sub-Goal Verifiable Reward

几何推理的里程碑:通过子目标可验证奖励解锁几何推理

Jianlong Chen, Daocheng Fu, Shengze Xu, Jiawei Chen, Yuan Feng, Yue Yang, Junchi Yan, Hongyuan Zha, Renqiu Xia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出SGVR框架,通过子目标可验证奖励提升多模态大语言模型在几何推理及泛化能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04891 2026-01-09 cs.CV cs.LG 79%

Scaling Vision Language Models for Pharmaceutical Long Form Video Reasoning on Industrial GenAI Platform

在工业生成式AI平台上扩展视觉语言模型用于制药长格式视频推理

Suyash Mishra, Qiang Li, Srikanth Patil, Satyanarayan Pati, Baddu Narendra

机构 * Roche(罗氏) Accenture(埃森哲) Involead

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出工业GenAI框架,解决制药领域长格式视频推理问题,通过多模态架构和实证分析提升效率并揭示现有VLMs的限制。

Comments Submitted to the Industry Track of Top Tier Conference; currently under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04777 2026-01-09 cs.CV cs.AI 77%

GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models

GeM-VG:迈向通用多图像视觉 grounding 的多模态大语言模型

Shurong Zheng, Yousong Zhu, Hongyin Zhao, Fan Yang, Yufei Zhan, Ming Tang, Jinqiao Wang

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 GeM-VG通过引入MG-Data-240K数据集和混合强化微调策略,提升多图像视觉 grounding 和通用多图像理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01802 2026-01-09 cs.AI 70%

PsychEval: A Multi-Session and Multi-Therapy Benchmark for High-Realism AI Psychological Counselor

PsychEval: 一个多会话和多疗法的基准,用于高真实感的AI心理顾问

Qianjun Pan, Junyi Wang, Jie Zhou, Yutao Yang, Junsong Li, Kaiyin Xu, Yougen Zhou, Yihan Li, Jingyuan Zhao, Qin Chen, Ningning Zhou, Kai Chen, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) School of Psychology and Cognitive Science, East China Normal University(东华大学心理学与认知科学学院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 PsychEval是一个多会话和多疗法的基准,用于评估高真实感的AI心理顾问,通过多阶段数据集和全面评估框架提升AI在心理咨询服务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04654 2026-01-09 eess.AS cs.AI cs.SD 70%

LLMs-Integrated Automatic Hate Speech Recognition Using Controllable Text Generation Models

集成大语言模型的自动仇恨言论识别方法:使用可控文本生成模型

Ryutaro Oshima, Yuya Hosoda, Youji Iiguni

机构 * The University of Osaka(大阪大学) Ritsumeikan University(立命馆大学)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型和可控文本生成模型,通过课程学习逐步训练以提高仇恨言论识别的准确率和效率。

Comments In Proceedings of the 17th Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04202 2026-01-09 cs.CL cs.AI cs.LG 67%

TeleTables: A Benchmark for Large Language Models in Telecom Table Interpretation

TeleTables: 电信表格解释中的大语言模型基准

Anas Ezzakri, Nicola Piovesan, Mohamed Sana, Antonio De Domenico, Fadhel Ayed, Haozhe Zhang

机构 * Paris Research Center, Huawei Technologies(巴黎研究中心,华为技术)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TeleTables 是一个用于评估大语言模型在电信表格解释能力的基准,揭示了在电信标准上进行领域微调的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04897 2026-01-09 cs.CL cs.CV cs.LG cs.MM 62%

V-FAT: Benchmarking Visual Fidelity Against Text-bias

V-FAT:基于文本偏见的视觉真实性基准测试

Ziteng Wang, Yujie He, Guanliang Li, Siqi Yang, Jiaqi Xiong, Songxiang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Meituan(美团) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 V-FAT通过三级评估框架量化文本偏见对视觉真实性的干扰,揭示多模态大语言模型在高语言主导性下的视觉崩溃问题。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06346 2026-01-09 cs.AI cs.CL 62%

LPFQA: A Long-Tail Professional Forum-based Benchmark for LLM Evaluation

LPFQA: 一个基于长尾专业论坛的LLM评估基准

Liya Zhu, Peizhuang Cong, Jingzhe Ding, Aowei Ji, Wenya Wu, Jiani Hou, Chunjie Wu, Xiang Gao, Jingkai Liu, Zhou Huan, Xuelei Sun, Yang Yang, Jianpeng Jiao, Liang Hu, Xinjie Chen, Jiashuo Liu, Tong Yang, Zaiyuan Wang, Ge Zhang, Wenhao Huang

机构 * ByteDance Seed Peking University(字节跳动种子北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LPFQA是一个基于真实专业论坛的长尾知识基准,用于评估LLM在专业领域推理和领域术语理解方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05101 2026-01-09 cs.AI 57%

Arabic Prompts with English Tools: A Benchmark

阿拉伯提示与英语工具:一个基准

Konstantin Kubrak, Ahmed El-Moselhy, Ammar Alsulami, Remaz Altuwaim, Hassan Ismail Fawaz, Faisal Alsaby

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出首个阿拉伯语言LLMs工具调用能力评估基准,揭示阿拉伯语交互环境下工具调用准确率下降5-10%的显著差距。

Comments 10 pages, 10 figures, LLMs, Big Data, and Multilinguality for All (LLMs4All) Workshop at IEEE BigData 2025 Conference, Macau, December 10, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05009 2026-01-09 cs.AI 57%

An Empirical Investigation of Robustness in Large Language Models under Tabular Distortions

对大型语言模型在表格扭曲下的鲁棒性进行实证研究

Avik Dutta, Harshit Nigam, Hosein Hasanbeig, Arjun Radhakrishna, Sumit Gulwani

机构 * Microsoft Corp.(微软公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究探讨了大型语言模型在表格数据扭曲下的鲁棒性问题,发现模型在缺乏显式提示时难以自动纠正表格错误,且顶级模型在扭曲下准确率显著下降。

Comments 4 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04960 2026-01-09 cs.CL cs.SD 57%

A Unified Spoken Language Model with Injected Emotional-Attribution Thinking for Human-like Interaction

具有注入情感归因思维的统一口语语言模型用于人样交互

Qing Wang, Zehan Li, Yaodong Song, Hongjie Chen, Jian Kang, Jie Lian, Jie Li, Yongxiang Li, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种通过注入情感归因思维提升情感智能的统一口语语言模型,实现人样交互中的情感感知与响应生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04895 2026-01-09 cs.AI 57%

DVD: A Robust Method for Detecting Variant Contamination in Large Language Model Evaluation

DVD:一种检测大规模语言模型评估中变体污染的稳健方法

Renzhao Liang, Jingru Chen, Bo Jia, Bo Deng, Chenggang Xie, Yidong Wang, Ke Jin, Xin Wang, Linfeng Zhang, Cunxiang Wang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 DVD通过分析生成分布的方差检测大规模语言模型评估中的变体污染,优于多种现有检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04709 2026-01-09 cs.AI 57%

Bridging Temporal and Textual Modalities: A Multimodal Framework for Automated Cloud Failure Root Cause Analysis

弥合时序与文本模态:一种多模态框架用于自动化云故障根本原因分析

Gijun Park

机构 * Okestro

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种多模态框架,通过融合时间序列与文本数据,提升云故障根本原因分析的自动化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04582 2026-01-09 cs.CL 57%

Aligning Text, Code, and Vision: A Multi-Objective Reinforcement Learning Framework for Text-to-Visualization

对齐文本、代码和视觉:一种多目标强化学习框架用于文本到可视化

Mizanur Rahman, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque

机构 * York University(约克大学) Salesforce AI Research(Salesforce人工智能研究) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出RL-Text2Vis框架,通过多目标强化学习提升文本到可视化的准确性和代码执行率。

Comments Accepted to EACL Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04540 2026-01-09 cs.SE cs.AI 57%

AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation

AdaptEval: 一个用于评估大型语言模型在代码片段适应上的基准

Tanghaoran Zhang, Xinjun Mao, Shangwen Wang, Yuxin Zhao, Yao Lu, Jin Zhang, Zhang Zhang, Kang Yang, Yue Yu

机构 * College of Computer Science and Technology(计算机科学与技术学院) National University of Defense and Technology(国防科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AdaptEval是一个用于评估大型语言模型在代码片段适应能力的基准,通过多粒度标注和细粒度测试框架,首次实证研究了六种LLMs在代码适应任务上的表现。

Comments 13 pages, 7 figures, Accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13655 2026-01-09 cs.CL cs.SE 57%

Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation

大语言模型擦除方法的比较分析:跨架构评估

Richard J. Young

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究比较了四种擦除工具在不同模型架构上的效果,发现数学推理能力对擦除干预最敏感,且单次通过方法在保持能力方面表现更优。

Comments 25 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05039 2026-01-09 cs.MA 50%

FinDeepForecast: A Live Multi-Agent System for Benchmarking Deep Research Agents in Financial Forecasting

FinDeepForecast:一个用于在金融预测中基准测试深度研究代理的实时多智能体系统

Xiangyu Li, Xuan Yao, Guohao Qi, Fengbin Zhu, Kelvin J. L. Koa, Xiang Yao Ng, Ziyang Liu, Xingyu Ni, Chang Liu, Yonghui Yang, Yang Zhang, Wenjie Wang, Fuli Feng, Chao Wang, Huanbo Luan, Xiaofen Xing, Xiangmin Xu, Tat-Seng Chua, Ke-Wei Huang

专题命中 推理评测 :reasoning(abstract)

AI总结 FinDeepForecast是一个实时多智能体系统,用于评估深度研究代理在金融预测中的表现,通过生成研究导向的金融预测任务,提供了一个公开的基准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26699 2026-01-09 cs.SE 50%

Using Copilot Agent Mode to Automate Library Migration: A Quantitative Assessment

使用 Copilot Agent 模式自动化库迁移:一项定量评估

Aylton Almeida, Laerte Xavier, Marco Tulio Valente

专题命中 推理评测 :planning(abstract)

AI总结 本文通过 Copilot Agent 模式评估了 SQLAlchemy 库迁移的自动化效果,发现其在功能迁移上表现良好但应用功能维护不足。

Comments Accepted at 1st International Workshop on Agentic Engineering (AGENT 2026, colocated with ICSE), pages 1-5

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 15 篇

2601.04878 2026-01-09 cs.AI cond-mat.mtrl-sci cs.CL cs.LG 82%

Higher-Order Knowledge Representations for Agentic Scientific Reasoning

高阶知识表示用于代理科学推理

Isabella A. Stewart, Markus J. Buehler

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于超图的知识表示方法,用于代理科学推理,通过高阶路径生成机理假设,提升科学发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05019 2026-01-09 cs.CL cs.AI q-bio.NC 81%

Hán Dān Xué Bù (Mimicry) or Qīng Chū Yú Lán (Mastery)? A Cognitive Perspective on Reasoning Distillation in Large Language Models

模仿(Mimicry)还是精通(Mastery)?从认知视角看大语言模型中的推理蒸馏

Yueqing Hu, Xinyang Peng, Shuting Peng, Hanqi Wang, Tianhong Wang

机构 * School of Philosophy, Anhui University(安徽大学哲学学院) Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) Faculty of Education, University of Cambridge(剑桥大学教育学院) School of Foreign Studies, South China Normal University(华南师范大学外语学院) Division of Psychology and Language Sciences, University College London(伦敦大学学院心理学与语言科学系)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 从认知视角研究大语言模型推理蒸馏,发现其导致功能对齐崩溃,揭示人类样样的认知是主动强化的涌现属性而非被动模仿。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04544 2026-01-09 cs.AI 79%

TCAndon-Router: Adaptive Reasoning Router for Multi-Agent Collaboration

TCAndon-Router: 多智能体协作的自适应推理路由

Jiuzhou Zhao, Chunrong Chen, Chenqi Qiao, Lebin Zheng, Minqi Han, Yanchi Liu Yongzhou Xu Xiaochuan Xu Min Zhang

机构 * Tencent Cloud Andon(腾讯云安顿)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 TCAndon-Router通过动态智能体接入和自然语言推理链提升多智能体协作的路由准确性与鲁棒性。

Comments 16 pages, 6 figures. Under review at IJCAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03905 2026-01-09 cs.AI cs.CL cs.LG 67%

Current Agents Fail to Leverage World Model as Tool for Foresight

当前智能体无法利用世界模型作为前瞻性工具

Cheng Qian, Emre Can Acikgoz, Bingxuan Li, Xiusi Chen, Yuji Zhang, Bingxiang He, Qinyu Luo, Dilek Hakkani-Tür, Gokhan Tur, Yunzhu Li, Heng Ji

机构 * UIUC(伊利诺伊大学香槟分校) THU(清华大学) JHU(约翰霍普金斯大学) Columbia(哥伦比亚大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了当前智能体能否利用世界模型作为工具提升前瞻性认知,发现其在模拟调用和结果整合方面存在显著不足。

Comments 36 Pages, 13 Figures, 17 Tables (Meta data updated)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04963 2026-01-09 cs.CL cs.AI 62%

Text as a Universal Interface for Transferable Personalization

文本作为通用的可转移个性化接口

Yuting Liu, Jian Guan, Jia-Nan Li, Wei Wu, Jiang-Ming Yang, Jianzhe Zhao, Guibing Guo

机构 * Software College, Northeastern University(东北大学软件学院) Ant Group(蚂蚁集团) Ant International(蚂蚁国际) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学商学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用自然语言作为通用接口,通过两阶段训练框架开发出可转移的偏好推理模型,实现在多个任务和模型家族中的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏