arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-01 至 2025-12-01 共收录 284 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 22 篇

2511.22471 2025-12-01 cs.CV 50%

Rethinking Cross-Generator Image Forgery Detection through DINOv3

重新思考通过DINOv3进行跨生成器图像伪造检测

Zhenglin Huang, Jason Li, Haiquan Wen, Tianxiao Li, Xi Yang, Lu Qi, Bei Peng, Xiaowei Huang, Ming-Hsuan Yang, Guangliang Cheng

机构 * University of Liverpool, UK(利物浦大学) Nanyang Technological University(南洋理工大学) HKUST(香港科技大学) UC Merced(加州大学默塞德分校) University of Sheffield(谢菲尔德大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 通过DINOv3发现无需训练即可实现跨生成器图像伪造检测,利用令牌排名策略提升检测准确度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22864 2025-12-01 cs.CV 50%

ControlEvents: Controllable Synthesis of Event Camera Datawith Foundational Prior from Image Diffusion Models

ControlEvents: 基于图像扩散模型的基础先验的可控事件相机数据合成

Yixuan Hu, Yuxuan Xue, Simon Klenk, Daniel Cremers, Gerard Pons-Moll

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出ControlEvents,利用图像扩散模型生成高质量事件数据,通过文本标签、2D骨骼和3D姿态控制信号,减少标注数据成本并提升视觉任务性能。

Comments Accepted to WACV2026. Project website:https://yuxuan-xue.com/controlevents/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 8 篇

2510.13022 2025-12-01 cs.CL cs.AI cs.LG 88%

On the Role of Preference Variance in Preference Optimization

关于偏好方差在偏好优化中的作用

Jiacheng Guo, Zihao Li, Jiahao Qiu, Yue Wu, Mengdi Wang

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Princeton University(普林斯顿大学) AI Lab(人工智能实验室)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究探讨了偏好方差在偏好优化中的作用,发现高方差提示在训练大型语言模型时表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23391 2025-12-01 cs.CL 83%

Ambiguity Awareness Optimization: Towards Semantic Disambiguation for Direct Preference Optimization

模糊性意识优化:朝着直接偏好优化的语义消歧

Jian Li, Shenglin Yin, Yujia Zhang, Alan Zhao, Xi Chen, Xiaohui Zhou, Pengfei Xu

机构 * AI Technology Center of OVB, Tencent, China(腾讯OVB人工智能技术中心,中国) School of Computer Science, Peking University, China(北京大学计算机学院,中国)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出模糊性意识优化(AAO)方法,通过计算偏好对的语义相似性自动重新加权模糊内容,有效提升直接偏好优化的性能。

Comments Accepted at EMNLP 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12565 2025-12-01 cs.CL 81%

Self Iterative Label Refinement via Robust Unlabeled Learning

通过鲁棒无标签学习实现自迭代标签细化

Hikaru Asano, Tadashi Kozuno, Yukino Baba

机构 * The University of Tokyo(东京大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出了一种通过鲁棒无标签学习实现自迭代标签细化的方法,有效提升了LLM在分类任务中的性能,并在安全对齐和生成任务中展示了优越性。

Comments To appear in the Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23184 2025-12-01 cs.CL cs.AI 81%

Listwise Preference Optimization with Element-wise Confusions for Aspect Sentiment Quad Prediction

基于元素混淆的列表偏好优化用于方面情感四元组预测

Wenna Lai, Haoran Xie, Guandong Xu, Qing Li, S. Joe Qin

机构 * The Hong Kong Polytechnic University(香港理工大学) Lingnan University(岭大) University of Technology Sydney(悉尼大学) The Education University of Hong Kong(香港教育大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于元素混淆的列表偏好优化方法,用于提升方面情感四元组预测的准确性和解释一致性。

Comments 11 pages, 7 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02433 2025-12-01 cs.LG cs.AI 81%

FairPO: Robust Preference Optimization for Fair Multi-Label Learning

FairPO: 为公平多标签学习的鲁棒偏好优化

Soumen Kumar Mondal, Prateek Chanda, Akshit Varmora, Ganesh Ramakrishnan

机构 * IIT Bombay(印度理工学院班加罗尔)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 FairPO通过结合偏好损失和群体鲁棒优化,提升多标签学习中不同标签的公平性,通过针对性改进和平衡目标缓解偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04182 2025-12-01 cs.CL cs.AI 73%

COPO: Causal-Oriented Policy Optimization for Hallucinations of MLLMs

COPO:面向MLLM幻觉的因果导向策略优化

Peizheng Guo, Jingyao Wang, Wenwen Qiang, Jiahuan Zhou, Changwen Zheng, Gang Hua

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) Amazon.com, Inc.(亚马逊公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 COPO通过引入因果完整性奖励和GRPO框架,解决多模态大语言模型的幻觉问题,通过令牌级因果约束确保输出的正确性和证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22982 2025-12-01 cs.CV cs.AI 57%

Ovis-Image Technical Report

Ovis-Image 技术报告

Guo-Hua Wang, Liangfu Cao, Tianyu Cui, Minghao Fu, Xiaohao Chen, Pengxin Zhan, Jianshan Zhao, Lan Li, Bowen Fu, Jiaqi Liu, Qing-Guo Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 Ovis-Image 是一个70亿参数的文本到图像模型,通过优化的多模态主干和文本聚焦训练方法,在紧凑架构下实现与大型开源模型相当的文本渲染性能。

Comments Code is released at https://github.com/AIDC-AI/Ovis-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04340 2025-12-01 cs.LG cs.HC 57%

Interactive Groupwise Comparison for Reinforcement Learning from Human Feedback

基于交互式组间比较的强化学习从人类反馈中学习

Jan Kompatscher, Danqing Shi, Giovanna Varni, Tino Weinkauf, Antti Oulasvirta

机构 * Aalto University(阿尔托大学) University of Cambridge(剑桥大学) University of Trento(特伦特大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.LG

AI总结 本文提出交互式组间比较方法,通过可视化和主动学习提升强化学习从人类反馈中学习的奖励和策略效果。

Comments 10 pages, 8 figures in proceedings of Computer Graphics Forum

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 10 篇

2511.23319 2025-12-01 cs.CL cs.AI 85%

Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language Models

每个token都重要:在大语言模型中推广1600万超长上下文

Xiang Hu, Zhanchao Zhou, Ruiqi Liang, Zehuan Li, Wei Wu, Jianguo Li

机构 * Ant Group(蚂蚁集团) Westlake University(西湖大学)

专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文提出了一种新型的分层稀疏注意力机制,用于在大语言模型中实现对超长上下文的有效建模,并在多个任务中展示了其处理1600万长度上下文的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22530 2025-12-01 cs.SE 85%

Boosting Pointer Analysis With LLM-Enhanced Allocation Function Detection

通过LLM增强的分配函数检测提升指针分析

Baijun Cheng, Kailong Wang, Ling Shi, Haoyu Wang, Peng Di, Ding Li, Xiangqun Chen, Yao Guo

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出CAFD技术,通过LLM增强的分配函数检测提升指针分析精度,有效识别CAFs并减少别名集大小,提升分析效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23436 2025-12-01 cs.AI 77%

Towards Continuous Intelligence Growth: Self-Training, Continual Learning, and Dual-Scale Memory in SuperIntelliAgent

迈向持续智能增长:在SuperIntelliAgent中实现自我训练、持续学习和双尺度记忆

Jianzhe Lin, Zeyu Pan, Yun Zhu, Ruiqi Song, Jining Yang

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI

AI总结 SuperIntelliAgent通过自我训练和双尺度记忆实现持续智能增长,利用可训练学习者与推理验证者配对,提升偏好对齐和学习效果。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04388 2025-12-01 cs.CL 77%

More Documents, Same Length: Isolating the Challenge of Multiple Documents in RAG

更多文档,相同长度:隔离多文档在RAG中的挑战

Shahar Levy, Nir Mazor, Lihi Shalmon, Michael Hassid, Gabriel Stanovsky

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现RAG中增加文档数量显著降低LLM性能,但Qwen2.5表现出更强的多文档处理能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21726 2025-12-01 cs.CL cs.AI cs.LG 75%

Goal-Directed Search Outperforms Goal-Agnostic Memory Compression in Long-Context Memory Tasks

目标导向搜索在长上下文记忆任务中优于目标无关的记忆压缩

Yicong Zheng, Kevin L. McKee, Thomas Miconi, Zacharie Bugaud, Mick van Gelderen, Jed McCaleb

机构 * Astera Institute(Astera研究所)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SUMER通过目标导向搜索在长上下文记忆任务中超越传统记忆压缩方法,达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22729 2025-12-01 cs.AI cs.MA 70%

Solving Context Window Overflow in AI Agents

解决AI代理中的上下文窗口溢出

Anton Bulle Labate, Valesca Moura de Sousa, Sandro Rama Fiorini, Leonardo Guerreiro Azevedo, Raphael Melo Thiago, Viviane Torres da Silva

机构 * IBM Research(IBM研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种方法,使LLMs能够处理任意长度的工具响应,避免上下文窗口溢出问题,减少令牌使用并提升执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02789 2025-12-01 cs.CL 70%

Strong Memory, Weak Control: An Empirical Study of Executive Functioning in LLMs

强记忆,弱控制:对大语言模型执行功能的实证研究

Karin de Langis, Jong Inn Park, Bin Hu, Khanh Chi Le, Andreas Schramm, Michael C. Mensink, Andrew Elfenbein, Dongyeop Kang

机构 * Department of Computer Science and Engineering, University of Minnesota(计算机科学与工程系,明尼苏达大学) Department of Linguistics, Hamline University(语言学系,哈姆林大学) Department of Psychology, University of Wisconsin-Stout(心理学系,威斯尼斯托大学) Department of English, University of Minnesota(英语系,明尼苏达大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现大语言模型在工作记忆方面表现优异,但执行功能和问题解决能力存在不足,提示需进一步改进注意力控制和认知灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22030 2025-12-01 cs.LG 57%

Calibration-Free EEG-based Driver Drowsiness Detection with Online Test-Time Adaptation

无需校准的基于EEG的驾驶员困倦检测与在线测试时适应

Geun-Deok Jang, Dong-Kyun Han, Seo-Hyeon Park, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学) Department of Brain and Cognitive Engineering, Korea University(脑科学与认知工程系,韩国大学)

专题命中 长上下文与记忆 :prompting(abstract);分类 cs.LG

AI总结 本文提出一种无需校准的EEG困倦检测方法,通过在线测试时适应技术提升模型对不同主体的适应能力,实验表明其在非独立同分布场景中性能优越。

Comments 10 pages, Submitted to IEEE Transactions on Human-Machine Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21631 2025-12-01 cs.CV cs.AI 57%

Qwen3-VL Technical Report

Qwen3-VL 技术报告

Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, Mei Li, Kaixin Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, Ruilin Luo, Chenxu Lv, Rui Men, Lingchen Meng, Xuancheng Ren, Xingzhang Ren, Sibo Song, Yuchong Sun, Jun Tang, Jianhong Tu, Jianqiang Wan, Peng Wang, Pengfei Wang, Qiuyue Wang, Yuxuan Wang, Tianbao Xie, Yiheng Xu, Haiyang Xu, Jin Xu, Zhibo Yang, Mingkun Yang, Jianxin Yang, An Yang, Bowen Yu, Fei Zhang, Hang Zhang, Xi Zhang, Bo Zheng, Humen Zhong, Jingren Zhou, Fan Zhou, Jing Zhou, Yuanzhi Zhu, Ke Zhu

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 Qwen3-VL 是一款强大的多模态模型,具备强大的纯文本理解、长上下文处理和多模态推理能力,适用于图像推理、代理决策和多模态代码智能。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22850 2025-12-01 cs.CV 50%

Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding

解决证据稀疏性:面向长文档理解的代理情境工程

Keliang Liu, Zizhi Chen, Mingcheng Li, Jingqun Tang, Dingkang Yang, Lihua Zhang

专题命中 长上下文与记忆 :language model(abstract)

AI总结 SLEUTH通过多代理框架解决长文档理解中的证据稀疏问题,提升多模态文档处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 52 篇

2511.22832 2025-12-01 cs.DB 90%

Structured Multi-Step Reasoning for Entity Matching Using Large Language Model

基于大语言模型的结构化多步推理实体匹配

Rohan Bopardikar, Jin Wang, Jia Zou

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出基于结构化多步推理的实体匹配框架,通过分解匹配过程为多个推理阶段,提升大语言模型在实体匹配任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02583 2025-12-01 cs.AI cs.LG 90%

CAMA: Enhancing Mathematical Reasoning in Large Language Models with Causal Knowledge

CAMA: 通过因果知识增强大语言模型的数学推理

Lei Zan, Keli Zhang, Ruichu Cai, Lujia Pan

机构 * Huawei Noah’s Ark Lab France(华为诺亚实验室(法国)) Guangdong University of Technology Peng Cheng Laboratory(广东工业大学鹏城实验室) Huawei Noah’s Ark Lab China(华为诺亚实验室(中国))

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 CAMA通过构建数学因果图并结合因果知识,提升大语言模型在数学推理任务中的性能。

Journal ref Main Track, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21706 2025-12-01 cs.CL cs.AI 90%

A General Highly Accurate Online Planning Method Integrating Large Language Models into Nested Rollout Policy Adaptation for Dialogue Tasks

一种整合大语言模型的通用高精度在线规划方法用于对话任务的嵌套回滚策略适应

Hui Wang, Fafa Zhang, Xiaoyu Zhang, Chaoxu Mu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出NRPA-GD方法,利用大语言模型实现无需训练的对话策略规划,通过嵌套回滚策略适应在目标导向对话任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12861 2025-12-01 cs.CL cs.CV 89%

From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models

从感知到推理:深度思考赋能多模态大语言模型

Wenxin Zhu, Andong Chen, Yuchen Song, Kehai Chen, Conghui Zhu, Ziyan Chen, Tiejun Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Global Tone Communication Technology(全球语音通信技术)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 本文提出多模态链式思维方法,旨在提升多模态大语言模型的推理能力,通过系统性综述分析其理论基础、实现方法及未来发展方向。

Comments Survey; 7 figures, 3 tables, 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23136 2025-12-01 cs.CL cs.AI 88%

Multi-chain Graph Refinement and Selection for Reliable Reasoning in Large Language Models

多链图细化与选择用于大语言模型中的可靠推理

Yujiao Yang, Jing Lian, Linhui Li

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 MGRS通过多链图细化与选择提升大语言模型的推理能力与效率,实现更高准确率和更快速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21753 2025-12-01 cs.CL cs.AI 88%

Extracting Disaster Impacts and Impact Related Locations in Social Media Posts Using Large Language Models

利用大型语言模型从社交媒体帖子中提取灾害影响及影响相关位置

Sameeah Noreen Hameed, Surangika Ranathunga, Raj Prasanna, Kristin Stock, Christopher B. Jones

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文利用大型语言模型从社交媒体中提取灾害影响及受影响位置,提升灾害响应决策效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09947 2025-12-01 cs.LG cs.AI 88%

EEGAgent: A Unified Framework for Automated EEG Analysis Using Large Language Models

EEGAgent: 一种利用大语言模型进行自动化EEG分析的统一框架

Sha Zhao, Mingyi Peng, Haiteng Jiang, Tao Li, Shijian Li, Gang Pan

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 EEGAgent利用大语言模型实现多任务EEG分析,提供灵活且可解释的自动化EEG处理与报告生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07984 2025-12-01 cs.CV 88%

SAMChat: Introducing Chain of Thought Reasoning and GRPO to a Multimodal Small Language Model for Small Scale Remote Sensing

SAMChat:引入链式推理和GRPO以增强小规模遥感遥感小语言模型

Aybora Koksal, A. Aydin Alatan

机构 * Center for the Image Analysis (OGAM) and Department of Electrical and Electronics Engineering of Middle East Technical University (METU)(图像分析中心(OGAM)和中东部技术大学(METU)电子与电气工程系)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title);large language model(abstract)

AI总结 SAMChat通过引入链式推理和GRPO,专为遥感影像分析优化,实现了在开放描述和分类任务上的高精度表现。

Comments Accepted to Journal of Selected Topics in Applied Earth Observations and Remote Sensing (JSTARS) Special Issue on Foundation and Large Vision Models for Remote Sensing. Code and dataset are available at https://github.com/aybora/SAMChat

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22176 2025-12-01 cs.CL cs.AI 86%

Focused Chain-of-Thought: Efficient LLM Reasoning via Structured Input Information

聚焦式链式思考:通过结构化输入信息实现高效的LLM推理

Lukas Struppek, Dominik Hintersdorf, Hannah Struppek, Daniel Neider, Kristian Kersting

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Technical University of Darmstadt(德累斯顿技术大学) University of Kassel(卡塞尔大学) TU Dortmund University(Dortmund技术大学) TU Center for Trustworthy Data Science and Security, University Alliance Ruhr(TU可信数据科学与安全中心,鲁尔大学联盟) Hessian Center for AI (Hessian.AI)(黑森人工智能中心(黑森.AI)) Centre for Cognitive Science, Technical University of Darmstadt(认知科学中心,德累斯顿技术大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出F-CoT方法,通过结构化输入减少LLM推理中的token使用和延迟,同时保持推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01584 2025-12-01 cs.AI cs.LG 85%

ReasoningWeekly: A General Knowledge and Verbal Reasoning Challenge for Large Language Models

ReasoningWeekly: 一个面向大语言模型的通用知识和逻辑推理挑战

Zixuan Wu, Francesca Lucchetti, Aleksander Boruch-Gruszecki, Jingmiao Zhao, Carolyn Jane Anderson, Joydeep Biswas, Federico Cassano, Arjun Guha

机构 * Northeastern University(东北大学) Wellesley College(韦尔斯利学院) University of Texas at Austin(德克萨斯大学奥斯汀分校) Cursor

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 ReasoningWeekly是一个基于NPR周日谜题挑战的通用知识和逻辑推理基准,揭示了现有评估中不明显的模型能力差距,并发现了新的推理失败类型。

详情

展开后加载摘要…

URL PDF HTML 收藏