arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 19038 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19038 篇

2603.00925 2026-03-03 cs.CL cs.CV cs.CY 79%

The Aftermath of DrawEduMath: Vision Language Models Underperform with Struggling Students and Misdiagnose Errors

DrawEduMath之后的后果:视觉语言模型在挣扎学生面前表现不佳且误判错误

Li Lucy, Albert Zhang, Nathan Anderson, Ryan Knight, Kyle Lo

机构 * University of Washington(华盛顿大学) Insource Services(Insource服务) Worcester Polytechnic Institute(沃斯特理工学院) Allen Institute for AI(人工智能联合研究所)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了视觉语言模型在处理学生数学错误识别任务中的表现,发现其在挣扎学生面前表现不佳,需改进以支持教育应用。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10085 2026-03-03 cs.CV cs.AI 79%

VITA: Zero-Shot Value Functions via Test-Time Adaptation of Vision-Language Models

VITA:通过视觉语言模型的测试时间适应实现零样本价值函数

Christos Ziakas, Alessandra Russo

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 VITA通过测试时间适应提升视觉语言模型的零样本价值估计能力,实现跨任务和环境的泛化,优于现有方法。

Comments International Conference on Learning Representations, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00142 2026-03-03 cs.MA cs.AI 79%

Evaluating Theory of Mind and Internal Beliefs in LLM-Based Multi-Agent Systems

评估基于大语言模型的多智能体系统中的理论心和内部信念

Adam Kostka, Jarosław A. Chudziak

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出一种整合理论心、BDI内部信念和符号求解器的多智能体架构,评估其在资源分配问题中提升协作智能的效果。

Journal ref 17th International Conference on Computational Collective Intelligence (ICCCI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24014 2026-03-02 cs.CV cs.AI 79%

Interpretable Debiasing of Vision-Language Models for Social Fairness

可解释的视觉-语言模型社会公平性偏见消除

Na Min An, Yoonna Jang, Yusuke Hirota, Ryo Hachiuma, Isabelle Augenstein, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能研究所) University of Copenhagen(哥本哈根大学) NVIDIA(英伟达公司)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本研究提出DeBiasLens框架,通过稀疏自编码器局部化VLM中的社会属性神经元,以可解释的方式消除模型中的社会偏见,同时保持语义知识。

Comments 25 pages, 30 figures, 13 Tables Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08016 2026-03-02 cs.CV cs.AI 79%

FRIEDA: Benchmarking Multi-Step Cartographic Reasoning in Vision-Language Models

FRIEDA:评估视觉语言模型中多步骤制图推理的基准

Jiyoon Pyo, Yuankun Jiao, Dongwon Jung, Zekun Li, Leeje Jang, Sofia Kirsanova, Jina Kim, Yijun Lin, Qin Liu, Junyi Xie, Hadi Askari, Nan Xu, Muhao Chen, Yao-Yi Chiang

机构 * University of Minnesota-Twin Cities(明尼苏达大学双城分校) University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 FRIEDA 是一个评估视觉语言模型多步骤制图推理能力的基准,通过多步骤推理和跨地图定位测试,揭示了当前模型在空间智能方面的不足。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00060 2026-03-02 cs.CV cs.AI cs.RO 79%

Less is More: Lean yet Powerful Vision-Language Model for Autonomous Driving

少即是多:一种高效而强大的视觉-语言模型用于自动驾驶

Sheng Yang, Tong Zhan, Guancheng Chen, Yanfeng Lu, Jian Wang

机构 * School of Data Science, Fudan University Shanghai, China(复旦大学数据科学学院) Institute of Automation, Chinese Academy of Sciences Beijing, China(中国科学院自动化研究所)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本研究提出Max-V1模型,通过端到端视觉-语言方法实现高效自动驾驶,取得nuScenes数据集上的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22193 2026-02-26 cs.CL 79%

Improving Parametric Knowledge Access in Reasoning Language Models

提升推理语言模型的参数知识访问能力

Melody Ma, John Hewitt

机构 * Columbia University(哥伦比亚大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 通过强化学习训练,提升推理语言模型在参数知识访问上的能力,改进知识回忆和问答任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21112 2026-02-26 cs.RO cs.AI 79%

EO-1: An Open Unified Embodied Foundation Model for General Robot Control

EO-1:一个通用机器人控制的开放统一具身基础模型

Delin Qu, Haoming Song, Qizhi Chen, Zhaoqing Chen, Xianqiang Gao, Dong Wang, Xinyi Ye, Qi Lv, Modi Shi, Guanghui Ren, Cheng Ruan, Maoqing Yao, Haoran Yang, Jiacheng Bao, Bin Zhao, Xuelong Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) AgiBot Northwestern Polytechnical University(西北工业大学)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

AI总结 EO-1是一个统一的具身基础模型,通过交错视觉-文本-动作预训练实现了在多模态推理和机器人控制中的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20878 2026-02-25 cs.AI 79%

Diagnosing Causal Reasoning in Vision-Language Models via Structured Relevance Graphs

通过结构化相关性图诊断视觉-语言模型中的因果推理

Dhita Putri Pratama, Soyeon Caren Han, Yihao Ding

机构 * University of Melbourne(墨尔本大学) The University of Western Australia(西澳大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出ViLCaR基准,通过结构化相关性图评估视觉-语言模型的因果推理能力,发现其局限性源于结构指导不足而非推理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14685 2026-02-25 cs.CL 79%

Language Models use Lookbacks to Track Beliefs

语言模型使用回溯来跟踪信念

Nikhil Prakash, Natalie Shapira, Arnab Sen Sharma, Christoph Riedl, Yonatan Belinkov, Tamar Rott Shaham, David Bau, Atticus Geiger

机构 * Northeastern University(东北大学) Technion(技术学院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Goodfire Pr(Ai) 2 R Group(Pr(Ai) 2 R集团)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本研究揭示语言模型通过回溯机制跟踪角色信念的算法模式,通过构建CausalToM数据集,分析LM在因果中介和抽象中的推理能力,并探讨可见性对信念更新的影响。

Comments 38 pages, 50 figures. Code and data at https://belief.baulab.info/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00628 2026-02-25 cs.SD cs.CL 79%

Hearing the Order: Investigating Position Bias in Large Audio-Language Models

听序:探究大型音频-语言模型中的位置偏差

Yu-Xiang Lin, Chen-An Li, Sheng-Lun Wei, Po-Chun Chen, Hsin-Hsi Chen, Hung-yi Lee

机构 * National Taiwan University(台湾大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本文首次系统研究了大型音频-语言模型中位置偏差问题,通过实验发现答案选项顺序影响模型性能,提出基于排列的策略可缓解偏差。

Comments The first two authors contributed equally. Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01080 2026-02-25 cs.LG cs.PF 79%

Development and Comparative Evaluation of Three Artificial Intelligence Models (NLP, LLM, JEPA) for Predicting Triage in Emergency Departments: A 7-Month Retrospective Proof-of-Concept

三种人工智能模型(NLP、LLM、JEPA)在急诊科分诊中的开发与比较评估:一项7个月的回顾性概念验证

Edouard Lansiaux, Ramy Azzouz, Emmanuel Chazard, Amélie Vromant, Eric Wiel

机构 * Department of Emergency Lille University Hospital(里尔大学医院急诊科) Centre Antipoison, Lille University Hospital(里尔大学医院毒物中心) Department of Public Health, EA 2694 & ULR 2694-METRICS(公共卫生部门,EA 2694及ULR 2694-METRICS) Lille University(里尔大学) Emergency Department Hôpital Pitié-Salpêtrière, AP-HP(皮蒂埃-萨尔佩特里耶医院急诊科,AP-HP)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.LG

AI总结 本研究评估了三种AI模型在急诊科分诊中的表现,发现基于LLM的URGENTIAPARSE在准确性和预测住院需求方面表现最佳,为提升急诊科患者安全和效率提供了新的方向。

Comments 13 pages, 7 figures, 3 tables

Journal ref 2025:2:1-10 BDCAT '25: Proceedings of the IEEE/ACM 12th International Conference on Big Data Computing, Applications and Technologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20066 2026-02-24 cs.CV cs.AI 79%

HeatPrompt: Zero-Shot Vision-Language Modeling of Urban Heat Demand from Satellite Images

HeatPrompt: 从卫星图像进行零样本的城市热需求视觉-语言建模

Kundan Thota, Xuanhao Mu, Thorsten Schlachter, Veit Hagenmeyer

机构 * Institute for Automation and Applied Informatics (IAI), Karlsruhe Institute of Technology (KIT), Germany(自动化与应用信息研究所(IAI)、卡尔斯鲁厄理工学院(KIT))

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 HeatPrompt通过卫星图像和地理信息数据,利用零样本视觉语言模型估算城市热需求,提升预测精度并支持数据稀缺地区的热规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19633 2026-02-24 cs.AI 79%

TAPE: Tool-Guided Adaptive Planning and Constrained Execution in Language Model Agents

TAPE: 语言模型代理中的工具引导自适应规划与约束执行

Jongwon Jeong, Jungtaek Kim, Kangwook Lee

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 TAPE通过工具引导的自适应规划与约束执行方法,提升语言模型代理在复杂任务中的成功率,特别是在困难设置中表现显著优于现有框架。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18700 2026-02-24 cs.CR cs.CL 79%

Watermarking LLM Agent Trajectories

对LLM代理轨迹进行水印标记

Wenlong Meng, Chen Gong, Terry Yue Zhuo, Fan Zhang, Kecen Li, Zheng Liu, Zhou Yang, Chengkun Wei, Wenzhi Chen

机构 * Zhejiang University, China(浙江大学) University of Virginia, USA(弗吉尼亚大学) Alibaba Qwen, China(阿里巴巴通义实验室) University of Alberta, Canada(阿尔伯塔大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出ActHook,一种针对LLM代理轨迹数据集的水印方法,通过在决策点插入钩子动作实现可靠的黑盒检测,实验显示其在数学推理等任务中具有高检测精度且性能影响小。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15950 2026-02-24 cs.CV cs.LG 79%

Can Vision-Language Models See Squares? Text-Recognition Mediates Spatial Reasoning Across Three Model Families

视觉-语言模型能识别正方形吗?文本识别在三种模型家族中介导空间推理

Yuval Levental

机构 * Rochester Institute of Technology(罗切斯特技术学院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG

AI总结 本研究发现视觉-语言模型在处理非文本视觉元素时存在空间定位能力缺陷,文本识别性能显著优于其本机视觉路径。

Comments 9 pages, 3 figures, 2 tables. Workshop-length paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10855 2026-02-23 cs.LG 79%

ExPairT-LLM: Exact Learning for LLM Code Selection by Pairwise Queries

ExPairT-LLM:通过成对查询实现LLM代码选择的精确学习

Tom Yuviler, Dana Drachsler-Cohen

机构 * Tom Yuviler(独立研究者) Dana Drachsler-Cohen(独立研究者)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.LG

AI总结 ExPairT-LLM通过成对查询提升LLM代码选择的精确性,实现更高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04108 2026-02-23 cs.CL 79%

Batch Prompting Suppresses Overthinking Reasoning Under Constraint: How Batch Prompting Suppresses Overthinking in Reasoning Models

批量提示抑制约束下的过度推理:如何通过批量提示抑制推理模型中的过度推理

Saurabh Srivastava, Janit Bidhan, Hao Yan, Abhishek Dey, Tanu Kansal, Paras Kath, Sina Mansouri, Mohit Marvania, Vamsi Shankar Simhadri, Gaurav Singh

机构 * George Mason University(乔治·马歇尔大学) Google(谷歌) eBay

专题命中 推理与问题求解 :prompting(title,abstract);分类 cs.CL

AI总结 批量提示通过减少推理标记和抑制过度推理行为,提升推理模型的效率和可靠性。

Comments New version with updated author list

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15896 2026-02-19 cs.CL 79%

Every Little Helps: Building Knowledge Graph Foundation Model with Fine-grained Transferable Multi-modal Tokens

每一点帮助都有价值:通过细粒度可迁移多模态标记构建知识图谱基础模型

Yichi Zhang, Zhuo Chen, Lingbing Guo, Wen Zhang, Huajun Chen

机构 * Zhejiang University, Zhejiang, China(浙江大学)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.CL

AI总结 本文提出TOFU模型,通过细粒度可迁移多模态标记提升多模态知识图谱推理的跨图谱迁移能力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18318 2026-02-19 cs.AI 79%

Earth AI: Unlocking Geospatial Insights with Foundation Models and Cross-Modal Reasoning

Earth AI:利用基础模型和跨模态推理解锁地理空间洞察

Aaron Bell, Amit Aides, Amr Helmy, Arbaaz Muslim, Aviad Barzilai, Aviv Slobodkin, Bolous Jaber, David Schottlander, George Leifman, Joydeep Paul, Mimi Sun, Nadav Sherman, Natalie Williams, Per Bjornsson, Roy Lee, Ruth Alcantara, Thomas Turnbull, Tomer Shekel, Vered Silverman, Yotam Gigi, Adam Boulanger, Alex Ottenwess, Ali Ahmadalipour, Anna Carter, Behzad Vahedi, Charles Elliott, David Andre, Elad Aharoni, Gia Jung, Hassler Thurston, Jacob Bien, Jamie McPike, Jessica Sapick, Juliet Rothenberg, Kartik Hegde, Kel Markert, Kim Philipp Jablonski, Luc Houriez, Monica Bharel, Phing VanLee, Reuven Sayag, Sebastian Pilarski, Shelley Cazares, Shlomi Pasternak, Siduo Jiang, Thomas Colthurst, Yang Chen, Yehonathan Refael, Yochai Blau, Yuval Carny, Yael Maguire, Avinatan Hassidim, James Manyika, Tim Thelin, Genady Beryozkin, Gautam Prasad, Luke Barrington, Yossi Matias, Niv Efron, Shravya Shetty

机构 * Google Research(谷歌研究) Google X(谷歌X) Google Cloud(谷歌云)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

AI总结 Earth AI通过基础模型和跨模态推理,提升地理空间数据分析能力,实现对地球的深入洞察。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11733 2026-02-18 cs.CL 79%

Human-like Affective Cognition in Foundation Models

基础模型中的人类样情感认知

Kanishk Gandhi, Zoe Lynch, Jan-Philipp Fränken, Kayla Patterson, Sharon Wambu, Tobias Gerstenberg, Desmond C. Ong, Noah D. Goodman

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.CL

AI总结 本文提出了一种评估框架,测试基础模型在情感认知方面的表现,发现模型在某些条件下能超越人类直觉,展现出人类样情感理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14749 2026-02-17 cs.CL 79%

Cognitive networks reconstruct mindsets about STEM subjects and educational contexts in almost 1000 high-schoolers, University students and LLM-based digital twins

认知网络重构了近1000名高中生、大学生和基于LLM的数字双胞胎对STEM学科和教育环境的看法

Francesco Gariboldi, Emma Franchino, Edith Haim, Gianluca Lattanzi, Alessandro Grecucci, Massimo Stella

机构 * Department of Psychology and Cognitive Science, University of Trento(心理学与认知科学系,特伦托大学) Department of Psychology and Communication, University of Bari(心理学与传播系,巴里大学) Department of Physics, University of Trento(物理学系,特伦托大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL

AI总结 本文通过认知网络分析揭示了不同群体对STEM学科的认知和情感差异,发现数学和统计学在高焦虑群体中表现出负面特征,而基于LLM的数字双胞胎在模拟文化态度时存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13103 2026-02-17 cs.LG 79%

R-Diverse: Mitigating Diversity Illusion in Self-Play LLM Training

R-Diverse: 缓解自博弈LLM训练中的多样性幻觉

Gengsheng Li, Jinghan He, Shijie Wang, Dan Zhang, Ruiqi Liu, Renrui Zhang, Zijun Yao, Junfeng Fang, Haiyun Guo, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research(武汉人工智能研究所) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.LG

AI总结 R-Diverse通过引入记忆增强惩罚和技能感知测量,缓解自博弈LLM训练中的多样性幻觉问题,提升模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19228 2026-02-17 cs.LG 79%

Predicting the Order of Upcoming Tokens Improves Language Modeling

预测即将到来的令牌顺序改进语言建模

Zayd M. K. Zuhri, Erland Hilman Fuadi, Alham Fikri Aji

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG

AI总结 通过学习排序损失预测令牌顺序,改进语言模型的下一个令牌预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07443 2026-02-17 cs.AI cs.GT 79%

Approximating Human Strategic Reasoning with LLM-Enhanced Recursive Reasoners Leveraging Multi-agent Hypergames

用LLM增强的递归推理器近似人类战略推理

Vince Trencsenyi, Agnieszka Mensfelt, Kostas Stathis

机构 * Royal Holloway University of London(伦敦皇家霍洛威大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于LLM增强的递归推理器框架,通过多智能体超游戏模型评估LLM的递归推理能力,并展示了其在近似人类行为和最优解达成方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11047 2026-02-17 cs.RO cs.AI 79%

Enhancing Supermarket Robot Interaction: A Multi-Level LLM Conversational Interface for Handling Diverse Customer Intents

增强超市机器人交互:一种多层级LLM对话接口用于处理多样化客户意图

Chandran Nandkumar, Luka Peternel

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出多层级LLM接口提升超市机器人处理多样化客户意图的效率与性能。

Journal ref Frontiers in Robotics and AI, Volume 12, 1576348, April 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19852 2026-02-16 cs.SD cs.AI 79%

Eliminating stability hallucinations in llm-based tts models via attention guidance

通过注意力引导消除基于大语言模型的TTS模型中的稳定性幻觉

ShiMing Wang, ZhiHao Du, Yang Xiang, TianYu Zhao, Han Zhao, Qian Chen, XianGang Li, HanJie Guo, ZhenHua Ling

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文通过改进注意力机制,减少基于大语言模型的TTS模型中的稳定性幻觉,提升语音合成的稳定性和连续性。

Comments The authors are withdrawing this preprint as it was submitted prematurely without the final approval of all collaborating institutions. We apologize for any inconvenience

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12405 2026-02-16 cs.RO cs.LG 79%

Self-Refining Vision Language Model for Robotic Failure Detection and Reasoning

自适应多任务视觉语言模型用于机器人故障检测与推理

Carl Qi, Xiaojie Wang, Silong Yong, Stephen Sheng, Huitan Mao, Sriram Srinivasan, Manikantan Nambi, Amy Zhang, Yesh Dattatreya

机构 * UT Austin(德克萨斯大学) Amazon Robotics(亚马逊机器人技术) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :language model(title);LLM(abstract);分类 cs.LG

AI总结 ARMOR是一种自适应多任务视觉语言模型,通过多任务自 refinement 过程提升机器人故障检测与推理性能,实现故障检测率提升30%和推理表现提升100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11782 2026-02-13 cs.AI cs.SE 79%

FlowMind: Execute-Summarize for Structured Workflow Generation from LLM Reasoning

FlowMind: 从LLM推理生成结构化工作流的执行-总结

Yihao Liu, Ziyun Zhang, Zile He, Huaqian Cai

机构 * Peking University(北京大学) East China University of Technology(东华大学) National Key Laboratory of Data Space Technology and System(数据空间技术与系统国家重点实验室)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 FlowMind通过执行-总结框架将LLM推理转化为结构化工作流,提高工作流的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01982 2026-02-13 cs.AI cs.IT math.IT 79%

ChaosBench-Logic: A Benchmark for Logical and Symbolic Reasoning on Chaotic Dynamical Systems

ChaosBench-Logic:逻辑和符号推理在混沌动力系统上的基准

Noel Thomas

机构 * Noel Thomas

专题命中 推理与问题求解 :language model(abstract,comments);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 ChaosBench-Logic通过30种混沌动力系统评估LLM逻辑和符号推理能力,揭示其在复杂推理任务中的局限性。

Comments 7 pages, 0 figures , Accepted to AAAI-26 Bridge Program: Logical and Symbolic Reasoning in Language Models (camera-ready)

Journal ref AAAI 2026 Bridge Program on Logical and Symbolic Reasoning in Language Models, Singapore, Jan 2026

详情

展开后加载摘要…

URL PDF HTML 收藏