arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5878 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5878 篇

1910.01751 2019-10-07 cs.LG cs.AI cs.CV stat.ML 62%

Causal Induction from Visual Observations for Goal Directed Tasks

Suraj Nair, Yuke Zhu, Silvio Savarese, Li Fei-Fei

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.05359 2019-09-13 cs.CL cs.AI 62%

From Textual Information Sources to Linked Data in the Agatha Project

Paulo Quaresma, Vitor Beires Nogueira, Kashyap Raiyani, Roy Bayot, Teresa Gonçalves

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Part of DECLARE 19 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.02606 2019-07-08 cs.IR cs.AI cs.CL 62%

A Road-map Towards Explainable Question Answering A Solution for Information Pollution

Saeedeh Shekarpour, Faisal Alshargi

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.08647 2019-06-20 cs.LG cs.AI cs.MA stat.ML 62%

Social Influence as Intrinsic Motivation for Multi-Agent Deep Reinforcement Learning

Natasha Jaques, Angeliki Lazaridou, Edward Hughes, Caglar Gulcehre, Pedro A. Ortega, DJ Strouse, Joel Z. Leibo, Nando de Freitas

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.09705 2019-04-23 cs.CL cs.AI 62%

Exploring Unsupervised Pretraining and Sentence Structure Modelling for Winograd Schema Challenge

Yu-Ping Ruan, Xiaodan Zhu, Zhen-Hua Ling, Zhan Shi, Quan Liu, Si Wei

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.07786 2019-01-24 cs.CL cs.AI 62%

Self-Attentive Model for Headline Generation

Daniil Gavrilov, Pavel Kalaidin, Valentin Malykh

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments accepted for ECIR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.02657 2018-04-10 cs.HC cs.AI cs.CL 62%

Emotion Orientated Recommendation System for Hiroshima Tourist by Fuzzy Petri Net

Takumi Ichimura, Issei Tachibana

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 6 pages, 10 figures, Proc. of IEEE 6th International Workshop on Computational Intelligence and Applications (IWCIA2013)

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.03454 2017-09-06 cs.CL cs.AI 62%

The Pragmatics of Indirect Commands in Collaborative Discourse

Matthew Lamm, Mihail Eric

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments International Conference on Computational Semantics 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08150 2026-05-26 cs.CL 61%

Verbalized Algorithms: Classical Algorithms are All You Need (Mostly)

言语化算法:经典算法就是你所需要的(大部分)

Supriya Lall, Christian Farrell, Hari Pathanjaly, Marko Pavic, Sarvesh Chezhian, Masataro Asai

机构 * MIT CSAIL(MIT 计算与人工智能实验室) MIT-IBM Watson AI Lab(MIT-IBM 沃森人工智能实验室) IBM Infrastructure(IBM 基础设施) Marist University(马里斯特大学) UC Irvine(加州大学尔湾分校) IBM Research Cambridge, USA(IBM 英国剑桥研究中心)

专题命中 其他推理 :reasoning(abstract,comments);分类 cs.CL

AI总结 提出言语化算法(VA)范式,将LLM作为可靠的基本操作(如字符串比较)集成到经典算法中,以提升推理的准确性和效率。

Comments Accepted in NeurIPS 2025 Workshop on Efficient Reasoning; Submitted to Position Paper Track at Neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08597 2024-10-14 cs.AI 61%

What killed the cat? Towards a logical formalization of curiosity (and suspense, and surprise) in narratives

Florence Dupin de Saint-Cyr, Anne-Gwenn Bosser, Benjamin Callac, Eric Maisel

专题命中 其他推理 :reasoning(abstract,journal_ref);分类 cs.AI

Journal ref 31st International Symposium on Temporal Representation and Reasoning (TIME 2024), Oct 2024, Montpellier, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.02011 2023-05-25 cs.CL 61%

Inverse scaling can become U-shaped

Jason Wei, Najoung Kim, Yi Tay, Quoc V. Le

专题命中 其他推理 :chain-of-thought(abstract,comments);分类 cs.CL

Comments v5 includes a reframed discussion section and new chain-of-thought results for Round 2 tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07486 2025-05-13 cs.HC 60%

Shots and Boosters: Exploring the Use of Combined Prebunking Interventions to Raise Critical Thinking and Create Long-Term Protection Against Misinformation

Huiyun Tang, Anastasia Sergeeva

专题命中 其他推理 :reasoning(abstract,comments)

Comments Presented at the 2025 ACM Workshop on Human-AI Interaction for Augmented Reasoning, Report Number: CHI25-WS-AUGMENTED-REASONING

Journal ref Proceedings of the 2025 ACM CHI Workshop on Human-AI Interaction for Augmented Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26949 2026-08-28 cs.AI 新提交 57%

A Table Is Worth 64 Tokens: Pixel-level Compression for Multi-Table Document Question Answering

一张表格值64个Token:面向多表格文档问答的像素级压缩

Iñigo Alonso, Mirella Lapata

机构 * School of Informatics(信息学院) University of Edinburgh(爱丁堡大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文针对多表格文档问答提出无需训练的两步像素级表格压缩方法,在长文档上节省41%总Token,比高效单步压缩配置少用15%Token且无准确率损失,还较原生分辨率单步问答提升7个百分点准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26641 2026-08-28 cs.CL 新提交 57%

Information-Guided Frontier Decoding: Contextual Utility-Driven Commitment in dMLLMs

信息引导的前沿解码:扩散多模态语言模型(dMLLMs)中上下文效用驱动的提交

Xingyou Fang, Jingxing Zhong, Xiaosong Yuan, Xiaofeng Zhang

机构 * Fuzhou University(福州大学) Jilin University(吉林大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 针对扩散多模态语言模型解码时结构令牌过早提交削弱上下文传播的问题,提出无需训练的信息引导前沿解码策略,通过多维度排序优化候选选择,在多类基准上实现了优于现有方法的性能。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15439 2026-08-28 cs.AI 版本更新 57%

Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?

解决ARC-AGI-3编码智能体是否需要可执行世界模型、简化和验证?

Sergey Rodionov

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨解决ARC-AGI-3时编码智能体是否需可执行世界模型、简化和验证。通过四个基于Codex的嵌套智能体评估,发现各变体随模型和推理强度改进,组件影响因设置而异,完整验证处理最佳,文本变体在部分设置中表现出色。

Comments 45 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04562 2026-08-28 cs.AI cs.NE 版本更新 57%

Heaviside Continuity of Rolling Coefficients for Eliminating Epistemic Entropy in Large Language Models

用于消除大语言模型认知熵的滚动系数的海维赛德连续性

MY Pitsane, Hope Mogale

机构 * North-West University, RSA(南非北开普大学) University of Pretoria, RSA(南非彼得里亚大学) Mankind Research Labs, Sandton(沙顿人类研究实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究大语言模型输出难检测错误的问题,提出海维赛德连续性的滚动系数框架,将推理重新表述为谓词门控状态转换,结合模型置信度与并行验证信号,防止无效状态传播,降低认知熵。

Comments Major revisions are going to be implemented and the paper will be restored later

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14586 2026-08-28 cs.IR cs.AI 版本更新 57%

CPGRec+: A Balance-oriented Framework for Personalized Video Game Recommendations

CPGRec+: 一种面向个性化视频游戏推荐的平衡框架

Xiping Li, Aier Yang, Jianghong Ma, Kangzhe Liu, Shanshan Feng, Haijun Zhang, Yi Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CPGRec+框架,通过引入偏好引导边加权和表示生成模块,解决传统推荐系统在准确率与多样性间的平衡问题,实验表明其在Steam数据集上表现更优。

Comments Published in ACM Transactions on Information Systems (TOIS). 43 pages, 9 figures

Journal ref ACM Trans. Inf. Syst. 44, 3, Article 66 (March 2026), 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09215 2026-08-28 cs.CL eess.AS 版本更新 57%

SPAR-K: Scheduled Periodic Alternating Early Exit for Spoken Language Models

SPAR-K:调度周期性交替早退用于语音语言模型

Hsiao-Ying Huang, Cheng-Han Chiang, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 SPAR-K通过调度周期性交替早退机制,提升语音语言模型的推理效率,同时保持感知质量,减少解码深度并优化性能。

Comments 8 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10002 2026-08-28 cs.AI 版本更新 57%

Interaction Protocol Shapes Moral Judgment in Multi-Agent Debate

辩论动态与价值对齐在大语言模型辩论中

Pratik S. Sachdeva, Tom van Nuenen

机构 * D-Lab University of California, Berkeley(D-Lab 加州大学伯克利分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究通过LLM辩论探讨多轮设置中模型的辩论动态与价值对齐,发现不同模型在同步和轮转结构下的行为差异及价值倾向。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22893 2026-08-28 cs.HC cs.AI 版本更新 57%

Toward a New Science of AI as Cognitive Infrastructure

迈向作为认知基础设施的人工智能新科学

Giuseppe Riva

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出跨学科领域认知基础设施研究(CIS),将AI视为认知基础设施,通过创新方法论研究其对人类认知、公共推理等的潜意识影响,填补多学科缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25960 2026-08-27 cs.AI 新提交 57%

LivingRAG: Augmenting Graph RAG with Experience

LivingRAG:用经验增强图检索增强生成(Graph RAG)

Yuzhuo Cui, Zongye Zhang, Qingjie Liu

机构 * Beihang University(北京航空航天大学) Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出具备可复用推理经验的LivingRAG框架,通过在Graph RAG中添加可写入经验存储,提升多跳问答准确率并减少完成令牌使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25935 2026-08-27 cs.CV cs.AI 新提交 57%

TAU-Agent: An Agentic Retrieval-Augmented Framework for Traffic Anomaly Understanding

TAU-Agent:用于交通异常理解的智能体式检索增强框架

Yuqiang Lin, Yan Shi, Sam Lockyer, Harish Tayyar Madabushi, Adrian Evans, Wenbin Li, Yinhai Wang, Nic Zhang

机构 * University of Bath(巴斯大学) University of Washington(华盛顿大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对交通异常理解需求,提出TAU-Agent智能体式检索增强框架,调度两类视觉工具获取证据,结合微调视觉语言模型推理,在AI City 2026挑战赛多赛道取得对应排名成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25577 2026-08-27 cs.DB cs.AI 新提交 57%

PolyMemDB: A Polyglot Database System for AI Memory Management

PolyMemDB:一款面向AI记忆管理的多语言数据库系统

Yu Wang, Jiaheng Lu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对现有智能体记忆系统的存储碎片化与事实冲突问题,推出PolyMemDB多语言数据库系统,通过多语言存储架构与概率推理引擎管理智能体记忆,以减少LLM幻觉并提升个性化体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25399 2026-08-27 cs.AI 新提交 57%

Can your AI agent be cheaper? Investigating the effects of task specifications on token spend in agentic coding tasks

你的AI智能体能更便宜吗?探究智能体编码任务中任务规格对token消耗的影响

Jakub Smékal

机构 * Stanford University(斯坦福大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文以Kimi K3模型为对象,探究智能体编码任务中任务规格对token消耗的影响,发现简化任务规格会提升token消耗,拟合的预测器可较优地预测token消耗,为评估AI编码工作流成本提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25276 2026-08-27 cs.CL 新提交 57%

Groundhog Bit-Flip Attack: Seeding Infinite Generation Loops in Mixture-of-Experts LLMs through Bit Flips

土拨比特翻转攻击:通过比特翻转在混合专家大语言模型中植入无限生成循环

Huakang Lin, Tiancheng Zheng, Mingxuan Sun, Tianhong Xu, Fan Zhang, Yunsi Fei, Ruyi Ding

机构 * Louisiana State University(路易斯安那州立大学) Northeastern University(东北大学) Zhejiang University(浙江大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Southeast University(东南大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出首个针对混合专家大语言模型的土拨比特翻转攻击,通过翻转路由层相关比特,可使平均输出膨胀率达5912%,揭示了MoE架构的鲁棒性漏洞。

Comments 9 pages, 3 figures; Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24902 2026-08-27 cs.HC cs.AI 新提交 57%

Beyond the Chatbot: Co-Learning and Co-Teaching through a Dual-Persona Generative-AI Assistant

超越聊天机器人:通过双角色生成式AI助手实现共学与共教

Chaido Mizeli, Marina Delianidi, Konstantinos Diamantaras

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究开发一款适配希腊教育领域的双角色生成式AI助手,可切换教学/学习角色,支持师生共学共教,构建了连接技术与课程的教学生成助手框架。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19872 2026-08-27 cs.AI 版本更新 57%

Simulated Self-Assessment in Large Language Models: A Psychometric Approach to AI Self-Efficacy

大语言模型的模拟自我评估:一种心理测量方法用于AI自我效能

Daniel I Jackson, Emma L Jensen, Syed-Amad Hussain, Emre Sezgin

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过心理测量方法评估大语言模型的自我效能,发现模型自我评估与实际表现不一致,且不同任务表现差异显著。

Comments 30 pages,7 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08375 2026-08-27 cs.CL 57%

Evaluating Transformer Models for Suicide Risk Detection on Social Media

Jakub Pokrywka, Jeremi I. Kaczmarek, Edward J. Gorzelańczyk

专题命中 其他推理 :CoT(abstract);分类 cs.CL

Journal ref 2024 IEEE International Conference on Big Data (BigData), pp. 8566-8573, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24358 2026-08-26 cs.AI 新提交 57%

The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents

交接代价:在大语言模型智能体中延续非原生轨迹

Roy Ganz, Mor Shpigel Nacson, Adi Kalyanpur, Ron Litman

机构 * AWS, Agentic AI(亚马逊云科技智能体人工智能部门)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究聚焦大语言模型智能体的交接代价,通过对比Claude和GPT系列模型的不同交接设置,发现完整轨迹升级质量提升有限且成本高,降级更具优势,且交接接口偏好随方向反转。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24115 2026-08-26 cs.RO cs.AI 新提交 57%

PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control

PonderPounce:作为机器人控制回合上下文引擎的预训练多模态大语言模型(MLLM)

Suhwan Choi, Jaeyoon Jung, Sungkyung Kim, Yunsung Lee, Youngjae Yu

机构 * Seoul National University(首尔大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 PonderPounce复用预训练MLLM的因果上下文作为机器人记忆,由System2 MLLM(Ponder)和System1 VLA(Pounce)组成,在RoboMME、RoboCasa-DC等数据集上的性能优于现有基线,实现了低延迟的机器人控制。

Comments Project page: https://worv-ai.github.io/ponderpounce/

详情

展开后加载摘要…

URL PDF HTML 收藏