arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 526 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 526 篇

2608.16213 2026-08-18 cs.AI cs.ET 新提交 57%

Process-Constituted Intelligence: A Shared Criterion for Humans and Machines

过程构成的智能:人类与机器的共同准则

Michael J. Richardson, Ayeh Alhasan, Cassandra Crone, M. Paula Diaz Monfort, Patrick Nalepka, Mark Dras, Rachel W. Kallen, David M. Kaplan

机构 * School of Psychological Sciences, Macquarie University(麦考瑞大学心理科学学院) Performance and Expertise Research Centre, Macquarie University(麦考瑞大学表现与专长研究中心) Minds and Intelligences Research Centre, Macquarie University(麦考瑞大学心智与智能研究中心) Frontier AI Research Centre, Macquarie University(麦考瑞大学前沿人工智能研究中心) Scuola Superiore Meridionale(南方高等学院) School of Computing, Macquarie University(麦考瑞大学计算学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该论文提出以过程构成智能的准则,定义人类与机器认知的强等价的七个过程特征,明确GenAI的设计原则与过程审计方法,以避免外包人类生成过程导致关键能力缺失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16178 2026-08-18 cs.DC cs.AI 新提交 57%

Agent-Native Telemetry: Verifiable State-Delta Evidence for Autonomous Operations

智能体原生遥测:面向自主操作的可验证状态增量证据

Jun He, Deying Yu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出智能体原生遥测架构,基于ATP协议和状态增量证据账本,在微服务基准测试中大幅降低了数据开销、LLM资源消耗,且能检测对抗性突变、抵御提示注入攻击。

Comments 13 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15919 2026-08-18 cs.IR cs.AI 新提交 57%

Noesis: Bidirectional Graph-RAG with Adaptive Parallelism and Cross-Knowledge-Base Semantic Discovery

Noesis:具备自适应并行性与跨知识库语义发现的双向图检索增强生成

Nicola Cogotti

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出具备自适应并行性与跨知识库语义发现的双向图检索增强生成架构Noesis,通过四种算法解决现有Graph-RAG系统的三类局限,在HotpotQA数据集上超越GraphRAG,实现更优性能。

Comments 14 pages, 6 figures, 4 tables. Patent pending

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15893 2026-08-18 cs.AI 新提交 57%

Breaking and Defending LLM-Powered Social Media Bot Detection Systems

突破与防御:基于大语言模型的社交媒体机器人检测系统

Nof Orenstein, Yoni Birman

机构 * Reichman University(莱希曼大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对基于大语言模型的社交媒体机器人检测系统,提出两种新型对抗攻击策略使其准确率降48%,并开发多LLM防御框架LSABRE,在强自适应对抗下仍维持86%准确率,相关方法可推广至其他LLM网络安全系统。

Comments Accepted at ACISP 2026 (Australasian Conference on Information Security and Privacy). Also accepted as a poster at IEEE Symposium on Security and Privacy (S&P) 2026. Published in Pragmatic Cybersecurity 2026, 1(2), 10, https://doi.org/10.53941/pc.2026.100010. 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15832 2026-08-18 cs.AI 新提交 57%

The Authority Resolution Framework: A Five-Domain Ontology for Governing Who and What Decides, at Scale

权威解析框架:用于大规模管理决策主体与决策事项的五域本体

Parviz Shariff

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ARF五域本体,将权威关系定义为跨域原语,提供机器可解释的权威表示,支持AI智能体在执行行动前确定权威的来源、范围与有效性,属于AI治理交叉领域的知识表示与推理研究。

Comments 27 Pages, 2 Tables, 1 Script, 1 Query

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15762 2026-08-18 cs.OS cs.DC cs.LG 新提交 57%

Global Simulation-Guided Dynamic Operator Scheduling for Efficient Multi-Tenant Model Serving

面向高效多租户模型服务的全局仿真引导型动态算子调度

Weinan Liu, Zeyuan Ding, Dian Ding, Chengcheng Wan, Lu Tang, Guangtao Xue, Jiwu Shu, Yiming Zhang

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出SliceScheduler系统,通过全局映射图、全局仿真器等组件实现算子级调度,在维持SLA违规率低于9%的同时,将多租户LLM服务的令牌吞吐量提升1.10-2.29倍,有效提高GPU利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15634 2026-08-18 cs.AI 新提交 57%

Argumentation for Common Ground: Finding Zones of Possible Agreement between Individuals in Conflict

寻求共识的论证:在冲突个体间寻找可能的共识区

Elisa Cavatorta, Antonio Rago

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出定量双极论证框架,通过合并冲突双方的推理框架识别可能的共识区(ZOPA),并以巴以冲突的调查数据验证其可行性,为冲突解决提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13472 2026-08-14 eess.SY cs.AI cs.SY 新提交 57%

AaLLM: An End-to-End Analog Circuit Design Framework from Topology Generation to Sizing Using Large Language Models

AaLLM:基于大语言模型的从拓扑生成到尺寸确定的端到端模拟电路设计框架

Mohammed Ayman Habib, Rylan Hart, Morteza Fayazi

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AaLLM,一种端到端多智能体LLM工作流,自动完成模拟电路拓扑生成与尺寸确定,可减少SPICE调用次数和运行时间,创新拓扑性能与传统拓扑相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13118 2026-08-14 cs.LG 新提交 57%

Branch and Bound for Relational Verification of Neural Networks

神经网络关系验证的分支定界法

Kota Fukuda, Zhenya Zhang, Guanqin Zhang, Jianjun Zhao

机构 * Graduate School and Faculty of Information Science and Electrical Engineering, Kyushu University(九州大学情报科学与电气工程研究院及学部) National Institute of Informatics(信息学研究所) UNSW Sydney(新南威尔士大学悉尼分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出分支定界(BaB)框架,通过关系神经元拆分及对应选择策略,在817个跨多数据集的验证问题上,使SaBRe在已解决实例数和效率上优于基线方法,提升神经网络关系验证效果。

Comments The full version of the paper accepted by EMSOFT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13101 2026-08-14 cs.CL eess.AS 新提交 57%

CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model

CASA:结合语音编码器与大语言模型的内容-语音口语评估

Nhan Phan, Ilona Lähteenmäki, Anna von Zansen, Olli-Pekka Pauna, Yaroslav Getman, Tamás Grósz, Mikko Kurimo

机构 * Aalto University(阿尔托大学) University of Helsinki(赫尔辛基大学) Walton Institute(沃尔顿研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出结合Whisper-medium与Qwen3.5-2B的CASA架构,在Speak & Improve Corpus 2025上RMSE达0.358,参数量减半,可分离语音表达与内容,还分析了声学与内容信息的贡献及性能稳定性。

Comments To be submitted to ICASSP 2027. Code is available at https://github.com/aalto-speech/casa

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12990 2026-08-14 cs.CL 新提交 57%

LycheeMemory V2: Efficient Long-Term Memory for LLM Agents via Semantic Segment-Level Consolidation

LycheeMemory V2:基于语义片段级整合的LLM智能体高效长期记忆

Dongfang Li, Zixuan Liu, Junmai Wang, Jiahe Huang, Fuhao Li, Bonian Jia, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 LycheeMemory V2用语义片段级整合替代轮次级整合,降低LLM编码成本,在LoCoMo、LongMemEval-S上实现SOTA性能,构建token用量较A-Mem大幅减少且未增加查询开销。

Comments 34 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12571 2026-08-14 cs.DL cs.CL 新提交 57%

Is this Citation on Point?

该引用是否相关?

Apurv Verma

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文针对现有大语言模型法律用例评估忽视的“指向真实案件却不支持主张”的引用问题,通过扰动真实法律引用验证14种模型配置,发现模型易混淆主题识别与页码级支持验证能力,规模与推理能力仅能部分缩小错精准页码扰动的检测差距。

Comments Accepted to the 1st Workshop on AI for Law at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12435 2026-08-14 cs.LG 新提交 57%

MARCH: Scaling Recurrent Memory with Content-Routed State Anchors

MARCH:通过内容路由状态锚点扩展循环记忆

Ming Zhang, Kaisen Yang, Shu Yu, Ermo Hua, Ning Ding, Xia Hu, Bowen Zhou, Chaochao Lu, Youbang Sun

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Fudan University(复旦大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出MARCH架构,通过内容路由状态锚点扩展循环记忆,在长序列上保持计算效率,经预训练后在多个长程任务中优于线性注意力变体,增强了循环长程记忆能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12350 2026-08-14 cs.CY cs.AI 新提交 57%

From Caveman to Expert Analyst: Energy Consumption of Variable LLM Tasks

从原始人到专家分析师:可变大语言模型任务的能耗

Diego Manya, Ethan I. Thorpe, Ji Zhang, Myranda Shirk, Jiamian He, Angel Hsu, Michael P. Vandenbergh

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究测试四类高可塑性用户行为评估AI能耗减排潜力,发现非推理模型能耗仅为推理模型的二十分之一,简单提示修改可进一步降65%能耗,最佳实践可减4%-35%电力需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12344 2026-08-14 cs.CL cs.CY stat.AP 新提交 57%

Predicting consumer-technology ownership without a diffusion history

基于扩散历史预测消费技术拥有情况

Irina Vartanova, Niels Selling, Jennifer Viberg Johansson, Pontus Strimling

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究利用人类及Anthropic Claude Opus 4.7、OpenAI GPT-5.5两款语言模型对消费技术的属性评分,通过符号约束惩罚回归预测技术拥有率,其效果优于上市年限基准模型,还对2025-2026年新品做了2027年拥有率预测。

Comments 31 pages, 4 figures, supplementary material included (Tables S1-S6, Figure S1), data and code at https://osf.io/dr5ct

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11758 2026-08-13 cs.CL 新提交 57%

AWARe: Mitigating Catastrophic Forgetting via Activation-Weighted Adaptive REtention

AWARe:基于激活加权的自适应保留缓解灾难性遗忘

Juncheng Liao, Jinfan Lv, Guoming Wang, Jupeng Zheng, Ling Xiao, Siliang Tang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) School of Artificial Intelligence, Sun Yat-Sen University(中山大学人工智能学院) Graduate School of Information Science, Hokkaido University(北海道大学信息科学研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 针对多模态大语言模型微调时的灾难性遗忘问题,提出无需修改架构的AWARe方法,通过激活加权控制参数更新,在保留上游能力的同时提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11676 2026-08-13 cs.AI 新提交 57%

XBridge: Entity-Grounded Latent Bridge for Heterogeneous LLM Communication

XBridge:面向异构大语言模型通信的实体锚定隐空间桥接器

Wooseong Yang, Wei-Chieh Huang, Weizhi Zhang, Yu Wang, Philip S. Yu, Junhyun Lee

机构 * Hankuk University of Foreign Studies(韩国外国语大学) Noah’s Farm(诺亚农场) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Capital One AI Foundations(Capital One AI 基金会)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 XBridge是免解码的异构大语言模型通信协议,通过词汇锚定映射和隐空间丰富桥接器解决跨架构通信的实体身份丢失问题,在多模型、多基准测试中表现优于现有方法,参数开销低。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10949 2026-08-12 cs.CV cs.CL 新提交 57%

StreamFlow: Dynamic Memory Flows for Streaming Video Understanding

StreamFlow:用于流视频理解的动态内存流

Muxin Fu, Yifan Zhang, Wentao Zhang, Fangming Guo, Qian Chen, Guibin Zhang, Shuicheng Yan, Bo An

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 StreamFlow是一种动态视觉内存框架,通过中期内存过滤冗余、长期内存整合潜变量及注意力检索,在流视频理解任务中实现最优性能,同时提升视觉依据性并降低延迟与内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10462 2026-08-12 cs.CL 新提交 57%

Calibrating Post-Training Feature Shifts for LLM Data Contamination Detection

校准用于大语言模型数据污染检测的训练后特征偏移

Zhen Yang, Mengqi Wang, Gengda Zhao, Mo Zhou, Jianwei Wang, Wenjie Zhang

机构 * The University of New South Wales(新南威尔士大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 针对训练后处理导致的LLM数据污染检测中特征偏移问题,提出CalibDCD校准框架,经实验可提升现有检测器的AUC和TPR@5%FPR指标。

Comments 14 pages, 7 figures. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10120 2026-08-12 cs.LG cs.NI 新提交 57%

ChronoSSM: Training for Temporally Aware Representations in Autoregressive State Space Models

ChronoSSM:自回归状态空间模型中用于时间感知表示的训练方法

Adrien Schoen, Nachiketa Ratnakar Patil, Arjun Bhagoji, Francesco Bronzino

机构 * ENS de Lyon(里昂高等师范学院) CNRS(法国国家科学研究中心) UCBL1(里昂第一大学) Indian Institute of Technology Bombay(印度理工学院孟买分校) Institut universitaire de France(法国大学研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 ChronoSSM是一种自回归状态空间模型,通过联合建模事件与时间戳的共享主干,在四个领域的实验中,能生成更具时间信息的表示且不降低内容生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09532 2026-08-11 cs.DB cs.AI 新提交 57%

Carnot: Interpretable, Interactive, and Optimized Execution of Deep Research Queries

Carnot:深度研究查询的可解释、交互式且优化的执行系统

Matthew Russo, Yash Agarwal, Tianyu Li, Zhuohan Gu, Michael Cafarella, Omar Khattab, Tim Kraska, Samuel Madden

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Carnot,一款可解释交互式的AI分析执行引擎,可编译自然语言查询为执行图,支持用户干预流程并优化成本与延迟,助力企业高效获取可验证数据洞察。

Comments 4 pages, 2 figures, published as a demo paper in VLDB 2026

Journal ref Proceedings of the VLDB Endowment, Vol. 19, No. 12 pages 4642 - 4645, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09227 2026-08-11 cs.AI 新提交 57%

Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models

Omni2LoRA:用于高效全模态语言模型的保持一致性的参数化存储器

Puneet Mathur, Manan Suri, Dinesh Manocha

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 Omni2LoRA是一种保持一致性的参数化存储器压缩框架,通过优化秩分配策略提升全模态语言模型效率,在视听问答任务中优于多种基线,大幅缩短推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08612 2026-08-11 cs.CV cs.AI 新提交 57%

REVEAL: A Rubric-Guided Agent for Explicit Evidence Sufficiency Verificationin Long-Video Question Answering

REVEAL:用于长视频问答的基于 rubric(评分标准)的显式证据充分性验证智能体

Caijun Yan, Yang Zhou, Meixing Shi, Haoran Sun, Yichen Li, Yuxiang Cai, Yankai Jiang

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对长视频问答中现有方法割裂事件、忽略证据充分性的问题,提出REVEAL框架,通过自适应分块的结构化记忆与rubric引导的证据验证,实现更可靠的推理且性能优于现有SOTA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08466 2026-08-11 cs.AI 新提交 57%

Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses

分层自改进:一种面向任务特定可进化智能体控制框架的方法

Tailin Zhou

机构 * HKUST(香港科技大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出HSI框架,使冻结LLM的任务特定控制框架可进化,在中等难度任务上取得性能提升,超出模型能力时无增益,为改进冻结LLM智能体提供可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08254 2026-08-11 cs.AI 新提交 57%

Your Prompt Is Not the Only Prompt: How Much Do LLMs Weight Structured-Output Schema Descriptions?

你的提示并非唯一提示:大型语言模型对结构化输出模式描述的权重有多大?

Sin-Ying Lin

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究测试LLM对结构化输出模式描述的权重,发现模式影响具模型依赖性,模式设计是更强杠杆,建议将提示与模式视为统一指令表面并实证验证其放置与字段设计。

Comments 11 pages, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07855 2026-08-11 cs.LG 新提交 57%

CommitKV: Lifecycle-Aware KV Cache Compression via Commit Transitions for Multi-Turn Agents

CommitKV:面向多轮智能体的、基于提交转换的生命周期感知KV缓存压缩

Weizhong Huang, Jinchao Zhang, Xiawu Zheng

机构 * Xiamen University(厦门大学) WeChat AI, Tencent Inc.(腾讯微信人工智能实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 CommitKV通过提交转换识别KV生命周期,区分休眠与可安全移除信息,在多轮智能体中降低内存占用、加速推理且准确率优于现有KV缓存压缩方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07478 2026-08-11 cs.CV cs.CL 新提交 57%

PragyaDoc: A Universal Document Intelligence Framework for Multilingual Medical Document Understanding in Low-Resource Settings

PragyaDoc:低资源场景下多语种医学文档理解的通用文档智能框架

Jagpal Singh Jhala

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 针对低资源场景下多语种医学文档理解问题,提出PragyaDoc通用文档智能框架,采用四层流水线实现医学文档的多语种理解,解决了印度因语言差异导致的医学文档可及性障碍。

Comments 7 pages 4 images/figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06922 2026-08-10 cs.AI 新提交 57%

Deal Me Maybe: The Role of Emotions in Multi-Agent Negotiation

或许与我成交:情绪在多智能体谈判中的作用

Massimiliano Luca, Apoorva Singh, Bruno Lepri

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究探讨提示条件下的情绪对LLM多智能体价格谈判的影响,发现愤怒买方成交率极低,快乐买方成交率最高但价格较差,情绪效应具有角色依赖性,引发商业中情绪条件智能体的担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06557 2026-08-10 cs.DC cs.LG 新提交 57%

Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving

Cascade:利用感知SLO的延迟预算实现公平且高吞吐量的LLM推理服务

Muhammad Adnan, Rohan Mahapatra, Prashant J. Nair, Daniel Berger, Pantea Zardoshti, Rodrigo Fonseca, Esha Choukse

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 Cascade是一款LLM服务系统,利用单请求延迟预算协同调度与KV缓存管理,在保留异构请求公平性的同时,使LLM推理服务吞吐量最高提升2.4倍,SLO违规率降低40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05418 2026-08-07 cs.AI 新提交 57%

Negotiating Risk Boundaries in AI for Policing Through Mixed-Stakeholder Deliberation

通过混合利益相关者协商确定警务AI的风险边界

Mackenzie Jorgensen, Jo Reilly, Alex Sutherland, Miri Zilka

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究通过包含社区代表、警察和学者的混合利益相关者协商研讨会,评估13个警务AI用例的种族偏见风险,发现多数参与者支持AI采用,仅拒绝3个用例,强调种族公平可优化AI风险-收益分析。

Comments Accepted to AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏