arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 19038 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19038 篇

2601.09459 2026-01-15 cs.IR cs.CL 80%

Dissecting Judicial Reasoning in U.S. Copyright Damage Awards

解析美国版权损害赔偿判决中的司法推理

Pei-Chi Lo, Thomas Y. Lu

机构 * National Sun Yat-sen University(国立中山大学)

专题命中 推理与问题求解 :LLM(abstract,comments);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL

AI总结 本研究提出基于修辞结构理论的LLM方法,用于解析版权损害赔偿判决中的司法推理,揭示各巡回法院因素权重差异,为法律分析提供新方法和实证洞察。

Comments Presented in SIGKDD'25 SciSoc LLM Workshop: Large Language Models for Scientific and Societal Advances

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09535 2025-12-16 cs.LG 80%

Latent-Autoregressive GP-VAE Language Model

潜在自回归GP-VAE语言模型

Yves Ruffenach

机构 * Conservatoire National des Arts et Métiers(法国国家艺术与工艺 conservatoire)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG

AI总结 该研究提出了一种基于高斯过程和变分自编码器的潜在自回归模型,通过概率几何支持语言模型的时间结构,而非显式神经运算。

Comments 27 pages, 1 figure, 4 tables. Proof-of-concept study of a latent-autoregressive GP-VAE language model with TCN encoder and non-autoregressive decoder. Code available at https://github.com/y-v-e-s/GP-VAE-Latent-AR

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03516 2025-06-05 cs.RO cs.AI 80%

SemNav: A Model-Based Planner for Zero-Shot Object Goal Navigation Using Vision-Foundation Models

Arnab Debnath, Gregory J. Stein, Jana Kosecka

机构 * George Mason University(乔治·马歇尔大学)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

Comments Accepted at CVPR 2025 workshop - Foundation Models Meet Embodied Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07998 2025-05-14 cs.CV cs.LG 80%

Vision Foundation Model Embedding-Based Semantic Anomaly Detection

Max Peter Ronecker, Matthew Foutter, Amine Elhafsi, Daniele Gammelli, Ihor Barakaiev, Marco Pavone, Daniel Watzenig

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.LG

Comments Accepted for the Workshop "Safely Leveraging Vision-Language Foundation Models in Robotics: Challenges and Opportunities" at ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26809 2026-08-28 cs.CV cs.MM 新提交 80%

Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning

思考镜头:基于智能体推理的一致多镜头视频编辑

Chenyang Wu, Fuchen Long, Binyuan Huang, Xinlong Sun, Xi Chen, Chun-Le Guo, Chongyi Li

机构 * Nankai University(南开大学) Tencent(腾讯)

专题命中 推理与问题求解 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本文针对多指令编辑长视频的挑战,提出MMLVE任务与智能体编辑框架,构建MMLVE-Bench数据集及评估指标,所提MMLVE-Agent优于Seedance 2.0等闭源SOTA方法,可实现一致且无幻觉的长视频编辑。

Comments Project Page: https://wucy0519.github.io/MMLVE/ and see source codes at https://github.com/Wucy0519/MMLVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25711 2026-08-27 cs.CR 新提交 80%

Reassembling Distributed Risk: Trajectory-Conditioned Action Generation for Multi-Turn Agent Safety

重构分布式风险:面向多轮智能体安全的轨迹条件动作生成

Yanbo Dai, Zhenlan Ji, Zongjie Li, Shuai Wang

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对多轮分解攻击下使用工具的LLM智能体的安全风险,提出生成时防御方法ReDiR,通过轨迹级安全条件整合跨轮安全信息,将攻击成功率降至8%以下,可迁移且开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25573 2026-08-27 cs.DB cs.SE 新提交 80%

DBcover: A White-box SQL Test Generation Framework for Coverage Improvement

DBcover:一种用于提升覆盖率的白盒SQL测试生成框架

Yankai Rong, Shuang Liu, Jinhao Dong, Qiang Yin, Wei Lu, Jianhua Wang, Xiaoyong Du

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对RDBMS测试覆盖率提升难题,提出LLM驱动的白盒SQL测试生成框架DBcover,经实验在PostgreSQL、MySQL及KingbaseES上均实现有效覆盖率提升。

Comments Accepted to the ICSE 2026 Industry Challenge Track. 12 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08462 2026-08-27 cs.CR cs.PL cs.SE 版本更新 80%

QLCoder: A Query Synthesizer For Static Analysis of Security Vulnerabilities

QLCoder:一种用于静态分析安全漏洞的查询生成器

Claire Wang, Ziyang Li, Saikat Dutta, Mayur Naik

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 QLCoder通过结合LLM与执行反馈,利用MCP接口生成有效的安全查询,有效检测漏洞。在111个Java项目中,53.4%的CVE被正确识别,优于仅使用Claude Code的10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23809 2026-08-26 cs.LG cs.AI cs.CL 新提交 80%

Discovering Cross-Language Reasoning Invariance in LLMs with Geometry-Invariant Sparse Autoencoders

利用几何不变稀疏自编码器发现大语言模型中的跨语言推理不变性

Igor Bogdanov, Changcheng Huang

机构 * Carleton University(卡尔顿大学)

专题命中 推理与问题求解 :LLM(summary_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究以MGSM数据集探究多语言LLM跨语言推理的特征机制,提出GI-SAE方法,发现跨语言特征共享依赖模型架构,GI-SAE主要放大现有跨语言结构且模型特异性明显。

Comments Accepted as a poster at the ICML 2026 Workshop on Mechanistic Interpretability

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23050 2026-08-26 cs.HC 版本更新 80%

What Makes an Initial Reaction Ready for Discussion?: Multi-Persona AI Support for Stance Reflection and Writing

是什么让初始反应适合讨论?:用于立场反思与写作的多角色AI支持

Sky Shih-Kai Hong, Mu-Tien Kuo, Wei-Ji Chen, Dennis Wang

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 本研究提出多角色AI工具StanceLab,通过对比三角色模式与独立LLM模式的试点,明确了设计需求并规划了未来工作流,助力用户准备讨论立场。

Comments 5 pages, 3 figures, 2 tables. Accepted to TAICHI 2026 (https://taichi2026.taiwanchi.org/program)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23154 2026-08-25 cs.IR 新提交 80%

The Disconnect Between Better Descriptive Reasoning Trace Quality and Recommendation Effectiveness

更优描述性推理轨迹质量与推荐效果之间的脱节

Gustavo Penha, Juan Elenter, Claudia Hauff, Hugues Bouchard, Paul Bennett, Mounia Lalmas

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 本研究通过2×2因子实验对比语义ID与自然语言标题的推理轨迹质量,发现提升描述性推理轨迹质量无法持续改善传统离线推荐效果。

Comments Accepted at the Recsys'26 Workshop on Agentic and Generative AI for E-Commerce

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21628 2026-08-25 cs.SE cs.RO 新提交 80%

ExploreAI: Agentic Exploration Knowledge Bases for Reproducible Observable-Regression Testing of Black-Box VR and 3D Applications

ExploreAI:用于黑盒VR与3D应用可复现可观测回归测试的智能探索知识库

Jiajie Wang, Kebin Peng, Wei Wang, Xiaoyin Wang, Sen He, Xue Qin

机构 * The University of Arizona(亚利桑那大学) East Carolina University(东卡罗来纳大学) The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Villanova University(维拉诺瓦大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 ExploreAI是LLM驱动的智能体框架,通过构建探索知识库(EKB),实现黑盒VR与3D应用的可复现可观测回归测试,在多场景中验证了其有效性。

Comments 11 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21431 2026-08-25 cs.CV cs.MM 新提交 80%

Boosting Knowledge-based Visual Question Answering with Structured Context Reasoning

基于结构化上下文推理提升基于知识的视觉问答性能

Qiyou Liu, Yong Zhang, Jianjie Luo, Zhenguo Yang, Yi Yu

机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Graduate School of Advanced Science and Engineering, Hiroshima University(广岛大学先进科学与工程研究生院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SCoRe框架,通过上下文获取、选择、压缩三阶段处理多模态知识,在OK-VQA和A-OKVQA基准上性能优于现有最优方法,提升了基于知识的视觉问答效果。

Comments Accepted by ICME 2026. Source code is available at https://github.com/WISLab-GDUT/SCoRe

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00968 2026-08-25 cs.HC 版本更新 80%

SherpaAI: A Multi-modal Solution for Delivering Personalized and Adaptive Fitness Interventions

FlexAI: 一种多模态解决方案,用于提供个性化和自适应的健身干预

Shivangi Agarwal, Zoya Ghoshal, Bharat Jain, Siddharth

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 FlexAI通过整合计算机视觉、生理传感器和大语言模型,提供实时个性化健身指导,显著提升用户参与度和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27204 2026-08-24 cs.CR cs.SE 版本更新 80%

MalSkills: Detecting Malicious Skills in the Agentic Supply Chain via Neuro-symbolic Reasoning

我的爱,华生。通过神经符号推理跨异构工件检测恶意技能

Shenao Wang, Junjie He, Yanjie Zhao, Yayi Wang, Kan Yu, Haoyu Wang

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 本文提出MalSkills框架,通过符号解析与LLM语义分析提取异构工件中的安全敏感操作,构建技能依赖图并进行神经符号推理,实现恶意技能检测,实验表明其在F1得分上优于现有方法。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09774 2026-08-21 cs.CR 版本更新 80%

QRS: A Rule-Synthesizing Neuro-Symbolic Triad for Autonomous Vulnerability Discovery

QRS:一种用于自主漏洞发现的神经符号三元组规则生成器

George Tsigkourakos, Constantinos Patsakis

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 QRS通过神经符号方法生成代码查询,发现超出预定义模式的漏洞,显著降低假阳性,并在低开销下发现高严重性漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18118 2026-08-20 math.OC cs.SY eess.SY 新提交 80%

Formal Safety Verification for Nonlinear Systems with Generative Barrier Certificate

基于生成式障碍证书的非线性系统形式化安全验证

Mengxin Ren, Hanrui Zhao

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对非线性系统安全验证中障碍证书推导计算成本高的问题,提出基于大语言模型的生成式框架,将BMI问题转化为LMI测试,实现了远超传统方法的速度与性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11615 2026-08-19 cs.SE 版本更新 80%

ThinkLog: Leveraging Reasoning for Log Statement Generation

ThinkLog:利用推理进行日志语句生成

Kazuki Kusama, Honglin Shu, Masanari Kondo, Tao Xiao, Yasutaka Kamei

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对现有端到端日志语句生成方法准确性有限的问题,提出ThinkLog,该方法基于LLM,通过将推理融入提示作为少样本示例,引导LLM生成日志语句,在准确率提升15.4%的同时,推理成本约为现有最佳方法的50%。

Comments 16 pages, Accepted at the 26th IEEE International Conference on Software Quality, Reliability, and Security (QRS 2026), Short Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15869 2026-08-18 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 80%

Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning

超越视觉思维链:用于主动视频推理的内化视觉思维

Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar, Arnab Kumar Mondal, Zhongyu Jiang, Ian Fasel, Joerg Liebelt

机构 * Apple(苹果公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出后训练框架IVT,在训练时内化视觉预测能力,推理时直接生成答案,相较Visual CoT性能相当或更优且延迟降低5倍以上,可实现更高效准确的主动视频推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15491 2026-08-18 cs.SE 新提交 80%

HxAgent: Iterative Agent Planning for End-to-End Web Application Testing

HxAgent:用于端到端Web应用测试的迭代智能体规划方法

Tu Nguyen, Duy Cao, Viet Nguyen, Phu Nguyen, Vy Le, Nguyen TK Nguyen, Tien N. Nguyen, Vu Nguyen

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 HxAgent是一种基于LLM的迭代规划智能体,通过主动修正策略结合多类信息优化Web测试,在MiniWoB++、350项Web任务及OnlineMind2Web数据集上均优于WALT模型,表现优异。

Comments Under review for a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11394 2026-08-13 cs.SE 新提交 80%

GraphAlignCoder: Aligning Program and Proof Graphs for Code Generation

GraphAlignCoder:对齐程序与证明图的代码生成框架

Yueke Zhang, Zihan Fang, Kevin Leach, Yu Huang

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 GraphAlignCoder是将显式正确性结构迁移至代码生成的训练框架,通过对齐程序与证明图提升性能,在多个基准测试中优于现有方法,验证图注入与验证到代码的整合是关键。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09924 2026-08-12 cs.CL cs.AI cs.LG 版本更新 80%

LLMs Encode Their Failures: Predicting Success from Pre-Generation Activations

LLMs编码其失败:从预生成激活中预测成功

William Lugoloobi, Thomas Foster, William Bankes, Chris Russell

机构 * Oxford Internet Institute, University of Oxford(牛津大学牛津互联网研究所) FLAIR, University of Oxford(牛津大学FLAIR) Department of Computer Science, University College London(伦敦大学学院计算机科学系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过预生成激活预测LLM在数学和编程任务中的成功率,发现模型内部表示能有效指导更高效的推理,且在MATH任务中通过模型池路由可提升性能并降低70%的推理成本。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09477 2026-08-11 cs.SE 新提交 80%

SmellCC: A Tool for Automated Code Smells Remediation

SmellCC:一种用于自动修复代码异味的工具

Xiaoting Zhang, Yujie Zhang, Zhipeng Gao, Xing Hu, Xin Xia

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 SmellCC是一款Visual Studio Code扩展,结合SonarQube与LLM流水线,采用思维链和少样本学习,可一键修复Python前10种常见代码异味,清洁率96.8%、准确率91.3%,能提升软件可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08884 2026-08-11 cs.RO cs.HC 新提交 80%

SHRIMP: Iterative Refinement of Robot Task Plans

SHRIMP:机器人任务计划的迭代优化

Mya Schroder, Yuna Hwang, Callie Y. Kim, Leqian Cheng, Jeffrey Li-cheng Liu, Chenchen Zheng, Xinning He, Bilge Mutlu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对协作机器人任务计划的语义歧义与透明度不足问题,提出SHRIMP系统,可通过自然语言生成分层机器人原语计划并迭代修正,经35人用户研究验证其能提升用户感知控制与机器人透明度。

Comments 11 pages, 8 figures, The 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05956 2026-08-07 cs.MA cs.SY eess.SY 新提交 80%

Certifying Collective Reasoning in Multi-Agent Systems via Koopman Spectral Analysis

基于Koopman谱分析的多智能体系统集体推理验证

Nuzhat Khan, Indrakshi Dey

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出基于Koopman算子理论的框架,通过分析多智能体集体的Koopman转移算子谱,实现对其推理收敛时间、派系及决策的可验证,在注意力共识模型上验证了方法的有效性,且运行高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05521 2026-08-07 cs.SE 新提交 80%

Reasoning from Traces: Divergence-Guided Agentic Repair of WebAssembly Discrepancies

从痕迹中推理:分歧引导的智能体修复WebAssembly差异

Liyan Huang, Kaicheng Wang, Weihang Wang

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 本文提出WasmMend系统,通过差分痕迹分析定位Wasm与原生执行的分歧函数,引导LLM智能体生成补丁,在真实C/C++项目上修复率达70.0%,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04798 2026-08-06 cs.HC 新提交 80%

Reference-Based Manipulation: A Framework and Pipeline for Multimodal Spatial Reasoning

基于参考的操作:多模态空间推理的框架与流程

Yangyang He, Zhuangze Hou, Yonglin Chen, Can Liu

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 本研究针对沉浸式平台中多模态空间交互问题,提出基于参考的操作框架,分解空间参考为源、锚点、框架组件,实现LLM驱动的流程并验证其效用,为空间交互设计提供关键经验。

Comments 16 pages, 10 figures. Accepted to the 39th Annual ACM Symposium on User Interface Software and Technology (UIST 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03648 2026-08-05 cs.MA 新提交 80%

Group Perspective Matters: Regulating Debate Relationships Can Mitigate Blind Conformity in Multi-Agent Debate

群体视角至关重要:调控辩论关系可缓解多智能体辩论中的盲目从众

Hao Wu, Shoucheng Song, Chang Yao, Haoyu Wang, Huaiyu Wan, Youfang Lin, Kai Lv

专题命中 推理与问题求解 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 针对多智能体辩论中LLMs易盲目从众的问题,提出DEAR框架,通过动态调控辩论关系缓解该问题,实验显示其性能更优且token消耗显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03558 2026-08-05 cs.SE 新提交 80%

EffiHolmes: Differential Profiling-Guided Repository Level Time Inefficiency Fix Localization

EffiHolmes:基于差分分析的仓库级时间低效修复定位

Haowen Yang, Yun Peng, Zishuo Ding

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 EffiHolmes是基于LLM的仓库级时间低效修复定位框架,通过差分分析等技术提升定位精度,在RepoEffi-Bench上优于多种基线方法,且跨模型规模稳健。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). 13 pages, 3 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17535 2026-08-05 cs.SE 版本更新 80%

AgentModernize: Preserving Business Logic in Legacy Modernization with Multi-Agent LLMs and Behavioral Specification Graphs

AgentModernize: 通过多智能体LLM和行为规范图在遗留系统现代化中保留业务逻辑

Sheikh Nazib Ahmed, Marnim Galib

专题命中 推理与问题求解 :LLM(title_cn,abstract)

AI总结 本文提出AgentModernize框架,通过多智能体系统和行为规范图来保留业务逻辑,解决传统方法在遗留系统现代化中丢失隐含规则和交叉模块约束的问题,实验表明该方法在多个场景中表现优异。

Comments 10 pages, 8 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏