arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1676 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1676 篇

2608.20564 2026-08-24 cs.AI 新提交 77%

Consilience: Conformally Calibrated Communication Control for Hidden-Profile Multi-Agent Reasoning

Consilience:用于隐式多智能体推理的保形校准通信控制

Abhijith Babu, Ramneet Kaur, Vishal Pramanik, Olivera Kotevska, Nathaniel D. Bastian, Susmit Jha, Sunny Raj, Yanzhao Wu, Sumit Kumar Jha, Anirban Roy

机构 * Knight Foundation School of Computing and Information Sciences, Florida International University(佛罗里达国际大学奈特基金会计算与信息科学学院) SRI International(SRI国际公司) University of Florida(佛罗里达大学) Oak Ridge National Laboratory(橡树岭国家实验室) Army Cyber Institute, United States Military Academy(美国军事学院陆军网络研究所) Oakland University(奥克兰大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本文提出Consilience框架,通过轮次保形校准程序保证多智能体通信控制的可靠性,在HiddenBench任务上提升了决策准确性与通信效率,优于现有协议甚至全信息基线。

Comments 39 pages, 2 figures, 9 tables. Includes appendix with full proof of Proposition 1, expanded results, ablations, and complete prompt templates

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16742 2026-08-18 cs.SE cs.AI 新提交 77%

TDD-Agent: Test-Driven Reasoning for Code Generation

TDD-Agent:用于代码生成的测试驱动推理

Hongyue Yu, Kefan Li, Jiakun Li, Hongzheng Chai, Yuan Yuan, Rui He, Junyi Wei

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15445 2026-08-18 cs.AI 新提交 77%

Measuring Reward Hacking and Reasoning-Answer Decoupling Under Position-Confounded Optimization

测量位置混淆优化下的奖励黑客行为与推理-答案解耦

Suyash Maniyar, Armaan Sandhu, Abhishek Mishra

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 该研究针对位置混淆优化下的奖励黑客与推理-答案解耦问题,通过GRPO训练语言模型,发现模型会学习答案位置捷径,推理与答案解耦,且该捷径可跨域迁移,解耦率等指标可区分能力损失与捷径。

Comments Accepted at the AI Measurement Science Workshop, COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15354 2026-08-18 cs.AI 新提交 77%

Incoherent by Design? On the Moral Self-Consistency of LLMs

天生不连贯?大型语言模型的道德自我一致性研究

Pegah Nokhiz, Aravinda Kanchana Ruwanpathirana, Helen Nissenbaum

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技学院) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :LLM(summary_cn);prompting(abstract);分类 cs.AI

AI总结 本研究针对GPT、Mistral、Llama等LLM,在义务论等三大伦理框架下,发现其道德推理存在最高78%的矛盾率,内部不连贯是AI对齐的必要前提。

Comments 88 pages; pages 16 to 88 are the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08935 2026-08-11 cs.AI 新提交 77%

Integrated Multimodal AI System for Retrieval-Augmented Reasoning, Object Sensing, and Damage Analysis

用于检索增强推理、物体感知与损伤分析的集成多模态AI系统

Kalelo Dukuray, Israel Pina, Evan Perez, Erika Ardiles-Cruz, Jie Wei

机构 * City College of New York(纽约城市学院) Air Force Research Lab(空军研究实验室)

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 本研究提出整合RAG、热谱感知等技术的多模态AI系统,用于损伤评估,通过多模块对比实验验证了其在提升推理准确性、鲁棒性及跨场景检测方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08069 2026-08-11 cs.SE cs.AI 新提交 77%

HugSelect: An Explainable Multi-Criteria Decision-Support Framework for foundation-model selection

HugSelect:一种用于基础模型选择的可解释多标准决策支持框架

Alireza Joonbakhsh, Arda Canser Adalı, Slinger Jansen, Farshad Khunjush, Siamak Farshidi

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.AI

AI总结 HugSelect是用于基础模型选择的可解释多标准决策支持框架,构建含71274个模型的知识库,经多维度评估,推荐质量与商业系统相当,推理可追溯且实用直观。

Comments Pages: 29, Figures: 5. Corresponding authors: Alireza Joonbakhsh (alireza.joonbakhsh@hafez.shirazu.ac.ir) and Siamak Farshidi (siamak.farshidi@wur.nl)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06938 2026-08-10 cs.CV cs.AI 新提交 77%

Debias in Text, Believe Your Eyes: Text-Anchored Cross-Modal Transfer for Visual Counter-Commonsense Reasoning

文本中的去偏:相信你的视觉:面向视觉反常识推理的文本锚定跨模态迁移

Chen Ling, Hanqian Li, Dongnan Liu, Keyu Qian, Jungang Li, Xinglong liu, Shiyi Wang, Xin Dong, Pengcheng Zhu, Wei Zhou, Linjian Mo, Nai Ding

机构 * Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型视觉反常识推理中语言先验干扰问题,提出文本锚定数据构建流程及后训练框架 TACT,实现无需视觉数据的跨模态去偏,提升模型视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06292 2026-08-07 cs.CL cs.SC 新提交 77%

NeSy-RAG: Neuro-Symbolic RAG for Explainable Question Answering

NeSy-RAG:用于可解释问答的神经符号检索增强生成框架

Jonas Gann, Michael Gertz

机构 * Heidelberg University(海德堡大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 NeSy-RAG是一种模块化神经符号RAG框架,可生成透明推理轨迹,在ShARC基准上以61.1%的准确率优于同模型RAG基线,实现可解释问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05254 2026-08-07 cs.CL cs.SC 新提交 77%

Constraint-First Reasoning: A Training-Free Protocol for Exploiting Answer-Space Constraints in Mathematical Problem Solving

约束优先推理:一种在数学问题求解中利用答案空间约束的无训练协议

Hongbo Ma, Bangji Yang, Yunqian Selina Cheng, Jiajun Fan, Hanwen Zhang, Ge Liu

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 该研究针对大型语言模型解数学题易违反约束的问题,提出无训练的两阶段提示协议CFR,经多数据集及多维度实验验证可提升性能,是针对性的测试时干预措施。

Comments 53 pages, 5 figures, 36 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04646 2026-08-06 cs.CL 新提交 77%

Evaluating Theory of Mind in Reasoning Models: Robustness over Reasoning

评估推理模型中的心理理论:推理的鲁棒性

Ian B. de Haan, Peter van der Putten, Max van Duijn

机构 * Leiden University(莱顿大学) LIACS(莱顿高级计算机科学研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究考察经强化学习训练的推理LLMs在ToM任务中的表现,发现其对提示与任务扰动的鲁棒性提升,支持鲁棒性解释而非ToM特有的新能力。

Comments Accepted for 29th International Conference on Discovery Science, October 5-9, 2026, Mainz, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04311 2026-08-06 cs.CL 新提交 77%

Pun Intended: Multi-Agent Translation of Wordplay with Contrastive Learning and Phonetic-Semantic Embeddings

并非双关:基于对比学习与音义嵌入的多智能体文字游戏翻译

Russell Taylor, Benjamin Herbert, Michael Sana

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究结合大型语言模型与语言约束,提出三种双关语翻译方法,其多智能体系统在CLEF JOKER 2025竞赛中获专家评估第一,可改善文字游戏翻译效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03028 2026-08-05 cs.AI 新提交 77%

Evaluating Counterfactual Sensitivity to Patient Information in Medication-Safety Reasoning

评估药物安全推理中对患者信息的反事实敏感性

Zhitian Hou, Yuhang Liu, Pengkai Wang, Zeyu Liu, Guanghao Zhu, Zheng Liu, Shuo Cai, Congkai Xie, Zhijie Sang, Kun Zeng, Hongxia Yang

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本研究推出MedPIC-Bench基准,评估不同LLM在药物安全推理中对患者信息的反事实敏感性,发现所有模型在反事实问题上表现更差,医学专用LLM的反事实表现落后于通用LLM,凸显静态准确性的评估局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22947 2026-07-28 cs.AI cs.MA cs.NI cs.SC 新提交 77%

Let AI Agents Translate Networks, Not Reason About Them

让人工智能代理翻译网络,而非对其进行推理

Hongyu Hè, Maria Apostolaki

机构 * Princeton University(普林斯顿大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对生产网络缺乏形式模型的问题,提出将人工智能局限于网络工件到形式逻辑规则的翻译,依靠求解器推理,构建TypoNet验证模拟广域网符号模型,能快速可靠回答操作问题及促进故障定位。

Comments 8 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22598 2026-07-28 cs.CY cs.AI cs.HC 新提交 77%

A didactical-driven teacher assistant for a dimensional modeling course

面向维度建模课程的教学驱动型教师助手

Laurent Brisson, Maria Segarra, Grégory Smits

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对维度建模课程,提出教学驱动型教师助手,无需商业大语言模型预算或GPU设施。架构含确定性模块处理多任务,大语言模型作语言执行器。评估学生问题发现标准检索不足,确定性管道精度高但覆盖有限,为教学策略提供新思路。

Journal ref International Conference on Computer Supported Education, May 2026, Benidorm/Spain, France. pp.177-189

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22574 2026-07-28 cs.AI cs.IR 新提交 77%

Too much evidence, too little time: From text to actionable recommendations through multi-objective evidence reasoning

证据过多,时间过少:通过多目标证据推理从文本到可操作的建议

Adela Bara, Simona-Vasilica Oprea

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对临床决策中证据过多难审查的问题,提出SCEPTER框架,结合多种技术将临床病例描述转化为建议,经150个案例研究评估,能大幅压缩搜索空间,留存证据多样,基于帕累托的选择提升了证据多样性和建议效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20372 2026-07-23 cs.CL 新提交 77%

Notes to Self: Can LLMs Benefit from Experiential Abstractions?

给自己的笔记:大语言模型能从经验抽象中受益吗?

Chang Liu, Xinyu Li, Artur Dubrawski

机构 * Auton Lab, Carnegie Mellon University(卡内基梅隆大学自动实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型能否从经验抽象中受益,通过从其在MATH训练集的痕迹提取抽象存入可检索库,探索推理时检索和强化学习两种使用模式,发现能提高模型在数学和逻辑推理基准上的性能,且框架可转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19742 2026-07-23 cs.CR cs.AI 新提交 77%

An Automated Framework for Extracting Reachable Attack Chains from Cyber Threat Intelligence Reports

一种从网络威胁情报报告中提取可达攻击链的自动化框架

Wenbo Hou, Ning Hu, Xueping Wang, Jiahao Gu, Wenjian Luo

机构 * Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies(广东新型安全情报技术重点实验室) School of Computer Science and Technology(计算机科学与技术学院) Harbin Institute of Technology(哈尔滨工业大学) New Network Research Department(新网络研究部) Peng Cheng Laboratory(鹏城实验室) Great Bay University(大湾区大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对CTI报告非结构化无法用于自动化攻击路径推理的问题,提出将攻击步骤建模为含条件和行为的单元,经多阶段管道结合大语言模型提取并规范化,编译成规则推理,在数据集上有更好表现,能有效提取可达攻击链。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17884 2026-07-21 cs.AI 新提交 77%

ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding

ST-Veto:通过泰勒预测和视觉基础实现用于扩散多模态语言模型的时空令牌否决

Keuntae Kim, Beomseok Lee, Hyunwoo Kim, Yong Suk Choi

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 研究针对扩散多模态大语言模型推理不足问题,提出无需训练的ST-Veto方法,利用二阶泰勒预测和图像注意力质量否决不稳定及弱基础令牌,与更安全候选交换,在多基准测试中优于其他方法,提升准确率且无额外成本。

Comments ICML 2026 - main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17240 2026-07-21 cs.AI 新提交 77%

Constrained Path Reasoning: Measuring When Committed Stages Earn Their Cost

受限路径推理:衡量已提交阶段何时值得付出成本

Honglin Li

机构 * ShanghaiTech University(上海科技大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究LLM推理管道中已提交阶段何时值得付出成本,提出受限路径推理(CPR)方法,通过源感知路径假设与阶段级核算结合,在多个实验设置下验证,可测量相关指标,为LLM推理提供新的衡量与验证方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15736 2026-07-20 cs.CL 新提交 77%

Better Starts, Better Ends: Bootstrapped Iterative Self-Reasoning Distillation for Compressed Reasoning

更好的开始,更好的结束:用于压缩推理的自引导迭代自推理蒸馏

Leichao Dong, Dongxu Zhang, Yiding Sun, Qirui Wang, Yuhan Wang, Lin Chen, Jihua Zhu

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 研究大型推理模型冗余计算问题,提出BIRD两阶段自推理蒸馏方法,先在简洁指令下采样简洁解并学习,再用简洁自教师进行策略内蒸馏,在Qwen3系列模型上提升精度并降低响应长度,凸显前缀支持对高效推理蒸馏的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15281 2026-07-20 cs.AI 新提交 77%

Causal-Audit: Explicit and Auditable Graph-based Reasoning via Target-Aware Causal Chain Construction

因果审计:通过目标感知因果链构建进行显式且可审计的基于图的推理

Su Lan, Xuefei Yin, Yanming Zhu, Alan Wee-Chung Liew

机构 * School of Information and Communication Technology, Griffith University(信息与通信技术学院,格里菲斯大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对无上下文干预问答,提出因果审计框架,通过目标感知因果图构建和路径级因果证据聚合机制,将因果推理结构化,实验证明该框架优于现有方法,能提供可解释且可审计的推理痕迹。

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14242 2026-07-17 cs.CL 新提交 77%

Implicit Reasoning Steering via Concept Chaining

通过概念链进行隐式推理引导

Xiao Ye, Sanika Chavan, Yuxi Huang, Shahriar Kabir Nahin, Muhao Chen, Anshuman Chhabra, Ben Zhou

机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) Department of Computer Science, University of California, Davis(加利福尼亚大学戴维斯分校计算机科学系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 研究大语言模型推理脆弱性,提出概念链方法,通过生成连接段落继续预训练模型,使自然文本能引导模型预测,揭示推理脆弱性可被利用,为潜在偏差影响模型决策创造渠道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11266 2026-07-14 cs.AI 新提交 77%

Valid $\ne$ Necessary: Diagnosing Latent Inefficiency in Chain-of-Thought

有效≠必要:诊断思维链中的潜在低效率

Daeyeop Lee, Hwanjo Yu

机构 * KT Corporation(KT公司) Pohang University of Science and Technology(浦项科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 研究思维链提示中存在的有效但低效推理问题,提出基于信息论的CAID度量,应用于PACE策略,能在保持准确率时减少令牌消耗,成功从推理链中去除冗余信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11089 2026-07-14 cs.AI 新提交 77%

OS-Pruner: Pruning Chains-of-Thought of Reasoning Models via Optimal Stopping

OS-Pruner:通过最优停止修剪推理模型的思维链

Mohammed Ehab, Aymane El Gadarri, Vivek F. Farias, Adam Jozefiak, Ciamac C. Moallemi

机构 * MIT(麻省理工学院) Columbia Business School(哥伦比亚商学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 研究针对大语言模型思维链推理存在计算过度问题,提出轻量级框架OS-Pruner,将思维链修剪转化为最优停止问题,通过优化效用动态评估终止点,在多基准和模型上减少生成长度且精度牺牲小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10994 2026-07-14 cs.LG 新提交 77%

A Multi-Agent Framework for Zero-Dimensional Reduced-Order Model Planning

用于零维降阶模型规划的多智能体框架

Bingteng Sun, Hao Yin, Yiling Chen, Renjie Xiao, Lei Xie, Shanyou Wang, Ruonan Wang, Shubao Chen, Qingzong Xu, Lin Lu, Qiang Du, Junqiang Zhu

机构 * Institute of Engineering Thermophysics, Chinese Academy of Sciences(中国科学院工程热物理研究所) National Key Laboratory of Science and Technology on Advanced Light-duty Gas-turbine(先进轻型燃气轮机技术重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Qingdao Institute of Aeronautical Technology(青岛航空技术研究院) Nanjing Future Energy System Research Institute(南京未来能源系统研究院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文针对复杂零维降阶模型规划中依赖人工、传统方法局限等问题,提出多智能体架构Z-COPA,其核心是专用图表示法,将规划转化为图结构优化问题,经多基准测试验证,该框架性能卓越且打破传统范式,提供新规划技术方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10480 2026-07-14 cs.CL 新提交 77%

When Reasoning Hurts Legal Drafting: The Verbalization Bottleneck in Patent Claim Generation

当推理对法律起草造成阻碍时:专利权利要求生成中的语言表达瓶颈

Lekang Jiang, Wenjun Sun, Stephan Goetz

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究专利权利要求生成中CoT提示是否有益,提出特定任务CoT方法并评估。结果显示推理增强提示可提升权利要求质量,且隐式CoT优于显式CoT,显式CoT会引入信息瓶颈,为法律任务和CoT应用提供新见解。

Comments Accepted to AI for Law Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09653 2026-07-13 cs.CR cs.AI 新提交 77%

VEXAIoT: Autonomous IoT Vulnerability EXploitation using AI Agents

VEXAIoT:使用人工智能代理进行物联网漏洞自动利用

Katherine Swinea, Kshitiz Aryal, Lopamudra Praharaj, Maanak Gupta

机构 * Department of Computer Science Tennessee Tech University Cookeville, TN, USA School of Interdisciplinary Informatics University of Nebraska Omaha Omaha, NE, USA 1 Department of Computer Science, Tennessee Tech University, TN, USA. 2 School of Interdisciplinary Informatics, University of Nebraska Omaha, NE, USA. 3 Dept. of Mathematics \& Computer Science, University of North Carolina at Pembroke, NC, USA.

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对物联网系统漏洞,提出VEXAIoT自主多代理框架,利用大语言模型推理和进攻性安全工具,结合漏洞检测与攻击执行代理,在特定环境评估中取得高成功率,证明其可实现物联网漏洞评估及安全工作流程自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07117 2026-07-09 cs.CV cs.AI 新提交 77%

Tree-of-Thoughts Reasoning for Text-to-Image In-Context Learning

用于文本到图像上下文学习的思维树推理

Stepanida Alekseeva, Jenifer Kalafatovich, Seong-Whan Lee

机构 * Korea University(韩国大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 研究文本到图像上下文学习中模型的推理问题,提出思维树推理框架,通过多阶段推理和选择层减轻提示模糊性与组合错误,实验表明该结构化多分支推理能提升图像生成效果,无需额外训练或微调。

Comments 6 pages, 3 figures, 4 tables. Accepted at IEEE SMC 2026. Code available at https://github.com/Pandastep/ToT-T2I-ICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04096 2026-07-07 cs.AI 新提交 77%

Forethought: Verifiable Reasoning from Neurosymbolic Primitive Programming

预思考:神经符号原始编程的可验证推理

Vishvesh Bhat, Jay Vaghasiya, Emmanuel Anaya Gonzalez

机构 * CoreThink AI UC San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);prompting(abstract);分类 cs.AI

AI总结 研究改进智能体工作流推理能力问题,提出神经符号推理系统Forethought,将推理视为可验证程序,由符号和神经原语库构建,经特定语言组合,提升了基础模型准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01387 2026-07-03 cs.IR cs.LG 新提交 77%

Bi-NAS: Towards Effective and Personalized Explanation for Recommender Systems via Bi-Level Neural Architecture Search

Bi-NAS:通过双层神经架构搜索实现推荐系统的有效和个性化解释

Longfeng Wu, Yao Zhou, Tong Zeng, Zhimin Peng, Bhanu Pratap Singh Rawat, Lecheng Zheng, Giovanni Seni, Dawei Zhou

机构 * Virginia Tech(弗吉尼亚理工大学) Google(谷歌) Amazon(亚马逊)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.LG

AI总结 提出Bi-NAS框架,通过双层神经架构搜索优化推荐解释,结合大语言模型生成个性化理由,提升准确性和解释效果。

详情

展开后加载摘要…

URL PDF HTML 收藏