arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 908 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 908 篇

2603.15600 2026-07-08 cs.RO cs.AI cs.CL cs.CV 版本更新 73%

From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation

从被动观察者到主动批评者:强化学习激发机器人操作的过程推理

Yibin Liu, Yaxing Lyu, Daqi Gao, Zhixuan Liang, Weiliang Tang, Shilong Mu, Xiaokang Yang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) Xiamen University Malaysia(厦门大学马来西亚分校) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Xspark AI

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出PRIMO R1框架,通过强化学习使视频MLLMs成为主动批评者,提升机器人操作中长期任务的监督准确性,实验表明其在过程推理和零样本泛化方面表现优异。

Comments Accepted to ECCV 2026. 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06576 2026-07-07 cs.CV cs.AI cs.LG cs.RO 版本更新 73%

BEVLM: Distilling Semantic Knowledge from LLMs into Bird's-Eye View Representations

BEVLM:将语言模型中的语义知识提炼到鸟瞰视图表示中

Thomas Monninger, Shaoyuan Xie, Qi Alfred Chen, Sihao Ding

机构 * Mercedes-Benz Research & Development North America(梅赛德斯-奔驰研发北美研究所) University of California, Irvine(加州大学伊尔弗分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究将大语言模型集成到自动驾驶,针对现有方法冗余计算、空间一致性受限等问题,提出BEVLM框架,连接鸟瞰视图表示与大语言模型,能有效提升跨视图驾驶场景推理准确性及端到端驾驶性能。

Comments Accepted to the 2026 European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18778 2026-07-01 cs.LG cs.CL 版本更新 73%

Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability

教模型自学:在可学习性边缘推理

Shobhita Sundaram, John Quan, Ariel Kwiatkowski, Kartik Ahuja, Yann Ollivier, Julia Kempe

机构 * MIT(麻省理工学院) Meta FAIR New York University(纽约大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出SOAR非对称自对弈框架,通过元强化学习生成自动课程,解决低初始成功率数据集上的推理模型扩展问题,发现基于学生进步的奖励优于内在可学习性奖励,且问题结构比答案正确性更重要。

Comments ICML 2026. Blog post: https://ssundaram21.github.io/soar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09731 2026-06-29 cs.CV cs.AI cs.CL 版本更新 73%

EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoning

EXPLORE-Bench:具有长视距推理的自我中心场景预测

Chengjun Yu, Xuhan Zhu, Chaoqun Du, Pengfei Yu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Foundation Model Team, Li Auto Inc.(蔚来汽车基础模型团队) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出EXPLORE-Bench基准,通过初始场景图像和动作序列预测最终场景,评估多模态大模型在自我中心长视距推理中的能力,发现与人类存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16518 2026-06-25 cs.CV cs.CL cs.LG 版本更新 73%

SyncLoop: A Multimodal Dual-Loop Framework for Self-Improving Mathematical Reasoning

SyncLoop: 一种用于自我改进数学推理的多模态双循环框架

Xiuwei Chen, Wentao Hu, Hanhui Li, Yongxin Wang Jun Zhou, Zisheng Chen, Meng Cao, Yihan Zeng, Kui Zhang, Yu-Jie Yuan, Jianhua Han, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学) MBZUAI Huawei Noah’s Ark Lab(华为诺亚实验室) Yinwang Intelligent Technology Co. Ltd(依文智科有限公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出SyncLoop多模态双循环框架,通过跨模态数据演化循环和数据-模型演化循环联合进化训练数据和模型能力,解决数据复杂度不匹配和演化分离问题,在数学推理基准上持续提升性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20209 2026-06-23 cs.LG cs.CL 版本更新 73%

Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning

Spark: 通过动态分支进行战略性策略感知探索以实现长周期智能体学习

Jinyang Wu, Shuo Yang, Changpeng Yang, Yuhao Shen, Shuai Zhang, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出Spark框架,通过关键状态动态分支实现资源高效探索,在长周期任务中以更少样本取得更高成功率和泛化能力。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09388 2026-06-23 cs.LG cs.CL 版本更新 73%

Don't Tell the Answer, Truly Guide the Reasoning During RL Rollouts

不要告诉答案,真正引导RL Rollout期间的推理

Xinyi Wang, Jinyi Han, Zishang Jiang, Tingyun Li, Jiaqing Liang, Sihang Jiang, Zhaoqian Dai, Shuguang Ma, Fei Yu, Yanghua Xiao

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学教育人工智能研究所) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对强化学习中任务难度超出模型能力导致奖励稀疏的问题,提出HINT框架,通过元提示和亲和力感知策略优化,提升模型推理能力并保持训练稳定性。

Comments Accepted to Findings of ACL 2026. 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21978 2026-06-19 cs.LG cs.AI 版本更新 73%

Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models

超越推理增益:缓解大型推理模型中的通用能力遗忘

Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

机构 * Meta Superintelligence Labs(Meta超智能实验室) New York University(纽约大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对强化学习训练导致推理模型遗忘基础能力的问题,提出RECAP重放策略,通过动态目标重加权在线调整训练重点,在保持通用能力的同时提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03460 2026-06-18 cs.AI cs.LG 版本更新 73%

FinSTaR: Towards Financial Reasoning with Time Series Reasoning Models

FinSTaR:面向时间序列推理模型的金融推理

Seunghan Lee, Jun Seo, Jaehoon Lee, Sungdong Yoo, Minjae Kim, Tae Yoon Lim, Dongwan Kang, Hwanil Choi, Soonyoung Lee, Wonbin Ahn

机构 * LG AI Research(LG人工智能研究)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对时间序列推理模型在金融领域的失效问题,提出基于2x2能力分类法的FinSTaR模型,通过Compute-in-CoT和Scenario-Aware CoT策略在FinTSR-Bench基准上达到78.9%平均准确率。

Comments KDD Workshop on SciSoc Agents & LLMs 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17104 2026-06-16 cs.AI cs.CL cs.LO 版本更新 73%

Towards Advanced Mathematical Reasoning for LLMs via First-Order Logic Theorem Proving

迈向基于一阶逻辑定理证明的大语言模型高级数学推理

Chuxue Cao, Mengze Li, Juntao Dai, Jinluan Yang, Zijian Zhao, Shengyu Zhang, Weijie Shi, Chengzhong Liu, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在多步一阶逻辑数学推理中的困难,提出DREAM方法,通过公理驱动策略多样化和子命题错误反馈提升推理多样性和正确性,在定理证明数据集上性能提升0.6%-6.4%。

Comments Accepted by EMNLP 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04671 2026-06-15 cs.CL cs.LG 版本更新 73%

Reward-SQL: Boosting Text-to-SQL via Stepwise Execution-Aware Reasoning and Process-Supervised Rewards

Reward-SQL:通过逐步执行感知推理和过程监督奖励提升Text-to-SQL

Yuxin Zhang, Meihao Fan, Ju Fan, Mingyang Yi, Yuyu Luo, Guoliang Li, Bin Wu, Wenchao Zhou

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Alibaba Cloud Computing(阿里云 computing)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对强化学习在Text-to-SQL中缺乏逐步执行感知推理和过程级奖励的问题,提出CoCTE框架和Reward-SQL方法,通过中间视图验证、结构化CTE及过程奖励模型,显著提升复杂查询的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02465 2026-06-11 cs.AI cs.CV cs.LG 版本更新 73%

MentisOculi: Revealing the Limits of Reasoning with Mental Imagery

MentisOculi: 揭示心智图像推理的局限性

Jana Zeller, Thaddäus Wiedemer, Fanfei Li, Thomas Klein, Prasanna Mayilvahanan, Matthias Bethge, Felix Wichmann, Ryan Cotterell, Wieland Brendel

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MentisOculi基准,通过多步推理问题测试前沿模型利用视觉表示辅助推理的能力,发现视觉策略普遍无法提升性能,且统一多模态模型存在生成错误累积和无法利用真实可视化的问题。

Comments 9 pages, 8 figures, Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04027 2026-06-10 cs.AI cs.CL 版本更新 73%

Why Does Reasoning Length Converge? Unveiling the Underfitting-Overfitting Trade-off in Chain-of-Thought

CoT-Space: 一种通过强化学习实现内部慢思考的理论框架

Zeyu Gan, Hao Yi, Yong Liu

机构 * Zeyu Gan, Yi Hao, Yong Liu(GAN 赵毅、LIU 刘永)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoT-Space理论框架,通过强化学习将推理过程从离散的token预测任务转化为连续的推理层面语义空间中的优化过程,揭示了测试时扩展中最优CoT长度的收敛是欠拟合与过拟合基本权衡的自然结果。

Comments Preprint Edition

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03862 2026-06-09 cs.AI cs.CL 版本更新 73%

Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards

正确性不足:通过执行器导向的奖励训练推理计划器

Tianyang Han, Hengyu Shi, Junjie Hu, Xu Yang, Zhiling Wang, Junhao Su

机构 * D 4 Lab(D4实验室) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TraceLift框架,通过执行器导向的奖励提升推理质量,利用rubric-based Reasoning Reward Model评估推理轨迹的可靠性与有效性。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03292 2026-06-09 cs.CL cs.AI cs.IR 版本更新 73%

From Conflict to Consensus: Boosting Medical Reasoning via Multi-Round Agentic RAG

从冲突到共识:通过多轮代理RAG提升医疗推理

Wenhao Wu, Zhentao Tang, Yafu Li, Shixiong Kai, Mingxuan Yuan, Zhenhong Sun, Chunlin Chen, Zhi Wang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MA-RAG框架,通过多轮代理循环迭代优化外部证据和内部推理历史,提升医疗复杂推理能力,实验显示在7个医疗问答基准上表现优于现有方法。

Comments 27 pages, 8 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21596 2026-08-21 cs.AI 版本更新 72%

FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills

FlowEvo:通过工作流和可执行技能的协同进化实现自我进化的智能体

Zeyu Ren, Ling Yue, Ran Li, Yishu Wang, Shengxiang Xu, Hanmo Liu, Shaowu Pan, Shimin Di

机构 * Southeast University(东南大学) Rensselaer Polytechnic Institute(伦斯勒理工学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :language model(abstract,comments);large language model(abstract);分类 cs.AI

AI总结 研究旨在让大型语言模型智能体通过工作流解决复杂任务。提出FlowEvo框架,通过工作流到技能编译、技能到工作流反馈、技能管理三个机制,使智能体无需更新模型参数积累完善能力,实验显示其在基准测试中精度-成本权衡优,各机制有贡献。

Comments Published as a conference paper at the Conference on Language Modeling (COLM) 2026. 25 pages, 3 figures, 16 tables. Code: https://github.com/DEFENSE-SEU/FlowEvo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30837 2026-06-16 cs.CR cs.LG 版本更新 72%

Send a SCOUT First: Pre-hoc Reasoning for Adaptive Detector Allocation in Prompt-Injection Defense

先派侦察兵:提示注入防御中自适应检测器分配的预推理方法

Shuhao Zhang, Jiarui Li, Qi Cao, Ruiyi Zhang, Pengtao Xie

机构 * UC San Diego(加州大学圣迭戈分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 针对提示注入检测器异构且不可靠的问题,提出SCOUT框架,通过预测每个检测器对每个样本的可靠性和延迟,动态分配检测器,实现安全性与效率的权衡。

Comments We propose SCOUT, a detector allocation framework that predicts each detector's accuracy and latency on a given input before running it, letting operators control the safety-utility trade-off with a single threshold and route to an LLM judge only when needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20776 2026-08-18 cs.CV 版本更新 71%

RingMo-Agent: A Unified Remote Sensing Foundation Model for Multi-Platform and Multi-Modal Reasoning

RingMo-Agent: 多平台多模态遥感基础模型

Huiyang Hu, Peijin Wang, Yingchao Feng, Kaiwen Wei, Wenxin Yin, Wenhui Diao, Mengyu Wang, Hanbo Bi, Kaiyue Kang, Tong Ling, Kun Fu, Xian Sun

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院 aerospace information research institute) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Target Cognition and Application Technology (TCAT)(目标认知与应用技术重点实验室)

专题命中 推理与问题求解 :foundation model(title)

AI总结 RingMo-Agent是一种多平台多模态遥感基础模型,通过大规模数据集和任务特定标记提升遥感图像的感知与推理能力。

Comments 24 pages, 5 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14008 2026-07-17 cs.CV 版本更新 71%

Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models

稀疏-LaViDa:稀疏多模态离散扩散语言模型

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

机构 * Adobe(Adobe公司) UCLA(加州大学洛杉矶分校)

专题命中 推理与问题求解 :language model(title)

AI总结 针对掩码离散扩散模型推理速度慢的问题,提出Sparse-LaViDa框架,通过动态截断冗余掩码令牌加速采样,引入专用寄存器令牌和注意力掩码保证质量与一致性,基于LaViDa - O构建,在多任务中实现加速且保持质量。

Comments 18 pages (12 pages for the main paper and 6 pages for the appendix), 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15654 2026-08-21 cs.RO cs.AI 版本更新 70%

PO-PDDL: Learning Symbolic POMDPs from Visual Demonstrations for Robot Planning Under Uncertainty

PO-PDDL: 从视觉演示中学习符号化POMDP以实现不确定性下的机器人规划

Wenjing Tang, Xuanjin Jin, Yuan Liu, Renming Huang, Cewu Lu, Panpan Cai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出PO-PDDL符号化POMDP框架,通过从机器人执行视频中重建潜在状态轨迹、识别部分可观测性并学习随机转移与观测模型,实现不确定性下的鲁棒任务规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02794 2026-08-21 cs.AI 版本更新 70%

CharTool: Tool-Integrated Visual Reasoning for Chart Understanding

CharTool: 集成工具的视觉推理用于图表理解

Situo Zhang, Yifan Zhang, Zichen Zhu, Da Ma, Lei Pan, Danyang Zhang, Zihan Zhao, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) Suzhou Laboratory(苏州实验室) AISpeech Co., Ltd.(思必驰科技股份有限公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CharTool,通过集成工具提升多模态大语言模型对图表的理解能力,通过双重数据管道和代理强化学习,在六个图表基准测试中取得显著提升。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12682 2026-08-21 cs.AI 版本更新 70%

GridCodex: A RAG-Driven AI Framework for Power Grid Code Reasoning and Compliance

GridCodex:一种用于电网规则推理与合规性的RAG驱动AI框架

Jinquan Shi, Yingying Cheng, Fan Zhang, Miao Jiang, Jun Lin, Yanbai Shen

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对电网规则缺乏自动化解读的问题,提出结合大语言模型、RAG及RAPTOR的GridCodex框架,经验证其答案质量提升26.4%、召回率超10倍,可助力电网合规性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06185 2026-08-20 cs.AI cs.CV 版本更新 70%

Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios

事件因果RAG:一种用于长视频复杂场景中长视频推理的检索增强生成框架

Peizheng Yan, Yu Zhao, Liang Xie, Juntong Qi, Mingming Wang, Erwei Yin

机构 * Tianjin Key Lab of Intelligent Unmanned Swarm Tech & System(天津智能集群技术与系统重点实验室) Tianjin University(天津大学) Institute of Computing and Intelligence(计算与智能研究所) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) Defense Innovation Institute Academy of Military Sciences(国防科技创新研究院) School of Future Technology(未来技术学院) Shanghai University(上海大学)

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出Event-Causal RAG框架,通过事件因果图和双存储记忆实现长视频推理,优于传统方法,在多事件整合和因果推理任务中表现更优,同时提升内存效率和流式性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09106 2026-08-19 cs.CL 版本更新 70%

LexKairos: Benchmarking Legal Temporal Capabilities in LLMs

LexKairos:评估大型语言模型的法律时间能力基准

Chenyang Li, Zejia Feng, Yuqin Huang, Yuxiao Ye, Huiyuan Xie

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出LexKairos基准,评估LLMs的中文法律时间能力,经多设置测试发现Gemini-3-Flash表现最优,但现有模型在时间敏感任务上仍存局限,相关能力待提升。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01008 2026-08-19 cs.SE cs.AI 版本更新 70%

FVSpec: Real-World Property-Based Tests as Lean Challenges

FVSpec: 作为精益挑战的真实世界基于属性的测试

Quinn Dougherty, Max von Hippel, Simon Henniger, Hazel Shackleton, Mike Dodds

机构 * Forall R&D(Forall 研发) Benchify Galois Inc(Galois 公司)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出FVSpec基准,通过从真实Python仓库中提取属性测试并自动翻译为Lean 4规范,评估AI在形式化验证任务上的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06461 2026-08-18 cs.CV cs.AI 版本更新 70%

Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning

通过对比注意力实现聚焦:增强视觉语言模型的视觉推理能力

Yuyao Ge, Shenghua Liu, Yiwei Wang, Lingrui Mei, Baolong Bi, Xuanshan Zhou, Jiayu Yao, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校)

专题命中 推理与问题求解 :language model(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对VLMs在复杂环境下性能下降的问题,提出无训练方法CARVE,通过像素级注意力对比提取任务相关视觉信号,在开源模型上实现最高75%的性能提升,为提升视觉推理提供了高效路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13049 2026-08-18 cs.CY cs.AI 版本更新 70%

Assessing AI-Generated vs. Human-Authored Spear Phishing SMS Attacks: An Empirical Study

评估AI生成与人类撰写的鱼叉式网络钓鱼短信攻击:一项实证研究

Jerson Francia, Derek Hansen, Benjamin Schooley, Matthew Taylor, Shydra Valynn Murray, Rebekah Cornelius, Greg Snow

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究对比GPT-4与新手学生撰写的个性化钓鱼短信,发现AI生成消息引发点击意图比例略高,工作相关消息更易诱导点击,参与者无法准确判断消息来源,还验证了TRAPD的价值与局限。

Comments 33 pages, 8 figures, and 5 tables. Revised to match the peer-reviewed version published in the Journal of Cybersecurity and Privacy

Journal ref J. Cybersecur. Priv. 2026, 6(4), 129

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05197 2026-08-14 cs.CL 版本更新 70%

Masked diffusion LLMs can use EoS tokens for hidden reasoning

扩散语言模型可以按EoS进行思考

Sarah Breckner, Sebastian Schuster

机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学博士学院)

专题命中 推理与问题求解 :LLM(abstract_cn);prompting(abstract);分类 cs.CL

AI总结 研究发现扩散语言模型通过EoS标记进行推理,通过实验验证EoS标记作为隐藏计算空间的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26722 2026-08-13 cs.MA cs.LG 版本更新 70%

DREvo: Distilling Recalibrated Historical Experience for Harness Self-Evolution

DREvo:提炼重校准的历史经验以实现工具链自主进化

Hanghui Guo, Weijie Shi, Zhangze Chen, Shengxiang Xu, Yishu Wang, Yimei Zhang, Wangze Ni, Jia Zhu, Shimin Di

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对现有工具链自主进化方法的两个局限,提出DREvo方法,通过整合三项技术提升进化稳定性,在五个基准上取得最优准确率,在两类任务上较基线实现显著性能提升。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07339 2026-08-13 cs.AI 版本更新 70%

Tools as Continuous Flow for Evolving Agentic Reasoning

工具作为连续流用于演进代理推理

Tairan Huang, Siyu Shang, Qiang Chen, Xiu Su, Yi Chen

机构 * Central South University(中南大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出FlowAgent,通过连续轨迹生成改进代理推理,引入计划级闭环基准,理论证明其鲁棒性和泛化能力,实验证明在长周期推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏