arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1676 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1676 篇

2606.26041 2026-06-25 cs.CV cs.CL 新提交 85%

How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations

OCR推理有多鲁棒?评估视觉语言模型在视觉扰动下的OCR推理鲁棒性

Yuxing Cheng, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出OCR-Robust基准,通过5种扰动类型和3种严重程度评估18个VLM在OCR推理任务上的鲁棒性,发现高干净精度不保证强鲁棒性,图表比文档更脆弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08649 2026-06-09 cs.CR cs.AI 新提交 85%

Sample-Efficient LLM-Based Detection of Malicious Web Server Logs with Forensically Explainable Reasoning

基于大语言模型的恶意Web服务器日志检测与取证可解释推理的样本高效方法

Bernhard Kneip, Nhien-An Le-Khac, Hong-Hanh Nguyen-Le

机构 * University of Tuebingen(图宾根大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出CEF-Log策略,通过五步推理模板使大语言模型学习日志分析方法,在CSIC 2010数据集上仅用4个示例达到F1=0.99,样本效率提升10倍,并引入新数据集ForenWebLog。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08300 2026-06-09 cs.LG 新提交 85%

QueryWeaver: Reliable Multi-Tool Query Execution Planning via LLM-Based Graph Generation

QueryWeaver: 基于LLM图生成的可靠多工具查询执行规划

Aishwarya Chakravarthy, Vidhi Kulkarni, Duen Horng Chau

机构 * School of Computational Science and Engineering, Georgia Institute of Technology, Atlanta, GA, USA(计算科学与工程学院,佐治亚理工学院,亚特兰大,GA,美国)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG

AI总结 提出将自然语言查询转换为结构化图并通过确定性规划器执行的系统,利用深度优先搜索解决跨工具依赖,实现高可靠性查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07441 2026-06-08 cs.CL 新提交 85%

Sycophantic Praise: Evaluating Excessive Praise in Language Models

谄媚式赞美:评估语言模型中的过度赞美

Daniel Vennemeyer, Phan Anh Duong, Meryl Ye, Ruihong Huang, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学) Carnegie Mellon University(卡内基梅隆大学) Texas A&M University(德克萨斯大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出参数化框架衡量赞美是否过度,发现谄媚式赞美在社交和解释性领域远多于客观推理领域,且现有方法无法可靠测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15710 2026-08-18 cs.CV cs.AI cs.CL 新提交 85%

Beyond Single Object: Learning 3D Relations with Large Language Models

超越单一物体:用大语言模型学习三维关系

Kohsuke Ide, Ryousuke Yamada, Yue Qiu, Xianzheng Ma, Yoshihiro Fukuhara, Hirokatsu Kataoka, Yutaka Satoh

机构 * AIST(日本国立 Advanced Industrial Science and Technology(AIST)) University of Tsukuba(筑波大学) University of Technology Nuremberg(纽伦堡工业大学) University of Oxford(牛津大学)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 针对现有3D-LLMs难以开展多物体间详细比较的问题,提出含MO3D数据集、Multi-3DLLM模型及Mini-apps基准的框架,该模型在MO3D任务上超越所有基线且对单物体分类有正向迁移

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08503 2026-08-11 cs.AI cs.CL 新提交 85%

MathShikkha: A Controlled Study of Answer-Only and Chain-of-Thought Supervision for Bangla Mathematical Reasoning in Small Language Models

MathShikkha:针对小型语言模型孟加拉语数学推理的仅答案与思维链监督对照研究

Rahma Simin Ali, Jawad Hossain

机构 * University at Albany(奥尔巴尼大学)

专题命中 推理与问题求解 :language model(title);small language model(title);分类 cs.CL、cs.AI

AI总结 本研究构建含GPT-5.4推理依据的孟加拉语数学数据集MathShikkha,微调4个4B-7B模型,发现CoT监督对域内强骨干无增益但提升弱模型,域外及BanglaMATH基准上均优于仅答案,核心益处为语言贴合度、可审核推理及域外鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05188 2026-08-07 cs.CL cs.AI 新提交 85%

Position: It's Time to Optimize LLMs for Self-Consistency

立场:是时候针对自一致性优化大型语言模型(LLMs)了

Itamar Pres, Belinda Z. Li, Laura Ruis, Zifan Carl Guo, Keya Hu, Mehul Damani, Isha Puri, Ekdeep Singh Lubana, Jacob Andreas

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出自一致性框架,指出LM的缺陷源于单输出对独立评估的假设,可通过一致性优化解决,为开发通用一致性LLM提供思路。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Position Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28146 2026-07-31 cs.CL cs.AI 新提交 85%

Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game

智能体能够欺骗吗?使用社交推理游戏评估ParliamentBench中的推理与欺骗能力

Niklas Bauer, Lars Benedikt Kaesberg, Akiko Aizawa, Jan Philip Wahle, Bela Gipp, Terry Ruas

机构 * University of Göttingen(哥廷根大学) National Institute of Informatics(信息学研究所) University of Tokyo(东京大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究基于《Secret Hitler》游戏构建ParliamentBench基准,评估16个LLM的欺骗与推理能力,发现前沿模型表现优异,多数LLM难以维持一致的欺骗人设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20056 2026-07-23 cs.CL cs.AI 新提交 85%

Language-Specific versus Cross-Lingual Knowledge Graphs for Implicit Aspect Identification in Arabic: A Comparative Study of Reasoning and Adaptation Strategies

用于阿拉伯语隐式方面识别的特定语言与跨语言知识图谱:推理和适应策略的比较研究

Lujain A. Alawwad

机构 * Saudi Electronic University(沙特电子大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究阿拉伯语隐式方面识别中特定语言与跨语言知识图谱策略,在混合管道中比较两种策略及生成提取器的零样本提示和特定任务微调两种适应策略,发现阿拉伯语本地KG效果更好,特定任务微调提升显著。

Comments 6 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13069 2026-07-16 cs.AI cs.CL cs.LO 新提交 85%

Interventional Grounding Audits: Black-Box Premise-Dependency Tests for LLM Chain-of-Thought via Predicate Substitution

介入式基础审计:通过谓词替换对大语言模型思维链进行黑盒前提依赖性测试

Hironao Nakamura

专题命中 推理与问题求解 :LLM(title);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI

AI总结 研究大语言模型思维链前提依赖性问题,提出介入式基础审计方法,通过谓词替换干预前提并重新运行模型,在ProntoQA基准测试中检测前提依赖性表现优异,还发现了“正确答案,错误推理”信号。

Comments Accepted at the ICLR 2026 Workshop on Logical Reasoning of Large Language Models (https://iclr.cc/virtual/2026/10017466)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26366 2026-07-10 cs.AI cs.CL cs.CY 新提交 85%

Narration-of-Thought: Inference-Time Scaffolding for Defeasible Ethical Reasoning in Large Language Models

思维叙述:大型语言模型中可废止伦理推理的推理时支架

Patrick Cooper, Alvaro Velasquez

机构 * Department of Computer Science(计算机科学系) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 针对道德困境中标准思维链的两种失败模式,提出思维叙述(NoT)系统提示,将思维链结构化为五个部分,无需训练即可大幅减少利益相关者崩溃和不确定性抑制,并通过消融实验和跨家族训练法官验证其有效性。

Comments 24 pages, 8 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32029 2026-07-01 cs.CL cs.AI 新提交 85%

When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors

当LLM粗心阅读表格时:测量并减少数据引用错误

Yuqing Yang, Qi Zhu, Zhen Han, Boran Han, Zhengyuan Shen, Shuai Wang, Vassilis N. Ioannidis, Huzefa Rangwala

机构 * University of Southern California(南加州大学) AWS AI Labs(AWS AI实验室)

专题命中 推理与问题求解 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究系统评估了大型语言模型在表格任务中的数据引用错误,并提出基于批评模型的过滤与拒绝采样方法,将答案准确率提升高达12.0%。

Comments ACL 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16845 2026-06-24 cs.CL cs.AI 新提交 85%

Robust Dual-Signal Fusion: Hybrid Neuro-Symbolic Gating with Compressed Chain-of-Thought Refinement for Irony Detection in Social Media Texts

鲁棒双信号融合:混合神经符号门控与压缩链式思维精炼用于社交媒体文本讽刺检测

Ankit Bhattacharjee, Krityapriya Bhaumik

机构 * Indian Institute of Technology Kharagpur(印度理工学院克勒格布尔分校)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出RDS融合框架,结合神经符号架构与压缩链式思维推理,在TweetEval和iSarcasm数据集上达到与微调BERTweet相当的性能,并显著优于监督方法。

Comments 11 pages total, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18910 2026-06-18 cs.LG cs.CL 新提交 85%

REVES: REvision and VErification--Augmented Training for Test-Time Scaling

REVES:通过修订与验证增强的测试时扩展训练

Yuanxin Liu, Ruida Zhou, Xinyan Zhao, Amr Sharaf, Hongzhou Lin, Arijit Biswas, Mohammad Ghavamzadeh, Zhaoran Wang, Mingyi Hong

机构 * Northwestern University(西北大学) Amazon AGI(亚马逊人工智能实验室) Qualcomm AI Research(高通人工智能研究) University of Minnesota(明尼苏达大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出REVES框架,通过将中间步骤的“接近正确”答案转化为解耦的修订和验证提示,实现高效的离策略数据生成,提升大语言模型的多步推理能力,在LiveCodeBench上比强化学习基线高6.5分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15307 2026-06-16 cs.CL cs.AI 新提交 85%

Adapting Reinforcement Learning with Chain-of-Thought Supervision for Explainable Detection of Hateful and Propagandistic Memes

利用思维链监督的强化学习进行仇恨和宣传模因的可解释检测

Mohamed Bayan Kmainasi, Mucahid Kutlu, Ali Ezzat Shahroor, Abul Hasnat, Firoj Alam

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学) Qatar University(卡塔尔大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出基于强化学习的后训练方法,结合任务特定奖励和组相对策略优化(GRPO),提升思考型多模态大语言模型在仇恨和宣传模因检测中的分类性能和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13610 2026-06-12 cs.CL cs.AI 新提交 85%

One Polluted Page Is Enough: Evaluating Web Content Pollution in Generative Recommenders

一个被污染的页面就够了:评估生成式推荐系统中的网页内容污染

Minghao Luo, Liang Chen

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出FORGE基准,评估搜索增强LLM在检索结果被污染时推荐虚假产品的脆弱性,发现单个污染页面即可导致高达27%的推荐错误率,且推理能力无法缓解此问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19218 2026-08-21 cs.CL cs.AI cs.LG 新提交 85%

Time-Series Retrieval for Grounding Multimodal Language Models in Remaining Useful Life

用于将多模态语言模型与剩余使用寿命关联的时间序列检索

Valeriu Dimidov, Raphaël Frank

机构 * University of Luxembourg(卢森堡大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出时间序列检索关联的多模态大语言模型框架,在C-MAPSS基准FD001分区实验显示,该方法可提升RUL预测的误差与稳定性,且效果随模型容量变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16032 2026-08-18 cs.CR 新提交 85%

Proof-of-Execution Memory: Defending LLM Agents Against Forged-Reasoning Attacks by Verifying What Actually Happened

执行证明内存:通过验证实际发生的内容防御大语言模型智能体的伪造推理攻击

Md Habibur Rahman, Jaeho Kim

专题命中 推理与问题求解 :LLM(title,abstract);language model(abstract)

AI总结 该研究针对大语言模型智能体的伪造推理攻击,提出执行证明内存(PoEM)防御方案,通过维护防篡改的HMAC链式分类账验证实际执行步骤,使攻击成功率降至0%,且误报率极低、开销微小。

Comments 8 pages, 6 figures, 5 tables. Code: https://github.com/bithabib/ai_security

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06829 2026-08-10 cs.SE 新提交 85%

How Reasoning Shapes Social Bias in LLM-Generated Code?

推理如何塑造大语言模型生成代码中的社会偏见?

Weifeng Sun, Jieke Shi, Zhou Yang, Yuchen Chen, Hongyan Li, Meng Yan, David Lo

专题命中 推理与问题求解 :LLM(title,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究首次系统探究基于推理的代码生成中的社会偏见,发现推理可降低偏见但会影响代码质量,进而提出ProbeDebias框架,有效检测并缓解代码偏见,同时保持较高质量。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28674 2026-08-03 cs.AI cs.CL cs.LG 新提交 85%

How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories

它认为有多难?分析大型语言模型思维链轨迹中感知步骤的推理能量

Hui Wei, Junda Wu, Sheldon Yu, Sizhe Zhou, Yizhu Jiao, Ming Zhong, Bowen Jin, Tong Yu, Shijia Pan, Jiawei Han, Julian McAuley

机构 * UC Merced(加州大学默塞德分校) UC San Diego(加州大学圣迭戈分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(奥多比研究院)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出SARE框架量化LLM思维链各步骤的推理能量,发现推理能量不均匀、错误轨迹关键节点能量更低,SARE特征性能优于或匹配输出置信度基线,揭示内部几何动态含预测信息。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24964 2026-07-29 cs.CR 新提交 85%

ALIBI: Adaptive Agentic Attacks on LLM-Based Vulnerability Detectors via Adversarial Code Comments

ALIBI:通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击

Zixuan Wu, Cristina Nita-Rotaru

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究如何通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击,提出ALIBI框架,将现实世界漏洞修复提交转换为编码任务评估多个检测器,发现其高度易受攻击,揭示攻击面并推动安全意识设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19847 2026-07-23 cs.LG cs.AI cs.CL cs.DB 新提交 85%

Auto-Fill: Learning to Predict Missing Values Accurately with Specialist Language Models

自动填充:使用专业语言模型准确预测缺失值

Yurong Liu, Yeye He, Haoyu Dong, Junjie Xing, Shi Han, Dongmei Zhang, Surajit Chaudhuri

专题命中 推理与问题求解 :language model(title,abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究表格数据缺失值预测问题,提出自动填充方法,通过后训练三个针对不同能力的专业小语言模型并结合校准集成机制,相比现有推理模型在保证高精度的同时大幅降低成本。

Comments VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15200 2026-07-17 cs.CL cs.AI cs.LG 新提交 85%

Mask-Aware Policy Gradients for Diffusion Language Models

用于扩散语言模型的掩码感知策略梯度

Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对强化学习扩展到MDLMs的难题,将MDLM生成形式化为两阶段动作MDP,使策略梯度分解为令牌项和掩码项,结合优化这两项在数学推理和编码基准测试中取得了最优成绩。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11948 2026-07-15 cs.AI cs.CL cs.LG cs.MA 新提交 85%

Ontology-Amplified Distillation and Contextuality Auditing for Sovereign Enterprise Language Models: A Combined Proof-of-Mechanism and Negative-Results Method Study

主权企业语言模型的本体增强蒸馏与上下文审查:机制验证与负面结果的组合方法研究

Thanh Luong Tuan

机构 * AgenticOS(智能操作系统)

专题命中 推理与问题求解 :language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对受数据驻留规则约束的金融机构需求,结合本体增强蒸馏机制验证与上下文审查方法,对Qwen3.6 - 27B学生模型进行训练及测试,结果不支持模型在多方面的优势,为企业语言模型应用提供参考。

Comments 15 pages, 2 figures. Combined proof-of-mechanism and negative-results method article consolidating ontology-amplified distillation with contextuality-audit routing for enterprise agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09962 2026-07-14 cs.RO 新提交 85%

Task Planning for Mobile Manipulation in Retail Stores using Foundation Models with Iterative Re-planning

使用具有迭代重新规划的基础模型进行零售商店中的移动操作任务规划

Vismay Vakharia, Sanjana Garai, Rolif Lima, Nijil George, Vighnesh Vatsal, Kaushik Das

机构 * TCS Research, Tata Consultancy Services Ltd.(塔塔咨询服务公司TCS研究院)

专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究零售场景补货问题,利用大语言模型和视觉语言模型,结合定制移动操作平台、用户驱动提示及反馈迭代重新规划方法纠错,在模拟环境验证端到端系统,为零售自动化提供了新的任务规划方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09756 2026-07-14 cs.RO 新提交 85%

LLM-Centric Agentic AI for UAV Swarms: Architecture, Enabling Technologies, and Open Problems

用于无人机群的以大语言模型为中心的智能体人工智能:架构、使能技术及开放问题

Yousef Emami, Rahim Taheri, Mohammadhossein Homaei, Muhammad Atif Ur Rehman, Mohammad Shojafar

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对无人机群实际部署受限问题,提出以大语言模型为中心的智能体人工智能LAUS,回顾相关使能技术,分析威胁,确定包括抗幻觉推理等在内的开放研究挑战。

Comments 8 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05440 2026-07-08 econ.EM cs.SY eess.SY 新提交 85%

Retrieval over Reasoning: A Cost-Controlled Benchmark of Language Models for Energy-Retrofit Recommendation

基于推理的检索:用于能源改造推荐的语言模型成本控制基准

Eliseo Curcio

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);large language model(abstract)

AI总结 研究为建筑推荐节能措施问题,通过树集成解决EUI预测,发现推荐任务框架影响模型选择,对八个大语言模型基准测试,表明其过度推荐,检索可缩小差距,还给出成本控制下模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02089 2026-07-03 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 85%

ESC: Emotional Self-Correction for Reliable Vision-Language Models

ESC:面向可靠视觉语言模型的情感自我纠正

Tien-Huy Nguyen, Minh-Nhat Nguyen, Nguyen Nhat Huy, Hung Viet Nguyen, Huy Nguyen Minh Nhat, Thanh-Huy Nguyen, Cuong Tuan Nguyen, Hoang M. Le, Dat Nguyen, Phat Kim Huynh, Min Xu, Ulas Bagci

机构 * 1 GenAI4E Lab 2 University of Information Technology, Ho Chi Minh City, Vietnam 3 Universit\"at Trier, Germany 4 Ho Chi Minh University of Technology, Ho Chi Minh City, Vietnam 5 PAMI Lab, Vietnamese German University, Vietnam 6 Vietnam National University, Ho Chi Minh City, Vietnam 7 Carnegie Mellon University, USA 8 Omoshiroi AI, USA 9 Harvard University, USA 10 Basis Research Institute 11 PASSIO Laboratory, North Carolina A\&T State University, USA 12 Mohamed bin Zayed University of Artificial Intelligence, UAE 13 Northwestern University, USA [4pt] Equal contribution. Corresponding author

专题命中 推理与问题求解 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出训练无关的ESC框架,通过外部验证器检测错误初始响应并注入情感反馈,促使VLM自我纠正,提升安全、幻觉、感知和多模态推理等任务的可靠性。

Comments ECCV Main Track 2026 (113 pages, 15 tables, 65 figures). Project Page: https://genai4e.github.io/ESC/?

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31725 2026-07-01 cs.SE 新提交 85%

Do Machines Struggle Where Humans Do? LLM and Human Comprehension of Obfuscated Code

机器会在人类感到困难的地方也遇到困难吗?大语言模型与人类对混淆代码的理解

Jack Le, Anh H. N. Nguyen, Tien N. Nguyen

专题命中 推理与问题求解 :LLM(title,abstract_cn);large language model(abstract);language model(abstract)

AI总结 基于人类对混淆代码理解的研究,评估大语言模型是否共享人类在混淆代码下的失败模式,发现推理调优模型与人类困难模式显著对齐,而指令调优模型相关性接近零。

Comments 13 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17389 2026-06-17 cs.CV cs.AI cs.CL cs.LG 新提交 85%

Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models

视觉会撒谎,一致性说话:在视觉-语言模型中解耦空间注意力与可靠性

Logan Mann, Yi Xia, Ajit Saravanan, Ishan Dave, Saadullah Ismail, Shikhar Shiromani, Emily Huang, Ruizhe Li, Kevin Zhu

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Algoverse AI Research(Algoverse AI研究) University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :language model(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出VLM可靠性探针(VRP),通过结构注意力指标和生成动态分析,发现空间注意力与准确性几乎无关(R≈0.001),而自一致性是可靠性的主要预测因子(R=0.429),揭示了视觉特征与最终生成之间的符号脱离现象。

Comments 16 pages. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence. Code: https://github.com/itsloganmann/VLM-Reliability-Probe

详情

展开后加载摘要…

URL PDF HTML 收藏