arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-26 至 2026-08-26 共收录 133 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 9 篇

2608.24087 2026-08-26 cs.LG cs.AI stat.ML 新提交 73%

Knowing When to Ask for Help: Bayesian Self-Escalation in Hierarchical LLM Agents

何时请求帮助:分层大语言模型智能体中的贝叶斯自我升级

Nadeem Shaikh

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对LLM智能体提出贝叶斯自我升级策略,将生成中委派建模为贝叶斯最优停止问题,经模拟和真实代码级联验证,其升级机制在同等成本下优于事后路由,能力信念区分度随生成提升。

Comments 21 pages, 5 figures. Code and data: this https URL (https://github.com/nadeem-shaikh/llm-self-escalation). Associated record: this https URL (https://doi.org/10.5281/zenodo.21330787)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24040 2026-08-26 cs.LG 新提交 70%

PinSieve: Production Selective VLM Serving and a Governed Memory Flywheel for Enterprise Content-Quality Triage

PinSieve:面向企业内容质量分类的生产级选择性VLM服务及受控内存飞轮

Chuqing Gao, Yuanfang Song, Jonathan Zhang, Yifan Wu, Vishwakarma Singh, Qinglong Zeng, Andrey Gusev

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.LG

AI总结 本文提出PinSieve,即面向企业内容质量分类的选择性VLM服务智能体,结合受控内存飞轮维护机制,提升审核效率、降低成本并改善信号交付,具有任务可迁移性。

Comments Accepted at the KDD 2026 workshop "Enterprise AI Agents: From Prototypes to Production."

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13705 2026-08-26 cs.LG cs.AI 版本更新 62%

When Can One Neuron Fix Repetition Loops in LLMs?

编辑1个神经元能修复LLM中的重复循环吗?

Aristotelis Lazaridis, Aman Sharma, Dylan Bates, Brian King, Vincent Lu, Jack FitzGerald

机构 * Edgerunner AI

专题命中 测试时计算 :self-correction(abstract);分类 cs.AI、cs.LG

AI总结 本文发现Gemma 4模型在长事实列举任务中高达95%的概率陷入重复循环,通过逐层消融和逐神经元归因定位到少量MLP神经元,并用静态权重编辑(小至单个神经元符号反转)消除循环,但无法解决因知识缺失导致的“末日循环”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04120 2026-08-26 cs.CL cs.AI 版本更新 62%

SaliMory: Orchestrating Cognitive Memory for Conversational Agents

SaliMory: 为对话代理编排认知记忆

Kai Zhang, Xinyuan Zhang, Hongda Jiang, Shiun-Zu Kuo, Hyokun Yun, Ejaz Ahmed, Shereen Oraby, Ziyun Li, Sanat Sharma, Ann Lee, Ahmed A Aly, Anuj Kumar, Raffay Hamid, Xin Luna Dong

机构 * Meta Reality Labs(Meta现实实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SALIMORY框架,通过层级阶段过程奖励和奖励分解对比优化,端到端训练单一语言模型管理认知结构记忆,显著降低记忆相关错误并提升个性化表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24571 2026-08-26 cs.AI cs.SE 新提交 57%

Joint Optimization of Tool Creation and Use for Large Language Model Agents

大型语言模型智能体的工具创建与使用联合优化

Zhi Rui Tam, Chieh-Yen Lin, Yun-Nung Chen, Shao-Hua Sun, Hung-yi Lee

机构 * Appier AI Research(沛星人工智能研究院) National Taiwan University(台湾大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出SMITH框架联合训练工具创建与使用,4B Qwen3经训练在多任务上取得最优表现,其编写的工具还提升了其他模型的推理性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24136 2026-08-26 cs.LG 新提交 57%

Steering Recurrent Reasoners at Inference Time with Readout Feedback

在推理阶段通过读出反馈引导循环推理器

Shunsuke Kamiya, Masanori Koyama, Seongcheol Jeong, Fumiya Uchiyama, Kenji Kubo, Kohei Hayashi, Masahiro Suzuki, Yutaka Matsuo

机构 * Graduate School of Engineering, The University of Tokyo(东京大学大学院工学系研究科)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 该研究提出测试时干预方法RoFB,将中间预测转为耦合力注入循环模型隐动态,在数独、迷宫任务的三类循环模型上提升性能,且计算成本相当或更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24667 2026-08-26 cs.IR 新提交 50%

EviGraph: Towards Verifiable Evidence Construction for Information-Seeking Agents

EviGraph:面向信息检索智能体的可验证证据构建

Jiashun Chen, Yirong Mao, Wenhui Que

专题命中 测试时计算 :verifier(abstract)

AI总结 EviGraph是分离搜索与证据记录的深度搜索框架,在BrowseComp等数据集上显著提升了智能体网络搜索的准确率,每轮生成token更少,验证了结构化证据记录的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 12 篇

2608.24082 2026-08-26 cs.CL cs.AI cs.IR 新提交 84%

PARTAB: Partition-Aware Reasoning with Structured Evidence for Scalable Table Understanding

PARTAB:面向可扩展表格理解的、结合结构化证据的分区感知推理

Md Mahadi Hasan Nahid, Davood Rafiei

机构 * University of Alberta(阿尔伯塔大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出PARTAB框架,通过构建结构化证据接口、分层选择表格证据,提升LLM在大规模表格推理任务中的性能,在多个基准上表现优于现有方法。

Comments 21 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23982 2026-08-26 cs.AI cs.CL cs.LG 新提交 82%

Memory Is Not Always Needed: Characterizing Conditional Memory in Scientific Reasoning

记忆并非总是必需:科学推理中条件记忆的特征分析

Zhen Bi, Xueshu Chen, Yan Wang, Zhizhi Peng, Haosen Hong, Zhen Wang, Zhixuan Chu, Bingyu Zhu, Jungang Lou

机构 * Huzhou Normal University(湖州师范大学) Alibaba Group(阿里巴巴集团) Bota Biosciences(博塔生物科技) Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探究科学推理中条件记忆的参与机制,提出知识边界感知路由器,在生物化学推理基准上验证其可保留有益记忆贡献并抑制退化,确立选择性记忆分配的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18974 2026-08-26 cs.CV 版本更新 78%

Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

Visual-OPSD:用于高效统一多模态推理的跨模态在策略自蒸馏

Pengyu Li, Zhitao Gao, Lingling Zhang, Muye Huang, Yuanming Li, Fangzhi Xu, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) MOE KLINNS Lab(MOE KLINNS实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Sun Yat-sen University(中山大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 提出Visual-OPSD方法,通过跨模态在策略自蒸馏,将多步扩散生成的可视化思维推理能力转移到纯文本学生模型,实现14.3倍加速且性能提升3.40个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13979 2026-08-26 cs.AI 版本更新 70%

ReflCtrl: Controlling LLM Reflection Efficiently via Representation Engineering

ReflCtrl: 通过表征工程控制LLM的反思

Ge Yan, Chung-En Sun, Linbo Liu, Tsui-Wei Weng

机构 * CSE, UCSD(计算机科学与工程系,加州大学圣塔克鲁兹分校) HDSI, UCSD(人类-数字系统研究所,加州大学圣塔克鲁兹分校)

专题命中 复杂问题求解 :reasoning(abstract);CoT(abstract_cn);分类 cs.AI

AI总结 ReflCtrl通过表征工程控制LLM的反思行为,减少冗余推理并提升效率。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23803 2026-08-26 cs.CV cs.AI cs.LG 新提交 62%

LUCAID: Agentic Multimodal AI for Lung Cancer Precision Pathology

LUCAID:用于肺癌精准病理学的智能体多模态AI

Marie-Lisa Eich, Kai Standvoss, Timo Milbich, Alexander Möllers, Miriam Hägele, Philipp Anders, Lars Tharun, Hanna Kontradiuk, Sebastian Kons, Nader Aldoj, Recepcan Adigüzel, Adam Narai, Lukas Hönig, Jonathan Striebel, Binru Yang, Mihnea P. Dragomir, Marvin Sextro, Philipp Keyl, Philipp Jurmeister, Rosemarie Krupar, Evelyn Ramberger, James Wells, Julika Ribbat-Idel, Andreas Kunft, Hussam Shuaib, Christian Grohé, Reinhard Büttner, David Horst, Klaus-Robert Müller, Lukas Ruff, Maximilian Alber, Frederick Klauschen, Simon Schallenberg

机构 * Institute of Pathology, Charité – Universitätsmedizin Berlin(柏林夏里特医学院病理学研究所) Freie Universität Berlin(柏林自由大学) Humboldt-Universität zu Berlin(柏林洪堡大学) Berlin Institute of Health at Charité – Universitätsmedizin Berlin(柏林夏里特医学院柏林卫生研究所) Aignostics GmbH(Aignostics有限公司) Machine Learning Group, Technical University of Berlin(柏林工业大学机器学习组) BIFOLD – Berlin Institute for the Foundations of Learning and Data(BIFOLD——柏林学习与数据基础研究所) MVZ HPH Institut für Pathologie und Hämatopathologie GmbH(HPH病理及血液病理诊断中心有限公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究开发并临床验证了LUCAID智能体多模态AI系统,其覆盖肺癌病理全流程任务,前瞻性验证中临床决策一致性达93.0%,优于经验丰富的胸病理学家,解决了现有AI工具的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22232 2026-08-26 cs.AI cs.CL cs.CV cs.MM 版本更新 62%

Beyond What Meets the Eye: Unveiling Situational Illusions for Multimodal Large Language Models

超越表象:揭示多模态大语言模型的情境错觉

Zhiming Yang, Zhuoxi Xiong, Donglin Zhou, Wenjun Wei, Shiyao Cui, Jinqiao Shi

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对多模态大语言模型(MLLMs)面临的情境错觉问题,构建分类体系并推出MSIBench基准,发现27种模型配置均易受6类错觉影响,通过提示工程和监督微调最多提升性能20%。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24462 2026-08-26 cs.AI 新提交 57%

Mahalanobis-Based Multi-Head Attention for Complex State Propagation

用于复杂状态传播的基于马氏距离的多头注意力

Xiaohe Li

机构 * GuangDong Police College(广东警官学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于马氏距离的多头注意力MHA-CSP,通过马氏距离RBF核与跨头协作实现高效结构化推理,在长序列状态跟踪任务上优于Transformer和GCN基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22055 2026-08-26 cs.AI 版本更新 57%

GenCoord: Skill-Path Commitments under Private Information

Peng He, Junning Zhu, Haohan Yuan, Jianpeng Liang

机构 * Tsinghua University(清华大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

Comments Paper source and compact evidence: this https URL (https://github.com/JulianZJN/GenCoord)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12634 2026-08-26 cs.AI 版本更新 57%

Atomic Units of X: The Compression Layer of Intelligence

X的原子单位:智能的压缩层

Sachin Dev Duggal, Pradyumna Swarnalatha Ramanna, Alexandros Vassiliades

机构 * SeKondBrain AI Labs(第二大脑人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该论文提出将智能视为原子压缩与组合复用过程的理论框架,借助多学科证据阐述原子单位概念,给出压缩演算等核心方法,为设计自进化知识系统奠基,为智能相关多方面提供统一视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24374 2026-08-26 cs.SD 新提交 50%

CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning

CoSTALA:基于多粒度层次对比学习的组合式时空音频-语言对齐

Peiwei Ren, Jinbo Hu, Fang Kang, Shan Liang, Yin Cao

机构 * Xi’an Jiaotong Liverpool University(西交利物浦大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus) University of Oulu(奥卢大学) Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 CoSTALA通过多粒度层次对比学习构建新型训练范式,解决传统ALM难以处理多事件音频序列的问题,为时空音频理解提供强大新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24134 2026-08-26 cs.CV 新提交 50%

EgoErrorVQA: Assess Egocentric Comprehension Capabilities through Procedural Errors for Ego-Agentic AI

EgoErrorVQA:通过程序错误评估自我主体人工智能的以自我为中心的理解能力

Junlong Li, Junxi Li, Jianjun Gao, Chen Cai, Lap-Pui Chau, Yi Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 针对现有视觉智能体和VLMs忽略以自我为中心视角评估程序理解能力的问题,本文提出EgoErrorVQA任务,开发基于A2A协议的评估智能体,引入Ego-ADR框架提升模型对程序错误的理解,取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23050 2026-08-26 cs.HC 版本更新 50%

What Makes an Initial Reaction Ready for Discussion?: Multi-Persona AI Support for Stance Reflection and Writing

是什么让初始反应适合讨论?:用于立场反思与写作的多角色AI支持

Sky Shih-Kai Hong, Mu-Tien Kuo, Wei-Ji Chen, Dennis Wang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本研究提出多角色AI工具StanceLab,通过对比三角色模式与独立LLM模式的试点,明确了设计需求并规划了未来工作流,助力用户准备讨论立场。

Comments 5 pages, 3 figures, 2 tables. Accepted to TAICHI 2026 ( this https URL (https://taichi2026.taiwanchi.org/program) )

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理评测 36 篇

2607.01388 2026-08-26 cs.CL 版本更新 90%

RusFinChain: A Russian Benchmark for Verifiable Chain-of-Thought Reasoning in Finance with Fuzzy-Aligned Evaluation

RusFinChain:面向金融领域可验证思维链推理的俄语基准与模糊对齐评估

Mullosharaf K. Arabov

机构 * Kazan Federal University(喀山联邦大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 提出首个俄语金融可验证思维链推理基准RusFinChain,包含5280个参数化示例和模糊对齐评估指标,揭示模型在步骤对齐与最终答案正确性之间存在显著差距。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15994 2026-08-26 cs.AI 版本更新 86%

ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

ReactBench: 一种用于在化学反应图上进行拓扑推理的MLLMs基准测试

Qiang Xu, Shengyuan Bai, Yu Wang, He Cao, Leqing Chen, Yuanyuan Liu, Bin Feng, Zijing Liu, Yu Li

机构 * International Digital Economy Academy(国际数字经济学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(title);分类 cs.AI

AI总结 ReactBench通过化学反应图揭示MLLMs在拓扑推理中的局限性,包含1618个专家标注的问答对,评估17种MLLMs显示锚定任务与整体结构推理任务存在超过30%的性能差距。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24641 2026-08-26 cs.SE 新提交 83%

Aging of Prompt Engineering Techniques Across LLM Versions

提示工程技术在大语言模型版本间的老化现象

Anastasiia Rudyk, Julian Oertel, Regina Hebig

专题命中 推理评测 :chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);reasoning(abstract)

AI总结 本研究通过评估三类模型对的五种提示技术,发现提示工程效果随LLM代际以模型家族特定方式老化,需针对性调整而非照搬。

Comments Accepted at ICSME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24232 2026-08-26 cs.AI 新提交 83%

TRACE: An Evidence-Grounded Benchmark for Safety Evaluation of Large Reasoning Models

TRACE:用于大型推理模型安全评估的基于证据的基准

Zhenyu Wu, Siyuan Chen, Changchun Yang, Jiaqi Dong, Min Zhou, Ali Almadan, Talal Hammad, Faisal Wahbo, Aminullah Tora, Mona Alshahrani, Xin Gao

机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究推出基于证据的安全评估基准TRACE,覆盖大型推理模型的完整推理流程,评估发现现有防护栏模型对推理轨迹的安全判断难度大,且难以准确提取支撑证据,凸显了改进防护栏模型的必要性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24086 2026-08-26 cs.AI cs.CE cs.SE 新提交 83%

EMRB: A Multi-Level Benchmark for Evaluating LLM Reasoning over Raw Electromagnetic Signals

EMRB:用于评估大型语言模型对原始电磁信号推理能力的多级基准

Mingxu Zhang, Ying Sun, Yuhan Li, Yang Ji, Dazhong Shen, Ke Zhang, Shan Huang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The 63rd Research Institute, National University of Defense Technology(国防科技大学第六十三研究所) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出EMRB基准评估LLMs对原始电磁信号的推理能力,针对14个LLMs的实验显示其表现存在差距,提出的ReconPilot方法可显著提升LLMs的相关任务得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23152 2026-08-26 cs.CL 版本更新 83%

Counter with Evidence! A Multi-Agent Memory Efficient Reasoning Framework for Hate Category Informed Counterspeech Generation

结合证据的回应!用于仇恨类别感知反仇恨言论生成的多智能体内存高效推理框架

Sujoy Nath, Aswini Kumar, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度德里理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究针对现有反仇恨言论生成未区分仇恨言论类别的问题,提出多智能体框架FIRE并构建数据集FactualCS,实验显示FIRE效果优于基线且毒性更低。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16654 2026-08-26 cs.CL cs.AI cs.LG 版本更新 82%

Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models

Omanic:迈向大语言模型多跳推理的逐步评估

Xiaojie Gu, Sherry T. Tong, Aosong Feng, Sophia Simeng Han, Jinghui Lu, Yingjian Chen, Yusuke Iwasawa, Yutaka Matsuo, Chanjun Park, Rex Ying, Irene Li

机构 * The University of Tokyo(东京大学) Yale University(耶鲁大学) Stanford University(斯坦福大学) Xiaomi EV(小米EV) Soongsil University(顺天大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型在多跳问答中中间步骤推理失败难以诊断的问题,提出Omanic基准,通过分解为单跳子问题并分析步骤级错误,揭示后期跳数瓶颈、事实知识下限和错误传播,微调后提升多个推理基准性能。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20073 2026-08-26 cs.CL cs.AI cs.LG 版本更新 82%

A Modular Multitask Reasoning Framework Integrating Spatio-temporal Models and LLMs

整合时空模型与大语言模型(LLMs)的模块化多任务推理框架

Kethmi Hirushini Hettige, Jiahao Ji, Cheng Long, Shili Xiang, Gao Cong, Jingyuan Wang

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) Institute for Infocomm Research, A*STAR, Singapore(资讯通信研究院) School of Computer Science and Engineering, Beihang University, China(北京航空航天大学计算机科学与工程学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出整合时空模型与LLMs的STReason框架,通过上下文学习分解查询生成解释,在时空推理任务中显著优于LLM基线,可抑制幻觉并减少专家工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23898 2026-08-26 cs.AI 新提交 79%

BenchBench-Protocol: Evaluating Real-World Wet-Lab Protocol Reasoning and Modification

BenchBench-Protocol:评估真实世界湿实验室方案的推理与修改能力

Aditya Sivakumar, Ashu Singhal, Nicholas Larus-Stone, Nithin Parsan

机构 * Benchling(本奇林公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究推出BenchBench-Protocol基准测试,包含149个源自真实实验修改的湿实验室方案推理与修改任务,评估9个模型后发现Claude Opus 5得分最高,该基准测试可用于评估模型在生命科学常规任务中的表现。

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19261 2026-08-26 cs.CV cs.AI 版本更新 79%

EviPathBench: Benchmarking Evidence Acquisition and Reasoning in Vision-Language Models for Whole-Slide Pathology

PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peking Union Medical College Hospital(北京协和医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24535 2026-08-26 cs.CV cs.HC 新提交 78%

VizAnchor: Decoding Manipulation Intent from Tampering Visualizations via Dual-Anchor Reasoning

VizAnchor:通过双锚推理从篡改可视化中解码操纵意图

Xiaotian Zhang, Huayuan Ye, Haiyang Zhang, Chenhui Li, Changbo Wang, Sicheng Song

机构 * School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院) Division of Emerging Interdisciplinary Areas, The Hong Kong University of Science and Technology(香港科技大学新兴跨学科领域分部) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出VizAnchor框架,通过双锚构建与VLM推理实现可视化操纵理解,含三个专用智能体,构建相关数据集,可准确定位篡改并生成忠实解释。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏