arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-24 至 2026-02-24 共收录 41 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 41 篇

2602.18806 2026-02-24 cs.CL cs.AI 88%

Think$^{2}$: Grounded Metacognitive Reasoning in Large Language Models

Think$^{2}$: 大语言模型中的 grounded 元认知推理

Abraham Paul Elenjical, Vivek Hruday Kavuri, Vasudeva Varma

机构 * IIIT Hyderabad(IIIT海得拉尔)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);self-correction(abstract)

AI总结 Think$^{2}$通过引入基于心理理论的元认知框架,提升大语言模型的自我诊断与纠正能力,显著提高推理准确性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20117 2026-02-24 cs.AI cs.LG 84%

ReSyn: Autonomously Scaling Synthetic Environments for Reasoning Models

ReSyn:自主扩展合成环境以增强推理模型

Andre He, Nathaniel Weir, Kaj Bostrom, Allen Nie, Darion Cassel, Sam Bayless, Huzefa Rangwala

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Web Services(亚马逊网络服务)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 ReSyn通过生成多样化推理环境,利用验证器监督和任务多样性提升推理语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19455 2026-02-24 cs.LG cs.AI cs.CL stat.ML 82%

SenTSR-Bench: Thinking with Injected Knowledge for Time-Series Reasoning

SenTSR-Bench: 带注入知识的思考以实现时间序列推理

Zelin He, Boran Han, Xiyuan Zhang, Shuai Zhang, Haotian Lin, Qi Zhu, Haoyang Fang, Danielle C. Maddix, Abdul Fatir Ansari, Akash Chandrayan, Abhinav Pradhan, Bernie Wang, Matthew Reimherr

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) AWS AI Labs(AWS人工智能实验室) Amazon RME Project(亚马逊RME项目)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SenTSR-Bench通过注入领域知识提升时间序列推理能力,结合强化学习方法实现高效的知识注入,方法在多个数据集上显著优于现有模型。

Comments Accepted by the 29th International Conference on Artificial Intelligence and Statistics (AISTATS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19895 2026-02-24 cs.LG cs.CL 81%

DSDR: Dual-Scale Diversity Regularization for Exploration in LLM Reasoning

DSDR:双尺度多样性正则化用于LLM推理中的探索

Zhongwei Wan, Yun Shen, Zhihao Dou, Donghao Zhou, Yu Zhang, Xin Wang, Hui Shen, Jing Xiong, Chaofan Tao, Zixuan Zhong, Peizhou Huang, Mi Zhang

机构 * The Ohio State University, USA(俄亥俄州立大学) Case Western Reserve University, USA(凯斯西储大学) The Chinese University of Hong Kong, Hong Kong(香港中文大学) Macquarie University, Australia(麦考瑞大学) University of Michigan, USA(密歇根大学) The University of Hong Kong, Hong Kong(香港大学) University College London, UK(伦敦大学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 DSDR通过双尺度多样性正则化提升LLM推理中的探索能力,通过全局和局部正则化机制增强路径多样性,提高学习信号稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17053 2026-02-24 cs.AI cs.CL 81%

RFEval: Benchmarking Reasoning Faithfulness under Counterfactual Reasoning Intervention in Large Reasoning Models

RFEval: 在大推理模型中评估推理忠实性下的反事实推理干预基准测试

Yunseok Han, Yejoon Lee, Jaeyoung Do

机构 * AIDAS Laboratory(AIDAS实验室) IPAI ECE(电子工程系) Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 RFEval通过反事实推理干预评估大推理模型的推理忠实性,发现49.7%的输出不忠实,主要源于立场不一致,强调准确性不能作为忠实性的可靠代理。

Comments Accepted in ICLR 2026 Poster: https://iclr.cc/virtual/2026/poster/10011763

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13370 2026-02-24 cs.MA cs.AI cs.CL 81%

G2CP: A Graph-Grounded Communication Protocol for Verifiable and Efficient Multi-Agent Reasoning

G2CP:一种基于图的可验证和高效的多智能体推理通信协议

Karim Ben Khaled, Davy Monticolo

机构 * University of Lorraine, LORIA(洛林大学,LORIA)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 G2CP通过图操作实现多智能体高效、可验证的推理通信,提升任务准确率并消除幻觉传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18493 2026-02-24 cs.LG cs.AI 81%

Learning to Remember: End-to-End Training of Memory Agents for Long-Context Reasoning

学习记忆:为长上下文推理端到端训练记忆代理

Kehao Zhang, Shangtong Gui, Sheng Yang, Wei Chen, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(智能信息处理重点实验室,计算技术研究所,中国科学院) Key Laboratory of AI Safety, Chinese Academy of Sciences(人工智能安全重点实验室,中国科学院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Li Auto Inc.(利亚德公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 UMA通过端到端强化学习框架,整合记忆操作与问答,提升长上下文推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19914 2026-02-24 cs.AI 79%

Watson & Holmes: A Naturalistic Benchmark for Comparing Human and LLM Reasoning

沃森与霍尔姆斯:一种自然情境下比较人类和大语言模型推理能力的基准

Thatchawin Leelawat, Lewis D Griffin

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出沃森与霍尔姆斯桌游作为自然情境下比较人类与大语言模型推理能力的基准,展示AI模型性能随时间显著提升,特别是在解决复杂案件时的推理能力进步。

Comments 51 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17052 2026-02-24 cs.AI 79%

ViLBias: Detecting and Reasoning about Bias in Multimodal Content

ViLBias:检测和推理解多模态内容中的偏见

Shaina Raza, Caesar Saleh, Azib Farooq, Emrul Hasan, Franklin Ogidi, Haad Zahid, Maximus Powers, Marcelo Lotif, Anam Zahid, Karanpal Sekhon, Veronica Chatrath, Roya Javedi, Vahid Reza Khazaie, Zhenyu Yu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ViLBias通过多模态基准检测新闻中的偏见,利用LLM和VLMs提升推理准确率和忠实度,参数高效方法能恢复大部分微调性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18459 2026-02-24 cs.CY cs.AI 79%

From Bias Mitigation to Bias Negotiation: Governing Identity and Sociocultural Reasoning in Generative AI

从偏见缓解到偏见协商:在生成式AI中治理身份与社会文化推理

Zackary Okun Dunivin, Bingyi Han, John Bollenbocher

机构 * Institute for Social Science, University of Stuttgart(斯图加特大学社会科学研究所) Department of Computer Science, Saarland University(萨尔兰大学计算机科学系) Department of Linguistics, University of Texas Austin TX USA(德克萨斯大学语言学系) Department of Linguistics, University of Texas(德克萨斯大学语言学系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出偏见协商作为生成式AI治理身份与社会文化推理的新框架,通过实证研究探讨其在缓解偏见和提升社会公正中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19828 2026-02-24 cs.CV 78%

TextShield-R1: Reinforced Reasoning for Tampered Text Detection

TextShield-R1: 用于篡改文本检测的强化推理

Chenfan Qu, Yiwu Zhong, Jian Liu, Xuekang Zhu, Bohan Yu, Lianwen Jin

专题命中 推理评测 :reasoning(title,abstract)

AI总结 TextShield-R1通过强化学习和OCR校正技术,提升篡改文本检测的准确性和鲁棒性,解决现有方法在微特征识别和跨语言评估中的不足。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19715 2026-02-24 cs.CV 78%

Pixels Don't Lie (But Your Detector Might): Bootstrapping MLLM-as-a-Judge for Trustworthy Deepfake Detection and Reasoning Supervision

像素不会说谎(但你的检测器可能会):通过生成器-评估器过程构建MLLM作为判断者以实现可信的深度伪造检测和推理监督

Kartik Kuckreja, Parul Gupta, Muhammad Haris Khan, Abhinav Dhall

机构 * MBZUAI Monash University(墨尔本大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出DeepfakeJudge框架,通过生成器-评估器过程提升深度伪造检测的推理忠实性,实现高准确率和高一致性的推理监督。

Comments CVPR-2026, Code is available here: https://github.com/KjAeRsTuIsK/DeepfakeJudge

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25232 2026-02-24 cs.AI cs.CL 73%

From Medical Records to Diagnostic Dialogues: A Clinical-Grounded Approach and Dataset for Psychiatric Comorbidity

从医疗记录到诊断对话:一种基于临床的途径和数据集用于精神疾病共病

Tianxi Wan, Jiaming Luo, Siyuan Chen, Kunyao Lan, Jianhua Chen, Haiyang Geng, Mengyue Wu

机构 * X - LANCE Lab, Shanghai Jiao Tong University, China(上海交通大学X-LANCE实验室) Shanghai Mental Health Center, SJTU School of Medicine, China(上海精神卫生中心,上海交通大学医学院) Chen Frontier Lab for AI and Mental Health, Tianqiao and Chrissy Chen Institute, Shanghai, China(陈前沿人工智能与心理健康实验室,田青和克里斯蒂娜·陈研究所)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于临床的途径和数据集,用于生成支持精神疾病共病的多轮诊断对话,通过合成患者电子医疗记录和多智能体对话生成技术,构建了首个大规模对话数据集PsyCoTalk,提升了诊断准确性和治疗计划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18776 2026-02-24 cs.CL cs.AI 73%

ArabicNumBench: Evaluating Arabic Number Reading in Large Language Models

阿拉伯数字阅读基准:评估大型语言模型在阿拉伯数字阅读任务中的表现

Anas Alhumud, Abdulaziz Alhammadi, Muhammad Badruddin Khan

机构 * Imam Mohammad Ibn Saud Islamic University Saudi Arabia(伊玛目穆罕默德·本·沙特伊斯兰大学)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 阿拉伯数字基准评估大型语言模型在阿拉伯数字阅读任务中的表现,揭示不同提示策略和模型在准确率上的显著差异,指出结构化输出生成的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19497 2026-02-24 cs.CV 67%

MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models

MICON-Bench: 多图像上下文图像生成的基准测试与增强

Mingrui Wu, Hang Liu, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 推理评测 :reasoning(abstract);verifier(abstract)

AI总结 MICON-Bench通过六个任务评估多图像上下文生成能力,并提出DAR机制提升生成质量与连贯性。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19467 2026-02-24 cs.CY cs.AI cs.CL 62%

Can Large Language Models Replace Human Coders? Introducing ContentBench

大语言模型能取代人类程序员吗?引入ContentBench

Michael Haman

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过ContentBench基准测试,评估低成本大语言模型在解释性编程任务中的表现,揭示其在高精度任务中的优势及在讽刺处理上的局限性。

Comments Project website: https://contentbench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18998 2026-02-24 cs.AI cs.CL 62%

Benchmark Test-Time Scaling of General LLM Agents

通用大语言模型代理的基准测试时间扩展

Xiaochuan Li, Ryan Ming, Pranav Setlur, Abhijay Paladugu, Andy Tang, Hao Kang, Shuai Shao, Rong Jin, Chenyan Xiong

机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Meta

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究提出General AgentBench基准测试,用于评估通用大语言模型代理在多个技能和工具上的表现,发现顺序和并行扩展方法在实际应用中均存在性能限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27246 2026-02-24 cs.CL cs.AI cs.IR 62%

Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs

超越一百万词:评估和增强LLM长期记忆的基准测试

Mohammad Tavakoli, Alireza Salemi, Carrie Ye, Mohamed Abdalla, Hamed Zamani, J Ross Mitchell

机构 * University of Alberta(阿尔伯塔大学) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LIGHT框架,通过增强LLM的三种记忆系统,提升其在长对话任务中的表现,实验显示平均提升3.5%-12.69%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17860 2026-02-24 cs.CL cs.AI 62%

Dialogue is Better Than Monologue: Instructing Medical LLMs via Strategical Conversations

对话优于独白:通过战略对话指导医学LLM

Zijie Liu, Xinyu Zhao, Jie Peng, Zhuangdi Zhu, Qingyu Chen, Kaidi Xu, Xia Hu, Tianlong Chen

机构 * UNC at Chapel Hill(北卡罗来纳大学教堂山分校) University of Science and Technology of China(中国科学技术大学) George Mason University(乔治·马歇尔大学) Yale University(耶鲁大学) City University of Hong Kong(香港城市大学) Rice University(得克萨斯大学奥斯汀分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过战略对话指导医学LLM,提升多轮推理和嘈杂环境下的准确率

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19843 2026-02-24 cs.SE cs.AI 57%

MAS-FIRE: Fault Injection and Reliability Evaluation for LLM-Based Multi-Agent Systems

MAS-FIRE:基于大语言模型的多智能体系统故障注入与可靠性评估

Jin Jia, Zhiling Deng, Zhuangbin Chen, Yingqi Wang, Zibin Zheng

机构 * Sun Yat-sen University(中山大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MAS-FIRE通过故障注入和分层分析,揭示多智能体系统在容错和鲁棒性方面的关键因素,为提升系统可靠性提供系统性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19212 2026-02-24 cs.CL 57%

Retrieval Augmented Enhanced Dual Co-Attention Framework for Target Aware Multimodal Bengali Hateful Meme Detection

基于检索增强的增强双注意力框架的目标感知多模态孟加拉语仇恨表情识别

Raihan Tanvir, Md. Golam Rabiul Alam

机构 * Department of Computer Science and Engineering, BRAC University(计算机科学与工程系,BRAC大学) Department of Computer Science and Engineering, Ahsanullah University of Science and Technology(计算机科学与工程系,Ahsanullah科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于检索增强的增强双注意力框架,用于目标感知多模态孟加拉语仇恨表情识别,通过语义对齐提升类别平衡和多样性,实验表明xDORA和RAG-Fused DORA在识别和检测任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16449 2026-02-24 cs.CV cs.AI 57%

Emotion-LLaMAv2 and MMEVerse: A New Framework and Benchmark for Multimodal Emotion Understanding

Emotion-LLaMAv2 和 MMEVerse:多模态情感理解的新框架和基准

Xiaojiang Peng, Jingyi Chen, Zebang Cheng, Bao Peng, Fengyi Wu, Yifei Dong, Shuyuan Tu, Qiyu Hu, Huiting Huang, Yuxiang Lin, Jun-Yan He, Kai Wang, Zheng Lian, Zhi-Qi Cheng

机构 * Shenzhen Technology University(深圳技术大学) Shenzhen University of Information Technology(深圳信息科技学院) University of Washington(华盛顿大学) Foundation Model Team, Meituan(美团基础模型团队) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Emotion-LLaMAv2和MMEVerse通过端到端多视图编码器、Conv Attention预融合模块和课程指令调制方案,提升了多模态情绪理解和推理能力,并构建了统一的多模态情绪基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16175 2026-02-24 cs.CV cs.AI 57%

Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight

Mantis:一种具有解耦视觉前瞻性能力的多功能视觉-语言-动作模型

Yi Yang, Xueqi Li, Yiyang Chen, Jin Song, Yihan Wang, Zipeng Xiao, Jiadi Su, You Qiaoben, Pengfei Liu, Zhijie Deng

机构 * SJTU(上海交通大学) SII(上海信息所) SUSTech(四川大学) NJUPT(南京工业大学) FDU(福建大学) BOSCH(博世)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Mantis通过解耦视觉前瞻性模块提升视觉-语言-动作模型的性能,实现高成功率和快速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23828 2026-02-24 cs.CL 57%

Beyond Understanding: Evaluating the Pragmatic Gap in LLMs' Cultural Processing of Figurative Language

超越理解:评估LLMs在处理隐喻语言中的文化差距

Mena Attia, Aashiq Muhamed, Mai Alkhamissi, Thamar Solorio, Mona Diab

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文评估了LLMs在处理隐喻语言中的文化理解差距,发现其在语用使用方面存在显著挑战,并发布了首个埃及阿拉伯语习语数据集用于进一步研究。

Comments EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03867 2026-02-24 cs.CL 57%

EuroGEST: Investigating gender stereotypes in multilingual language models

EuroGEST:研究多语言语言模型中的性别刻板印象

Jacqueline Rowe, Mateusz Klimaszewski, Liane Guillou, Shannon Vallor, Alexandra Birch

机构 * University of Edinburgh(爱丁堡大学) Warsaw University of Technology(华沙技术大学) Aveni

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 EuroGEST研究多语言语言模型中的性别刻板印象,通过跨29种欧洲语言的数据集揭示了性别刻板印象的普遍性及模型对刻板印象的编码强度。

Comments In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 32074-32096, Suzhou, China. Association for Computational Linguistics. 9 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13904 2026-02-24 cs.CL 57%

Calibrating Large Language Models with Sample Consistency

通过样本一致性校准大型语言模型

Qing Lyu, Kumar Shridhar, Chaitanya Malaviya, Li Zhang, Yanai Elazar, Niket Tandon, Marianna Apidianaki, Mrinmaya Sachan, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学) ETH Zurich(苏黎世联邦理工学院) University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 通过样本一致性方法提升大型语言模型的校准效果,改进其预测置信度评估和性能表现。

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18940 2026-02-24 cs.AI 57%

DREAM: Deep Research Evaluation with Agentic Metrics

DREAM: 基于代理度量的深度研究评估

Elad Ben Avraham, Changhao Li, Ron Dorfman, Roy Ganz, Oren Nuriel, Amir Dudai, Aviad Aberdam, Noah Flynn, Elman Mansimov, Adi Kalyanpur, Ron Litman

机构 * AWS Agentic AI(AWS敏捷人工智能) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 DREAM提出一种基于代理度量的深度研究评估框架,通过能力平衡原则解决现有基准在事实和时间衰减检测上的不足,实现可扩展的无参考评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18824 2026-02-24 cs.SI cs.AI 57%

UniRank: A Multi-Agent Calibration Pipeline for Estimating University Rankings from Anonymized Bibliometric Signals

UniRank:一种多智能体校准流程,用于从匿名化的引文计量信号中估算大学排名

Pedram Riyazimehr, Seyyed Ehsan Mahmoudi

机构 * NotionWave

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 UniRank通过多智能体校准流程,利用匿名化引文数据估算大学排名,实现零记忆误差和高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18731 2026-02-24 cs.AI 57%

Beyond Description: A Multimodal Agent Framework for Insightful Chart Summarization

超越描述:一种多模态代理框架用于深入的图表摘要

Yuhang Bai, Yujuan Ding, Shanru Lin, Wenqi Fan

机构 * The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出多模态代理框架Chart Insight Agent Flow,通过结合MLLMs的感知与推理能力,提升图表摘要的深度和多样性,并引入新数据集ChartSummInsights以支持研究。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18693 2026-02-24 cs.CL 57%

Contradiction to Consensus: Dual Perspective, Multi Source Retrieval Based Claim Verification with Source Level Disagreement using LLM

与共识相悖:基于双视角、多源检索的声明验证系统,利用源级别分歧

Md Badsha Biswas, Ozlem Uzuner

机构 * George Mason University(乔治·梅奥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出基于双视角多源检索和跨源分歧分析的声明验证系统,利用LLM提升验证准确性并揭示来源差异。

详情

展开后加载摘要…

URL PDF HTML 收藏