arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-09 至 2025-12-09 共收录 123 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 17 篇

2512.07141 2025-12-09 cs.CV cs.CL 70%

Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models

思考-反思-修订:一种基于策略的反思框架,用于大型视觉语言模型的安全对齐

Fenghua Weng, Chaochao Lu, Xia Hu, Wenqi Shao, Wenjie Wang

机构 * Shanghaitech University(上海科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 TRR通过策略引导的反思框架提升大型视觉语言模型的安全对齐,显著提高安全响应率至87.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06266 2025-12-09 cs.CL 70%

Nanbeige4-3B Technical Report: Exploring the Frontier of Small Language Models

Nanbeige4-3B 技术报告:探索小型语言模型的前沿

Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le, Ruixiang Feng, Tao Zhang, Wei Ruan, Xiaoqi Liu, Xiaoxue Cheng, Xiyun Xu, Yang Song, Yanzipeng Gao, Yiming Jia, Yun Xing, Yuntao Wen, Zekai Wang, Zhenwei An, Zhicong Sun, Zongchao Chen

机构 * Nanbeige LLM Lab(纳布吉LLM实验室)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 Nanbeige4-3B通过FG-WSD调度器、DPD蒸馏和强化学习技术,实现了小型语言模型在性能和扩展定律上的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01132 2025-12-09 cs.LG cs.AI cs.CL 67%

A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning

多轮代理强化学习实践指南

Ruiyi Wang, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校) NVIDIA(英伟达)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多轮代理强化学习的训练方法,通过分析环境、奖励和策略三个支柱,总结出训练LLM代理的实践指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06327 2025-12-09 physics.flu-dyn physics.comp-ph 67%

OpenFOAMGPT: a RAG-Augmented LLM Agent for OpenFOAM-Based Computational Fluid Dynamics

OpenFOAMGPT:一种基于检索增强生成的LLM代理,用于基于OpenFOAM的计算流体力学

Sandeep Pandey, Ran Xu, Wenkang Wang, Xu Chu

专题命中 复杂问题求解 :chain-of-thought(abstract);CoT(abstract)

AI总结 OpenFOAMGPT是一种基于检索增强生成的LLM代理,用于优化OpenFOAM的CFD模拟,通过高效处理复杂任务提升工程应用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23045 2025-12-09 cs.AI cs.CL cs.SE 62%

Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents

Kimi-Dev:无代理训练作为SWE-代理的技能先验

Zonghan Yang, Shengjie Wang, Kelin Fu, Wenyang He, Weimin Xiong, Yibo Liu, Yibo Miao, Bofei Gao, Yejie Wang, Yingwei Ma, Yanhao Li, Yue Liu, Zhenxing Hu, Kaitai Zhang, Shuyi Wang, Huarong Chen, Flood Sung, Yang Liu, Yang Gao, Zhilin Yang, Tianyu Liu

机构 * Moonshot AI THU(清华大学) PKU(北京大学) UCAS(中国科学技术大学) BUPT(北京邮电大学) NUS(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Kimi-Dev通过无代理训练生成技能先验,使SWE-代理在SWE-bench Verified上取得60.4%的优异成绩,并通过额外SFT适应达到48.6%的pass@1,与Claude 3.5 Sonnet相当。

Comments 68 pages. GitHub repo at https://github.com/MoonshotAI/Kimi-Dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06350 2025-12-09 cs.CY cs.AI cs.CL 62%

Why They Disagree: Decoding Differences in Opinions about AI Risk on the Lex Fridman Podcast

为何他们意见分歧:解码对人工智能风险意见差异的Lex Fridman播客讨论

Nghi Truong, Phanish Puranam, Özgecan Koçak

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分析Lex Fridman播客中关于人工智能风险的分歧,揭示了不同观点在定义、事实和因果前提上的差异,提出使用LLMs解析文本数据以识别关键争议点的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06196 2025-12-09 cs.AI cs.CL 62%

ARCANE: A Multi-Agent Framework for Interpretable and Configurable Alignment

ARCANE:一种多智能体框架,用于可解释和可配置的对齐

Charlie Masters, Marta Grześkiewicz, Stefano V. Albrecht

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ARCANE是一种多智能体框架,通过动态规则生成实现可解释和可配置的对齐,适用于复杂长期任务。

Comments Accepted to the AAAI 2026 LLAMAS Workshop (Large Language Model Agents for Multi-Agent Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14683 2025-12-09 cs.SE cs.AI 57%

Unified Software Engineering Agent as AI Software Engineer

统一软件工程代理作为AI软件工程师

Leonhard Applis, Yuntong Zhang, Shanchao Liang, Nan Jiang, Lin Tan, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学) Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出统一软件工程代理USEagent,旨在通过协调多种能力提升软件开发效率,通过USEbench验证其效果,发现其在复杂任务中表现优于现有代理。

Comments Leonhard Applis and Yuntong Zhang contributed equally to this work. To appear in ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06555 2025-12-09 cs.CR cs.AI cs.CY 57%

BEACON: A Unified Behavioral-Tactical Framework for Explainable Cybercrime Analysis with Large Language Models

BEACON:一种结合大语言模型的可解释性网络犯罪分析统一行为-战术框架

Arush Sachdeva, Rajendraprasad Saravanan, Gargi Sarkar, Kavita Vemuri, Sandeep Kumar Shukla

机构 * International Institute of Information Technology Hyderabad(国际信息研究所海得拉巴)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 BEACON通过整合行为心理学与网络犯罪战术生命周期,利用大语言模型实现网络犯罪的可解释性分析,提升分类准确率和推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23730 2025-12-09 cs.CL 57%

Evaluating Long-Term Memory for Long-Context Question Answering

评估长期记忆以实现长上下文问答

Alessandra Terranova, Björn Ross, Alexandra Birch

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文评估了增强记忆方法在长上下文问答任务中的效果,发现通过RAG和事件记忆可显著减少令牌使用并保持准确性。

Comments Accepted as a poster at Metacognition in Generative AI EurIPS workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16001 2025-12-09 cs.AI q-bio.NC 57%

Artificial Human Intelligence: The role of Humans in the Development of Next Generation AI

人工人类智能:人类在下一代AI发展中的作用

Suayb S. Arslan

机构 * Department of Computer Engineering, Boğaziçi University(计算机工程系,博兹达奇大学) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology (MIT)(脑与认知科学系,麻省理工学院(MIT))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了人类在下一代AI发展中的关键作用,分析了人类与人工智能的互动,提出以人类为中心的发展方向,并强调伦理、责任和稳健智能系统的重要性。

Comments 19 pages, 8 figures, 2 tables, accepted to IEEE Transactions on Emerging Topics in Computational Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06328 2025-12-09 cs.CV 50%

ReCAD: Reinforcement Learning Enhanced Parametric CAD Model Generation with Vision-Language Models

ReCAD: 基于强化学习的参数化CAD模型生成增强框架

Jiahao Li, Yusheng Luo, Yunzhong Lou, Xiangdong Zhou

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 ReCAD通过强化学习增强参数化CAD模型生成,利用预训练模型生成高精度CAD模型,显著提升几何精度和语义保真度。

Comments Accepted as an Oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 29 篇

2510.10072 2025-12-09 cs.CL 85%

Unilaw-R1: A Large Language Model for Legal Reasoning with Reinforcement Learning and Iterative Inference

Unilaw-R1:基于强化学习和迭代推理的法律推理大语言模型

Hua Cai, Shuang Zhao, Liang Zhang, Xuli Shen, Qing Xu, Weilin Shen, Zihao Wen, Tianke Ban

机构 * UniDT Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 Unilaw-R1通过强化学习和迭代推理,提升法律推理能力,在多个基准测试中超越同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00974 2025-12-09 cs.CL 85%

RPRO: Ranked Preference Reinforcement Optimization for Enhancing Medical QA and Diagnostic Reasoning

RPRO:基于优先级的强化优化用于增强医学问答与诊断推理

Chia-Hsuan Hsu, Jun-En Ding, Hsin-Ling Hsu, Chih-Ho Hsu, Li-Hung Yao, Chun-Chieh Liao, Feng Liu, Fang-Ming Hung

机构 * Department of Computer Science and Information Engineering, National Taiwan University of Science and Technology(计算机科学与信息工程系,台湾科技大学) Department of Systems Engineering, Stevens Institute of Technology(系统工程系,史蒂文斯理工学院) Department of Management Information Systems, National Chengchi University(管理信息系,National Chengchi University) AI Research Center, Agaruda System(Agaruda系统人工智能研究中心) Department of Computer Science, Stevens Institute of Technology(计算机科学系,史蒂文斯理工学院) Far Eastern Memorial Hospital(东部纪念医院) Smart Healthcare Interdisciplinary College, National Taipei University of Nursing and Health Sciences(智慧医疗跨领域学院,台北大学护理及健康科学学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 RPRO通过结合强化学习与优先级驱动的推理细化,提升医疗问答和诊断推理的可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07611 2025-12-09 cs.AI cs.LG 81%

Comparative Analysis and Parametric Tuning of PPO, GRPO, and DAPO for LLM Reasoning Enhancement

PPO、GRPO和DAPO在LLM推理增强中的比较分析与参数调优

Yongsheng Lian

机构 * Mechanical Engineering Department University of Louisville(路易斯维尔大学机械工程系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过比较PPO、GRPO和DAPO在LLM推理增强中的表现,发现GRPO和DAPO在参数调优下具有更稳定的训练动态和更高的准确性,而DAPO禁用动态采样时表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07136 2025-12-09 cs.CV cs.AI 79%

A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning

大规模多模态数据集与基准用于人类活动场景理解和推理

Siyang Jiang, Mu Yuan, Xiang Ji, Bufang Yang, Zeyu Liu, Lilin Xu, Yang Li, Yuting He, Liran Dong, Wenrui Lu, Zhenyu Yan, Xiaofan Jiang, Wei Gao, Hongkai Chen, Guoliang Xing

机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) University of Pittsburgh(匹兹堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 CUHK-X是一个大规模多模态数据集和基准,用于人类活动场景理解和推理,通过生成逻辑一致的活动序列提升描述一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21933 2025-12-09 cs.CL cs.AI 79%

Why Chain of Thought Fails in Clinical Text Understanding

为什么链式思维在临床文本理解中失效

Jiageng Wu, Kevin Xie, Bowen Gu, Nils Krüger, Kueiyu Joshua Lin, Jie Yang

机构 * Harvard Medical School(哈佛医学院) MIT(麻省理工学院) Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现链式思维在临床文本理解中导致性能下降,揭示了其在临床任务中可靠性与可解释性的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23478 2025-12-09 cs.CV 78%

Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models

Video-R2: 通过强化一致性和基于现实的推理提升多模态语言模型

Muhammad Maaz, Hanoona Rasheed, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Linköping University(林肯皮大学) Australian National University(澳大利亚国立大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 Video-R2通过强化学习提升多模态模型在视频推理中的时间对齐和逻辑一致性,提高准确性和可信度。

Comments Video-R2 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04702 2025-12-09 cs.SE 78%

POLARIS: Is Multi-Agentic Reasoning the Next Wave in Engineering Self-Adaptive Systems?

POLARIS:多智能体推理是否是工程自适应系统下一波浪潮?

Divyansh Pandey, Vyakhya Gupta, Prakhar Singhal, Karthik Vaidhyanathan

专题命中 推理评测 :reasoning(title,abstract)

AI总结 POLARIS通过多智能体推理框架提升自适应系统在复杂环境中的适应能力与预测性能。

Comments Accepted as a short paper at SEAMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06751 2025-12-09 cs.CL cs.AI cs.LG 67%

Becoming Experienced Judges: Selective Test-Time Learning for Evaluators

成为经验丰富的法官:用于评估者的选择性测试时间学习

Seungyeon Jwa, Daechul Ahn, Reokyoung Kim, Dongyeop Kang, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) University of Minnesota(明尼苏达大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出选择性测试时间学习框架,使评估者在推理过程中逐步改进,通过自适应元提示提升评估效果,实验证明其在多个基准上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07608 2025-12-09 cs.CL cs.AI 62%

Metric-Fair Prompting: Treating Similar Samples Similarly

度量公平提示:对待相似样本同样

Jing Wang, Jie Shen, Xing Niu, Tong Zhang, Jeremy Weiss

机构 * NLM(国家医学图书馆) Stevens Institute of Technology(史蒂文斯理工学院) AWS AI(亚马逊人工智能) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 度量公平提示通过促进个体公平性,提高LLM在高风险临床多选问题上的准确性。

Journal ref NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07090 2025-12-09 cs.CL cs.AI 62%

Leveraging KV Similarity for Online Structured Pruning in LLMs

利用键值相似性实现LLMs中的在线结构剪枝

Jungmin Lee, Gwangeun Byeon, Yulhwa Kim, Seokin Hong

机构 * Sungkyunkwan University(成均馆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Token Filtering方法,利用键值相似性实现在线结构剪枝,提升LLMs推理效率与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07079 2025-12-09 cs.LG cs.AI 62%

Procrustean Bed for AI-Driven Retrosynthesis: A Unified Framework for Reproducible Evaluation

AI驱动的逆合成回溯的普罗克鲁斯床:可重复评估的统一框架

Anton Morgunov, Victor S. Batista

机构 * Yale University(耶鲁大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RetroCast框架,通过标准化评估基础设施,揭示了基于搜索和序列的方法在可解性与路线质量上的差异,并释放了标准化数据库以促进可重复发展。

Comments 11 pages + 7 pages of SI. RetroCast is available on GitHub, see https://github.com/ischemist/project-procrustes. SynthArena is publicly available, see https://syntharena.ischemist.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07011 2025-12-09 cs.LG cs.CL cs.PF 62%

Block Sparse Flash Attention

块稀疏Flash注意力

Daniel Ohayon, Itay Lamprecht, Itay Hubara, Israel Cohen, Daniel Soudry, Noam Elata

机构 * Technion -- Israel Institute of Technology, Haifa, Israel(技术离子-以色列理工学院, 海法, 以色列) Intel -- Habana Labs, Tel Aviv, Israel(英特尔 -- Habana实验室, 特拉维夫, 以色列)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 块稀疏Flash注意力通过精确计算查询-键相似性,提升长上下文推理效率并保持高准确性。

Comments 10 pages, 5 figures. Code: https://github.com/Danielohayon/Block-Sparse-Flash-Attention

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06097 2025-12-09 cs.CL cs.AI 62%

Empathy by Design: Aligning Large Language Models for Healthcare Dialogue

设计中的共情:为医疗对话对齐大语言模型

Emre Umucu, Guillermina Solis, Leon Garza, Emilia Rivas, Beatrice Lee, Anantaa Kotal, Aritran Piplai

机构 * Department of Public Health Sciences, The University of Texas at El Paso, USA(公共卫生科学系,德克萨斯理工大学埃尔帕索分校) Department of Nursing, The University of Texas at El Paso, USA(护理系,德克萨斯理工大学埃尔帕索分校) Department of Rehabilitation Sciences, The University of Texas at El Paso, USA(康复科学系,德克萨斯理工大学埃尔帕索分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于DPO的对齐框架,通过优化医疗对话中事实准确性、语义连贯性和共情能力,提升AI助手在医疗场景中的可信度和人文关怀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07777 2025-12-09 cs.CL 57%

Mary, the Cheeseburger-Eating Vegetarian: Do LLMs Recognize Incoherence in Narratives?

玛丽,吃汉堡的素食者:LLMs能否识别叙述中的不一致?

Karin de Langis, Püren Öncel, Ryan Peters, Andrew Elfenbein, Laura Kristen Allen, Andreas Schramm, Dongyeop Kang

机构 * Department of Computer Science and Engineering, University of Minnesota(计算机科学与工程系,明尼苏达大学) Department of Educational Psychology, University of Minnesota(教育心理学系,明尼苏达大学) Department of Linguistics, Hamline University(语言学系,哈姆林大学) Department of English, University of Minnesota(英语系,明尼苏达大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究发现LLMs在识别叙述不一致时存在不足,尤其在处理设定冲突和角色特征冲突时表现不一致,表明其对叙事一致性理解不完整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07186 2025-12-09 cs.CV cs.AI 57%

START: Spatial and Textual Learning for Chart Understanding

START: 空间与文本学习用于图表理解

Zhuoming Liu, Xiaofeng Gao, Feiyang Niu, Qiaozi Gao, Liu Liu, Robinson Piramuthu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Amazon AGI(亚马逊人工智能实验室) MIT(麻省理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 START通过空间与文本学习提升图表理解能力,引入图表元素定位和图表到代码生成,增强多模态大语言模型对图表结构和数据细节的理解。

Comments WACV2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07075 2025-12-09 cs.CL 57%

Do Large Language Models Truly Understand Cross-cultural Differences?

大型语言模型真的能理解跨文化差异吗?

Shiwei Guo, Sihang Jiang, Qianxi He, Yanghua Xiao, Jiaqing Liang, Bi Yude, Minggui He, Shimin Tao, Li Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出SAGE基准,通过跨文化核心概念对齐和生成任务设计,评估LLMs的跨文化理解和推理能力,揭示其在跨文化推理中的系统性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07059 2025-12-09 cs.CL 57%

Replicating TEMPEST at Scale: Multi-Turn Adversarial Attacks Against Trillion-Parameter Frontier Models

在大规模上复制TEMPEST:针对万亿参数前沿模型的多轮对抗攻击

Richard Young

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过TEMPEST框架评估了十种前沿模型对多轮对抗攻击的鲁棒性,发现模型规模不影响鲁棒性,而思考模式能提升安全性。

Comments 30 pages, 11 figures, 5 tables. Code and data: https://github.com/ricyoung/tempest-replication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04002 2025-12-09 cs.CL 57%

AgriGPT-VL: Agricultural Vision-Language Understanding Suite

AgriGPT-VL:农业视觉-语言理解套件

Bo Yang, Yunkui Chen, Lanfei Feng, Yu Zhang, Xiao Xu, Jianyu Zhang, Nueraili Aierken, Runhe Huang, Hongjian Lin, Yibin Ying, Shijian Li

机构 * Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 AgriGPT-VL通过构建农业专用的视觉-语言模型和评估套件,提升了农业领域的多模态理解和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏