arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2512.12084 2026-03-17 cs.IR 50%

FloodSQL-Bench: A Retrieval-Augmented Benchmark for Geospatially-Grounded Text-to-SQL

FloodSQL-Bench: 一个用于洪水管理领域的检索增强基准

Hanzhou Liu, Kai Yin, Zhitong Chen, Chenyue Liu, Ali Mostafavi

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出FloodSQL-Bench,一个结合异构数据集的地理空间基准,用于评估大语言模型在多表和地理空间推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09924 2026-03-17 cs.CV 50%

Towards Reason-Informed Video Editing in Unified Models with Self-Reflective Learning

面向统一模型的基于推理的视频编辑:带有自我反思学习

Xinyu Liu, Hangjie Yuan, Yujie Wei, Jiazheng Xing, Yujin Han, Jiahao Pan, Yanbiao Ma, Chi-Min Chan, Kang Zhao, Shiwei Zhang, Wenhan Luo, Yike Guo

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出RVE任务,通过构建RVE-Bench基准,引入自反思学习框架ReViSE,提升视频编辑的准确性和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13412 2026-03-17 cs.CV 50%

WAT: Online Video Understanding Needs Watching Before Thinking

WAT:在线视频理解需要先观看再思考

Zifan Han, Hongbo Sun, Jinglin Xu, Canhui Tang, Yulong Lei, Xuchong Zhang, Hongbin Sun, Zhongjiang He, Hao Sun

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(国家人类-机器混合增强智能重点实验室,人工智能与机器人研究院,西安交通大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) University of Science and Technology Beijing(北京科技大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 WAT提出双阶段框架,通过分阶段处理实现在线视频理解,结合查询与短期记忆进行跨时间推理,实验显示在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24267 2026-03-17 cs.CV 50%

FakeScope: Large Multimodal Expert Model for Transparent AI-Generated Image Forensics

FakeScope:大型多模态专家模型用于透明的AI生成图像取证

Yixuan Li, Yu Tian, Yipo Huang, Wei Lu, Shiqi Wang, Weisi Lin, Anderson Rocha

机构 * College of Computing, City University of Hong Kong(城市大学 computing 学院) School of Data Science and Artificial Intelligence, Chang’an University(长安大学数据科学与人工智能学院) School of Computer Science and Engineering, Ministry of Education Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-Sen University(中山大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学 computing 与数据科学学院) Artificial Intelligence Lab. (Recod.ai) at the University of Campinas(坎皮纳斯大学人工智能实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 FakeScope通过多模态专家模型提升AI生成图像的检测能力,提供可解释的取证分析,实现高精度识别与深入解释,具备零样本检测和跨生成器泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02108 2026-03-16 cs.CV cs.GR cs.MM 50%

Unveiling Deep Shadows: A Survey and Benchmark on Image and Video Shadow Detection, Removal, and Generation in the Deep Learning Era

揭示深层阴影:深度学习时代图像和视频阴影检测、去除与生成的综述与基准

Xiaowei Hu, Zhenghao Xing, Tianyu Wang, Chi-Wing Fu, Pheng-Ann Heng

机构 * School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学院) Adobe Research(Adobe研究)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文综述并建立了深度学习时代图像和视频阴影检测、去除与生成的统一基准,揭示了现有研究中的不一致、模型设计依赖性和跨数据集泛化限制,并提出了未来研究方向。

Comments Accepted by International Journal of Computer Vision (IJCV). Publicly available results, trained models, and evaluation metrics at https://github.com/xw-hu/Unveiling-Deep-Shadows

Journal ref International Journal of Computer Vision (IJCV), vol.134, article 158, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21662 2026-03-16 cs.CV 50%

Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following

多标准:在多元标准下评估多模态裁判

Tianyi Xiong, Yi Ge, Ming Li, Zuolong Zhang, Pranav Kulkarni, Kaishen Wang, Qi He, Zeying Zhu, Chenxi Liu, Ruibo Chen, Tong Zheng, Yanshuo Chen, Xiyao Wang, Renrui Zhang, Wenhu Chen, Heng Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Waterloo(滑铁卢大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Multi-Crit基准,评估多模态裁判在多元标准下的表现,揭示了专有模型和开源模型在遵循复杂标准方面的不足,以及整体判断信号对视觉理解的影响。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10061 2026-03-13 cs.RO 50%

Decision-Aware Uncertainty Evaluation of Vision-Language Model-Based Early Action Anticipation for Human-Robot Interaction

基于视觉语言模型的早期动作预测在人机交互中的决策感知不确定性评估

Zhaoda Du, Michael Bowman, Qiaojie Zheng, Xiaoli Zhang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种系统评估基于视觉语言模型的短期动作识别在人机交互中的不确定性方法,通过引入时间前缀评估协议和校准度量标准,揭示了部分观测下的误校准模式和失败模式,为信心门控的人机交互模块提供了可靠性证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03114 2026-03-12 cs.SE 50%

PromCopilot: Simplifying Prometheus Metric Querying in Cloud Native Online Service Systems via Large Language Models

PromCopilot: 通过大型语言模型简化云原生在线服务系统的Prometheus指标查询

Chenxi Zhang, Bicheng Zhang, Dingyu Yang, Xin Peng, Miao Chen, Senyu Xie, Gang Chen, Wei Bi, Wei Li

专题命中 推理评测 :reasoning(abstract)

AI总结 PromCopilot通过大型语言模型简化云原生在线服务系统的Prometheus指标查询,首次提出文本到PromQL框架,准确率达69.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10795 2026-03-12 cs.CR cs.ET 50%

Re-Evaluating EVMBench: Are AI Agents Ready for Smart Contract Security?

重新评估 EVMBench:AI代理是否准备好应对智能合约安全?

Chaoyuan Peng, Lei Wu, Yajin Zhou

专题命中 推理评测 :reasoning(abstract)

AI总结 重新评估EVMBench发现AI代理在智能合约安全检测中存在稳定性、真实事件处理和框架依赖性问题,挑战了自动化审计的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10342 2026-03-12 cs.DC 50%

AgentServe: Algorithm-System Co-Design for Efficient Agentic AI Serving on a Consumer-Grade GPU

AgentServe: 为在消费级GPU上高效执行代理AI服务的算法-系统协同设计

Yuning Zhang, Yan Yan, Nan Yang, Dong Yuan

专题命中 推理评测 :reasoning(abstract)

AI总结 AgentServe通过算法-系统协同设计,在消费级GPU上实现高效代理AI服务,提升延迟稳定性并保持吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09896 2026-03-11 cs.CV 50%

Stepping VLMs onto the Court: Benchmarking Spatial Intelligence in Sports

迈向赛场:评估体育中的空间智能

Yuchen Yang, Yuqing Shao, Duxiu Huang, Linfeng Dong, Yifei Liu, Suixin Tang, Xiang Zhou, Yuanyuan Gao, Wei Wang, Yue Zhou, Xue Yang, Yanfeng Wang, Xiao Sun, Zhihang Zhong

专题命中 推理评测 :reasoning(abstract)

AI总结 CourtSI通过大规模体育场景数据集评估VLMs的空间智能,发现现有基准存在局限,并验证了模型在体育场景中的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09820 2026-03-11 cs.SD 50%

EmoSURA: Towards Accurate Evaluation of Detailed and Long-Context Emotional Speech Captions

EmoSURA:迈向精确评估详细且长上下文情感语音字幕

Xin Jing, Andreas Triantafyllopoulos, Jiadong Wang, Shahin Amiriparian, Jun Luo, Björn Schuller

机构 * CHI – Chair of Health Informatics, TUM University Hospital, Munich, Germany(慕尼黑大学医院健康信息学系) MCML - Munich Center for Machine Learning, Munich, Germany(慕尼黑机器学习中心) Huawei, Netherlands(荷兰华为) GLAM, Imperial College London, UK(伦敦帝国理工学院GLAM研究中心)

专题命中 推理评测 :reasoning(abstract)

AI总结 EmoSURA通过原子验证机制和SURABench基准,提供更可靠的长上下文情感语音字幕评估方法

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09471 2026-03-11 cs.CV 50%

OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks

OmniEarth:一个评估遥感任务中视觉-语言模型的基准

Ronghao Fu, Haoran Liu, Weijie Zhang, Zhiwen Lin, Xiao Yang, Peng Zhang, Bo Yang

机构 * Jilin University(吉林大学) Chang Guang Satellite Technology(长光卫星技术)

专题命中 推理评测 :reasoning(abstract)

AI总结 OmniEarth是一个评估遥感任务中视觉-语言模型性能的基准,通过多维任务和严格测试协议,揭示现有模型在复杂地理任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10778 2026-03-11 cs.RO 50%

Asset-Centric Metric-Semantic Maps of Indoor Environments

以资产为中心的度量-语义地图:室内环境

Christopher D. Hsu, Pratik Chaudhari

机构 * Department of Electrical & Systems Engineering and General Robotics, Automation, Sensing and Perception (GRASP) Laboratory at the University of Pennsylvania(宾夕法尼亚大学电气与系统工程系及通用机器人、自动化、传感与感知(GRASP)实验室) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 推理评测 :planning(abstract)

AI总结 本文提出了一种以资产为中心的度量-语义地图方法,利用四足机器人和RGB-D数据构建室内环境的高精度表示,结合自然语言和网格信息,提升机器人场景理解和导航能力。

Comments 9 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08738 2026-03-11 cs.AR cs.SE 50%

FormalRTL: Verified RTL Synthesis at Scale

FormalRTL: 在大规模上实现验证的RTL综合

Kezhi Li, Min Li, Xiangyu Wen, Shibo Zhao, Jieying Wu, Junhua Huang, Qiang Xu

专题命中 推理评测 :planning(abstract)

AI总结 FormalRTL通过整合软件参考模型,实现了大规模、验证的RTL综合,解决了工业级硬件设计中的规范模糊和正确性保证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08303 2026-03-10 cs.HC 50%

Do Models See in Line with Human Vision? Probing the Correspondence Between LVLM Representations and EEG Signals

模型的视觉感知是否与人类视觉一致?探测LVLM表示与EEG信号之间的对应关系

Xin Xiao, Yang Lei, Haoyang Zeng, Xiao Sun, Xinyi Jiang, Yu Tian, Hao Wu, Kaiwen Wei, Jiang Zhong

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过EEG信号分析,揭示了LVLM的视觉表示与人类大脑的对应关系,发现中间层与EEG活动对齐,多模态架构提升大脑对齐性,且视觉表现强的模型EEG相似性更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08077 2026-03-10 cs.IR 50%

Why Large Language Models can Secretly Outperform Embedding Similarity in Information Retrieval

为何大语言模型可以秘密超越嵌入相似性在信息检索中的表现

Matei Benescu, Ivo Pascal de Jong

专题命中 推理评测 :reasoning(abstract)

AI总结 本文探讨了大语言模型在信息检索中通过推理超越传统嵌入相似性方法的潜力,并指出当前注释数据集难以准确评估其效果。

Comments 13 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07966 2026-03-10 cs.CV 50%

Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time

用眼睛倾听:跨时空的自体视觉共指基准测试

Weijie Zhou, Xuantang Xiong, Zhenlin Hu, Xiaomeng Zhu, Chaoyang Zhao, Honghui Dong, Zhengyou Zhang, Ming Tang, Jinqiao Wang

机构 * Beijing Jiaotong University(北京交通大学) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences (CASIA)(基础模型研究中心、自动化研究所、中国科学院(CASIA)) Tencent Robotics X(腾讯机器人X) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST)(计算机科学与工程系、香港科学与技术大学(HKUST)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出EcoG-Bench,通过严格测试语音-手势绑定,揭示多模态接口可能限制时间对齐线索的可观察性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07786 2026-03-10 cs.CV 50%

OrdinalBench: A Benchmark Dataset for Diagnosing Generalization Limits in Ordinal Number Understanding of Vision-Language Models

OrdinalBench: 一种用于诊断视觉-语言模型在序数理解通用性限制的基准数据集

Yusuke Tozaki, Hisashi Miyamori

机构 * Division of Frontier Informatics, Kyoto Sangyo University, Kyoto, Japan(前沿信息学系,京都精华大学,京都,日本)

专题命中 推理评测 :reasoning(abstract)

AI总结 OrdinalBench通过评估视觉-语言模型在序数理解上的表现,揭示其在大序数和复杂路径条件下的泛化能力不足问题。

Comments Accepted as a Short Paper at VISAPP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07401 2026-03-10 cs.CV 50%

VIVECaption: A Split Approach to Caption Quality Improvement

VIVECaption:一种改进标题质量的分步方法

Varun Ananth, Baqiao Liu, Haoran Cai

机构 * Adobe Inc.(Adobe公司)

专题命中 推理评测 :reasoning(abstract)

AI总结 VIVECaption通过双面方法改进标题质量,利用分层抽样和模型对齐策略提升图像-标题对齐效果,提供高质量训练数据解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04989 2026-03-10 cs.CV 50%

TAPFormer: Robust Arbitrary Point Tracking via Transient Asynchronous Fusion of Frames and Events

TAPFormer: 通过帧和事件的瞬态异步融合实现鲁棒的任意点跟踪

Jiaxiong Liu, Zhen Tan, Jinpu Zhang, Yi Zhou, Hui Shen, Xieyuanli Chen, Dewen Hu

机构 * National University of Defense Technology(国防科技大学) Hunan University(湖南大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 TAPFormer通过帧和事件的瞬态异步融合实现鲁棒的任意点跟踪,提升跟踪精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21060 2026-03-10 eess.AS 50%

Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models

测量音频对正确性的影响:面向大音频语言模型的音频贡献意识后训练

Haolin He, Xingjian Du, Renhe Sun, Zheqi Dai, Yujia Xiao, Mingru Yang, Jiayi Zhou, Xiquan Li, Zhengxi Liu, Zining Liang, Chunyat Wu, Qianhua He, Tan Lee, Xie Chen, Wei-Long Zheng, Weiqiang Wang, Mark Plumbley, Jian Liu, Qiuqiang Kong

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本文提出AudioMCQ数据集和Audio-Contribution Filtering方法,通过弱到强和混合到强的后训练范式,提升大音频语言模型的音频贡献意识和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14878 2026-03-10 cs.HC 50%

InterMind: Doctor-Patient-Family Interactive Depression Assessment Empowered by Large Language Models

InterMind:由大型语言模型赋能的医生-患者-家庭交互式抑郁症评估系统

Zhiyuan Zhou, Jilong Liu, Sanwang Wang, Shijie Hao, Yanrong Guo, Richang Hong

专题命中 推理评测 :CoT(abstract)

AI总结 InterMind利用大型语言模型,通过医生、患者和家庭的互动提升抑郁症评估的精确性和效率。

Comments Accepted at ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06856 2026-03-10 cs.MA 50%

Evaluating Multi-Agent LLM Architectures for Rare Disease Diagnosis

评估多智能体LLM架构在罕见病诊断中的表现

Ahmed Almasoud

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究评估了多智能体LLM架构在罕见病诊断中的表现,发现分层结构略优于其他拓扑,而对抗模型性能显著下降,支持动态拓扑选择的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06700 2026-03-10 cs.CV 50%

SIQA: Toward Reliable Scientific Image Quality Assessment

SIQA:迈向可靠的科学图像质量评估

Wenzhe Li, Liang Chen, Junying Wang, Yijing Guo, Ye Shen, Farong Wen, Chunyi Li, Zicheng Zhang, Guangtao Zhai

机构 * TongJi University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 SIQA提出了一种多维框架,通过SIQA-U和SIQA-S评估科学图像的科学正确性和感知清晰度,揭示模型在评分一致性与科学理解上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06422 2026-03-09 cs.CR 50%

Before You Hand Over the Wheel: Evaluating LLMs for Security Incident Analysis

在交出轮子之前:评估LLMs用于安全事件分析

Sourov Jajodia, Madeena Sultana, Suryadipta Majumdar, Adrian Taylor, Grant Vandenberghe

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出SIABENCH框架,通过构建首个涵盖安全事件分析两大类任务的数据集,并实现自主执行SIA任务的代理,对11种LLM进行基准测试,以评估其在动态安全事件分析中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00092 2026-03-09 cs.CV 50%

Spatial4D-Bench: A Versatile 4D Spatial Intelligence Benchmark

Spatial4D-Bench: 一种多功能的4D空间智能基准

Pan Wang, Yang Liu, Guile Wu, Eduardo R. Corral-Soto, Chengjie Huang, Binbin Xu, Dongfeng Bai, Xu Yan, Yuan Ren, Xingxin Chen, Yizhe Wu, Tao Huang, Wenjun Wan, Xin Wu, Pei Zhou, Xuyang Dai, Kangbo Lv, Hongbo Zhang, Yosef Fried, Aixue Ye, Bailan Feng, Zhenyu Chen, Zhen Li, Yingcong Chen, Yiyi Liao, Bingbing Liu

机构 * Pan Wang Fundation Model Dept, Huawei(王潘 基础模型部门,华为) Yang Liu Noah’s Ark Lab, Huawei(刘阳 神秘 Ark 实验室,华为) Guile Wu Noah’s Ark Lab, Huawei(吴古力 神秘 Ark 实验室,华为) Eduardo R. Corral-Soto Noah’s Ark Lab, Huawei(埃杜阿多·R·科拉尔-索托 神秘 Ark 实验室,华为) Chengjie Huang Noah’s Ark Lab, Huawei(黄成杰 神秘 Ark 实验室,华为) Binbin Xu Noah’s Ark Lab, Huawei(徐彬彬 神秘 Ark 实验室,华为) Dongfeng Bai Noah’s Ark Lab, Huawei(白东风 神秘 Ark 实验室,华为) Xu Yan Fundation Model Dept, Huawei(颜绪 基础模型部门,华为) Yuan Ren Noah’s Ark Lab, Huawei(袁仁 神秘 Ark 实验室,华为) Xingxin Chen Noah’s Ark Lab, Huawei(陈星心 神秘 Ark 实验室,华为) Yizhe Wu Fundation Model Dept, Huawei(吴义哲 基础模型部门,华为) Tao Huang Fundation Model Dept, Huawei(黄涛 基础模型部门,华为) Wenjun Wan Central Media Technology Institute, Huawei(万文军 中央媒体技术研究院,华为) Xin Wu Central Media Technology Institute, Huawei(吴新 中央媒体技术研究院,华为) Pei Zhou Central Media Technology Institute, Huawei(周佩 中央媒体技术研究院,华为) Xuyang Dai Central Media Technology Institute, Huawei(戴绪阳 中央媒体技术研究院,华为) Kangbo Lv Fundation Model Dept, Huawei(吕康博 基础模型部门,华为) Hongbo Zhang Fundation Model Dept, Huawei(张宏波 基础模型部门,华为) Yosef Fried Fundation Model Dept, Huawei(弗里德·约瑟夫 基础模型部门,华为) Aixue Ye Fundation Model Dept, Huawei(叶爱雪 基础模型部门,华为) Bailan Feng Fundation Model Dept, Huawei(冯 Bailan 基础模型部门,华为) Zhenyu Chen Fundation Model Dept, Huawei(陈振宇 基础模型部门,华为) Zhen Li CUHK-Shenzhen(李振 中山大学深圳校区) Yingcong Chen HKUST-GZ(陈应聪 香港科技大学-广东) Yiyi Liao Zhejiang University(廖亿毅 浙江大学) Bingbing Liu Fundation Model Dept, Huawei(刘冰冰 基础模型部门,华为)

专题命中 推理评测 :reasoning(abstract)

AI总结 Spatial4D-Bench提出了一种多功能的4D空间智能基准,用于评估多模态大语言模型的4D空间推理能力,并揭示其在路线规划、动作识别等任务中的局限性。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06366 2026-03-09 cs.CV 50%

OralGPT-Plus: Learning to Use Visual Tools via Reinforcement Learning for Panoramic X-ray Analysis

OralGPT-Plus:通过强化学习学习使用视觉工具进行全景X射线分析

Yuxuan Fan, Jing Hao, Hong Chen, Jiahao Bao, Yihua Shao, Yuci Liang, Kuo Feng Hung, Hao Tang

机构 * The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) School of Computer Science, Peking University(北京大学计算机学院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 OralGPT-Plus通过强化学习实现全景X射线分析中的交互式对称推理,提升诊断可靠性。

Comments 34 pages, 24 figures, conference

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06065 2026-03-09 cs.IR 50%

ChatShopBuddy: Towards Reliable Conversational Shopping Agents via Reinforcement Learning

ChatShopBuddy:通过强化学习实现可靠的对话购物代理

Yiruo Cheng, Kelong Mao, Tianhao Li, Jiejun Tan, Ji-Rong Wen, Zhicheng Dou

专题命中 推理评测 :reasoning(abstract)

AI总结 ChatShopBuddy通过强化学习优化对话购物代理,结合分层奖励建模和动态对比策略优化,提升购物代理的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05646 2026-03-09 cs.PL 50%

Evaluating LLMs in the Context of a Functional Programming Course: A Comprehensive Study

在函数式编程课程背景下评估LLM:一项全面研究

Yihan Zhang, Brigitte Pientka, Xujie Si

专题命中 推理评测 :reasoning(abstract)

AI总结 本文评估了LLM在函数式编程课程中的有效性,通过构建三个基准测试,发现LLM在纠正语法和类型错误及回答基础概念问题方面表现良好,但解决低资源环境下家庭作业问题的能力较弱。

Journal ref The Art, Science, and Engineering of Programming, 2026, Vol. 11, Issue 1, Article 5

详情

展开后加载摘要…

URL PDF HTML 收藏