arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2512.01232 2025-12-02 cs.SE cs.AI 57%

LLM-as-a-Judge for Scalable Test Coverage Evaluation: Accuracy, Operational Reliability, and Cost

基于LLM的判别器用于可扩展的测试覆盖率评估:准确性、操作可靠性与成本

Donghao Huang, Shila Chew, Anna Dutkiewicz, Zhaoxia Wang

机构 * School of Computing and Information Systems(计算与信息系统学院) Singapore Management University(新加坡管理大学) Research and Development(研发)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 LLM-as-a-Judge通过低成本高可靠性的测试覆盖率评估方法,显著降低评估成本并提升准确性。

Comments 7 pages, accepted by the AAAI 2026 Workshop on Next Gen Code Development with Collaborative AI Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01191 2025-12-02 cs.CL 57%

Generalist Large Language Models Outperform Clinical Tools on Medical Benchmarks

通用大语言模型在医疗基准测试中优于临床工具

Krithik Vishwanath, Mrigayu Ghosh, Anton Alyakin, Daniel Alexander Alber, Yindalon Aphinyanaphongs, Eric Karl Oermann

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 通用大语言模型在医疗基准测试中表现优于临床工具,揭示了临床AI系统在某些关键能力上的不足。

Comments 17 pages, 4 figures (2 regular, 2 supplemental)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00630 2025-12-02 cs.LG q-fin.CP 57%

Financial Text Classification Based On rLoRA Finetuning On Qwen3-8B model

基于Qwen3-8B模型的金融文本分类研究:rLoRA微调

Zhiming Lian

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出基于rLoRA微调的Qwen3-8B模型,用于金融文本分类,展示了其在准确率和训练效率上的优势。

Comments This paper has been accepted to the 2025 2nd International Conference on Digital Economy and Computer Science (DECS 2025) and is awaiting publication in the ACM International Conference Proceeding Series

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00231 2025-12-02 cs.SE cs.AI 57%

CodeFlowLM: Incremental Just-In-Time Defect Prediction with Pretrained Language Models and Exploratory Insights into Defect Localization

CodeFlowLM:基于预训练语言模型的增量即需缺陷预测与缺陷定位的探索性洞察

Monique Louise Monteiro, George G. Cabral, Adriano L. I. OLiveira

机构 * cin.ufpe.br(佛罗里达大学佩德罗斯分校计算机学院) Recife-PE – Brazil(巴西佩德罗斯)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CodeFlowLM通过增量学习提升即时软件缺陷预测性能,同时探索LLMs在缺陷定位中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23387 2025-12-01 cs.AI 57%

Hierarchical AI-Meteorologist: LLM-Agent System for Multi-Scale and Explainable Weather Forecast Reporting

分层人工智能气象学家:用于多尺度和可解释性天气预报报告的LLM代理系统

Daniil Sukhorukov, Andrei Zakharov, Nikita Glazkov, Katsiaryna Yanchanka, Vladimir Kirilin, Maxim Dubovitsky, Roman Sultimov, Yuri Maksimov, Ilya Makarov

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出分层人工智能气象学家,通过多尺度推理和关键词生成提升天气预报的可解释性和鲁棒性。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19079 2025-12-01 cs.CV cs.AI cs.HC 57%

Reading Smiles: Proxy Bias in Foundation Models for Facial Emotion Recognition

读微笑:面部情绪识别基础模型中的代理偏差

Iosif Tsangko, Andreas Triantafyllopoulos, Adem Abdelmoula, Adria Mallol-Ragolta, Bjoern W. Schuller

机构 * CHI – Chair of Health Informatics, MRI, Technical University of Munich(慕尼黑技术大学健康信息学系) MCML – Munich Center for Machine Learning(慕尼黑机器学习中心) GLAM – Group on Language, Audio, & Music(语言、音频与音乐小组) MDSI – Munich Data Science Institute(慕尼黑数据科学研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了面部情绪识别基础模型中视觉线索的依赖性及潜在偏差,揭示了模型在情绪推理中的内在一致性及公平性风险。

Journal ref IEEE Access, Early Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01734 2025-12-01 cs.CL 57%

Benford's Curse: Tracing Digit Bias to Numerical Hallucination in LLMs

本福特定律的诅咒:追踪数字偏差到大语言模型中的数值幻觉

Jiandong Shao, Yao Lu, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) University College London(伦敦大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究发现LLMs在预训练中学习到的数字偏倚导致数值生成偏差,通过修剪特定神经元可缓解错误输出。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22275 2025-12-01 cs.AI 57%

RecToM: A Benchmark for Evaluating Machine Theory of Mind in LLM-based Conversational Recommender Systems

RecToM:用于评估基于LLM的对话推荐系统机器理论 of mind 的基准

Mengfan Li, Xuanhua Shi, Yang Deng

机构 * SMU(德克萨斯南方大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RecToM是一个用于评估基于LLM的对话推荐系统中机器理论 of mind 能力的新基准,重点关注认知推理和行为预测两个维度。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21982 2025-12-01 cs.CV cs.AI 57%

DialBench: Towards Accurate Reading Recognition of Pointer Meter using Large Foundation Models

DialBench: 通过大基础模型实现指针表盘读数的准确识别

Futian Wang, Chaoliu Weng, Xiao Wang, Zhen Chen, Zhicheng Zhao, Jin Tang

机构 * School of Computer Science and Technology, Anhui University, Hefei 230601, China(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University, Hefei 230601, China(安徽大学人工智能学院) Department of Computer Science and Information Technology, La Trobe University, Bendigo, Australia(拉筹伯大学计算机科学与信息技术系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出DialBench基准数据集和MRLM模型,通过物理关系注入提升指针表盘读数识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19957 2025-12-01 cs.CL 57%

AppSelectBench: Application-Level Tool Selection Benchmark

AppSelectBench: 应用级工具选择基准

Tianyi Chen, Michael Solodko, Sen Wang, Jongwoo Ko, Junheng Hao, Colby Banbury, Sara Abdali, Saeed Amizadeh, Qing Xiao, Yinheng Li, Tianyu Ding, Kamran Ghasedi Dizaji, Suzhen Zheng, Hao Fan, Justin Wagle, Pashmina Cameron, Kazuhito Koishida

机构 * Microsoft(微软)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 AppSelectBench通过评估CUAs的应用选择能力,揭示了模型在跨应用推理中的系统性优劣,为智能代理的研究提供了新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19220 2025-12-01 cs.CV cs.AI 57%

Are Large Vision Language Models Truly Grounded in Medical Images? Evidence from Italian Clinical Visual Question Answering

大视觉语言模型真的在医学图像上具有基础性吗?来自意大利临床视觉问答的证据

Federico Felizzi, Olivia Riccomi, Michele Ferramola, Francesco Andrea Causio, Manuel Del Medico, Vittorio De Vita, Lorenzo De Mori, Alessandra Piscitelli, Pietro Eric Risuleo, Bianca Destro Castaniti, Antonio Cristiano, Alessia Longo, Luigi De Angelis, Mariapia Vassalli, Marcello Di Pumpo

机构 * SIIAM NSBProject Dept. of Life Sciences & Public Health, UCSC(生命科学与公共卫生系,UCSC) ASL RM 4 UCSC Univ. Paris Cité(巴黎Cité大学) Univ. of Pisa(比萨大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究通过测试四种先进模型在意大利医学问题上的表现,揭示了大视觉语言模型在视觉基础上的差异,强调了临床部署前的严格评估需求。

Comments Accepted at the Workshop on Multimodal Representation Learning for Healthcare (MMRL4H), EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14307 2025-12-01 cs.CL 57%

How LLMs Comprehend Temporal Meaning in Narratives: A Case Study in Cognitive Evaluation of LLMs

大语言模型如何在叙述中理解时间意义:一项对大语言模型认知评估的案例研究

Karin de Langis, Jong Inn Park, Andreas Schramm, Bin Hu, Khanh Chi Le, Michael Mensink, Ahn Thu Tong, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学) Hamline University(哈姆林大学) University of Wisconsin-Stout(威斯康星州立大学斯托特分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过实验发现,大语言模型在处理叙述中的时间意义时,过度依赖原型性,导致不一致的判断和因果推理困难,表明其与人类在理解叙述方面存在根本差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10507 2025-11-27 cs.CL 57%

AdvancedIF: Rubric-Based Benchmarking and Reinforcement Learning for Advancing LLM Instruction Following

AdvancedIF:基于规则的基准测试与强化学习以推进大语言模型指令跟随

Yun He, Wenzhe Li, Hejia Zhang, Songlin Li, Karishma Mandyam, Sopan Khosla, Yuanhao Xiong, Nanshu Wang, Xiaoliang Peng, Beibin Li, Shengjie Bi, Shishir G. Patil, Qi Qi, Shengyu Feng, Julian Katz-Samuels, Richard Yuanzhe Pang, Sujan Gonugondla, Hunter Lang, Yue Yu, Yundi Qian, Maryam Fazel-Zarandi, Licheng Yu, Amine Benhalloum, Hany Awadalla, Manaal Faruqui

机构 * Meta Superintelligence Labs(Meta超智能实验室) Princeton University(普林斯顿大学)

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 本研究提出AdvancedIF基准和RIFL方法,通过规则生成和奖励塑造提升大语言模型的指令跟随能力,在AdvancedIF上实现6.7%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21568 2025-11-27 cs.CL 57%

RoParQ: Paraphrase-Aware Alignment of Large Language Models Towards Robustness to Paraphrased Questions

RoParQ:面向抗 paraphrased 问题的大型语言模型对齐

Minjoon Choi

机构 * Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 RoParQ 通过引入 XParaCon 指标和基于推理的 SFT 策略,提升 LLM 在 paraphrased 问题上的鲁棒性与一致性。

Comments 12 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21339 2025-11-27 cs.CV cs.AI 57%

SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding

SurgMLLMBench: 一个用于手术场景理解的多模态大语言模型基准数据集

Tae-Min Choi, Tae Kyeong Jeong, Garam Kim, Jaemin Lee, Yeongyoon Koh, In Cheul Choi, Jae-Ho Chung, Jong Woong Park, Juyoun Park

机构 * Samsung Research(三星研究所) Center for Humanoid Research, Korea Institute of Science and Technology(人类研究学院,韩国科学技术院) Department of plastic surgery, College of medicine, Korea University(医学院整形外科部,韩国大学) Department of orthopedic surgery, College of medicine, Korea University(医学院骨科部,韩国大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SurgMLLMBench是一个用于手术场景理解的多模态大语言模型基准数据集,整合了像素级分割和结构化VQA注释,支持跨领域的全面评估和更丰富的视觉-对话交互。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20795 2025-11-27 cs.CV cs.AI 57%

Revisiting KRISP: A Lightweight Reproduction and Analysis of Knowledge-Enhanced Vision-Language Models

重新审视 KRISP:一种轻量级的知识增强视觉-语言模型的再现与分析

Souradeep Dutta, Keshav Bulia, Neena S Nair

机构 * Centre For Digital Health(数字健康中心) Indian Institute of Technology Bombay(孟买印度理工学院) Department of Metallurgical engineering & Material science(冶金工程与材料科学系) Department of Bioscience & Bioengineering(生物科学与生物工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究重新审视 KRISP,通过轻量级模型揭示知识增强 VQA 的设计缺陷与资源受限下的有效性。

Comments 7 pages , 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15277 2025-11-27 cs.CL 57%

Web-Shepherd: Advancing PRMs for Reinforcing Web Agents

Web-Shepherd: 促进强化网络代理的PRMs

Hyungjoo Chae, Sunghwan Kim, Junhee Cho, Seungone Kim, Seungjun Moon, Gyeom Hwangbo, Dongha Lim, Minjin Kim, Yeonjun Hwang, Minju Gwak, Dongwook Choi, Minseok Kang, Gwanhoon Im, ByeongUng Cho, Hyojun Kim, Jun Hee Han, Taeyoon Kwon, Minju Kim, Beong-woo Kwak, Dongjin Kang, Jinyoung Yeo

机构 * Georgia Institute of Technology(佐治亚理工学院) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 Web-Shepherd是首个用于强化网络代理的PRM,通过构建大规模数据集和元评估基准,提升了网络导航任务的准确性和效率。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20067 2025-11-26 cs.AI cs.HC 57%

"Are We Done Yet?": A Vision-Based Judge for Autonomous Task Completion of Computer Use Agents

我们完成了吗?

Marta Sumyk, Oleksandr Kosovan

专题命中 推理评测 :self-correction(abstract);分类 cs.AI

AI总结 本文提出了一种基于视觉的评估机制,通过视觉-语言模型评估计算机使用代理的任务完成情况,提升了任务完成的准确性和可靠性。

Comments This work has been accepted to appear at the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19875 2025-11-26 cs.SE cs.AI 57%

CodeFuse-CommitEval: Towards Benchmarking LLM's Power on Commit Message and Code Change Inconsistency Detection

CodeFuse-CommitEval: 向基于提交信息和代码变更不一致检测的LLM能力基准测试迈进

Qingyu Zhang, Puzhuo Liu, Peng Di, Chenxiong Qian

机构 * Ant Group(蚂蚁集团) The University of Hong Kong(香港大学) Tsinghua University(清华大学) The University of New South Wales(新南威尔士大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 CodeFuse-CommitEval是首个用于评估LLM检测提交信息与代码变更不一致能力的基准,通过生成七类不一致消息并验证样本,评估六种开源LLM在不同增强策略下的表现,揭示了不同增强方法对模型性能的影响及不同类型不一致的检测差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20192 2025-11-26 cs.LG cs.IR 57%

FunReason: Enhancing Large Language Models' Function Calling via Self-Refinement Multiscale Loss and Automated Data Refinement

FunReason: 通过自精炼多尺度损失和自动化数据精炼增强大语言模型的功能调用

Bingguang Hao, ZengZhuang Xu, Maolin Wang, Yuntao Wen, Yicheng Chen, Cunyin Peng, Long Chen, Dong Wang, Xiangyu Zhao, Jinjie Gu, Chenyi Zhuang, Ji Zhang

机构 * AWorld Team, Inclusion AI(AWorld Team,Inclusion AI) City University of Hong Kong(香港城市大学) Southwest Jiaotong University(西南交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 FunReason通过自精炼多尺度损失和自动化数据精炼方法,提升大语言模型的功能调用能力,实现性能接近GPT-4o并缓解微调中的灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17432 2025-11-26 cs.CV cs.CL 57%

Video Understanding with Large Language Models: A Survey

利用大语言模型进行视频理解:综述

Yolo Y. Tang, Jing Bi, Siting Xu, Luchuan Song, Susan Liang, Teng Wang, Daoan Zhang, Jie An, Jingyang Lin, Rongyi Zhu, Ali Vosoughi, Chao Huang, Zeliang Zhang, Pinxin Liu, Mingqian Feng, Feng Zheng, Jianguo Zhang, Ping Luo, Jiebo Luo, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文综述了利用大语言模型进行视频理解的最新进展,探讨了Vid-LLMs的分类、功能及应用场景,并指出了未来研究方向。

Comments Accepted to IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19427 2025-11-25 cs.SE cs.AI 57%

Prompt Less, Smile More: MTP with Semantic Engineering in Lieu of Prompt Engineering

无需提示,微笑更多:通过语义工程替代提示工程的MTP

Jayanaka L. Dantanarayana, Savini Kashmira, Thakee Nathees, Zichen Zhang, Krisztian Flautner, Lingjia Tang, Jason Mars

机构 * University of Michigan(密歇根大学) Jaseci Labs(Jaseci实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 通过语义工程替代提示工程,提升AI集成编程中提示的准确性与开发者效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18854 2025-11-25 cs.SE cs.AI 57%

Time Travel: LLM-Assisted Semantic Behavior Localization with Git Bisect

时间旅行:借助Git Bisect的LLM辅助语义行为定位

Yujing Wang, Weize Hong

机构 * University of Waterloo(滑铁卢大学) Brock University(布罗克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用LLM和Git Bisect进行语义行为定位,通过结构化推理链提升故障定位准确率,实验显示成功率提升6.4个百分点,平均bisect时间减少2倍。

Comments submitted to Git Bisect SCALCOM 2025 Calgary (to be published)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01285 2025-11-25 cs.AI cs.IR stat.AP 57%

BioDisco: Multi-agent hypothesis generation with dual-mode evidence, iterative feedback and temporal evaluation

BioDisco:基于双模式证据、迭代反馈和时间评估的多智能体假设生成

Yujing Ke, Kevin George, Kathan Pandya, David Blumenthal, Maximilian Sprang, Gerrit Großmann, Sebastian Vollmer, David Antony Selby

机构 * Data Science and its Applications, DFKI(数据科学及其应用,德系人工智能研究所) DFKI Friedrich-Alexander-Universität Erlangen-Nürnberg(德系人工智能研究所,弗赖堡-埃朗根-纽伦堡大学) University of Saarland(萨尔大学) Friedrich-Alexander-Universität Erlangen-Nürnberg(弗赖堡-埃朗根-纽伦堡大学) University of Kaiserslautern–Landau (RPTU)(凯撒斯劳滕-兰道大学(RPTU)) Department of Dermatology, University Medical Center Mainz(梅奥医学中心法兰克福大学皮肤科)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 BioDisco通过双模式证据系统、迭代反馈和时间评估,实现多智能体生成新颖且证据支持的科学假设。

Comments 12 pages main content, 31 including appendices. 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18436 2025-11-25 cs.CL 57%

Can Code-Switched Texts Activate a Knowledge Switch in LLMs? A Case Study on English-Korean Code-Switching

代码切换文本能否在LLMs中激活知识切换?一种英语-韩语代码切换案例研究

Seoyeon Kim, Huiseo Kim, Chanjun Park, Jinyoung Yeo, Dongha Lee

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过EnKoQA数据集探讨代码切换是否能激活LLMs中的知识,发现其在低资源语言任务中具有潜力。

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18486 2025-11-25 cs.CL 57%

Evaluation of OpenAI o1: Opportunities and Challenges of AGI

OpenAI o1的评估:通用人工智能的机会与挑战

Tianyang Zhong, Zhengliang Liu, Yi Pan, Yutong Zhang, Zeyu Zhang, Yifan Zhou, Shizhe Liang, Zihao Wu, Yanjun Lyu, Peng Shu, Xiaowei Yu, Chao Cao, Hanqi Jiang, Hanxu Chen, Yiwei Li, Junhao Chen, Huawen Hu, Yiheng Liu, Huaqin Zhao, Shaochen Xu, Haixing Dai, Lin Zhao, Ruidong Zhang, Wei Zhao, Zhenyuan Yang, Jingyuan Chen, Peilong Wang, Wei Ruan, Hui Wang, Huan Zhao, Jing Zhang, Yiming Ren, Shihuan Qin, Tong Chen, Jiaxi Li, Arif Hassan Zidan, Afrar Jahin, Minheng Chen, Sichen Xia, Jason Holmes, Yan Zhuang, Jiaqi Wang, Bochen Xu, Weiran Xia, Jichao Yu, Kaibo Tang, Yaxuan Yang, Bolun Sun, Tao Yang, Guoyu Lu, Xianqiao Wang, Lilong Chai, He Li, Jin Lu, Xin Zhang, Bao Ge, Xintao Hu, Lian Zhang, Hua Zhou, Lu Zhang, Shu Zhang, Zhen Xiang, Yudan Ren, Jun Liu, Xi Jiang, Yu Bao, Wei Zhang, Xiang Li, Gang Li, Wei Liu, Dinggang Shen, Andrea Sikora, Xiaoming Zhai, Dajiang Zhu, Tuo Zhang, Tianming Liu

机构 * Department of Mathematical and Statistical Sciences, University of Alberta, Edmonton, Canada(阿尔伯塔大学数学与统计学系) School of Computing, University of Georgia, GA, USA(佐治亚大学计算机科学学院) Institute of Medical Research, Northwestern Polytechnical University, Xi’an, China(西北工业大学医学研究所) Department of Computer Science and Engineering, University of Texas at Arlington, TX, USA(德克萨斯大学阿灵顿分校计算机科学与工程系) College of Arts and Sciences, University of Georgia, Athens, USA(佐治亚大学文理学院) Institute of Plant Breeding, Genetics & Genomics, University of Georgia, Athens, GA, USA(佐治亚大学植物育种、遗传与基因组研究所) School of Computer Science, Northwestern Polytechnical University, Xi’an, China(西北工业大学计算机科学学院) School of Automation, Northwestern Polytechnical University, Xi’an, China(西北工业大学自动化学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 OpenAI o1在多领域复杂推理任务中表现出色,展现出接近或超越人类水平的能力,为通用人工智能的发展提供了重要进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17624 2025-11-25 cs.LG 57%

QML-HCS: A Hypercausal Quantum Machine Learning Framework for Non-Stationary Environments

QML-HCS:一种用于非平稳环境的超因果量子机器学习框架

Hector E Mozo

机构 * NeureonMindFlux Research Lab(NeureonMindFlux研究实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 QML-HCS通过超因果反馈动态和混合执行机制,为非平稳环境中的量子启发式机器学习提供适应性框架。

Comments 11 pages, 10 figures, and 8 tables. The implementation and full source code of the Hypercausal Quantum Machine Learning System (QML-HCS) are openly available on GitHub at: https://github.com/Neureonmindflux-Research-Lab/qml-hcs

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17131 2025-11-24 cs.SE cs.AI 57%

UI-CUBE: Enterprise-Grade Computer Use Agent Benchmarking Beyond Task Accuracy to Operational Reliability

UI-CUBE:超越任务准确性的企业级计算机使用代理基准测试到操作可靠性

Horia Cristescu, Charles Park, Trong Canh Nguyen, Sergiu Talmacel, Alexandru-Gabriel Ilie, Stefan Adam

机构 * UiPath Romania(UiPath罗马尼亚) UiPath UK(UiPath英国) UiPath France(UiPath法国)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 UI-CUBE通过系统性测试揭示CUA在复杂流程中的性能断崖,表明内存管理等架构限制而非训练优化可解决

Comments 18 pages, 8 figures, 5 tables. Benchmark comprising 226 tasks across two difficulty tiers. Code and benchmark available at https://github.com/UiPath/uipath_enterprise_benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16937 2025-11-24 cs.CV cs.AI 57%

OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios

OmniGround: 一个全面的时空接地基准用于现实复杂场景

Hong Gao, Jingyu Wu, Xiangkai Xu, Kangni Xie, Yunchen Zhang, Bin Zhong, Xurui Gao, Min-Ling Zhang

机构 * SouthEast University(东南大学) ZTE Corporation(中兴通讯)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 OmniGround提出一个全面的时空接地基准,通过改进的标注流程和评估框架,提升了复杂现实场景中视频目标定位的性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02894 2025-11-24 cs.LG cs.CR 57%

Adaptive and Robust Data Poisoning Detection and Sanitization in Wearable IoT Systems using Large Language Models

基于大语言模型的可适应和鲁棒数据污染检测与净化在可穿戴物联网系统中的应用

W. K. M Mithsara, Ning Yang, Ahmed Imteaj, Hussein Zangoti, Abdur R. Shahid

机构 * Southern Illinois University(辛辛那提大学) Florida Atlantic University(佛罗里达 Atlantic 大学) Jazan University(贾兹安大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出利用大语言模型进行可穿戴物联网系统中的数据污染检测与净化,通过角色扮演和逐步推理策略提升系统安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏