arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-27 至 2026-08-27 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 7 篇

2608.24954 2026-08-27 cs.LG physics.ao-ph 新提交 83%

AFDBench: A Reasoning-First AI Scientist for NationalWeather Service Forecast Discussions

AFDBench:面向国家气象局预报讨论的推理优先AI科学家

Manmeet Singh, Somnath Luitel, Prabhjot Singh, Manraaj Banga, Naveen Sudharsan, Josh Durkee

机构 * Western Kentucky University(西肯塔基大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) RediMinds Inc.(睿智公司)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.LG

AI总结 针对LLMs生成高风险气象文本时虚构数值的问题,研究提出AFDBench基准,采用GRPO优化7B参数模型,提升其生成专业气象讨论的风格契合度与数据保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26013 2026-08-27 cs.CL 新提交 57%

VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following

VISA:用于多模态指令遵循的智能体式自进化数据合成

Min Zeng, Guanxin Tan, Libin Cen, Yawei Wen, Rui Hu, Liuyang Bian, Xiaolong Chen, Xiaoxin Chen

机构 * vivo AI Lab(vivo AI实验室)

专题命中 逻辑推理 :verifier(abstract);分类 cs.CL

AI总结 VISA是一种智能体式自进化数据合成框架,通过自进化循环优化多模态指令合成,在MM-IFEval等基准上提升了多模态指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25771 2026-08-27 cs.HC cs.LG 新提交 57%

Large Language Model Few-Shot Prompting with Dilemma Training Outperforms Human Surrogates in Predicting Patient Preferences

采用困境训练的大语言模型少样本提示在预测患者偏好方面优于人类替代者

Natasha Ureyang, Sebastian Porsdam Mann, Yuxin Liu, Zuriel Hassirim, Melanie Almonte, Wenhao Chen, Joyce Ng, Thant Nay Lin, Aung Thiha, Gerald CH Koh, Brian David Earp, Pin Sym Foong

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究提出采用困境训练的P4-DT智能体,通过12组患者-替代者配对实验,其预测患者治疗选择的准确率达81.7%,优于人类替代者及相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05545 2026-08-27 cs.CY cs.AI cs.HC 版本更新 57%

Vibe Compiler: A Research-Logic Synthesis Tool That Runs without Prompt Engineering -Toward Enhancing Metacognition for Sustaining Agency in the Age of Generative AI-

Vibe Compiler:无需提示工程即可运行的研究逻辑综合工具——迈向生成式AI时代维持智能体的元认知

Riichiro Mizoguchi, Tomoki Aburatani, Kento Koike, Machi Shimmei

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对生成式AI可能侵蚀人类认知智能体的问题,提出基于综合-分析互惠模型的Vibe Compiler工具,通过16个学术参数的本体编译研究想法,以反思性问题引导研究人员,减少对复杂提示的依赖,提升AI辅助推理效果。

Comments 98 pages, 3 figures. English version (pp. 1-54) followed by a Japanese version (pp. 55-98)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25573 2026-08-27 cs.DB cs.SE 新提交 50%

DBcover: A White-box SQL Test Generation Framework for Coverage Improvement

DBcover:一种用于提升覆盖率的白盒SQL测试生成框架

Yankai Rong, Shuang Liu, Jinhao Dong, Qiang Yin, Wei Lu, Jianhua Wang, Xiaoyong Du

专题命中 逻辑推理 :reasoning(abstract)

AI总结 针对RDBMS测试覆盖率提升难题,提出LLM驱动的白盒SQL测试生成框架DBcover,经实验在PostgreSQL、MySQL及KingbaseES上均实现有效覆盖率提升。

Comments Accepted to the ICSE 2026 Industry Challenge Track. 12 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17172 2026-08-27 cs.NE 版本更新 50%

Automating Parent Selection Configuration in Genetic Programming with Agentic AI

用智能体人工智能实现遗传编程中父代选择配置的自动化

Jose Guadalupe Hernandez, Jui-Hsuan Chang, Anil Kumar Saini, Xi Li, Jason H. Moore

专题命中 逻辑推理 :reasoning(abstract)

AI总结 该研究提出智能体AI框架,结合LLM推理与RAG实现遗传编程父代选择配置自动化,经符号回归测试,5 mini--AR配置表现优于锦标赛选择,为进化系统自动化设计提供了新路径。

Comments Updated Benchmarking figure with correct statistical test results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00894 2026-08-27 cs.AR 版本更新 50%

Rethinking Agentic Kernel Generation for Emerging Accelerators

面向新兴加速器的智能体内核生成方法反思

Ruijie Gao, Jirong Yang, Barry Lyu, Haoran Jin, Nathan Bleier

专题命中 逻辑推理 :reasoning(abstract)

AI总结 针对新兴加速器内核生成的现有方法反复重建无关语义的问题,提出编译器介导的Zomboss框架,将语义编译为可复用接口,在20个Gemmini和36个PLENA工作负载上实现全实例正确,且性能优于基线方法、推理成本更低。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏