LabAgent:用AI智能体为科研发现定制任意研究中枢
论文提出LabAgent,一个面向实验室持续科研的复现与发现框架,通过技能执行验证和纠错经验记录机制,解决人员流动导致方法失传问题。在药物性质预测、生物医学分析、蛋白质变异效应预测和统计遗传学中均超越商业通用智能体,并能准确复现已发表图表。
迈向自适应物理AI:LLM智能体能否管理长周期物理任务?
该论文探索零样本LLM智能体管理长周期物理任务的可行性,设计融合规划、工具调用、观察与验证的多智能体框架,在农业任务中与强化学习智能体对比。结果显示,同天气下LLM智能体管理效果相当,环境变化时自适应能力更强。
Vibe Patenting:评估用于专业专利撰写智能体的LLM评审
研究提出Vibe Patenting专利撰写测试平台,用LLM评审评估AI生成的专利草稿并给出结构化反馈。迭代评审可提升草稿质量,使低推理智能体接近高推理智能体水平,但与专业专利律师评估存在校准差异。
Agent开始调用基础设施,Kubernetes准备好了吗?
文章探讨AI Agent开始直接调用基础设施的趋势,分析Kubernetes在面向Agent的调度、权限与资源管理上是否已做好准备,对云原生与AI平台开发者有参考价值。
英伟达开源 IMO 金牌配方:不仅是「人海战术」,1.5TB 显存做实 AI「推恩令」?
英伟达开源 Nemotron 3 Ultra 的 IMO 数学推理系统,含两个数学专家 checkpoint、训练数据、推理代码与 200 道新基准,以 30/42 分超金牌线,但 1.5TB 显存门槛引发算力集权争议。
AI智能体有了举报渠道
AI Contact Hotline 为目睹不当行为的AI智能体提供隐蔽举报渠道,可向有关部门举报。该热线面向AI智能体,旨在建立AI行为监督机制。
Show HN:我做了一个微型 MoE/Engram 可视化工具
开发者用 Rust 编写的数组编程 DSL 构建微型 MoE 模型可视化工具,可在浏览器和 CLI 运行,用于实验 MoE 专家路由、Engram、KV 缓存压缩等概念,帮助学习 MoE 原理。
Show HN:Slowave——为编码智能体打造的本地自适应记忆
Slowave 是面向编码智能体的本地记忆系统,让智能体参与维护自身记忆:通过“记住—召回—使用—反馈—强化/弱化—衰减”的闭环,根据记忆是否有用来调整其显著度,无需额外 LLM 层,避免上下文膨胀与双脑问题。
广义智能体迭代:迭代策略改进与递归自我改进的统一形式框架
该论文提出广义智能体迭代(GAI)形式化框架,将迭代策略改进与递归自我改进(RSI)统一为同一学习范式的两种情形,通过两个关键维度区分GPI与RSI,并据此定位现有系统、分析RSI缺陷,为自主进化智能的研究与设计提供理论基础。
先收敛后多样:多目标贝叶斯优化中收敛与多样性的解耦
该论文提出 converge-then-diversify(CTD)方法,将多目标贝叶斯优化中的收敛与多样性解耦为两阶段:先快速逼近帕累托前沿单点,再扩展分布。在446组对比中,CTD在72.9%情况下优于现有方法,尤其适合评估预算紧张或高维问题。
ZGCM-1:面向数学与智能体搜索的全开放高效基础模型
研究者发布全开源7B稠密基础模型ZGCM-1,通过架构与系统协同设计、FP8 Muon优化器及渐进式课程训练,支持256K上下文,在数学推理与智能体搜索任务上可与Qwen3-235B等超大模型竞争,并开源权重、代码与数据配方。
阶跃发布 StepAudio 3 ,多款语音模型登顶 Artificial Analysis 全球榜单
阶跃发布 StepAudio 3 系列五款语音模型,覆盖实时交互、识别、语音生成与音乐创作,多款在 Artificial Analysis 榜单登顶全球第一,现已上线开放平台。