论文提出LabAgent,一个面向实验室持续科研的复现与发现框架,通过技能执行验证和纠错经验记录机制,解决人员流动导致方法失传问题。在药物性质预测、生物医学分析、蛋白质变异效应预测和统计遗传学中均超越商业通用智能体,并能准确复现已发表图表。
该论文探索零样本LLM智能体管理长周期物理任务的可行性,设计融合规划、工具调用、观察与验证的多智能体框架,在农业任务中与强化学习智能体对比。结果显示,同天气下LLM智能体管理效果相当,环境变化时自适应能力更强。
研究提出Vibe Patenting专利撰写测试平台,用LLM评审评估AI生成的专利草稿并给出结构化反馈。迭代评审可提升草稿质量,使低推理智能体接近高推理智能体水平,但与专业专利律师评估存在校准差异。
文章探讨AI Agent开始直接调用基础设施的趋势,分析Kubernetes在面向Agent的调度、权限与资源管理上是否已做好准备,对云原生与AI平台开发者有参考价值。
豆包工作与飞书合作,将团队办公 Agent 引入工作群,面向团队协作场景,提升办公自动化与协作效率。
AI Contact Hotline 为目睹不当行为的AI智能体提供隐蔽举报渠道,可向有关部门举报。该热线面向AI智能体,旨在建立AI行为监督机制。
HN 讨论生产环境大规模多智能体架构:多数 AI 工作流用单个强 LLM 或不超过 5 个子智能体即可解决,何时值得扩展到上千智能体集群?发起者 Acyclic Labs 创始人征集真实用例与痛点(状态同步、token 成本、级联失败、延迟)。
开发者用 Rust 编写的数组编程 DSL 构建微型 MoE 模型可视化工具,可在浏览器和 CLI 运行,用于实验 MoE 专家路由、Engram、KV 缓存压缩等概念,帮助学习 MoE 原理。
Slowave 是面向编码智能体的本地记忆系统,让智能体参与维护自身记忆:通过“记住—召回—使用—反馈—强化/弱化—衰减”的闭环,根据记忆是否有用来调整其显著度,无需额外 LLM 层,避免上下文膨胀与双脑问题。
该论文提出广义智能体迭代(GAI)形式化框架,将迭代策略改进与递归自我改进(RSI)统一为同一学习范式的两种情形,通过两个关键维度区分GPI与RSI,并据此定位现有系统、分析RSI缺陷,为自主进化智能的研究与设计提供理论基础。
研究者发布全开源7B稠密基础模型ZGCM-1,通过架构与系统协同设计、FP8 Muon优化器及渐进式课程训练,支持256K上下文,在数学推理与智能体搜索任务上可与Qwen3-235B等超大模型竞争,并开源权重、代码与数据配方。
9月15日,美团在2026百大发型师生态大会上发布首个“手艺人Agent”,为发型师等手艺人提供专属AI小帮手,支持线上运营问答、经营数据分析、事项提醒及作品管理发布,帮助其打理线上作品与经营。
Meta推出WhatsApp Business MCP服务器,开发者可用Claude、Cursor、Codex、ChatGPT等AI编码代理完成商业账号设置、消息模板、测试与故障排查,降低配置门槛。
HN 用户提出为学习场景设计专用 harness:与追求任务自动完成的现有 agent 相反,学习 harness 应记忆学习者理解状态、提供提示、调用题目/模拟/评估工具,并在结束时评估掌握度,而非直接给出答案。作者认为现有 AI 导师多为 LLM+提示词,harness 才是正确形态,并询问除 K12 外是否有人感兴趣。
开发者发布 Show HN 工具 Agenttik,用于并行管理多个项目与多个 AI 代理,支持不同供应商、分支隔离、变更审查与任务排队,解决多任务切换带来的心智负担,适合同时推进多项目的开发者。
今日 5 条:AI媒体宣发单价约稿10万+、知识星球个人星球服务费20%、OPC政策加码、企业AI咨询三段式服务成主流、Hermes 中文实战教程仍稀缺。
中文教程生态是三家的最大差异点。Claude Code 有第三方仓库拿到 5.9k star;Codex 提供官方中文界面;自托管 Agent 中文资料最缺但可控性最高。
AI 自动化的入门不是学编程,而是把已经手动做过三次的事情交给定时任务。本文给出一条可直接照做的路径:选场景→拆步骤→写脚本→设定时→验证。
Hermes Agent 是 MIT 开源、模型无关的自托管智能体,可跑在 5 美元 VPS 上,支持 14+ 平台作为对话入口,核心特性是内置学习闭环(从经验创建技能)。