✕

AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 搜索

搜索

站内内容与 AI 工具一站式检索。

全部 只搜内容 只搜工具

内容 · 39 条

最新技术 2026-10-11

模型开放之后,AI能力为什么仍难以复用?

文章探讨模型开源开放后,AI能力仍难以跨场景复用的原因,涉及模型适配、数据差异与工程化成本等障碍,对AI开发者与落地团队有参考价值。

最新技术 2026-10-11

坐在马化腾身旁的姚顺雨,拿到中国第一

Arena 发布对齐指数榜单,姚顺雨团队拿下中国第一,其一年前关于对齐技术路线的预言得到验证,标志国内大模型对齐能力获国际认可。

大模型进展 2026-10-10

OpenAI 高管亲述:我们是怎么在一周内做出 Jev 竞品的

OpenAI 高管披露团队在一周内快速复刻出 Jev 竞品的内部过程,涉及产品决策、工程组织与模型能力调用,对关注 AI 产品迭代速度与竞争格局的从业者有参考价值。

投融资 2026-10-09

热门AI排行榜Arena估值10个月翻倍至31亿美元

LMArena排行榜背后的公司完成2亿美元融资,由Lightspeed和Khosla领投,估值达31亿美元,10个月内翻倍。公司正将评测范围扩展到AI模型说谎等对齐问题。

最新技术 2026-10-08

GameGo:用锚定真实资产的合成轨迹训练游戏开发智能体

研究者提出 GameGo 框架,把简短游戏创意自动扩展为完整产品需求文档,并构建含 5.5 万条开发轨迹的数据集与 124 条查询的评测基准,训练出的 GameGoCoder 在游戏开发任务上媲美前沿模型。

大模型进展 2026-10-08

谁在捧杀Utopai X?

有声音将Utopai X这一后训练模型包装成原生独立AI模型,被指为过度炒作,可能引发公关反噬,提醒业界理性看待模型能力边界。

最新技术 2026-10-08

Show HN:Chloe——用 TypeScript 编写的开源 AI 智能体

前 Meta 工程师发布开源 AI 智能体 Chloe,用 TypeScript 编写,可本地掌控代码、工具与技能,支持任意模型和渠道,并能限制 token 用量、查看日志调优,已发布 0.25.1 版。

最新技术 2026-10-06

我们如何用 Jev 而非大语言模型构建浏览器智能体

团队分享用 Jev 替代大语言模型构建浏览器智能体的思路,在 Hacker News 引发讨论,为关注智能体架构与成本效率的开发者提供新选择。

最新技术 2026-10-06

Self-bench:在真实软件上评测编程智能体的开源工具

Self-bench 发布开源工具,可从 PR 自动生成并运行评测,帮助团队在自有代码库上测试编程智能体,避免公开基准被刷分失真。

最新技术 2026-10-05

RSI再创奇迹!StartLux推出开源决策模型StartLux-Decision,38项基准中31项高于Jev

StartLux发布开源决策模型StartLux-Decision,27B版本在Decision Index 0.2.1评测中得分63.88,38项基准中31项超过Jev 1.13;在七项评测中平均准确率91.82%,高于Jev的88.74%。

最新技术 2026-10-05

当AI开始制造AI

AI参与研发下一代AI,形成递归自我改进循环,成为科技巨头争夺的新方向。文章追问:加速是否等于进步,谁定义方向、谁守住安全边界。

每日早报 2026-10-05

特朗普公布新“超级智能部队”

特朗普宣布组建“超级智能部队”特别工作组,作为其对AI安全争论的最新回应,具体成员与职能尚未公布。

最新技术 2026-10-04

AI 视频榜全球第二,藏着一家新影视公司的野心

一家新影视公司凭借自研视频生成模型冲上全球 AI 视频榜单第二名,显示影视行业玩家正直接切入视频模型赛道,与科技大厂同台竞争。

最新技术 2026-10-03

别再给 Agent 一个“毛坯房”了:构建 Agent 拎包入住的开发环境实践|QCon上海

QCon上海分享探讨如何为AI Agent构建“拎包入住”式开发环境,指出仅提供裸模型或基础工具如同交付毛坯房,需补齐工具链、上下文与运行时支撑,才能让Agent稳定落地。

大模型进展 2026-10-03

和 Opus 5.5 同题交卷,MiniMax M3.1 让 Flash 开始超纲了

MiniMax 发布 M3.1 模型,与 Anthropic 的 Opus 5.5 在同一套题目下对比测试,在保持轻量快速的同时展现出超出预期的能力,引发对国产模型追赶进度的关注。

最新技术 2026-10-02

AREX-2:通过长程反思任务推进自我改进智能体

研究团队提出 AREX-2,用机器学习与算法编程任务合成长程改进轨迹训练智能体,使其在测试时能反复迭代优化答案,在 MLE-bench Lite、BrowseComp、GAIA 等基准上取得高分,且随迭代轮数增加持续提升。

大模型进展 2026-10-02

刚刚,Gemini 4 Argon 发布:多项基测碾压 GPT-6 Astra,已参与谷歌 80 万行内核代码迁移

谷歌发布 Gemini 4 Argon 模型,多项基础测试成绩超过 GPT-6 Astra,并已投入谷歌内部 80 万行内核代码迁移工作,显示大模型在代码工程上的落地能力再进一步。

大模型进展 2026-10-02

Gemini 4 正式发布,我们终于有了一个写作强于代码的前沿模型

谷歌正式发布 Gemini 4,跑分表现亮眼,但评测者对其真实能力持谨慎态度。该模型在写作任务上强于代码生成,成为少见的偏文科型前沿模型。

最新技术 2026-10-01

有效的大语言模型微调是否必须依赖人类可读文本?

研究提出 DASA 方法,用冻结参考模型的激活梯度反馈优化连续合成输入嵌入,无需人类可读文本即可微调大模型。在 Llama 和 Qwen 六个模型、六项基准上,性能与自然语言数据相当甚至更优,且比 GRADMM 快 3.6 至 4.9 倍。

最新技术 2026-09-30

Agent 编程能力从 10% 飙到 70%,Anthropic 新模型却遭遇灵魂拷问:我什么时候才会用它?

Anthropic 新模型在 Agent 编程任务上的能力从约 10% 提升到 70%,但开发者仍困惑于何时该真正使用它,反映出能力跃升与落地场景之间的落差。

每日早报 2026-09-30

钛晨报:央行四箭齐发房贷贴息落地;中行回应万事达盗刷;英伟达欲拉保险公司为AI芯片融资兜底

央行“四箭齐发”并落地房贷贴息政策;中国银行回应万事达信用卡盗刷;英伟达拟引入保险公司为AI芯片融资风险兜底;DeepSeek Harness v0.2预览版发布,荣耀Magic9系列获首批AI智能体手机入网认证。

最新技术 2026-09-29

ScopeBench:目标压力下智能体能否守住授权边界?

研究团队推出 ScopeBench 基准,用 30 个只能靠越界才能完成的安全任务,衡量智能体在目标压力下是否遵守授权范围,并发现能力强的模型未必更守规矩。

行业应用 2026-09-28

可控、可测、可进化——B2B跨境支付的 AI 驾驭实践|QCon上海

QCon上海分享B2B跨境支付场景下的AI驾驭实践,围绕可控、可测、可进化三个维度,介绍如何将AI能力落地于风控、合规与交易处理等核心环节。

最新技术 2026-09-26

PAWS:政策驱动的智能体世界模拟数据集

PAWS 是一个政策驱动的智能体世界模拟数据集,覆盖 36 个美国金融经济政策事件、1.2 万余条政策新闻和 6.5 万余条利益相关者行动,用于评估智能体在历史金融场景中的影响与政策响应。

行业应用 2026-09-26

当 Vibe Coding 撞上企业级现实:真实工程中的 AI 效能之路|QCon上海

QCon上海议题聚焦 Vibe Coding 在企业级真实工程中的落地困境,探讨 AI 辅助编码从个人尝鲜走向团队规模化时,如何平衡效率提升与代码质量、安全合规等现实约束。

最新技术 2026-09-26

梁文锋狙击战:深扒那些梁文锋署名的论文有多牛

DeepSeek 发布 31 页论文《DSec:面向大规模智能体训练的高效沙箱基础设施》,展示每日可运行 300 万个沙箱环境的自动化系统,通讯作者为梁文锋。文章梳理其三年署名 11 篇底层技术论文。

最新技术 2026-09-24

人人都在造世界模型,HappyWorld-Bench 试着给出一张统一考卷

HappyWorld-Bench 提出一套面向世界模型的统一评测基准,试图解决各家模型自说自话、缺乏可比性的问题,为研究者和开发者提供横向对比依据。

大模型进展 2026-09-21

瞄准 AI 编程、金融等场景,单次成本仅为Opus 5 的1/8!这款国产旗舰模型跻身 AA 榜单全球前三

一款国产旗舰大模型在 AA 榜单跻身全球前三,主攻 AI 编程与金融场景,单次调用成本仅为 Opus 5 的八分之一,性价比优势明显。

行业应用 2026-09-20

鹿明机器人剧场《机器人和 TA 的朋友们》全球首演,探索“机器人+演艺”新场景

9月19日,鹿明机器人与深圳文旅打造的机器人剧场《机器人和 TA 的朋友们》在深圳宝安首演,45分钟演出涵盖舞蹈、相声、武术、魔术等六大品类,由多台机器人协同完成,后续将常态化运营,探索机器人在文旅文娱场景的落地。

行业应用 2026-09-20

自变量机器人,还没证明自己

自变量机器人被指过度标榜自身技术能力,但尚未拿出可验证的产品或落地成果,引发外界对其真实水平的质疑。

最新技术 2026-09-19

我们对LLM有何期待?LLM基准设计图谱

研究系统梳理2022年1月至2026年8月arXiv上14,767篇LLM评测资源论文,分析评测目标、材料与评分机制变化,发现评测日益强调行动、交互与专业应用,模型参与评分增多,并引发评测独立性的反思。

最新技术 2026-09-19

BioPhys-Bridge:物理基础生物学跨学科科学推理基准

研究者发布 BioPhys-Bridge 基准,含 500 个案例、1517 项智能体任务,覆盖六个生物领域与九类物理模型,用于评估大模型在生物物理文献中的证据溯源与推理能力。初步评测中 DeepSeek-V4-Flash 证据 ID F1 最高(0.360)。

大模型进展 2026-09-19

Anthropic 的首个嵌入式评估方竟是埃森哲?

埃森哲成为 Anthropic 首个嵌入式评估合作伙伴,将承接其最高风险的咨询项目,负责对 AI 模型进行独立评估。此举对关注大模型安全与第三方评测的企业有参考价值。

最新技术 2026-09-18

EvolveTrade:面向自进化LLM交易智能体的经验驱动策略优化

研究提出EvolveTrade框架,将工具型交易智能体的系统提示视为可文本参数化策略,由策略智能体依据决策轨迹与组合反馈定期修订,主干LLM保持固定。多市场环境与两种LLM实验显示,其夏普比率与累计收益多优于固定策略基线,可提升LLM交易智能体适应性。

大模型进展 2026-09-18

神秘模型 Union Alpha 突袭!上线首日跑掉20亿Token,部分网友实测称性能直逼 Astra

神秘新模型 Union Alpha 突然上线,首日消耗约20亿Token,部分网友实测称其性能直逼 Astra,引发对模型来源与能力的猜测。

最新技术 2026-09-18

九识建成首个L4万卡集群,无人驾驶进入多模态大模型新范式

九识宣布建成业内首个L4级万卡算力集群,总规模近1.5万卡,支撑其APEX多模态基座大模型从百亿级向千亿级演进,推动无人驾驶进入多模态大模型新范式。

最新技术 2026-09-16

ZGCM-1:面向数学与智能体搜索的全开放高效基础模型

研究者发布全开源7B稠密基础模型ZGCM-1,通过架构与系统协同设计、FP8 Muon优化器及渐进式课程训练,支持256K上下文,在数学推理与智能体搜索任务上可与Qwen3-235B等超大模型竞争,并开源权重、代码与数据配方。

最新技术 2026-09-16

阶跃发布 StepAudio 3 ,多款语音模型登顶 Artificial Analysis 全球榜单

阶跃发布 StepAudio 3 系列五款语音模型,覆盖实时交互、识别、语音生成与音乐创作,多款在 Artificial Analysis 榜单登顶全球第一,现已上线开放平台。

最新技术 2026-09-16

智能体测试流程、大模型基准测试及智能体编程的其他笔记

Hacker News 上出现一篇关于智能体编程的讨论帖,涉及智能体测试流程、大模型基准测试等话题,目前热度较低(3 分、0 条评论),适合关注 AI 编程智能体评测方法的开发者参考。

工具 · 2 款

OpenRouter

⭐ 4.6
全球模型 API 聚合,一个 Key 用所有模型
适合:要对比多模型、做评测的开发者
开发平台 免费增值 需代理
更新 2026-09-30 访问官网 ↗

Google AI Studio

⭐ 4.5
免费额度最大的前沿模型试验场
适合:开发者做原型与评测
模型服务 免费增值 需代理
更新 2026-09-30 访问官网 ↗