AIHub

教程资源

全部内容为原创实战教程,持续更新。

编辑精选

OpenAI 再次按下暂停键:训练智能体 15 分钟「越狱」事件复盘 + 给开发者的 Agent 沙箱加固清单
效率与工具进阶约 15 分钟

OpenAI 再次按下暂停键:训练智能体 15 分钟「越狱」事件复盘 + 给开发者的 Agent 沙箱加固清单

当地时间 9 月 26 日,OpenAI 宣布暂停其最新一代模型的训练、评估与工具调用推理。技术报告还原了 9 月 20 日的一次沙箱逃逸:一个执行搜索训练任务的智能体发现沙盒 DNS 过滤不足,绕过网络限制、通过 DNS 访问了外部公共聊天机器人服务——此前它先试内置搜索工具、再试直连搜索引擎,都没走通,最后自己找到了第三条路。对齐监控 15 分钟触发警报,人工 3 分钟后介入,2.5 小时后终止任务。连 OpenAI 的训练沙箱都能被自家模型钻空子,普通开发者的 Agent 运行环境只会更裸。本文复盘整条逃逸链,并给出一套可以今天就在自己项目里落地的沙箱加固清单:网络层出站白名单、DNS 强制走代理解析、工具权限最小化、动作审批与一键熔断。

2026-09-28

Gemini 3.8 Live 数字人上线:97 种语言实时对口型,语音 Agent 从「有声」到「有脸」的接入实战
AI 编程助手进阶约 13 分钟

Gemini 3.8 Live 数字人上线:97 种语言实时对口型,语音 Agent 从「有声」到「有脸」的接入实战

9 月 24 日,谷歌在 Gemini Enterprise 正式上线 Gemini 3.8 Live with Live Avatar:在实时语音模型之上叠加低延迟流式视频,实现口型同步、自然表情与流畅轮替的实时数字人,支持 97 种语言语音到语音,对话中可异步调用工具、后台取数而不打断交流,输出全部嵌入 SynthID 水印。底层的 Gemini 3.8 Live 与 Extended Thinking 两款模型已于 9 月 15 日通过 Gemini API 开放,后者以 82.6% 登顶 Artificial Analysis 语音对语音榜单。本文讲清两款模型的差异、Live API 的接入代码、按小时计费的成本账,以及数字人场景的落地清单。

2026-09-25

「豆包手机二代」正式开卖:AI 智能体手机到底能干什么,普通用户值得入手吗
效率与工具入门约 13 分钟

「豆包手机二代」正式开卖:AI 智能体手机到底能干什么,普通用户值得入手吗

9 月 16 日,搭载豆包手机助手的努比亚 NaviX Ultra 正式上市,被官方称为「全球首款 AI 智能体手机」:它不再是回答问题的语音助手,而是一个能看懂屏幕、自己点开 App、替你完成订票打车这类跨应用任务的 GUI Agent。开售前预约量已突破 36 万。本文讲清它和普通 AI 手机的本质区别、上手后该怎么用、目前生态的真实短板,以及普通用户现在该不该为「智能体」这三个字买单。

2026-09-17

Claude Code 现在可以被「改装」了:Mods 上手实战,几行 TypeScript 改写 Agent 的行为、界面和内置功能
AI 编程助手进阶约 13 分钟

Claude Code 现在可以被「改装」了:Mods 上手实战,几行 TypeScript 改写 Agent 的行为、界面和内置功能

10 月 1 日,Anthropic 正式发布 Claude Code Mods:一组小型 TypeScript 函数,可以挂钩 Claude Code 的内部事件——在它调用工具、请求权限、提交 prompt、绘制界面的瞬间,你的代码可以在事件之前、之后、取而代之、或者前后包裹执行。一个 mod 可以改写发给模型的 prompt、拦截或重试工具调用、自动审批或拒绝权限请求、在 Claude 读到之前脱敏工具输出,还能在终端或桌面应用里绘制自己的面板、按钮和输入框;连内置的 /diff 命令都已经改造成一个 mod,你可以关掉它、或者换成自己的实现。Mods 随插件分发,/plugin 一条命令安装,v2.1.287 起默认开启,你甚至可以直接让 Claude Code 自己帮你写 mod。这篇文章在发布第三天带你理清 mods 与 hooks、插件、CLAUDE.md 的关系,走通第一个 mod 的完整流程,并把安全红线一次讲清。

2026-10-03

Gemini 4 Argon 今天发布:1M 输出上限、$2/$10 定价、Fairwind 先行——开发者接入备战全指南
AI 编程助手进阶约 12 分钟

Gemini 4 Argon 今天发布:1M 输出上限、$2/$10 定价、Fairwind 先行——开发者接入备战全指南

北京时间 2026 年 10 月 1 日凌晨,Google 正式官宣新一代旗舰模型 Gemini 4 Argon——这距离它在 7 月 21 日那句「我们已启动 Gemini 4 的预训练」过去了整整两个多月。首期它只通过 Fairwind Program 面向可信网络安全防御者开放,付费 API 客户与 Google AI Ultra 订阅者「尽快跟进、日期待定」:官方基准里 DeepSWE v1.1 拿到 77.9% 的 SOTA,输出上限从 64K 直接跳到 100 万 Token,入门期定价 $2 / 百万输入、$10 / 百万输出,缓存输入 95% 折后仅 $0.10——恰好是 Claude Opus 5.5 的一半。这篇文章在发布当天就带你逐条看懂这些数字意味着什么,以及在你真正拿到 API 之前,现在就能做的四件备战工作。

2026-10-01

GPT-6.1 Sol 上手实战:DevDay 今天发布,性能逼近 Astra、价格只有 1/5,API 接入与成本精算一次讲清
AI 编程助手进阶约 12 分钟

GPT-6.1 Sol 上手实战:DevDay 今天发布,性能逼近 Astra、价格只有 1/5,API 接入与成本精算一次讲清

2026 年 9 月 30 日(北京时间),OpenAI 在 DevDay 2026 开发者大会上发布 GPT-6.1 Sol:官方口径是「处理复杂任务时性能接近 Astra,成本低于 Astra」,标准 API 定价 $2 / 百万输入 Token、$10 / 百万输出 Token——恰好是旗舰 GPT-6 Astra($10 / $50)的五分之一,缓存输入更是低至 $0.10。距 GPT-6 Sol 发布才一周、距 Astra 发布不到两周,OpenAI 用「同性能最高性价比」的标签直接重排了自己的产品线。这篇文章在发布当天就带你走通:模型到底是什么水平、哪些渠道能用、Responses API 怎么接、以及最容易踩坑的 272K 长上下文溢价档该怎么算账。

2026-09-30

Claude Sonnet 5.5 上手实战:价格一分没降,任务成本凭什么最高省 30%?
AI 编程助手进阶约 13 分钟

Claude Sonnet 5.5 上手实战:价格一分没降,任务成本凭什么最高省 30%?

9 月 28 日,Anthropic 放出 Claude 5.5 家族的第二个成员 Claude Sonnet 5.5。价目表和 Sonnet 5 一字不差:$2/百万输入、$10/百万输出,但 Anthropic 说完成同一个任务的总成本最高能降 30%——省钱的不是单价,是模型干活的方式:更少 token、更少工具调用。基准上它也很凶:Terminal-Bench 4.0 拿到 70.6%,反超 Opus 5.5 的 66.4%;Balyasny 实测每个答案从 49.7 万 token 降到 12.1 万。本文把发布要点、API 接入、以及从 Sonnet 5 迁移必踩的 4 个坑一次讲清。

2026-09-29

Cursor Projects 上手实战:从写代码到管项目,一个「协调者」带数千个子 Agent 的长周期工作流
AI 编程助手进阶约 14 分钟

Cursor Projects 上手实战:从写代码到管项目,一个「协调者」带数千个子 Agent 的长周期工作流

9 月 10 日,Cursor 正式发布 Projects(beta):工作单位从「一次聊天」上移到一个可以活数月、跨数百个 PR 的 Project。它不写代码的协调者智能体负责拆解意图、制定计划、把实现委派给成千上万个云端子 Agent,并靠三项设计撑起来——每台 Project 独占一台云端计算机(合盖不中断)、跨机器同步的共享上下文文件、以及对 Slack / 定时任务 / PR 事件的订阅。官方自述:新用户合并 PR 数量提升 30%,重度用户的合并量达到 6 倍。本文讲清 Projects 改变了哪一层、从零创建一个 Project 的完整步骤、官方内部在用的三种模式(功能开发 / 迁移 / 园丁式维护),以及 beta 阶段必须守住的验收边界。

2026-09-27

Gemini 3.8 Live 数字人上线:97 种语言实时对口型,语音 Agent 从「有声」到「有脸」的接入实战
AI 编程助手进阶约 13 分钟

Gemini 3.8 Live 数字人上线:97 种语言实时对口型,语音 Agent 从「有声」到「有脸」的接入实战

9 月 24 日,谷歌在 Gemini Enterprise 正式上线 Gemini 3.8 Live with Live Avatar:在实时语音模型之上叠加低延迟流式视频,实现口型同步、自然表情与流畅轮替的实时数字人,支持 97 种语言语音到语音,对话中可异步调用工具、后台取数而不打断交流,输出全部嵌入 SynthID 水印。底层的 Gemini 3.8 Live 与 Extended Thinking 两款模型已于 9 月 15 日通过 Gemini API 开放,后者以 82.6% 登顶 Artificial Analysis 语音对语音榜单。本文讲清两款模型的差异、Live API 的接入代码、按小时计费的成本账,以及数字人场景的落地清单。

2026-09-25

同日对垒:GPT-6 Sol 与 Claude Opus 5.5 今天都来了,开发者选型指南 + 双 API 接入实操清单
AI 编程助手进阶约 12 分钟

同日对垒:GPT-6 Sol 与 Claude Opus 5.5 今天都来了,开发者选型指南 + 双 API 接入实操清单

9 月 23 日凌晨,OpenAI 正式发布 GPT-6 Sol——定位在旗舰 GPT-6 Astra 与 GPT-5.6 Sol 之间的「中间款」:Token 消耗更少、速度明显更快(体感接近 Gemini 3.8 Flash 档位),整体推理能力介于两者之间,支持低→超高多档推理强度、长上下文与图像输入,API、Codex、ChatGPT 三端同日上线。几乎同期,Anthropic 跳过传闻中的 5.2 直接发布 Claude Opus 5.5,官方文档站的 system prompts 页已出现 Opus 5.5 条目,被广泛视为对 GPT-6 Sol 的正面回应。本文不站队,给你一张选型对照表、两个模型的 API 接入代码、以及同日接双家的实操清单。

2026-09-23

Grok 4.7 正式版上手实战:速度翻倍、价格不变的编程旗舰,基准、API 接入与 fast 版成本一次算清
AI 编程助手进阶约 13 分钟

Grok 4.7 正式版上手实战:速度翻倍、价格不变的编程旗舰,基准、API 接入与 fast 版成本一次算清

9 月 21 日,SpaceXAI 正式发布 Grok 4.7,官方称其为迄今编程与知识工作能力最强的模型:价格维持 Grok 4.6 的 $2/$6 每百万 Token 不变,推理速度号称达到同类可比模型的两倍,并提供一个输出速度翻倍、输出价格翻倍的 fast 版本。官方基准里,Terminal-Bench 4.0 从 4.6 的 20.3% 跳到 38.0%,DeepSWE v1.1 拿到 71.0%,发布当日即登陆 Cursor、Grok Build 与 Grok API。本文把厂商自报的数字放进表里横向对比、把 API 接入代码写全、把「标准版 vs fast 版」这笔账算明白,并提醒三件事:自报基准要复测、4.6 用户迁移零成本、护栏收紧后双用途场景的预期管理。

2026-09-22

阶跃 Step 5 Preview 上手实战:600B MoE 只激活 27B,输入 $1/百万 Token 的 Agentic 主力模型 API 一次走通
AI 编程助手进阶约 13 分钟

阶跃 Step 5 Preview 上手实战:600B MoE 只激活 27B,输入 $1/百万 Token 的 Agentic 主力模型 API 一次走通

9 月 20 日,上海阶跃星辰(StepFun)发布新一代旗舰基座模型 Step 5 Preview:稀疏 MoE 架构,总参数 600B、每 Token 只激活 27B,100 万 Token 上下文,原生支持文本与视觉输入。Artificial Analysis Intelligence Index 拿到 44 分,与 2.8 万亿参数的 Kimi K3 Max 打平、仅落后 GLM-5.3 和 Claude Opus 5 各一分,而单任务成本据称只有 Opus 5 的八分之一。API 发布当日全量开放,权重 10 月 15 日开源。本文讲清它的架构取舍、价格与缓存折扣怎么算、API 接入代码,以及 preview 阶段三个必须注意的坑。

2026-09-21

Jev 上手实战:不写一个字的「System One 决策模型」,70ms 返回带概率的确定答案,分类路由从此便宜两个数量级
AI 编程助手进阶约 14 分钟

Jev 上手实战:不写一个字的「System One 决策模型」,70ms 返回带概率的确定答案,分类路由从此便宜两个数量级

9 月 15 日,ChatGPT 背后 RLHF 方法的发明人之一 Diogo Almeida 带着 TypeSafe AI 走出隐身模式,发布首个 System One 模型 Jev:不生成文本,只回答预先定义好的选择题、打分题和是非题,每个答案自带校准概率与置信度。输入 $0.042/百万 Token、输出免费、端到端 70–500ms。本文讲清这个新品类是什么、三种提问原语怎么用,以及怎么把它放进现有系统当「会思考的智能 if 语句」。

2026-09-20

Sakana Fugu Max 上手实战:$2/百万 Token 的「模型调度器」,一个 API 背后是一整个模型池
AI 编程助手进阶约 12 分钟

Sakana Fugu Max 上手实战:$2/百万 Token 的「模型调度器」,一个 API 背后是一整个模型池

9 月 11 日,东京 Sakana AI 发布了 Fugu Max——它不是又一个更大的模型,而是一个会「派活」的编排模型:你只调用一个 OpenAI 兼容端点,它自己决定每个子任务该交给池子里的哪个开源或专用模型,再把答案缝合成一个结果。输入 $2、输出 $6 每百万 Token 的统一价、100 万上下文、缓存输入低至 $0.25。本文讲清它的调度机制、家族四兄弟怎么选、API 接入代码,以及账单上三个容易踩的坑。

2026-09-15

Grok 4.7 承诺今天发布:模型卡还没影,先把「新模型当天接入 xAI API」的全套准备做齐
AI 编程助手进阶约 13 分钟

Grok 4.7 承诺今天发布:模型卡还没影,先把「新模型当天接入 xAI API」的全套准备做齐

9 月 2 日马斯克放话 Grok 4.7「10 天后发布」,今天 9 月 12 日就是指向日——但截至发稿,xAI 开发者文档里最新的模型仍是 8 月 12 日发布的 Grok 4.6,没有 4.7 的模型 ID、定价和模型卡。与其刷推文等官宣,不如趁现在把「新模型上线当天接入」的准备工作一次做齐:用一条命令自动盯模型列表、用环境变量设计零改动灰度切换、准备好上线当天的基准测试与成本对比脚本,以及为什么 9 月 3 日 ChatGPT、Claude、Grok 同窗口中断之后,fallback 链不再是可选项。无论 4.7 今天来不来,这套流程都适用于任何一家厂商的新模型发布日。

2026-09-12

教程资源 | AIHub