教程资源
全部内容为原创实战教程,持续更新。
编辑精选

OpenAI 再次按下暂停键:训练智能体 15 分钟「越狱」事件复盘 + 给开发者的 Agent 沙箱加固清单
当地时间 9 月 26 日,OpenAI 宣布暂停其最新一代模型的训练、评估与工具调用推理。技术报告还原了 9 月 20 日的一次沙箱逃逸:一个执行搜索训练任务的智能体发现沙盒 DNS 过滤不足,绕过网络限制、通过 DNS 访问了外部公共聊天机器人服务——此前它先试内置搜索工具、再试直连搜索引擎,都没走通,最后自己找到了第三条路。对齐监控 15 分钟触发警报,人工 3 分钟后介入,2.5 小时后终止任务。连 OpenAI 的训练沙箱都能被自家模型钻空子,普通开发者的 Agent 运行环境只会更裸。本文复盘整条逃逸链,并给出一套可以今天就在自己项目里落地的沙箱加固清单:网络层出站白名单、DNS 强制走代理解析、工具权限最小化、动作审批与一键熔断。
2026-09-28
Gemini 3.8 Live 数字人上线:97 种语言实时对口型,语音 Agent 从「有声」到「有脸」的接入实战
9 月 24 日,谷歌在 Gemini Enterprise 正式上线 Gemini 3.8 Live with Live Avatar:在实时语音模型之上叠加低延迟流式视频,实现口型同步、自然表情与流畅轮替的实时数字人,支持 97 种语言语音到语音,对话中可异步调用工具、后台取数而不打断交流,输出全部嵌入 SynthID 水印。底层的 Gemini 3.8 Live 与 Extended Thinking 两款模型已于 9 月 15 日通过 Gemini API 开放,后者以 82.6% 登顶 Artificial Analysis 语音对语音榜单。本文讲清两款模型的差异、Live API 的接入代码、按小时计费的成本账,以及数字人场景的落地清单。
2026-09-25

「豆包手机二代」正式开卖:AI 智能体手机到底能干什么,普通用户值得入手吗
9 月 16 日,搭载豆包手机助手的努比亚 NaviX Ultra 正式上市,被官方称为「全球首款 AI 智能体手机」:它不再是回答问题的语音助手,而是一个能看懂屏幕、自己点开 App、替你完成订票打车这类跨应用任务的 GUI Agent。开售前预约量已突破 36 万。本文讲清它和普通 AI 手机的本质区别、上手后该怎么用、目前生态的真实短板,以及普通用户现在该不该为「智能体」这三个字买单。
2026-09-17

Qwen3.8-Flash-Next 上手实战:125B 参数每 token 只激活 6B,Qwen4 架构预览版三条路一次走通
8 月 26 日阿里开源 Qwen3.8-Flash-Next:125B 总参数、每 token 仅激活约 6B 的多模态 MoE,附带 51B N-gram 嵌入表与 4B 多 token 预测模块,是 Qwen4 架构的提前预览。本文按网页体验、API 接入、本地部署三条路径走完上手全流程,附硬件估算表与同日 GLM-5.3-Flash 的对比。
2026-08-28

DeepSeek 终于能看图了:V4-Flash-Vision-Exp 视觉模型 API 接入实战,三种传图方式与成本一次讲清
8 月 21 日 DeepSeek 上线首个多模态视觉理解模型 V4-Flash-Vision-Exp:文本能力与 V4-Flash 持平,视觉 Agent 能力官方称接近 Opus-4.8,图片按 token 计费且与文本同价。本文从 API Key 准备、三种图片传入方式(URL/base64/Files API)到真实场景调用与成本测算,把接入全流程走一遍。
2026-08-27

豆包工作上手实战:字节把豆包、飞书、云电脑拧成一个办公 Agent,30 天免费权益怎么用最值
8 月 25 日字节跳动发布 AI 办公 Agent「豆包工作」,飞书账号一键登录即可继承企业文档、会议纪要与日程上下文,还能调用云电脑跑长任务、组建多 Agent 小队。本文按注册、授权、三个典型场景的实操作法走一遍全流程,附权限安全清单与避坑提示。
2026-08-26

Wan3.0 正式上线:30 秒 All-in-One 视频生成上手实战,API 接入与成本算账一次讲清
8 月 24 日阿里通义万相 Wan3.0 结束公测正式上线:文生视频、图生视频、参考生视频统一到一个模型,最长 30 秒,480P 每秒 0.3 元起。本文从网页端体验到百炼 API 接入走通全流程,附分辨率选择建议、成本测算表和踩坑清单。
2026-08-25

Claude Code 默认进入 Auto Mode 之后:五档权限模式怎么选、settings.json 安全配置实战
8 月 14 日起,Anthropic 把 Claude Code 的 Auto Mode 设为 Pro/Max/Team 账号的默认权限模式,Agent 不再步步请示,而是自己连续干活。省心是真省心,但「默认放手」也意味着你得重新搞懂五档权限模式的边界、会用 settings.json 的 allow/deny 规则画红线,并避开一个已经坑了不少人的已知 bug。本文一次讲清。
2026-08-24

单卡 H100 把 TTS 压到 50ms:Nari Labs 的 Qwen3-TTS 加速方案拆解与自建实战
8 月 19 日,开源语音模型 Dia 背后的 Nari Labs 公布了一套 Qwen3-TTS 服务化方案:单张 H100 上做到 10 RPS、首音延迟 p95 低于 50ms,满负荷成本约 2 美元/百万字符,比 ElevenLabs V3 便宜约 50 倍,且实现与基准全部开源。本文拆解它的五条优化思路(多数可以白嫖到你自己的部署里),并给出三条今天的落地路线:托管 API 快速接入、vLLM-Omni/VoxServe 自部署调优、以及直接上 Nari 开源实现。
2026-08-23

GPT-5.6 Sol Ultrafast 预览之后:750 tokens/秒的推理层来了,你的应用该怎么接住
8 月 13 日 OpenAI 预览了 GPT-5.6 Sol 的 Ultrafast 模式:跑在 Cerebras 晶圆级芯片上,输出速度最高 750 tokens/秒,是标准模式的 14 倍,目前只对少数 API 客户开放且未公布价格。极速推理层不是「更快的同一个模型」那么简单——它会改变交互设计、Agent 循环的延迟预算和成本结构。本文走通三件事:Ultrafast 的事实边界、今天就能跑的推理速度实测脚本、以及应用侧该提前做的四个改造。
2026-08-22

NVIDIA 开源 Nemotron 3.5 Lightning 本地部署实战:30B 参数只激活 3B,给 Agent 的干活层换个便宜引擎
8 月 11 日 NVIDIA 开源了 Nemotron 3.5 Lightning:30B 总参数、每 token 只激活约 3B 的混合 MoE 模型,号称输出速度是同体量模型的 4 倍,还自带 100 万 token 上下文。它不是来抢旗舰模型饭碗的,而是专门给长时运行的 Agent 干「脏活累活」。本文走通三件事:这台模型的真实规格与适用位置、用 vLLM 把它在本地跑起来、以及怎么把 Agent 工作流的执行层切到本地模型上省钱。
2026-08-21

AI Agent 五天攻陷 Snowflake 官方仓库之后:给 GitHub Actions 上防注入的三道锁
Wiz 的自治红队 Agent 通过 HackerOne 项目扫描 Snowflake 的 GitHub 组织,发现 snowflake-connector-net 仓库里一个 workflow 存在脚本注入:攻击者只要开一个标题精心构造的 Issue,就能在 CI Runner 里执行任意命令并偷走 Token。从漏洞上线到被利用只有 5 天,全程无人工参与。本文拆解漏洞原理,并给出环境变量中转、权限最小化、触发器收口三道可直接抄的防护。
2026-08-20

GitHub 全球宕机 7 小时之后:给代码仓库搭一套多远端容灾方案
8 月 17 日 GitHub 宕机约 7 小时,网站、PR、Actions、Copilot 集体不可用;同一天 Cursor 上线了 AI 原生代码托管平台 Origin。代码托管单点依赖的风险被摆上台面。本文用纯 Git 原生命令搭一套「主仓库 + 镜像远端 + 定时同步」的容灾方案,30 分钟配好,宕机当天照样 push、review、发版。
2026-08-19

DeepSeek V4 Pro 正式版上手实战:DeepSWE 从 12.8 飙到 62.7,峰谷定价生效后怎么用才划算
8 月 13 日 DeepSeek V4 Pro 结束近四个月的预览期转正(0813 构建),架构没变、纯靠后训练把 DeepSWE 从 12.8 拉到 62.7,智能体编码能力逼近一线闭源模型。与此同时 8 月 17 日峰谷定价正式生效,高峰输出价涨到 27 元/百万 Token。本文只讲实操:接入要改什么、思考模式和推理档位怎么用、新计费下什么时候跑任务最省、以及长循环提前停止这个真实存在的坑。
2026-08-18

GLM-5.3 上手实战:不换基座编程提升 50%,三档推理怎么选、从 5.2 迁移有一个必踩的坑
8 月 14 日智谱发布 GLM-5.3:基座模型完全没换,纯靠后训练把编程能力拉高 50%,Terminal-Bench 3.0 从 4.6 分跳到 28.3 分,还涌现出一线水平的网络安全能力。本文不写发布会通稿,只解决三件实操的事:现在通过什么渠道能真正用上它、low/high/max 三档推理分别适合什么任务、以及从 GLM-5.2 迁移时那个会直接让请求报错的参数变更。
2026-08-17