首页

实战 SOP

场景化落地教程,含真实截图、Prompt、工作流模板与踩坑记录。

LLaDA-Image 本地部署 SOP:五步跑通 6B 生图模型

把蚂蚁开源 6B 生图模型 LLaDA-Image 跑起来的五步 SOP:①环境准备(依赖与国内镜像加速下载);②四档权重怎么选(Base 50 步 / Turbo 4 步 × BF16 / FP8,国内走 ModelScope);③跑通第一张图(Base 与 Turbo 最小可用命令);④进阶(参考图编辑、文字渲染、ComfyUI 接入、显存不足时的降级策略);⑤生产化(批量队列、并发容量规划、成本监控、结果入库与故障降级)。含 6 条踩坑与 10 项上线自检清单,命令逐字取自官方 README;仓库 license 为 null,商用前须确权。

自建 OpenMAIC 课堂 SOP:从取码到接 Agent 工作台

从零把 OpenMAIC 跑起来的完整 SOP:①零部署路线(open.maic.chat 取访问码即用);②本地标准部署(pnpm >= 10,clone → pnpm install → .env → pnpm dev);③生产化(pnpm build && pnpm start、Vercel 一键、docker compose up --build);④进阶(Postgres 持久化 profile、ACCESS_CODE 访问码、MP4 导出 profile、Lemonade/FunASR 本地化);⑤接进 agent 工作台(clawhub install openmaic 或导入 skills/openmaic/,从飞书/Slack 发消息生成课堂)。含 6 条踩坑与 10 项上线自检清单,全部命令逐字取自官方 README。

Kimi 双协议接入:一套配置打通 Codex 与 Claude Code

月之暗面 2026-09-02 宣布 Kimi API 原生双协议:OpenAI Responses(`api.moonshot.cn/v1`)+ Anthropic Messages(`api.moonshot.cn/anthropic`),主推模型 kimi-k3。实战 SOP:改 Claude Code 的 `~/.claude/settings.json` 把 ANTHROPIC_BASE_URL 指向 /anthropic、模型设 kimi-k3[1m];改 Codex 的 `~/.codex/config.toml` 设 wire_api="responses"。即可把 Kimi 当统一模型路由网关,切底层模型不改客户端代码。边界:Responses 仅文本+图片、K2.7 Code 强制思考、旧 ANTHROPIC_API_KEY 须删。

用 GPT-6 Astra 搭建长任务智能体工作流

基于 GPT-6 Astra 真实能力(105 万上下文、12.8 万输出、对齐越权 0%)搭建长任务智能体的实战 SOP:先完成三项准备(OpenAI Python SDK 1.50+、OPENAI_API_KEY 环境变量、API 白名单),再按长上下文规划→定义工具(函数调用 + 计算机使用)→异步调用模式→中途纠偏→验收与成本控制的顺序落地。重点:开局只放任务目标、验收标准、工具清单与关键背景让模型先出计划;工具须写清 name/description/parameters;异步用流式事件 + 后台队列 + 任务 id 轮询;纠偏直接注入新指令无需重启;验收用独立脚本做断言、默认收小 max_output_tokens 并设日花费上限。

Kimi 开放平台原生接入 Codex 与 Claude Code

Kimi 开放平台(月之暗面)现可把 OpenAI/Anthropic 兼容工具原生指向 Kimi,无需自建代理。两条路:① OpenAI Responses API 接 Codex——base_url=https://api.moonshot.cn/v1,~/.codex/config.toml 配 KIMI_API_KEY 与 wire_api="responses";② Anthropic Messages API 接 Claude Code——base_url=https://api.moonshot.cn/anthropic,~/.claude/settings.json 的 env 配 ANTHROPIC_BASE_URL/ANTHROPIC_AUTH_TOKEN=Kimi Key/ANTHROPIC_MODEL=kimi-k3[1m]([1m] 选 1M 上下文)。模型含 kimi-k3(1M)/kimi-k2.7-code(256K 强制思考)/kimi-k2.7-code-highspeed/kimi-k2.6。Responses API 暂不支持视频。本文给可套用配置片段、最小验证步骤与 6 条避坑(含 [1m] 不可省、kimi-k2.7-code 强制思考、配额分档)。速率为分档制,确切数字以控制台为准。

Claude Fable 5.1 API 破坏性变更迁移 SOP

2026-09-01 Fable 5.1 发布列了三条破坏性 API 变更,任何一条都可能在切模型时直接 400 或静默退化。① tool_choice=any/tool 返回 400,改用 auto + strict tool use/structured outputs;②思考块模型绑定单向兼容——Fable 5.1 能读旧模型的 thinking block,旧模型读不了新的,降级时丢失推理链;③编辑历史轮次使思考块失效,对 2026-08-31 及之后创建的账号强制报错。本文给出升级前三步自查、逐条迁移代码、迁移后回归验证(并行调用分布、thinking 连续性、20+ 轮压测、水印/C2PA 下游兼容)、灰度降级与回滚,以及八条避坑(含整文件重写倾向、低 effort 凭记忆作答、改写历史击穿缓存)。beta 能力 turn-scoped system messages 与 context-editing 为解药,header 确切名称以官方文档为准。

升级前先把状态目录备份了:OpenClaw 2.0 迁移、回滚与凭证加固实操 SOP

写给已在跑 OpenClaw 的工程师:怎么安全升 2.0、升不上去怎么退、升完怎么收紧凭证。第一原则——升级前整体备份 Gateway 的 configuration 与 state(不是单个客户端),并验证可恢复。四步升级:检查→openclaw doctor --fix→重启 Gateway→验证健康(模型访问验证通过才算生效)。两个 breaking change:OpenProse 插件与 /prose 命令移除(.prose 源文件保留)、codex/* 与 openai-codex/* 路由迁 openai/*(冲突手动修)。2026-09-01 插件 SDK 弃用(plugin-sdk-config-runtime-subpath → api.pluginConfig)死线就在今天。降级有界:SQLite 之后新建会话旧版读不到,整体回滚还会带回 approvals 与 dedup 记录。升后主动配五件事:开掩码凭证请求、配 proxy 白名单、精确授权、角色收敛、纠正 Incognito 误用。

模型下线迁移止血 SOP:4 步把涨价、替换与下线三类变更的账算清

2026 年 8 月 31 日集中发生三件事:Sonnet 5 的 API 费率从 2 与 10 美元恢复到 3 与 15 美元、GPT-5.4 与 GPT-5.4 mini 对 ChatGPT 登录的 Codex 用户停止提供、kimi-k2.5 与 moonshot-v1 同日下线。这三类变更的处理方式完全不同,但很多团队用同一套动作应对,结果要么过度反应要么反应不足。这篇给一套四步流程:第 0 步先分类,用公告里的关键词判断是下线(sunset / deprecated,当天必须处理)、替换(replace / default 变更,本周内,不报错但模型变了,需回归)还是涨价(只写 pricing,本月内,业务不中断但要重算成本);第 1 步依赖盘点,用一条 grep 把散落在各处的模型 ID 全扫出来,收敛到集中配置并接进 CI;第 2 步按类型执行迁移动作;第 3 步用分词放大系数、峰谷时段占比、缓存命中率三个系数重算月度成本。另附 11 条可复制检查清单、第 4 步的限额与告警与降级路径配置,以及七个踩坑点——最常见的一条是模型 ID 散落在代码里,改一处漏三处。

Qwen3.8-Flash-Next 全栈部署 SOP:125B 主模型 + 51B N-gram 嵌入,从托管 API 到 Apple Silicon 的三层路线

把 Qwen3.8-Flash-Next 从「能跑起来」推到「跑得省」的三层路线。托管层零运维:QwenCloud API 兼容 OpenAI 与 Anthropic 规范,QwenWork 的 Standard 模式由它驱动。服务化自部署给四条逐字出自官方 README 的命令:transformers serve(--continuous-batching)、SGLang(--tp-size 4 --context-length 262144 --reasoning-parser qwen3 --tool-call-parser qwen3_coder)、vLLM(--tensor-parallel-size 4 --max-model-len 262144 --enable-auto-tool-choice)与 TokenSpeed,四者都在 localhost:8000/v1 提供 OpenAI 兼容 API。本地与端侧另有 llama.cpp 的 GGUF、Apple Silicon 的 mlx-vlm 与 Unsloth。工程上最值得记的一点是额外那 51B N-gram embeddings 可以卸载到主机内存,靠异步预取与模型计算重叠——README 未给官方显存基线,故不猜硬件门槛,标注以官方 recipe 与实测为准。含 YaRN 外推 1M 的取舍、微调框架选择(Unsloth / Swift / Llama-Factory)与 7 条踩坑,其中第一条就是:GitHub 仓库无 LICENSE 文件,商用前先去模型页核对协议。

腾讯 770B 旗舰自部署 SOP:8 张 H100 连 FP8 权重都放不下,官方起步线是 16 张 B200

自部署腾讯 770B 旗舰 Hy4 preview 的完整 SOP。先泼冷水算清显存账:FP8 权重约 770GB,官方 vLLM recipe 明确基线是 16×B200 或 8×B300(weights+KV cache),8×H100(640GB)连 FP8 权重都放不下--激活 49B 省的是算力,770B 权重必须整份驻留显存。两条部署路线命令逐字出自官方 README:vLLM 预构建镜像(MTP 投机解码 num_speculative_tokens=3、FLASHMLA_SPARSE 注意力后端、hy_v4 工具/推理解析器)与 SGLang 预构建镜像(NEXTN 投机、tp-size 8)。含 OpenAI 兼容调用(temperature 0.9/top_p 1.0,no_think 关深度思考省输出 token)、AngelSlim 自量化、finetune 管线、7 条踩坑与 10 项上线 checklist;不自部署的可走腾讯云 TokenHub/OpenRouter 或 WorkBuddy/CodeBuddy 两周免费。