书生-S2(Intern-S2)是上海人工智能实验室于 2026 年 9 月完整开源的 397B MoE 模型,主打科学长程任务:生物分子相互作用设计、材料结构生成、竞赛与高等数学的长程推理、智能体执行。对个人和小团队来说,最现实的路径不是把 397B 搬到本地,而是走免费 API;有算力的机构可以加载 HuggingFace 权重做私有化;做科研的可以叠加 Memory Decoder 可插拔记忆模块,在冻结基座上挂载领域知识、免重训。这篇 SOP 给出一条从零到跑通的最短路径:判断路线、领取额度、发第一个请求、跑通本地推理、写科学长程任务的 prompt、挂载记忆模块、上生产并避开十个坑。
边界说明:步骤基于官方 README 与发布文档整理(截至 2026-09),命令与界面以官方文档为准;本文整理自公开资料,非逐字实录。Preview 版将于 2026-10-31 下线,正式地址以官方公告为准。
本指南面向中国技术从业者(含个人与小团队),目标是照着做就能接上,不必读完每份文档。命令若不确定,以官方 README 为准。
一、先判断你该走哪条路
不是所有人都需要同一条路径。先按算力和目标分三类:
第一类,个人开发者和小团队。你没有成规模的 GPU,也不想维护推理集群,目标是快速验证想法、接进自己的产品。这类人走免费 API 最划算:在线体验五分钟上手,API 对所有用户开放一定免费额度,高额度再申请。这条路零运维、零硬件成本。
第二类,有算力的高校、院所或企业。你有八卡甚至更多 A100 或国产加速卡,数据不能出网,要做私有化部署或二次开发。这类人走 HuggingFace 权重推理(用 transformers 加载)或者 ModelScope 权重,在自有集群上跑。注意 397B 本地不友好,需要大显存或多卡切分。
第三类,做科研、需要把模型变成领域专家的人。你在生物、材料、数学等方向有私有语料,希望模型长期记住这些知识但又不重训基座。这类人在走 API 或本地权重的基础上,叠加 Memory Decoder 记忆模块,把领域知识挂上去。
一句话:验证想法走 API,数据不出网走本地权重,要领域长期记忆走记忆模块。
补一句成本现实:397B 全量 BF16 权重约八百 GB,单张 80GB 显存至少要十张才放得下,还不算激活与中间状态。对个人来说这相当于一套房的显卡预算,所以免费 API 不是将就,而是唯一划算的入口。反过来,若数据绝不出网,API 这条路直接排除,本地权重再贵也得走。
二、接入方式对照表
下面是三条路径的门槛、算力、适合人群与链接对照。
| 接入方式 | 路径 | 门槛 | 算力需求 | 适合谁 | 链接 |
|---|---|---|---|---|---|
| 免费 API | 在线体验与编程调用 | 注册即领免费额度 | 无需本地算力 | 个人、小团队、快速验证 | chat.intern-ai.org.cn;internlm.intern-ai.org.cn/api/strategy |
| HuggingFace 权重 | transformers 加载 | 会写推理代码 | 大显存、多卡 | 有算力机构、私有化 | huggingface.co/internlm/Intern-S2-397B |
| GitHub 与 ModelScope | 源码与国产权重 | 会部署 | 大显存、多卡 | 国内合规、二次开发 | github.com/InternLM/Intern-S1;modelscope.cn/models/Shanghai_AI_Laboratory/Intern-S2-397B |
选路建议:先用免费 API 把场景跑起来,确认值得投入算力,再考虑本地权重;记忆模块目前多以申请为主,先在 API 上把任务定义清楚。
把表当作起步筛选而非承诺:多数团队应先在免费 API 上测真实时延与成本,只有数据或规模理由具体时才上本地权重。记忆模块叠在任一路之上,不改变这个判断。
三、免费 API 实操步骤
这一步是全文最该照做的部分。目标:十分钟拿到 endpoint 与 key,发出第一个请求。
第 1 步,注册并领取额度。打开在线体验 chat.intern-ai.org.cn,用账号登录。额度策略与申请入口在 internlm.intern-ai.org.cn/api/strategy:所有用户开放一定免费额度,高额度需要单独申请。先领免费的,够用就不必申请。
第 2 步,创建密钥。在 API 控制台创建 API Key,复制保存好,后续调用都靠它。密钥只出现一次,泄露要立即吊销。
第 3 步,拿到 endpoint 与 key。把 key 设为环境变量,避免在代码里硬编码:
export INTERN_S2_API_KEY="你的密钥"endpoint 与具体路径以官方文档为准,下文用占位 https://chat.intern-ai.org.cn/... 表示。
第 4 步,用 Python 发第一个请求。下面这段最小可运行,requests 即可:
import os
import requests
api_key = os.environ.get("INTERN_S2_API_KEY")
endpoint = "https://chat.intern-ai.org.cn/..." # 以官方文档为准
resp = requests.post(
endpoint,
headers={"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"},
json={"model": "intern-s2", "messages": [{"role": "user", "content": "用一句话解释分子对接"}]},
)
print(resp.json())跑通返回即说明链路通了。后续把 messages 换成你的科学长程任务即可。
返回是标准对话格式,输出在 choices 里;4xx 多半是 key 或额度问题,5xx 多半是服务端限流,按退避重试即可。需要流式就把 stream 设为 true,逐块读取而不是等整段。记下请求 id,方便向服务商追查失败。
四、HuggingFace 推理最小示例
有算力的机构用 transformers 加载权重做多模态问答。下面给出代码骨架,注意两件事:一是 397B 需要大显存或多卡切分,单卡基本跑不动;二是仓库用了自定义代码,必须 trust_remote_code=True,以官方 README 为准。
from transformers import AutoModel, AutoTokenizer
model = AutoModel.from_pretrained(
"internlm/Intern-S2-397B",
trust_remote_code=True,
torch_dtype="auto",
device_map="auto", # 多卡自动切分
)
tokenizer = AutoTokenizer.from_pretrained(
"internlm/Intern-S2-397B", trust_remote_code=True
)
inputs = tokenizer("描述这张分子结构图里的结合位点", return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))实操提醒:先确认集群显存总量,估算能否放下 BF16 权重;不够就用多卡 device_map 或量化;国产算力注意框架与算子适配。推理慢是常态,长任务要设超时与重试。
单机优先用 device_map 自动切分;显存仍紧就上 4 位或 8 位量化,代价是略掉精度。批量前先跑一个代表性 prompt 测时延,长上下文生成本就慢,队列大小要按实测而非拍脑袋。
五、科学长程任务 prompt 套路
书生-S2 强在长程推理与工具调用,关键是把任务拆成目标到约束到步骤到验证。下面给两个可直接改的模板。
模板一,蛋白结合剂与分子设计类:
你是一名计算生物学家。任务:为靶蛋白 [PDB ID] 设计结合剂。
步骤:1)列出结合口袋的关键残基与相互作用类型;2)提出三条候选序列并各自说明理由;
3)对每条序列评估结合亲和力、溶解度与免疫原性风险;4)用工具检索已有文献交叉验证;
5)给出最优候选与下一步实验建议。
约束:每步给出可验证依据,不确定处明确标注。模板二,材料结构生成类:
你是一名材料科学家。任务:设计一种满足 [目标带隙/导电性/稳定性] 的晶体结构。
步骤:1)确定元素组成的化学约束;2)生成候选结构并用物理规则自洽性检查;
3)调用计算工具评估性质;4)对比三条候选并解释取舍;5)输出可合成路径建议。
约束:所有数值给出来源或估算方法,禁止凭空编造。长程推理加工具调用怎么用:把大任务拆成多步,让模型在每一步先推理再调用工具(检索、计算、查库),把工具结果喂回下一步,形成闭环;最后要求它输出推理链条到结论,而不仅是答案。这样能显著降低长任务的事实漂移。
第三个套路是数学长程推理:把证明或计算拆成若干子目标,每步要引理与依据,最后汇总。书生-S2 在竞赛与高等数学长程推理上突出,关键是多要完整推理链而非只给答案。工具循环里要把每次工具结果与模型的解释都落盘,结论出错时才能回溯到哪一步跑偏。
六、Memory Decoder 记忆模块怎么挂
Memory Decoder 是书生-S2 的可插拔记忆模块(如 Intern-MemDec-4B),核心卖点是:在冻结基座的前提下挂载领域知识,免重训、低成本把通用模型变成领域专家。概念上,你准备领域语料,生成记忆参数,挂载到基座的指定层,推理时一起生效。
实操上,目前记忆模块多以申请为主,具体申请入口、挂载方式与参数格式以官方 README 为准,不要照抄第三方教程。建议路径:先在免费 API 上把领域任务定义清楚,积累足够语料与评估集,再向官方申请记忆模块,拿到挂载说明后在自有或授权环境接入。记忆模块不是万能药:语料质量决定记忆质量,挂载后仍需用评估集验证效果。
从工程看,记忆模块贵在可热插拔:同一基座挂不同领域记忆即可切换专家身份,且基座冻结意味着你不用承担全量微调的训练与回归成本。代价是记忆模块要随语料迭代维护,并像模型工件一样做版本管理。
七、生产化与踩坑速查
把书生-S2 接进生产,十个坑最常见。下面速查表逐条给现象与对策。
| 坑 | 现象 | 对策 |
|---|---|---|
| 免费额度限速 | 高频调用被限流报错 | 加退避重试,错峰调用,按需申请高额度 |
| 397B 显存爆炸 | 单卡 OOM 起不来 | 多卡切分、量化或改用 API |
| 长上下文截断 | 长文档被截断丢信息 | 分块、摘要前置、保留关键上下文 |
| 记忆模块未申请 | 领域知识挂不上 | 先走 API 验证,再申请记忆模块 |
| Preview 版下线 | 2026-10-31 链接失效 | 迁移到正式地址,关注官方公告 |
| 国产算力适配 | 算子或框架不兼容 | 测算子覆盖,必要时用兼容后端 |
| 评测口径偏官方 | 指标与实际有落差 | 自建评估集,按真实任务验收 |
| 长任务超时 | 推理久到客户端断开 | 服务端异步、轮询结果、设合理超时 |
| 并发限制 | 多请求互相挤占 | 限流排队,控制并发数 |
| 密钥泄露防护 | key 进代码库被刷 | 环境变量加密钥管理,泄露即吊销 |
生产化补充:免费 API 适合验证与原型,正式服务注意限流、超时、密钥与日志;本地权重注意监控显存与并发;科学长程任务建议异步化,结果落库再回查。
另外对每次长任务做成本与耗时采样,建自己的评估集,用真实任务验收而非只看官方榜单。科学任务的事实正确性要靠可复现实验或文献交叉验证,不能只凭模型自述。再加基础可观测:记录每路的输入 token、输出 token、时延与错误率,额度临近上限就告警,别让原型在生产里静默崩。
常见问题
Q1:个人零成本怎么用?
走免费 API。注册 chat.intern-ai.org.cn 领取免费额度,所有用户都开放一定额度,高额度再申请。先用在线体验验证想法,再用 Python 接 API,零硬件成本。
Q2:本地能跑吗?
397B 本地不友好。单卡基本跑不动,需要大显存或多卡切分,还要 trust_remote_code。个人和小团队不建议本地,优先免费 API;有算力机构再考虑 HF 权重或国产算力私有化。
Q3:API 和 HF 权重差别在哪?
API 零运维、按额度用、适合快速验证;HF 权重要自己有算力部署、数据不出网、可做二次开发,但运维与显存成本全在你。路线选择看算力与合规要求。
Q4:记忆模块能干什么,怎么申请?
它在冻结基座上挂载领域知识,免重训把通用模型变领域专家。目前多以申请为主,具体入口与挂载方式以官方 README 为准。建议先在 API 上定义好任务与语料,再申请。
Q5:和 GPT、Claude 比,适合什么场景?
书生-S2 强在科学长程任务(生物分子、材料结构、竞赛数学、智能体执行)与国产算力合规场景。通用闲聊与生态成熟度不如闭源大模型,但科学推理与数据不出网是它的主场。