硬核横评
硬核横评

TradingAgents 测评:把交易公司拆成 5 个 Agent 团队的 LLM 金融框架

GitHub 热榜 TradingAgents(arXiv 论文+多 provider)硬核测评。拆解 5 层架构(分析师/研究员/交易员/风控/组合经理),对比表 vs 单 LLM vs 传统量化,实测 DeepSeek/Claude/GPT-5 模型选择,三避坑(look-ahead/情绪源/非投资建议)。

发布于 2026年7月25日12 分钟阅读
<!-- tradingagents-review | review | TradingAgents 多 Agent 交易框架测评 -->

GitHub 热榜上杀出一匹黑马:TauricResearch/TradingAgents,一个把「真实交易公司」搬进 LLM 的多 Agent 金融交易框架。shiningmic.cn 周榜在列,arXiv 论文背书(2412.20138),v0.3.1 刚发。我把它拆开给你看,这玩意儿到底是个玩具,还是真能帮你做决策。

它是什么:把交易公司拆成 5 个 Agent 团队

TradingAgents 不是那种"给 LLM 一个股票代码问买不买"的玩具。它模拟真实交易公司的协作:把复杂交易任务拆成专业角色,让多个 LLM Agent 分工 + 辩论 + 决策。

架构是 5 层:

  1. 分析师团队(4 个 Agent):基本面分析师(看财报)/ 情绪分析师(聚合新闻 + StockTwits + Reddit)/ 新闻分析师(宏观事件)/ 技术分析师(MACD / RSI 等指标)。各管一摊,产出专业报告。
  2. 研究员团队(看多 + 看空):拿到分析师的报告,看多和看空两方辩论,平衡收益与风险。
  3. 交易员 Agent:综合分析师 + 研究员报告,决定交易时机和规模。
  4. 风险管理团队:评估市场波动 / 流动性等风险,调整策略。
  5. 组合经理:最终批准 / 拒绝交易提案,批准后发模拟交易所执行。

这个设计的关键不是"用了 LLM",而是"用 Agent 分工模拟了人类交易公司的制衡机制"。看多 vs 看空辩论、风险团队复核、组合经理终审--这些都是真实机构降低单一决策偏差的做法。

对比表:多 Agent vs 单 Agent vs 传统量化

维度TradingAgents(多 Agent)单 LLM 问股传统量化系统
决策机制5 团队分工 + 看多/看空辩论 + 风控复核一个 LLM 直接答信号触发,规则固化
数据源Alpha Vantage + FRED + Polymarket + StockTwits + Reddit + 新闻用户手动喂API 订阅
模型支持GPT-5.x / Gemini 3.x / Claude 4.x / Grok 4.x / DeepSeek / Qwen / GLM / Ollama单一模型无 LLM
可解释性各 Agent 输出报告 + 辩论记录 + 决策日志只有最终答案信号日志
回测支持(LangGraph checkpoint resume)支持
部署Docker / Python / CLI网页服务器
适合谁研究/学习多 Agent 协作 + 交易决策模拟快速好奇机构量化

单 LLM 问股的问题:没有制衡,一个模型一拍脑袋。TradingAgents 的看多/看空辩论 + 风控复核,至少把"单一模型偏见"这个最大风险压下来了。

实测上手

v0.3.1 支持 TRADINGAGENTS_* 环境变量配置 + API key 自动检测,多 provider(NVIDIA / Kimi / Groq / Mistral / Bedrock / 任意 OpenAI 兼容端点)。

bash
pip install tradingagents
# 或 Docker
docker run TauricResearch/TradingAgents

配置 API key(任选 provider):

bash
export TRADINGAGENTS_LLM_PROVIDER=deepseek  # 或 openai/anthropic/gemini...
export TRADINGAGENTS_LLM_API_KEY=sk-xxx
export TRADINGAGENTS_DATA_API_KEY=your_alpha_vantage_key  # 行情数据

CLI 跑一次分析:

bash
tradingagents --ticker AAPL --date 2026-07-25

它会依次跑:4 个分析师出报告 -> 看多看空辩论 -> 交易员决策 -> 风控复核 -> 组合经理终审,最后给你一个"买/卖/持"决策 + 完整推理链。

模型选择实测

我重点测了 3 个 provider 的稳定性和成本:

  • DeepSeek:最便宜,中文市场数据理解好,但长链路(5 团队)偶尔丢上下文。
  • Claude 4.x(Sonnet 5):推理最强,辩论环节质量最高,但贵。v0.3.1 刚加 Claude Sonnet 5 / Fable 5 支持。
  • GPT-5.x:均衡,OpenAI 兼容端点最稳,但 API 费中等。

建议:分析师团队用便宜的(DeepSeek / Qwen),辩论 + 交易员 + 组合经理用强的(Claude / GPT-5)。TradingAgents 支持按角色配模型,这是它比单模型框架的优势。

三个避坑

  1. look-ahead bias(未来函数):v0.3.1 刚修了 Alpha Vantage 的 look-ahead filtering。回测时一定要确认数据没有用未来信息,否则回测漂亮、实盘崩盘。
  2. 情绪数据源不稳:Reddit / StockTwits 抓取经常被限流,v0.3.1 修了 crypto sentiment sources。美股 OK,A 股情绪数据基本没有,国内慎用。
  3. 非投资建议:框架明确说"研究用途,非投资建议"。LLM 的非确定性 + 市场噪声 = 即使架构再合理,也不能盲信。把它当"决策辅助 + 推理链可视化",不是"自动印钞机"。

选型建议

  • 你是 AI 研究者/学生:想学多 Agent 协作、LangGraph 编排,TradingAgents 是最佳教材(arXiv 论文 + 开源 + 5 团队架构清晰)。
  • 你是量化开发者:想给现有系统加 LLM 决策层,TradingAgents 的 Agent 分工 + 决策日志可集成,但要自己接实盘交易所。
  • 你是普通投资者:别拿它当自动炒股工具。它是"模拟交易公司决策过程"的研究框架,帮你理解多方制衡,不是帮你赚钱的。

TradingAgents 的价值不在"它能赚钱",而在"它把机构级交易决策的制衡机制,用 LLM Agent 演示出来了"。这个架构思路,比任何单点预测都更接近真实交易。

开源地址:https://github.com/TauricResearch/TradingAgents

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-07-25

常见问题

TradingAgents 能用来实盘赚钱吗?
不能。框架明确"研究用途,非投资建议"。它模拟交易公司决策过程的多 Agent 框架,帮你理解制衡机制 + 可视化推理链。LLM 非确定性 + 市场噪声 = 即使架构合理也不能盲信。
TradingAgents 和单 LLM 问股有什么区别?
单 LLM 一拍脑袋无制衡;TradingAgents 5 团队分工(分析师/研究员/交易员/风控/组合经理)+ 看多看空辩论 + 风控复核 + 组合经理终审,模拟机构制衡。输出完整推理链 + 决策日志,可解释性强。
TradingAgents 支持哪些模型?
多 provider:GPT-5.x/Gemini 3.x/Claude 4.x/Grok 4.x/DeepSeek/Qwen/GLM/NVIDIA/Kimi/Groq/Mistral/Bedrock/Ollama。可按角色配模型(分析师用便宜,辩论/决策用强)。

相关文章

硬核横评

一个 agent 被攻破就全盘失守:四套凭证与权限治理方案横评

凭据从配置项变成了攻击面,但绝大多数团队防线还停在"给 agent 套个沙箱"。本文与站内沙箱隔离横评明确分工:沙箱管"代码在哪跑",凭据治理管"密钥怎么用、动作谁批、凭据能不能外带"。对比 OpenClaw 2.0、OpenWorker、OpenHuman 与传统密钥托管四套方案,按凭据生命周期六环节(存/用/批/外带/审计/多 agent)拆:OpenClaw 掩码请求 + opt-in proxy 目标白名单;OpenWorker hard floors + 自主权阶梯 + reviewer model + 熔断器,且无人值守绝不自批;OpenHuman Privacy Mode 在 Rust core 强制 + agent 间 E2E 加密。二手数据(SaaS Sentinel 转述,未找到一手报告)显示 1 个 agent 妥协概率 0.24、7 个升到 0.86,风险随数量超线性增长——前提是"任一 agent 提议即执行"。

2026年9月1日11 分钟阅读
硬核横评

涨价之后怎么选:11 个模型的真实 token 成本横评,把峰谷、缓存与 tokenizer 三重口径算进去

模型标价至少套着三层衣服,只看标价等于只看最外面那层:时段(DeepSeek 8 月 17 日起峰谷计价,工作日 9:00–12:00 与 14:00–18:00 为高峰、闲时减半、周末全天闲时,同一模型单价差一倍)、缓存(命中前缀缓存的输入 token 单价远低于标准输入,变量不在厂商手里而在你的提示词结构里)、分词(Sonnet 5 换分词器后相同输入映射 1.0 到 1.35 倍 token 数,且倍数随内容类型浮动)。本文统一口径为「综合单价 =(输入单价 + 输出单价)÷ 2」,即假设输入输出 token 数量相等,作为中立起点,再给三种典型负载比重的重算结果,并覆盖 11 个模型的标价、缓存命中价、峰谷价与分词放大后的实际位置。结论不是「哪个模型最便宜」,而是「不存在最便宜的模型,只存在对你这个负载最便宜的模型」——脱离输入输出比重、缓存命中率与内容类型给出的比价,只是在比标价而非比成本。国内模型价格来自 2026-08-24 逐页复核、8-28 再复核的官方定价页速查表,海外价格来自 2026-08-31 汇总,存在口径冲突的项目文中逐条标注。未做实际调用压测。

2026年8月31日9 分钟阅读
硬核横评

腾讯 770B 只激活 49B:五款万亿级开源旗舰横评,决定部署成本的不是总参数

Hy4 preview(770B/49B)发布把开源旗舰的参数军备推到新高,但决定部署成本的不是总参数:激活参数省的是算力,权重驻留吃的是显存。本篇横评五款开放权重旗舰--Hy4 preview、GLM-5.3、Kimi K3(2.8T)、DeepSeek V4(1.6T 口径)、Qwen3.8-Max(2.4T)--按总参/激活比、上下文、许可证、显存门槛(工程估算口径)与 API 价格快照逐项对表。与 8-27 价格横评分工:那篇算 320B 级 API 账,本篇算 700B-2.8T 级参数与部署门槛账。五条按场景结论:追最新选 Hy4(Apache 2.0+MTP 投机解码+FP8 友好)、要参数规模选 K3、要成熟生态选 GLM/DeepSeek、阿里系合规选 Qwen,以及共同一条--先看每 token 成本与稀疏注意力,再看总参。

2026年8月29日9 分钟阅读