This is a viewer only at the moment see the article on how this works.
To update the preview hit Ctrl-Alt-R (or ⌘-Alt-R on Mac) or Enter to refresh. The Save icon lets you save the markdown file to disk
This is a preview from the server running through my markdig pipeline
Monday, 24 November 2025
我的系统DISE是一个自我优化、自我组合、基于软件工程的工作流程建设者。它生成了可测试的代码文物,客观地评估它们,并在没有人类持续监督的情况下随着时间推移而演变。但问题是:旅行者 — — 2023年令人印象深刻的Minecraft 机器人 — — 已经通过创造可再利用的技能来做到这一点了吗?工具执行者没有已经证明LLMS可以通过测量结果来学习使用工具吗?如果我们已经有了写自己的工具并学习何时使用工具的代理商,我们难道没有解决自我改进人工智能代理商的问题吗?
破坏者:不。并理解为什么如果你正在建造 任何需要生产的东西,那么你为什么重要。
"这听起来像旅行者,但有 更多的步骤。"
有道理,如果你一直在研究LLM驱动的代理商研究 旅行者 (Wang等人,2023年) -- -- 教授GPT-4通过生成可再使用代码“技能”来玩木工艺的系统 -- -- 以及 工具前工具工具工具 (Schick等人,2023年) - 它教LLMs通过衡量实际结果使用工具,两者都令人印象深刻、有影响力并被广泛引用。
乍一看, DISE (Directed 合成进化) 可能看上去像旅行者 + Tolorex 和 新的涂料涂层。 但这就像说生产数据库只是一个带有更多步骤的电子表格。 如果您关心规模、成本和实际运输的东西, 区别很重要 。
新来的DISE? 退 退 退 我的电梯投投投 然后探索“与DISE一起烹饪”系列: 关于毕业生学徒的第二部分 和 第三部分 关于无可信赖的LMLM。该员额特别侧重于 DISE 的架构与旅行者和工具者有何不同。
以及为什么DISE的建筑设计方法能解决两个都无法单独解决的问题。
2023年的两篇论文改变了我们对LLM代理和工具的看法:
旅行者提出一个至关重要的见解:
LLMs可产生自己的可再使用工具。
旅行者使用GPT-4在天体上写字功能,而没有硬编码排雷工艺中的每一项行动。每项成功行动都成为矢量数据库中存储的一种可重复使用的技能。
您的功能将被重新用于 构建更复杂的功能。 因此, 您应该使它具有通用性和可重复使用性 。
这一点很重要。 一种代理系统首次将工具的生成视为 实际软件工程 旅行者表明,代理商可以:
管用 算是吧 在矿工业里 和GPT -4一起
工具前工具工具工具 (Schick等人,2023年)采取了不同的做法。 何时调用现有工具.
聪明的一点:工具前者自己生成了培训数据。它会:
由此创建的模型从 目标目标成果 返回正确答案的计算器 API 要比不正确答案好-不需要LLM 的判断。
DiSE从这两篇论文中汲取了深刻的见解,
来自旅行者:
从工具前端 :
DISE的基因学:
将DISE视为ReCA、Reflexion、Toolex和Voyager的孙子。 每个祖先都做出了重要贡献:
graph TB
ReAct[ReAct 2022:<br/>Reason + Act<br/>Step-by-step thinking] --> DiSE
Reflexion[Reflexion 2023:<br/>Self-critique loops<br/>Try → Reflect → Retry] --> DiSE
Toolformer[Toolformer 2023:<br/>Learn from outcomes<br/>Self-generated training data] --> DiSE
Voyager[Voyager 2023:<br/>Generate reusable tools<br/>Code as memory] --> DiSE
DiSE[DiSE 2024:<br/>Directed Synthetic Evolution]
DiSE --> G[Generate tools with tests]
DiSE --> E[Evaluate objectively]
DiSE --> M[Mutate and improve]
DiSE --> S[Store with usage stats]
DiSE --> R[Retrieve and reuse]
DiSE --> C[Tiered execution]
style ReAct stroke:#8b5cf6,stroke-width:2px
style Reflexion stroke:#ec4899,stroke-width:2px
style Toolformer stroke:#f59e0b,stroke-width:2px
style Voyager stroke:#ef4444,stroke-width:2px
style DiSE stroke:#10b981,stroke-width:3px
遗产:
DISE补充说:
工具前证明您可以通过测量真实结果来训练模型来使用工具。 旅行者已证明的代理商可以建立自己的工具库。 反灵活证明反射循环工作。 ReAct证明结构化推理很有帮助。
DiSE 询问 : 如果我们把这些洞察力结合起来, 却让它便宜到可以生产, 并且聪明到可以不断改进自己呢?
是的,那里也有Roy Fielding的 REST 结构的破折号 工具是使用 URI 、 元数据、 和版本的状态资源。 每个工具都是可处理的、 可缓存的, 并且可以与其他工具一起组成。 工具登记册不仅仅是一个矢量数据库; 它是一个可更新的商店, 资源( 工具) 具有状态( usage Stats、 性能衡量标准、 版本历史) , 影响它们如何被检索和进化 。
那不是训练,不是一次性的一代人 定向进进.
graph TB
subgraph Voyager["Voyager (2023)"]
A[GPT-4] --> B[Generate Code]
B --> C[Execute in Minecraft]
C --> D{Success?}
D -->|Yes| E[Store with embedding]
D -->|No| F[GPT-4 suggests fix]
F --> B
E --> G[Vector DB]
G --> H[Future retrieval]
H --> A
end
style A stroke:#ef4444,stroke-width:3px
style F stroke:#ef4444,stroke-width:3px
note1[All reasoning flows through GPT-4]
note1 -.-> A
看到问题了吗?每个决定 — — 规划、评估、调试、构成 — — 都经过相同的前沿模式。当你每一步需要辉煌时,你都需要GPT-4(或同等的GPT-4 ) 。
旅行者不仅使用GPT-4来生成代码,还依靠GPT-4来:
当模型所做的一切, 它需要是 前沿水平的辉煌 每次。
这就是为什么旅行者没有超越Minecraft。这就是为什么在生产中经营它要花费很多钱的原因。
让我们做一些餐巾纸数学。 说你想运行一个旅行者风格的系统, 用于现实世界的任务 :
现在添加检索查询、 拼写尝试、 调试周期。 您很容易看到 数百 美元, 一个代理来建立一个中等技能图书馆 。
比较一下,这里是分层方法的成本:
|------|-----------------|---------------|---------| 0.001 (Llama 3.1 8B) 98%
| 每项任务平均平均 | $0.20 | $0.016 | 92% |
当你只把昂贵的模型称为真正困难的问题时, 经济学就会发生巨大的变化。
旅行者、工具变异者和反灵活并不是失败。 他们只是打破了他们当时的技术和经济上限。
三个制约因素阻碍了2023年的进展:
限制(2023年) 后果 改变什么 (2024-2025年) |-------------------|-------------|--------------------------| GPT-4是唯一可靠的推理引擎 * 一种模型必须做一切事情 * * * 固定模型堆 - GPT-4o + Quen + DeepSeek + Llama * 本地嵌入器薄弱或未使用 回收成本昂贵 BGE/北极/迷你LM 消费者GPU LLM认为LLM LLM现在通过集装箱化的Exec清洁运行代码
旅行者和工具者无法进化
它们只能称为模型或微调模型。 他们无法在系统上传播认知 他们无法施加选择压力
他们解决了 "我们能吗?" 问题。
DISE 解答 "我们如何不断改进?" 问题。
不是因为我比王或石克聪明 而是因为硬件、工具和经济学 终于赶上来了
这是一个工程问题。 工程总是一个时间问题。
DISE背后的关键思想简单但深刻:
结构取代了智慧。
DISE不指望一种模型能完美地完成所有事情,而是将问题散布到一个管弦系统。它不假定模型“知道如何编码”。相反,它创造出一个“知道如何编码”的模型。 压力、反馈和内存 所以模型可以迭接地改进代码 而不是在第一次尝试时完美生成代码
graph TB
subgraph DiSE["DiSE (Distributed System)"]
A[Triage Agent] -->|Easy| B[Fast Model - Qwen/Llama]
A -->|Hard| C[Strong Model - GPT-4o]
B --> D[Test Suite]
C --> D
D -->|Pass| E[Structured Registry]
D -->|Fail| F{Worth escalating?}
F -->|Yes| G[Optimizer Agent]
F -->|No| H[Mark as failed]
G --> I[Mutation Pipeline]
I --> D
E --> J[RAG with usage stats]
J --> K[Clustering & reranking]
K --> A
end
style D stroke:#10b981,stroke-width:3px
style E stroke:#3b82f6,stroke-width:3px
style K stroke:#8b5cf6,stroke-width:3px
note2[Most tasks never hit expensive models]
note2 -.-> B
差异十分明显:
因为 每个单位生成的代码单位都被当作文物处理而不是迅速答复。
它不是根据"这样看起来不错吗?" 来判断的 它的判断依据是:
廉价的LLM( wen 2.5 comer 7B, Llama 3.1 8B) 可以产生五个变体。 测试选择最佳。 较强的模型只有在较弱的模型失败时才参与其中 。
随着时间的推移,这个系统学会了哪些模型对哪些领域是好的。 语义搜索实施 - 你不需要最大的模型 当你有合适的结构。
完善过程成为完善过程 进化,不是自动后退.
说你想让你的经纪人 执行高效的分类
旅行者办法:
DISE 方法 :
廉价的模型可以探索解决方案空间。 测试可以进行选择。 昂贵的模型只有在所有五个变体都失败时才会参与。
我一直在尝试类似的原则 我博客的RAG系统 和 语义情报特征模式是一贯的:
使用最大的建筑决策模式,而不是执行模式。
当我建造 断断链接处理器 语义搜索后退,我没有使用 GPT -4 检查每个链接。
昂贵的情报在设计中 而不是执行中
每个系统都提出一个不同的问题:
工具前端询问 :
一个LLM能够通过测量哪些工具电话实际上有帮助来学习何时使用工具吗?
旅行者询问:
LLM 能够产生有助于未来任务的可重复使用的代码吗?
DiSE 询问 :
一个系统能否产生工具,客观地评价工具,根据实际结果加以发展,并且所有这一切是否都足以高效地进行生产?
工具前工具已被验证 基于成果的学习工作. 旅行者证明 生成的工具可以重新使用. DISE 证明 工具可以在不打破银行的情况下不断演变.
工具前工具工具 培训时间. 旅行者是 闪闪闪闪. DISE 是 基础设施基础设施.
一个显示你可以从结果中学习。 一个显示您可以生成工具 。 另一机制为持续演变建立机制。
如果你今天正在建立LLM动力系统,DISE方法建议:
不要生成代码,希望它有效。写测试来定义“工作”。像我所做的一样 框架迁移 不需要LLM的判断
简便的路线任务到廉价的模型。 保留昂贵的模型给真正棘手的问题。 您的钱包会感谢您的 。
不仅存储代码,而且:
这个元数据成为你路线逻辑的训练数据
创造变异体,测试它们,保持赢家, 改变好但不完美的人。
这就是我如何在这个博客上看待发展--在公众中反复出现, 从实际交通中学习,根据实际使用情况加以改进。
旅行者和DISE的区别不光是成本,而是... 当事情失败时会发生什么.
在旅行者中,失败意味着:
在DISE中,故障触发因素:
系统得到 更聪明 了解自己不知道的事情.
我不认为我们会看到纯粹的“单一模型能让一切成功”系统在生产中获胜。经济学不起作用,失败模式也太不透明。
相反,我们将看到像DISE这样的混合系统:
我们到处都看到这种模式:
魔力不在于有一个杰出的模特儿 正确时间右侧模型 和和 右上下文.
旅行者是一个信标,它显示代理商可以通过生成代码来学习。
下一步并没有更迅速。这个方法已经到了极限。
下一步是 定向合成进化:
DISE根本不想一试就变聪明 它试图更好 在 下一个 中枪了
这就是进化的开端。
与生物进化不同, 我们不必等上百万年才能看到结果。
论文:
博客上写道:
工具 :
© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.