# "DISE不是只有旅行者吗?"

<!--category-- AI, Machine Learning, LLMs, Code Generation -->
<datetime class="hidden">2025-11-24T18:00</datetime>

我的系统DISE是一个自我优化、自我组合、基于软件工程的工作流程建设者。它生成了可测试的代码文物,客观地评估它们,并在没有人类持续监督的情况下随着时间推移而演变。但问题是:旅行者 — — 2023年令人印象深刻的Minecraft 机器人 — — 已经通过创造可再利用的技能来做到这一点了吗?工具执行者没有已经证明LLMS可以通过测量结果来学习使用工具吗?如果我们已经有了写自己的工具并学习何时使用工具的代理商,我们难道没有解决自我改进人工智能代理商的问题吗?

破坏者:不。并理解为什么如果你正在建造 任何需要生产的东西,那么你为什么重要。

## 一. 导言 导言 导言 导言 导言 导言 一,导言 导言 导言 导言 导言 导言

"这听起来像旅行者,但有 更多的步骤。"

有道理,如果你一直在研究LLM驱动的代理商研究 [旅行者](https://arxiv.org/abs/2305.16291) (Wang等人,2023年) -- -- 教授GPT-4通过生成可再使用代码“技能”来玩木工艺的系统 -- -- 以及 [工具前工具工具工具](https://arxiv.org/abs/2302.04761) (Schick等人,2023年) - 它教LLMs通过衡量实际结果使用工具,两者都令人印象深刻、有影响力并被广泛引用。

乍一看, DISE (Directed 合成进化) 可能看上去像旅行者 + Tolorex 和 新的涂料涂层。 但这就像说生产数据库只是一个带有更多步骤的电子表格。 如果您关心规模、成本和实际运输的东西, 区别很重要 。

> **新来的DISE?** 退 退 退 [我的电梯投投投](/blog/elevatorpitch) 然后探索“与DISE一起烹饪”系列: [关于毕业生学徒的第二部分](/blog/blog-article-cooking-dise-part2-apprenticeships) 和 [第三部分 关于无可信赖的LMLM](/blog/blog-article-cooking-dise-part3-untrustworthy-gods)。该员额特别侧重于 DISE 的架构与旅行者和工具者有何不同。

以及为什么DISE的建筑设计方法能解决两个都无法单独解决的问题。

[TOC]

## 旅行者和工具前者做了什么好事

2023年的两篇论文改变了我们对LLM代理和工具的看法:

### 旅行者:能生成工具的代理

旅行者提出一个至关重要的见解:

**LLMs可产生自己的可再使用工具。**

旅行者使用GPT-4在天体上写字功能,而没有硬编码排雷工艺中的每一项行动。每项成功行动都成为矢量数据库中存储的一种可重复使用的技能。

> 您的功能将被重新用于 构建更复杂的功能。 因此, 您应该使它具有通用性和可重复使用性 。

这一点很重要。 一种代理系统首次将工具的生成视为 **实际软件工程** 旅行者表明,代理商可以:

- 逐步建立不断增长的技能库
- 将简单技能纳入复杂行为
- 通过嵌入式检索避免灾难性的遗忘

管用 算是吧 在矿工业里 和GPT -4一起

### 工具前工具 : 代理器可以学习何时使用工具

[工具前工具工具工具](https://arxiv.org/abs/2302.04761) (Schick等人,2023年)采取了不同的做法。 **何时调用现有工具**.

聪明的一点:工具前者自己生成了培训数据。它会:

1. 在文本中插入潜在的工具调用 (“ 我也许应该在此使用计算器 ” ) 。
2. 实际执行这些工具
3. 保留工具帮助工具的范例, 丢弃工具没有的工具
4. 完善成功范例

由此创建的模型从 **目标目标成果** 返回正确答案的计算器 API 要比不正确答案好-不需要LLM 的判断。

### DISE如何将两者结合起来(更进一步)

DiSE从这两篇论文中汲取了深刻的见解,

**来自旅行者:**

- 生成可重复使用的代码文物
- 存储它们,供今后检索。
- 但加上:客观的试管, 不只是“它是否在Minecraft中起作用?”
- 而非GPT-4,
- 但加上:变异和进化,

**从工具前端 :**

- 学习客观成果
- 自动生成培训数据
- 不只是训练-时间学习,
- 不只是学习如何称呼工具,
- 而非仅仅使用工具。

**DISE的基因学:**

将DISE视为ReCA、Reflexion、Toolex和Voyager的孙子。 每个祖先都做出了重要贡献:

```mermaid
graph TB
    ReAct[ReAct 2022:<br/>Reason + Act<br/>Step-by-step thinking] --> DiSE
    Reflexion[Reflexion 2023:<br/>Self-critique loops<br/>Try → Reflect → Retry] --> DiSE
    Toolformer[Toolformer 2023:<br/>Learn from outcomes<br/>Self-generated training data] --> DiSE
    Voyager[Voyager 2023:<br/>Generate reusable tools<br/>Code as memory] --> DiSE

    DiSE[DiSE 2024:<br/>Directed Synthetic Evolution]

    DiSE --> G[Generate tools with tests]
    DiSE --> E[Evaluate objectively]
    DiSE --> M[Mutate and improve]
    DiSE --> S[Store with usage stats]
    DiSE --> R[Retrieve and reuse]
    DiSE --> C[Tiered execution]

    style ReAct stroke:#8b5cf6,stroke-width:2px
    style Reflexion stroke:#ec4899,stroke-width:2px
    style Toolformer stroke:#f59e0b,stroke-width:2px
    style Voyager stroke:#ef4444,stroke-width:2px
    style DiSE stroke:#10b981,stroke-width:3px
```

**遗产:**

- **重拍** 与行动观察环进行结构化推理
- **反反缩** · 通过反思自我改善(但法学硕士法官本身)
- **工具前工具工具工具** 从实际成果中学习,而不仅仅是从激励中学习
- **旅行者** 生成和储存可再使用代码文物

**DISE补充说:**

- 客观试验利用(而不是LLM自评)
- 运行时间演变(不仅仅是培训时间)
- 捆绑式示范执行(当需要时才便宜贵)
- 整个工具生命周期(出生  突变  继承  死亡)
- 成本优化反馈循环
- 国家工具登记册(一些Fielding的REST结构----作为国家可处理资源的工具)

工具前证明您可以通过测量真实结果来训练模型来使用工具。 旅行者已证明的代理商可以建立自己的工具库。 反灵活证明反射循环工作。 ReAct证明结构化推理很有帮助。

DiSE 询问 : **如果我们把这些洞察力结合起来, 却让它便宜到可以生产, 并且聪明到可以不断改进自己呢?**

是的,那里也有Roy Fielding的 REST 结构的破折号 工具是使用 URI 、 元数据、 和版本的状态资源。 每个工具都是可处理的、 可缓存的, 并且可以与其他工具一起组成。 工具登记册不仅仅是一个矢量数据库; 它是一个可更新的商店, 资源( 工具) 具有状态( usage Stats、 性能衡量标准、 版本历史) , 影响它们如何被检索和进化 。

那不是训练,不是一次性的一代人 **定向进进**.

### 旅行者建筑

```mermaid
graph TB
    subgraph Voyager["Voyager (2023)"]
        A[GPT-4] --> B[Generate Code]
        B --> C[Execute in Minecraft]
        C --> D{Success?}
        D -->|Yes| E[Store with embedding]
        D -->|No| F[GPT-4 suggests fix]
        F --> B
        E --> G[Vector DB]
        G --> H[Future retrieval]
        H --> A
    end

    style A stroke:#ef4444,stroke-width:3px
    style F stroke:#ef4444,stroke-width:3px

    note1[All reasoning flows through GPT-4]
    note1 -.-> A
```

看到问题了吗?每个决定 — — 规划、评估、调试、构成 — — 都经过相同的前沿模式。当你每一步需要辉煌时,你都需要GPT-4(或同等的GPT-4 ) 。

## 是什么保持了旅行者后退

旅行者不仅使用GPT-4来生成代码,还依靠GPT-4来:

- **规划 规划 规划 规划 规划 规划 规划 规划** - 将高层次目标细分为次级任务
- **评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价评价** - 决定一项技能是否正确工作
- **分解** - 研究现有哪些技能可以结合起来
- **命名命名** - 创建用于储存的描述性标识符
- **选择** - 从嵌入中选择正确的技能
- **质量判断** - 决定什么是"足够好"

当模型所做的一切, 它需要是 前沿水平的辉煌 每次。

这就是为什么旅行者没有超越Minecraft。这就是为什么在生产中经营它要花费很多钱的原因。

### 成本问题

让我们做一些餐巾纸数学。 说你想运行一个旅行者风格的系统, 用于现实世界的任务 :

- GPT-4 涡轮: ~ 每1K 输入牌0.01美元, ~ 每1K 输出牌0.03美元
- 典型技能生成:~2K输入+1K输出=0.05美元
- 100个技能,3个尝试重试,每个=~300个电话= **$15**
- 这只是最初的图书馆建设

现在添加检索查询、 拼写尝试、 调试周期。 您很容易看到 数百 美元, 一个代理来建立一个中等技能图书馆 。

比较一下,这里是分层方法的成本:


|------|-----------------|---------------|---------|
0.001 (Llama 3.1 8B)  98%
 
* 评价 * 0.5美元 * 0美元(静态测试) * 100% *

| **每项任务平均平均** | **$0.20** | **$0.016** | **92%** |

当你只把昂贵的模型称为真正困难的问题时, 经济学就会发生巨大的变化。

## 为什么DISE不可能在2023年(但现在是)

旅行者、工具变异者和反灵活并不是失败。 他们只是打破了他们当时的技术和经济上限。

三个制约因素阻碍了2023年的进展:

限制(2023年) 后果 改变什么 (2024-2025年)
|-------------------|-------------|--------------------------|
GPT-4是唯一可靠的推理引擎 * 一种模型必须做一切事情 * * * 固定模型堆 - GPT-4o + Quen + DeepSeek + Llama *
本地嵌入器薄弱或未使用 回收成本昂贵 BGE/北极/迷你LM 消费者GPU
LLM认为LLM LLM现在通过集装箱化的Exec清洁运行代码

**旅行者和工具者无法进化**

它们只能称为模型或微调模型。
他们无法在系统上传播认知
他们无法施加选择压力

他们解决了 **"我们能吗?"** 问题。

DISE 解答 **"我们如何不断改进?"** 问题。

不是因为我比王或石克聪明 而是因为硬件、工具和经济学 终于赶上来了

**这是一个工程问题。**
工程总是一个时间问题。

## DISE 的核心差异

DISE背后的关键思想简单但深刻:

**结构取代了智慧。**

DISE不指望一种模型能完美地完成所有事情,而是将问题散布到一个管弦系统。它不假定模型“知道如何编码”。相反,它创造出一个“知道如何编码”的模型。 **压力、反馈和内存** 所以模型可以迭接地改进代码 而不是在第一次尝试时完美生成代码

### DISE 建筑结构

```mermaid
graph TB
    subgraph DiSE["DiSE (Distributed System)"]
        A[Triage Agent] -->|Easy| B[Fast Model - Qwen/Llama]
        A -->|Hard| C[Strong Model - GPT-4o]

        B --> D[Test Suite]
        C --> D

        D -->|Pass| E[Structured Registry]
        D -->|Fail| F{Worth escalating?}

        F -->|Yes| G[Optimizer Agent]
        F -->|No| H[Mark as failed]

        G --> I[Mutation Pipeline]
        I --> D

        E --> J[RAG with usage stats]
        J --> K[Clustering & reranking]
        K --> A
    end

    style D stroke:#10b981,stroke-width:3px
    style E stroke:#3b82f6,stroke-width:3px
    style K stroke:#8b5cf6,stroke-width:3px

    note2[Most tasks never hit expensive models]
    note2 -.-> B
```

差异十分明显:

* 旅行者 * * DISE * * 能力 * * 旅行者 * * DISE * * * 能力 * * 旅行者 * * 旅游者 * * DISE * * * 能力 *
|------------|---------|------|
GPT-4  GPT-4
评估 GPT-4 判决  非LLM 测试 度量
具有元数据+标签+使用量的登记簿
GPT-4建议修补 加速和突变管道
内存 * 矢量 DB * RAG + 群集 + 进化跟踪 *
GPT-4计划 工作流图规划
* 成本控制 * 无 * 优先化 + 后退逻辑 *

## 为什么DISE不需要GPT-4(时间最短)

因为 **每个单位生成的代码单位都被当作文物处理**而不是迅速答复。

它不是根据"这样看起来不错吗?" 来判断的 它的判断依据是:

- 它能运行吗?
- 它能解决任务吗?
- 比以前快吗?
- 它通过测试套房吗?

廉价的LLM( wen 2.5 comer 7B, Llama 3.1 8B) 可以产生五个变体。 测试选择最佳。 较强的模型只有在较弱的模型失败时才参与其中 。

随着时间的推移,这个系统学会了哪些模型对哪些领域是好的。 [语义搜索实施](/blog/semantic-search-with-onnx-and-qdrant) - 你不需要最大的模型 当你有合适的结构。

完善过程成为完善过程 **进化,不是自动后退**.

### 真实示例: 排序算法

说你想让你的经纪人 执行高效的分类

**旅行者办法:**

1. GPT-4 生成快速执行
2. GPT-4评估是否“看来正确”
3. GPT-4在环境中运行
4. 如果失败,GPT-4建议修正
5. 费用:每次尝试费用~0.20-0.30美元

**DISE 方法 :**

1. trigage: “ 实施高效排序” 
2. 25码器7B生成5种变体(QuickSort、合并Sort、HeapSort、变异)
3. 测试套件运行所有 5 个对齐 :
   - 正确度测试(分类输出、稳定性、边缘情况)
   - 业绩基准(时间、记忆)
   - 静态分析(复杂度、代码质量)
4. 最佳执行变式可进入具有衡量指标的登记处
5. 费用: < 0.002-0.005美元
6. 今后提出“分类”请求,以收回这一已证实的执行请求
7. 如果后来有人需要“稳定排序”,优化器可以改变现有的代码,而不是从头开始

廉价的模型可以探索解决方案空间。 测试可以进行选择。 昂贵的模型只有在所有五个变体都失败时才会参与。

## 这实际上意味着什么?

我一直在尝试类似的原则 [我博客的RAG系统](/blog/rag-primer) 和 [语义情报特征](/blog/semantidintelligence)模式是一贯的:

**使用最大的建筑决策模式,而不是执行模式。**

当我建造 [断断链接处理器](/blog/the-war-on-404) 语义搜索后退,我没有使用 GPT -4 检查每个链接。

1. 使用简单的 HEAD 请求检查链接有效性(无 LLM)
2. 当链接断开时返回语义搜索( ONNX 模型)
3. 只有在语义搜索失败( 急需) 时才涉及 LLM 。

昂贵的情报在设计中 而不是执行中

## 关键问题

每个系统都提出一个不同的问题:

**工具前端询问 :**

> 一个LLM能够通过测量哪些工具电话实际上有帮助来学习何时使用工具吗?

**旅行者询问:**

> LLM 能够产生有助于未来任务的可重复使用的代码吗?

**DiSE 询问 :**

> 一个系统能否产生工具,客观地评价工具,根据实际结果加以发展,并且所有这一切是否都足以高效地进行生产?

工具前工具已被验证 **基于成果的学习工作**.
旅行者证明 **生成的工具可以重新使用**.
DISE 证明 **工具可以在不打破银行的情况下不断演变**.

工具前工具工具 **培训时间**.
旅行者是 **闪闪闪闪**.
DISE 是 **基础设施基础设施**.

一个显示你可以从结果中学习。
一个显示您可以生成工具 。
另一机制为持续演变建立机制。

## 实际影响

如果你今天正在建立LLM动力系统,DISE方法建议:

### 1. 建设评价第一

不要生成代码,希望它有效。写测试来定义“工作”。像我所做的一样 [框架迁移](/blog/efmigrationstherightway) 不需要LLM的判断

### 2. 认真使用

简便的路线任务到廉价的模型。 保留昂贵的模型给真正棘手的问题。 您的钱包会感谢您的 。

### 3. 跟踪什么工作

不仅存储代码,而且:

- 它所创造的,
- 哪个模型创造了它
- 其表现如何
- 其被再利用的频率

这个元数据成为你路线逻辑的训练数据

### 4. 拥抱进 进

创造变异体,测试它们,保持赢家, 改变好但不完美的人。

这就是我如何在这个博客上看待发展--在公众中反复出现, [从实际交通中学习](/blog/usingumamidataforwebsitestats),根据实际使用情况加以改进。

## 为什么结构比你想的更重要

旅行者和DISE的区别不光是成本,而是... **当事情失败时会发生什么**.

在旅行者中,失败意味着:

- 要求 GPT-4 调试
- 希望它能理解问题
- 支付0.05美元作为此项特权

在DISE中,故障触发因素:

- 结构错误分析(失败、原因、预期)
- 替代工作办法的变式生成
- 只有在问题真正具有新意时才升级
- 学习未来类似失败的学习

系统得到 **更聪明 了解自己不知道的事情**.

## 未来是混合的

我不认为我们会看到纯粹的“单一模型能让一切成功”系统在生产中获胜。经济学不起作用,失败模式也太不透明。

相反,我们将看到像DISE这样的混合系统:

- 共同模式的廉价模式
- 新问题昂贵模式
- 其他一切(测试、度量、验证)的非LLLM逻辑
- 实际从成果中学习的记忆系统

我们到处都看到这种模式:

- [RAG 系统](/blog/rag-architecture) 合并检索+生成
- [多机构工作流程](/blog/workflowsystem-part1-introduction) 具有专门成分的
- [语义搜索](/blog/semantic-search-in-action) 使用嵌入 + 重排

魔力不在于有一个杰出的模特儿 **正确时间右侧模型** 和和 **右上下文**.

## 结论 结论 结论 结论 结论

旅行者是一个信标,它显示代理商可以通过生成代码来学习。

下一步并没有更迅速。这个方法已经到了极限。

下一步是 **定向合成进化**:

- 故意变化
- 客观评价
- 系统继承
- 结构性学习

DISE根本不想一试就变聪明
它试图更好 在 **下一个** 中枪了

这就是进化的开端。

与生物进化不同, 我们不必等上百万年才能看到结果。

---


## 为什么DISE不同

- **不需要微调** - 通过API与任何LLM合作
- **不需要所有GPT -4GPT -4(GPT -4)** - 捆绑的执行可以降低成本
- **没有幻觉评估** - 客观测试工具,而不是LLM判断
- **不丢弃密码** - 每一个文物都储存, 版本,跟踪
- **不要忘记过去的工作** - RAG+用量统计=机构记忆
- **不怕失败** - 用作进化的筛选压力

---


## 继续阅读

**论文:**

- [旅行者:拥有大语言模型的不限名额工作人员代理](https://arxiv.org/abs/2305.16291) - 原始文件
- [工具前工具工具](https://arxiv.org/abs/2302.04761) - 教LLMM公司使用工具
- [重拍](https://arxiv.org/abs/2210.03629) - 理由+行为模式
- [思想树](https://arxiv.org/abs/2305.10601) - 有意解决问题

**博客上写道:**

- [建立RAG系统](/blog/rag-primer) - 混合检索+发电结构
- [使用 ONNX 和 Qdrant 搜索语义](/blog/semantic-search-with-onnx-and-qdrant) - 没有昂贵的APPS入住
- [404年战争](/blog/the-war-on-404) - 确定联系的分层办法
- [使用 Ollama 本地LMLM](/blog/reanimation) - 自我主办小型模型
- [a 建筑律师GPT系列](/blog/building-a-lawyer-gpt-for-your-blog-part1) - 关于RAG+LLMs的多部分系列

**工具 :**

- [奥拉马](https://ollama.ai/) - 在当地运行Llama、Quwen和其他模型
- [利特林](https://github.com/BerriAI/litellm) - 100+LLLM供应商的统一API
- [Lang Chain 兰钱](https://www.langchain.com/) - LLM应用程序框架(虽然我倾向于避免重型框架)