# "क्या रानी सिर्फ वोर नहीं है?" - क्यों संरक्षा scrasyion

<!--category-- AI, Machine Learning, LLMs, Code Generation -->
<datetime class="hidden">2025-11-24T18:00</datetime>

मेरी तंत्र, Rouns, क्या एक आत्म-प्रयोगी है, खुद का निर्माण करने के लिए निर्माण किया जा रहा है, सॉफ्टवेयर इंजीनियरिंग का निर्माणकर्ता. यह परीक्षण योग्य कोडों को बनाता है, और उन्हें स्थिर मानव निरीक्षण के बिना समय का मूल्यांकन करता है. लेकिन यहाँ बात यह है कि 20 23 - कि मेरे प्रभावशाली यंत्रों द्वारा बनाया गया था, और अगर हम पहले से ही काम करने के लिए तैयार नहीं किया है, हम पहले से ही कर सकता है कि अपने स्वयं के परिणामों का उपयोग करने के लिए पता चला है? और अगर हम उन्हें पहले से ही प्राप्त करने के लिए प्रयोग कर लिया है, हम अपने स्वयं को साबित कर लिया है कि हम स्वयं के लिए तैयार करने के लिए तैयार हैं.

और समझ में आता है कि अगर आप कुछ भी निर्माण में चलाने के लिए जरूरत है उत्पादन में चलाने के लिए की जरूरत है।

## परिचय

"यह वोर की तरह लगता है लेकिन अधिक चरणों के साथ. "

BRLM-Son एजेंट अनुसंधान किया गया है, तो आप शायद सुना है [वोयागर](https://arxiv.org/abs/2305.16291) (वांग ए., 2023) - प्रणाली जिसने GBS-4 को फिर से बनाने के लिए मेरा जादू सिखाया. [औज़ार जो पहले से ही औज़ार (o)](https://arxiv.org/abs/2302.04761) दोनों प्रभावशाली, प्रभावशाली, प्रभावशाली, और व्यापक रूप से उल्लेख किए गए ।

पहले दृष्टि में, Rance (प्रायक्खिक विज्ञान) शायद रंग के एक ताज़ा कोट के साथ पूर्व की तरह लग जाए. लेकिन यह ऐसा कह रहा है कि एक उत्पादन डाटाबेस सिर्फ अधिक चरणों के साथ एक स्प्रेडशीट है. अंतर है यदि आप की परवाह करते हैं, लागत, और वास्तव में कुछ और वास्तव में बंद कुछ भी.

> **गलत काम करने के लिए नए?** जाँच बाहर [मेरी लिफ्ट राल](/blog/elevatorpitch) बड़ी तस्वीर के लिए, फिर "मांज के साथ नृत्य" श्रृंखला की जाँच करें: [स्नातकों में से २](/blog/blog-article-cooking-dise-part2-apprenticeships) और [विश्‍वासयोग्य होने का दावा करनेवाला एक भाग 3](/blog/blog-article-cooking-dise-part3-untrustworthy-gods)इस पोस्ट में खास तौर पर इस बात पर ज़ोर दिया गया है कि कैसे डॉ.

यह पोस्ट स्पष्ट करता है कि क्या वो पहले क्या Wakagger और उपकरण सही मिला, जहां वे सीमाओं हिट, और क्यों Danse के कंडी दृष्टिकोण समस्याओं को हल करते हैं कि और अकेले ही नहीं कर सकते.

[TOC]

## कौन सा वोयागर और औज़ार पहले ठीक किया था

2023 से दो पत्र बदल गए । हम कैसे सोचते हैं कि नीएम एजेंटों और औज़ारों के बारे में:

### वोयाजर: एजेंट औज़ार तैयार कर सकते हैं

वोयागर ने एक निर्णायक अन्तर्दृष्टि प्रस्तुत की:

**LLLMM अपने खुद की रीकरेबल उपकरण तैयार कर सकते हैं.**

मेरी कुरान में हर क्रिया को मुश्किल करने के बजाय, वोर ने उड़ान पर कार्यों को लिखने के लिए इस्तेमाल किया। प्रत्येक सफल क्रिया एक सदिश डाटाबेस में संग्रह किया जा सकता है। यह स्पष्ट था:

> "आपका फंक्शन और अधिक जटिल कार्यों के लिए फिर से उपयोग में लिया जाएगा. इसलिए, आपको इसे जेनेरिक और फिर वापस करने योग्य होना चाहिए."

यह महत्त्वपूर्ण था । **वास्तविक सॉफ्टवेयर इंजीनियरिंग** एक से बंद करने के बजाय। वोयाजर दिखाया कि एजेंटों को पता चला:

- समय - समय पर कौशल की बढ़ती हुई लाइब्रेरी बनाएँ
- जटिल व्यवहारों में सरल कौशल बनाएं
- भारी भूल से दूर रहिए- आधारित पुनः प्राप्त करने के द्वारा

और यह काम किया. मेरी जादू में. GES-4 के साथ.

### औज़ार: औज़ार इस्तेमाल करते वक्‍त एजेंट सीखना सीख सकते हैं

[औज़ार जो पहले से ही औज़ार (o)](https://arxiv.org/abs/2302.04761) ( फज़., 2023) ने अलग - अलग तरीके से बात की । **मौजूदा औज़ारों को कॉल करने के लिए**.

चतुर बिट: पहले से ही अपने प्रशिक्षण डाटा तैयार किया गया उपकरण. यह होता:

1. संभव औज़ार पाठ में प्रविष्ट करें (" हो सकता है कि मैं यहाँ एक गणक का उपयोग कर दूँ)?)
2. वास्तव में उन उपकरणों को चलाना
3. उदाहरण रखें जहाँ मदद औज़ारों की मदद की गई हो, फेंक दें जहाँ उन्होंने नहीं किया
4. सफल उदाहरण पर उत्तम- क्लिक करें

यह बनाया गया मॉडल है जिसने सीखा उपकरण इस्तेमाल किया **लक्ष्य परिणाम** मानव व्याख्या के बजाय. सही उत्तर बताता है कि एक गणक एपीआई जो सही उत्तर देता है, उस से बेहतर है जो - कोई भी न्याय की ज़रूरत नहीं है.

### कैसे डिथरिंग दोनों जोड़ता है (और अधिक चला जाता है)

एन. ए. डी.

**वोयागर से:**

- UGTKKSEACKSEANK/ maketitle
- भविष्य की वापसी के लिए उन्हें इकट्ठा कीजिए
- CURIT लेकिन जोड़ता है: खाली जांच टैंकों, सिर्फ "यह मेरी जादू में काम करता है?"
- COWAN लेकिन जोड़ें: GBS-4 के बजाय टीयरेड मॉडल सब कुछ के लिए
- • लेकिन जोड़िए: चोरी - छिपे और विकासवाद, सिर्फ भंडारण नहीं

**पहले से औज़ार से:**

- • ज़रूरी परिणामों से सीखिए
- एसटीसी प्रशिक्षण डाटा स्वचालित तैयार करता है
- GEST लेकिन जोड़ें: रन टाइम विकास, सिर्फ प्रशिक्षण का समय नहीं
- जोड़ें लेकिन जोड़ें: उपकरण खुद बनाएँ, सिर्फ उन्हें फोन करना नहीं
- लेकिन जोड़ें: पूर्ण जीवन - साधन बेहतर किए जा सकते हैं, न कि सिर्फ इस्तेमाल किए गए

**डिथरिंग की वंशावली:**

हर पूर्वज ने कुछ महत्त्वपूर्ण भूमिका निभायी:

```mermaid
graph TB
    ReAct[ReAct 2022:<br/>Reason + Act<br/>Step-by-step thinking] --> DiSE
    Reflexion[Reflexion 2023:<br/>Self-critique loops<br/>Try → Reflect → Retry] --> DiSE
    Toolformer[Toolformer 2023:<br/>Learn from outcomes<br/>Self-generated training data] --> DiSE
    Voyager[Voyager 2023:<br/>Generate reusable tools<br/>Code as memory] --> DiSE

    DiSE[DiSE 2024:<br/>Directed Synthetic Evolution]

    DiSE --> G[Generate tools with tests]
    DiSE --> E[Evaluate objectively]
    DiSE --> M[Mutate and improve]
    DiSE --> S[Store with usage stats]
    DiSE --> R[Retrieve and reuse]
    DiSE --> C[Tiered execution]

    style ReAct stroke:#8b5cf6,stroke-width:2px
    style Reflexion stroke:#ec4899,stroke-width:2px
    style Toolformer stroke:#f59e0b,stroke-width:2px
    style Voyager stroke:#ef4444,stroke-width:2px
    style DiSE stroke:#10b981,stroke-width:3px
```

**भाग:**

- **फिर से सक्रिय करें** क्रिया-bination लूप के साथ स्ट्रक्चर
- **अपॉयरेशन** RESICARS REARE (लेकिन स्वयं ही जजों के साथ)
- **औज़ार जो पहले से ही औज़ार (o)** ▪ सही नतीजे से सीखिए, न कि सिर्फ आगे बढ़ने के लिए
- **वोयागर** ✔ तैयार करने और स्टोर करने के लिए तैयार करें (t)

**आर. एस.**

- ऑब्जेक्टिव टेस्ट स्लॉट (कोई स्व-न्याय नहीं)
- रन समय एवोल्यूशन (सिर्फ प्रशिक्षण समय नहीं)
- टीयरित मॉडल मारता है (जब आवश्यक हो तो ही अच्छा लग सकता है)
- पूरा जीवित उपकरण (प्रयोगात्मक विरासत)
- लागत अनुकूलन फ़ीडबैक लूप्स
- स्टेटेड औजार रजिस्ट्री ( फ़ील्ड के पुनःप्रयोगीय निर्माण औज़ार के रूप में पता योग्य संसाधन के रूप में औज़ारों के रूप में)

उपकरण पूर्व प्रमाणित किया कि आप औज़ारों का उपयोग करने के लिए मॉडलों को प्रशिक्षित कर सकते हैं असली परिणामों को नापने के लिए।

डिथरिंग पूछता है: **अगर हम इन सभी अन्तर्दृष्टिओं को साथ देते हैं, तब क्या?**

और हाँ, रॉय फ़ील्ड की Robing की एक दुर्घटना है वहाँ भी बहुत ही सुंदर संसाधन हैं URI, मेटाडेटा, मेटाडेटा, और संस्करण के साथ। प्रत्येक उपकरण पता योग्य है, कैशेबल, और अन्य लोगों के साथ बनाया जा सकता है। उपकरण पाया जा सकता है सिर्फ एक सदिश डाटाबेस नहीं है; यह एक Roundy संपत्ति है जहाँ मुझे नहीं किया गया है (संपरन) प्रभाव, और कि वे कैसे विकसित कर रहे हैं।

यही कारण है कि प्रशिक्षण नहीं है। यह एक-बंद पीढ़ी नहीं है। **एवोल्यूशन द्वारा निर्देशित किया गया**.

### वोयागरेथ

```mermaid
graph TB
    subgraph Voyager["Voyager (2023)"]
        A[GPT-4] --> B[Generate Code]
        B --> C[Execute in Minecraft]
        C --> D{Success?}
        D -->|Yes| E[Store with embedding]
        D -->|No| F[GPT-4 suggests fix]
        F --> B
        E --> G[Vector DB]
        G --> H[Future retrieval]
        H --> A
    end

    style A stroke:#ef4444,stroke-width:3px
    style F stroke:#ef4444,stroke-width:3px

    note1[All reasoning flows through GPT-4]
    note1 -.-> A
```

समस्या को देखें? हर निर्णय, मूल्यांकन, अभिकलन - समान मॉडल के माध्यम से चला जाता है. जब आपको प्रत्येक कदम पर सहजता की जरूरत होती है, तो आप जीआर-४ (या हर जगह) की आवश्यकता होती है.

## क्या बेच दिया वोर पीछे

कोड पीढ़ी के लिए जीबी-4 का उपयोग नहीं कर रहा था. यह जीबीआर-४ पर भरोसा करता था:

- **योजना** - उच्च स्तर लक्ष्य को उप-कार्य में तोड़ रहे हैं
- **परीक्षण** - अगर एक कौशल सही ढंग से काम किया है
- **डिक्शन स्थिति** - जो मौजूदा कौशल को मिलाने के लिए
- **नाम** - भंडार के लिए वर्णनात्मक पहचानकारक बनाया जा रहा है
- **चयन** - एम्बेडिंग से सही कौशल चुनना
- **विशेषता निर्णय** - क्या "बहुत अच्छा है"

मॉडल सब कुछ करता है, यह हर समय सामने शानदार होने की जरूरत है.

यही कारण है कि क्यों वोयागर मेरी जादू - टोने से परे नहीं था. और यह क्यों इसे उत्पादन में चला रहा है एक भाग्य की कीमत चुकाना होगा.

### खर्चा समस्या

चलो कुछ झपकीक गणित करते हैं. कहो आप वास्तव में दुनिया के कार्यों के लिए एक Waky - शैली प्रणाली चलाने के लिए चाहते हैं:

- GEET-4 vERS: 1K इनपुट टोकन, 0. 00.005 प्रति 1K आउटपुट संकेत
- विशिष्ट कौशल पीढ़ी: ~2 इनपुट + 1K आउटपुट = 0. 05
- 3 में से 100 कौशल प्रत्येक कोशिशों के साथ प्रयास करें = ~300 कॉल = **$15**
- यह सिर्फ आरंभिक लाइब्रेरी बिल्ड है

अब retrackies, रचना प्रयास, डिबगिंग चक्र जोड़िए. आप एक एकल एजेंट के लिए सैकड़ों डॉलर को आसानी से देख रहे हैं एक मध्यम कौशल लाइब्रेरी का निर्माण करने के लिए.

तुलना के लिए, यहाँ एक टाई का तरीका क्या खर्च हो सकता है:

अंगों को स्थिर करता है
|------|-----------------|---------------|---------|
DIBSTP/ birig $ 0. 005 $01 (लला 3ला 3. 8B)
फर्ज़ कीजिए कि आरंभिक राष्ट्र २. ०. ०.५ $ २ (Q) औद्वीन ५५० कोडर)
STANTENDENTE( 0. 53 $0) औवेल्यूशन 2001
SERTE (10%) 2000- 2005 $ 0. 0 (G2- 4o) औवेल्यूशन 0
| **औसत कार्य** | **$0.20** | **$0.016** | **92%** |

जब आप केवल सच्ची कठिन समस्याओं के लिए महँगी मॉडल कहते हैं, तो आर्थिक परिवर्तन नाटकीय रूप से बदल जाता है ।

## क्यों 2023 में हेतु संभव नहीं था (लेकिन अब है)

वे बस अपने पल की तकनीकी और आर्थिक छत को मारते थे ।

2023 में तीन अवरोधों ने प्रगति रोक दी:

0. 2023 (2023) ने किस बदलाव की रिपोर्ट दी (2020202025)
|-------------------|-------------|--------------------------|
EXES-4 केवल भरोसेमंद तर्क इंजन था, एक मॉडल जो कुछ भी करने के लिए किया गया था TBS-2o - G2o + Qven + गहरे खोज + Lamapap
स्थानीय नीकोल कमज़ोर या गैरकानूनी रूप से मरम्मत कर रहे थे / डेज़ीम / मिंपीएम के लिए महँगी / कम कीमत चुकानी पड़ती थी
लॉएल नोएल नोएल लिमएम का फैसला करके अब बर्तन के ज़रिए कोड साफ - सफाई का काम करता है

**तो वोयागर और औज़ार पहले से ही विकसित नहीं हो सकते थे.**

वे केवल मॉडल या उत्तम-प्रयोग मॉडल कॉल कर सकता है.
वे एक सिस्टम पर वितरित नहीं कर सका.
वे चयन दबाव लागू नहीं कर सका.

उन्होंने हल कर लिया **"हमें यकीन है?"** सवाल ।

डिथरिंग हल करता है **"हम कैसे सुधार करते रहते हैं?"** सवाल ।

नहीं क्योंकि मैं Wang या शॉक - से चालाक हूँ... ... लेकिन क्योंकि हार्डवेयर, औजार, और वित्तीय्स अंत में पकड़ा.

**यह एक इंजीनियरिंग समस्या है.**
और इंजीनियरिंग हमेशा समय का एक सवाल है.

## डिथरिंग का कोर भिन्नता

दिमाग के पीछे जो खास बात है, वह है सरल मगर गहरा:

**स्ट्रक्चर बदल जाता है.**

पूरी तरह से कुछ करने के लिए एक मॉडल की उम्मीद करने के बजाय, डिथरिंग प्रणाली के माध्यम से समस्या वितरित करता है। यह मॉडल "कैसे कोड के लिए पता है." इसके बजाय, यह उत्पन्न करता है। **दबाव, फ़ीडबैक, और स्मृति** इसलिए आदर्श बनाने के बजाय, यह पहली कोशिश पर पूरी तरह से तैयार करने के बजाय, कोड को बेहतर बना सकते हैं ।

### डिथरिंग

```mermaid
graph TB
    subgraph DiSE["DiSE (Distributed System)"]
        A[Triage Agent] -->|Easy| B[Fast Model - Qwen/Llama]
        A -->|Hard| C[Strong Model - GPT-4o]

        B --> D[Test Suite]
        C --> D

        D -->|Pass| E[Structured Registry]
        D -->|Fail| F{Worth escalating?}

        F -->|Yes| G[Optimizer Agent]
        F -->|No| H[Mark as failed]

        G --> I[Mutation Pipeline]
        I --> D

        E --> J[RAG with usage stats]
        J --> K[Clustering & reranking]
        K --> A
    end

    style D stroke:#10b981,stroke-width:3px
    style E stroke:#3b82f6,stroke-width:3px
    style K stroke:#8b5cf6,stroke-width:3px

    note2[Most tasks never hit expensive models]
    note2 -.-> B
```

यह फर्क गलत है:

आग्रही कैपेशियाई वोयार रिपोर्टGenericName
|------------|---------|------|
INBL कोड बनाने की पीढ़ी घड़ू GET-4 टीयर बहु-LLLLYAREALL( c)
UNTITELENTELEGERT-4 जज गैर-एम जाँच, मेरे वायरस
सरकशी उपकरण फिर से एम्बेडिंग सिर्फ मेटाडेटा + टैग + उपयोग स्टेटेशन के साथ
AVERAGERS GET- 4 सुझाव देती है कि बहुत से सुधार व प्रोग्रेसिव इवेल्यूशन
INBGRG RG + क्लैम्पिंग + एवोल्यूशन ट्रैकिंग
नई संरचनाERTEGGEGT-4 योजनाGenericName
कड़ी कास्ट कंट्रोल (L)

## क्यों DOSP-4 की आवश्यकता नहीं है (समय के अधिकांश)

क्योंकि **उत्पन्न किए गए कोड के प्रत्येक इकाई को एक आर्टिक के रूप में माना जाता है**, एक संकेत प्रतिक्रिया नहीं है.

यह "यह अच्छा लग रहा है" द्वारा न्याय नहीं किया जाता है? - यह के द्वारा न्याय किया जाता है:

- यह चला जाता है?
- क्या यह कार्य हल करता है?
- क्या यह पहले से भी तेज़ है?
- क्या यह जाँच सूट पास है?

एक छोटा सा मॉडल जब कमज़ोर लोग असफल हो जाते हैं तब केवल एक मजबूत मॉडल चुनना शामिल होता है ।

समय के बीतने पर, प्रणाली सीखती है कि कौन डोमेन के लिए अच्छा है. की तरह मैं अपने साथ किया [िडिक खोज कार्यान्वयन](/blog/semantic-search-with-onnx-and-qdrant) - आप सबसे बड़ा मॉडल की जरूरत नहीं है जब आप सही इमारत है.

उन्‍नति करने की प्रक्रिया शुरू हो जाती है **क्रमविकास, ऑटोग्रेसिव नहीं**.

### वास्तविक उदाहरण: छंटाई एल्गोरिदम

चलो यह सुनिश्चित करते हैं. कहो कि आप अपने एजेंट को कुशल छंटाई करने के लिए चाहते हैं.

**वोयागर पास:**

1. GPT-4 त्वरित कार्यान्वयन तैयार करता है
2. GPT-4 मूल्यांकन यदि "देख" सही है"
3. GPT-4 यह वातावरण में चलाता है
4. यदि यह असफल, जीएन- 4 सुझाव देता है फिक्सेस
5. लागत: ~$0.20-0 प्रति प्रयास

**डिथरिंग पास:**

1. ट्रॉज़: "अनुप्रयोगी प्रभावी छंटाई" जनरल टाईप को मार कर
2. क्यूईएसई2 कोडर 7B से 5 प्रतिशत पैदा होता है (चारो, सम्मिलित करना, डायफिग, crocrat)
3. जाँच सूट सभी 5 के साथ चलाता है:
   - सही जांच (अनुप्रयोगित आउटपुट, स्थिर, किनारा मामलों)
   - परफ़ॉर्मेंस स्लाइडरमार्क्स (समय, मेमोरी)
   - स्थिर विश्लेषण (सामान्यता, कोड विशेषता)
4. बढ़िया प्रदर्शन भिन्नताओं को मेगनिसिस के साथ कतार में चला जाता है
5. लागत: ~$05-0- 0. 005
6. "कार्यिंग" के लिए भविष्य निवेदन इस सिद्ध कार्यान्वयन को प्राप्त करने के लिए निवेदन
7. यदि किसी को बाद में "प्रयोग" की जरूरत होती है, मौजूदा कोड कोश से शुरू करने के बजाय विकृत कर सकते हैं

यह व्यावहारिक मॉडल समाधान अंतरिक्ष का पता लगा सकता है. जाँच चयन करता है. महँगी मॉडल केवल तब भी शामिल होता है जब सभी ५ प्रतिशत असफल होते हैं.

## अभ्यास में इसका क्या अर्थ है

मैं में ऐसे सिद्धांतों के साथ परीक्षण किया गया है [मेरा ब्लॉग रेजी तंत्र](/blog/rag-primer) और [तंत्र गुण](/blog/semantidintelligence). पैटर्न संगत है:

**निर्माण निर्णयों के लिए सबसे बड़ा मॉडल इस्तेमाल करें, चलाने के लिए नहीं.**

जब मैं बनाया [टूटी लिंक हैंडलर](/blog/the-war-on-404) मै ने GST-4 का उपयोग हर कड़ी जांच के लिए नहीं किया था. तंत्र:

1. सरल शीर्ष प्रयोग लिंक को जाँचने के लिए निवेदन करता है (कोईलीएम नहीं)
2. जब लिंक टूट जाएँ (NX मॉडल पर)
3. केवल एक लेसेएम में ही शामिल है यदि एनिकिक खोज असफल रहे (अधीन की आवश्यकता है)

यह बहुत ही महँगी दवा है ।

## कुंजी प्रश्न

हर तंत्र एक अलग सवाल पूछता है:

**औज़ार जो पहले से पूछता है:**

> क्या एक औज़ार उस औज़ार का प्रयोग करने के लिए कर सकता है जिसके औज़ार वास्तव में मदद करते हैं?

**वोयागर पूछता है:**

> क्या एक LLM फिर से असंभव कोड तैयार कर सकता है जो भविष्य में कार्यों में मदद करता है?

**डिथरिंग पूछता है:**

> क्या एक ऐसी व्यवस्था उपकरण उत्पन्‍न कर सकती है, उन्हें उचित रूप से परख सकती है, और क्या यह सब अच्छी तरह से उत्पादन में भाग लेने के लिए पर्याप्त है?

औज़ार जो पहले से ही साबित हो गया **परिणाम आधारित सीखने का कार्य**.
वोयागर साबित हुआ **उत्पन्न किया उपकरण फिर से उपयोग किया जा सकता है**.
डिथरिंग साबित होता है **बैंक को तोड़ने के बिना वे लगातार आगे बढ़ सकते हैं**.

औज़ार पूर्व है **प्रशिक्षण समय**.
वोयागर है **फ्लैश**.
डिथरिंग है **इन्फास्ट्रक्चर**.

एक दिखाता है कि आप परिणामों से सीख सकते हैं ।
एक दिखाता है कि आप औज़ार तैयार कर सकते हैं।
इसके अलावा, विकासवाद को लगातार बढ़ावा देने के लिए दूसरे तरीके भी तैयार किए गए हैं ।

## व्यावहारिकIMEACKENICKS

आप आज निर्माण कर रहे हैं अगर आप कर रहे हैं

### 1 पहले जाँच कीजिए

कोड तैयार नहीं है और आशा यह काम करता है. जाँच लिखें कि "कार्य" को परिभाषित करता है जैसे मैं के लिए करता हूँ. [मेरे एंटिटी फ्रेमवर्क उत्प्रवासन](/blog/efmigrationstherightway) - जाँच चल रही है, या वे नहीं.

### 2. टीयर एग्रेसिव इस्तेमाल करें

महँगी मॉडलों के लिए सरल सरल कार्य. असली कठिन समस्याओं के लिए अतिरिक्त महँगी मॉडल. आपका बटुआ आपको धन्यवाद करेगा.

### 3. ट्रैक क्या करता है

कोड सिर्फ भंडारित नहीं करें, लेकिन:

- यह किस बात के लिए उत्पन्न किया गया
- जिसने पैदा किया, फिर ठीक-ठाक किया,
- यह कितनी अच्छी तरह किया
- कितनी बार इसे फिर से प्रयोग किया जाता है

यह मेटाडाटा आपके आरआउट तर्क के लिए प्रशिक्षण डेटा बन जाता है.

### 4 एवोल्यूशन को प्राप्त किया जा रहा है.

पहले की कोशिश में सिद्धता की उम्मीद मत करो. अंतरहीनता पैदा करो, उनको जांचो, जीत हासिल करो, भले भले में सिद्ध न हों.

इस ब्लॉग पर मैं विकास के लिए जा रहा हूँ। [वास्तविक ट्रैफ़ से सीखिए](/blog/usingumamidataforwebsitestats), वास्तविक उपयोग पर आधारित सुधार.

## आप जितना सोचते हैं उससे ज़्यादा स्ट्रक्चर क्यों करते हैं

वोर और डिथरिंग के बीच अंतर केवल लागत के बारे में नहीं है. यह के बारे में है. **जब स्थिति नाकाम हो जाती है तब क्या होता है**.

वोर में, विफलता का मतलब है:

- GPT-4 को डिबग करने के लिए पूछें
- आशा है कि यह समस्या को समझता है
- इस विशेषाधिकार के लिए $0.05 का ख़र्च करें

डिथरिंग में, विफलता ट्रिगरः

- संरक्षा त्रुटि विश्लेषण (क्या असफल, क्यों, उम्मीद की गई थी)
- चलाने के विकल्प से चर छवियाँ
- तभी गर्भ में पल रहे इस समस्या को सच साबित किया जा सकता है
- भविष्य में ऐसी ही असफलताओं के लिए सीखना

तंत्र जाता है **यह क्या नहीं जानता के बारे में स्मार्ट**.

## भविष्य है Hyrobed है

मुझे नहीं लगता कि हम शुद्ध "नए मॉडल" को देखने जा रहे हैं जो सब कुछ करता है "सभी" तंत्रों को उत्पादन में जीत लेते हैं। आर्थिक काम नहीं करते, और असफलता मोड भी अपारदर्शी हैं।

इसके बजाय, हम बुरी तरह बुरी व्यवस्थाओं को देखेंगे:

- आम पैटर्नों के लिए कच्चे मॉडल
- उपन्यासों की समस्याओं के लिए बढ़िया मॉडल
- सभी बातों के लिए गैर-LM तर्क (पिक्स, मीसिक्शन, वैध)
- स्मृति व्यवस्था जो वास्तव में परिणाम से सीखते हैं

हम हर जगह इस पैटर्न को देख रहे हैं:

- [RAG तंत्र](/blog/rag-architecture) संयोग से प्राप्त किया जा रहा है + पीढ़ी
- [मल्टी- एजेंट कार्य प्रवाह](/blog/workflowsystem-part1-introduction) विशिष्ट अवयव के साथ
- [सेमेन्टिक खोज](/blog/semantic-search-in-action) एम्बेड किया जा रहा है + रीप्ले कर रहा है

जादू एक शानदार मॉडल होने में नहीं है. यह होने में है **दाहिनी ओर का मॉडल सही समय पर** के साथ **दाहिनी ओर का संदर्भ**.

## कंटेनमेंट

वोयागर एक बैंगर था. इसने दिखाया कि एजेंट तैयार कोड द्वारा सीख सकते हैं.

अगला कदम और अधिक उत्तेजित नहीं था. वह तरीका अपनी सीमाओं तक पहुँच रहा है.

अगला कदम है **सजीवित विकासवाद को निर्देशित करें**:

- किस प्रकार के बदलाव
- मूल्यांकन
- तंत्र मददगार विरासत
- स्ट्रक्चरल पढ़ना

डिथरिंग एक एकल शॉट में स्मार्ट होने की कोशिश नहीं कर रहा है.
यह पर बेहतर होने की कोशिश कर रहा है **अगला** गोली मार दी.

यही वजह है कि विकासवाद की शुरूआत कहाँ से होती है ।

और जैविक विकास से भिन्‍न, हमें नतीजे देखने के लिए लाखों साल इंतज़ार नहीं करना पड़ता ।

---


## हमारे बारे में क्या?

- **ठीक नहीं की आवश्यकता नहीं है** - किसी भी के साथ काम करता है एपीआई के माध्यम से
- **सब बातों के लिए जी-टी4 की आवश्यकता नहीं है** - टीयरित मौत की कीमत कम होती है
- **मूल्यांकन नहीं करता है** - उद्देश्य परीक्षण कर रहे हैं, न कि फैसला
- **कोड दूर नहीं फेंकता है** - हर कला का भंडार भंडारित है, संस्करण्ड है, ट्रैक किया
- **पिछले काम को भूल नहीं जाता है** - RAG + उपयोग स्टेट्स = संस्थाल मेमोरी
- **भय विफलता नहीं है** - इसे विकास के लिए चयन के रूप में इस्तेमाल करें

---


## आगे पढ़ा जा रहा है

**कागजः**

- [वोयागर: एक ओपन- अंत में, महान भाषा मॉडलों के साथ एजेंट](https://arxiv.org/abs/2305.16291) - मूल कागज
- [औजारफ़ॉर्मर](https://arxiv.org/abs/2302.04761) - शिक्षण औज़ार इस्तेमाल करने के लिए
- [फिर से सक्रिय करें](https://arxiv.org/abs/2210.03629) - तर्किंग + कार्रवाई पैटर्न
- [विचार के वृक्ष](https://arxiv.org/abs/2305.10601) - किस तरह की समस्या को दूर करना है?

**इस ब्लॉग पर:**

- [RAG सिस्टम बनाना](/blog/rag-primer) - Hywad वापसी + पीढ़ी रचना
- [सेप्टिक खोज ऑन एनएनएक्स तथा क्यूडंट के साथ](/blog/semantic-search-with-onnx-and-qdrant) - महँगी एपीआई के बिना एम्बेडिंग
- [404 में युद्ध](/blog/the-war-on-404) - लिंक ठीक करने के लिए टीयरेड समीप
- [स्थानीय बिलिम के लिए ओलमा का उपयोग किया जा रहा है](/blog/reanimation) - स्विंग छोटे मॉडल
- [एक कानून - पत्र बनाना](/blog/building-a-lawyer-gpt-for-your-blog-part1) - RAG +LMM पर बहु- भाग श्रृंखला

**औज़ार (T)**

- [ओलमाjapan. kgm](https://ollama.ai/) - Lama, क्यूवेन, और अन्य मॉडलों को स्थानीय रूप से चलाएँ
- [लेसर](https://github.com/BerriAI/litellm) - 60+LLM प्रबंधन के लिए एकीकृत API
- [लावाइन](https://www.langchain.com/) - CLM apps के लिए फ्रेमवर्क (हालाँकि मैं भारी फ्रेमवर्क से दूर रहता हूँ)