# नहीं, छोटा मॉडल नहीं "बॉज विकल्प"

<!--category-- AI, LLM, Opinion, Ollama, ONNX -->
<datetime class="hidden">2025-12-28T16:00</datetime>

छोटे और स्थानीय TLLM अकसर सामने वाले मॉडलों के लिए मामूली विकल्प के रूप में फ्रेम होते हैं. कि framing गलत है. वे एक ही बात का एक घृणित संस्करण नहीं हैं. वे एक अलग कवर चयन, चुना गया है **नियंत्रण**, **एस्टीमेट:**, और **सुरक्षित असफल मोड**.

मैं किसी को भी करने के लिए दोषी हूँ 'वे स्वतंत्र' विवरण के रूप में... के रूप में अगर वह एकमात्र निर्णायक तत्व था. लेकिन एक डेटाबेस / मशीन के लिए आप समझने की जरूरत है एक प्रणाली का चयन करना पसंद करना पसंद करते हैं **आप क्या कर रहे हैं व्यापार बंद**.

के द्वारा एक छोटा सा मॉडल इस्तेमाल किया जा रहा है [ओलमाjapan. kgm](https://ollama.ai/), LM छात्रो, [ऑन NNX रन समय](https://onnxruntime.ai/)पैसा बचाने के बारे में भी ऐसा ही नहीं है । **जहाँ अस्तित्व में रहने की अनुमति नहीं है**.

[TOC]

## वास्तविक भिन्नता: विफलता मोड

बड़े - बड़े पैमाने पर बड़े - बड़े मॉडलों को और भी असरदार तरीके से पेश किया जाता है । **अधिक खतरनाक** ऐसी व्यवस्थाओं में जो गारंटी की ज़रूरत होती है ।

सामने वाले मॉडलों को समझ में आता है जब चौड़ाई की ज़रूरत होती है और आउटपुट डिजाइन - सृजनात्मक मसौदा द्वारा सहायक होते हैं, खुला, या ज्ञात डोमेन के दौरान. लेकिन यह सबसे उत्पादन व्यवस्था नहीं है.

वे अपनी हार मान रहे हैं **संरक्षा के बजाय इटेलमिक**. यह वर्ग त्रुटि है: एक आकारवादी घटक के रूप में इस्तेमाल किया जा रहा है जैसे कि यह सिस्टम सीमा है. वे सही देखने वाले आउटपुट जो गलत तरीके से गलत हैं. वे असफल हैं:

- पता लगाने के लिए सूचना
- डिबग करने के लिए बहुतेरे दृश्य
- अकसर नुकसान होने के बाद ही दिखाई देता है

**छोटे मॉडल एक अलग तरह से असफल हो जाते हैं.**

जब कोई छोटा मॉडल उलझन में होता है, तो यह उसे पसंद करता है:

- स्कीमा ब्रेक करें
- एमुल अवैध JSON
- आउटपुट छोटा करें
- स्ट्रक्चर्स की मात्रा

ये हैं **असफल**वे सरल आधार के साथ पता लगा सकते हैं ।

**यह एक कमज़ोरी नहीं है ।**

## यह सिद्धांत कहाँ से आता है

इस अन्तर्दृष्टि दुनियावी सिद्धांत नहीं है - यह की बुनियाद है [दस आज्ञाएँ](/blog/tencommandments)कोर सिद्धांत:

> **हकीकत का मतलब समझने की कोशिश कीजिए ।**

जब आप इस सिद्धान्त का पालन करते हैं, तो आप कुछ आश्‍चर्यचकित पाते हैं: **आप महँगे मॉडलों की ज़रूरत बंद कर देते हैं**. 7B पैरामीटर मॉडल स्थानीय रूप से चल रहा है, सुविभ्यता, और पुनः उत्पन्‍न कर सकता है - क्योंकि इसके चारों ओर की जानकारीवादी व्यवस्थाएँ उन सब बातों को संभालती हैं जो वास्तव में सही होने की ज़रूरत हैं ।

छोटे मॉडल "संयोग" नहीं हैं - वे अक्सर होते हैं **पर्याप्त** क्योंकि समस्या पहले ही उस समय तक कम हो चुकी है जब तक कि वह उन्हें पहुँच न जाए ।

सामने वाले मॉडल आप भरोसेमंद आप अपने आप को निर्माण किया जाना चाहिए।

## सही मानसिक आदर्श

जैसा कि DuckB "चिम्प एसक्यूएल" और पोस्ट विग्रिण नहीं है, छोटे seck पर रहता है **डिजाइन स्पेस में भिन्न बिन्दु**. आप उन्हें कब चुनते हैं:

छोटी - छोटी मॉडलों के बारे में चिंता
|---------|----------------------|
| **जगह** SMTP आपके हार्डवेयर, नेटवर्क पर चलता है, अपने आधिकारिक प्रमाण
| **सुनने योग्यता** प्रत्येक इंच लॉग किया जाता है, रीफ्रेक्टिक, जाँचयोग्य है
| **विस्फोट** निलिस विफलताएं शामिल हैं, न कि API जंजीरों के माध्यम से इस्तेमाल किया गया है
| **सही मात्रा में सुधार करें** XIV वेलिडेशन मॉडल के बाहर हो जाता है
| **अनदेखा किया गया अ- निर्धारितता** यु. पू.

## मैं अभ्यास में इसका कैसे इस्तेमाल करता हूँ

यह अस्पष्ट नहीं है. मेरे परियोजनाएं इस पैटर्न को बारंबार प्रदर्शित करते हैं:

### ग्राफ REG तीन निकालना मोड के साथ

[मेरे ग्राफआरईजी कार्यान्वयन](/blog/graphrag-minimum-viable-implementation) तीन मोड्स देता है:

बुर् मोड (L)
|------|-----------|----------|
| **अतिवादी** सेंटीमीटर 0 प्रति मिनट साफ- सफाई IDF + संरचना 6 के माध्यम से निर्धारित करता है
| **हाइब्रिड** SECACCAN 1 किसी भी दस्तावेज़ में छोटे मॉडल पर निर्भर करता है% 2 मौत के घाट उतार दिया गया है
| **सीएलएम** SHA 2 प्रति मिनट अधिकतम क्वालिटी जब आवश्यक हो

वह **ग्रोन मोड** यह मीठा जगह है: Sercrircentircions (प्रयोगात्मक), फिर एक छोटा सा स्थानीय मॉडल इन्हें वैध बनाता है और उन्हें समृद्ध करता है. एक बार किसी दस्तावेज़ को फोन करता है, प्रति मिनट में नहीं.

ओलमा स्थानीय रूप से चल रही है, कीमत $0. लेकिन यह नहीं है कि मैं इसका उपयोग करता हूँ - लागत का उपयोग एक पक्ष का परिणाम है, लक्ष्य नहीं. मैं इसका उपयोग क्योंकि मैं इसका इस्तेमाल करता हूँ. **नाकामी की भावना बहुत कम और साफ नज़र आती है**.

### डिक्सिंग: कोई नलएम आवश्यक नहीं

[सेंसिक खोज ऑन एनएनएक्स तथा क्यूडंट के साथ](/blog/semantic-search-with-onnx-and-qdrant) एक और पैटर्न दिखाता है: कुछ कार्य की आवश्यकता नहीं है...

- **सीपीयू- मित्रता** - कोई जीपीयू आवश्यक नहीं
- **डिम्बिएशन आउटपुट** - वही इनपुट हमेशा इसी तरह पैदा करता है
- **स्थानीय चलाने वाला@ info: whatsthis** - कोई एपीआई कॉल नहीं, कोई देरी नहीं, कोई दर सीमा नहीं
- **~90MB मॉडल** - कहीं भी चलाता है

के लिए [ओपन- पीजीपी खोज](/blog/rag-hybrid-search-and-indexing), मैं BM25 कैंचिंग के साथ इन नृत्यों को साझा करते हैं. "एलीएम केवल Doyym ही समय पर दिखाई देता है - और फिर भी, एक छोटा सा स्थानीय मॉडल ठीक काम करता है क्योंकि यह है **समझा जा रहा है** ऐसी बनावट जो भविष्य की जानकारी देती है, पहले से ही सही साबित हुई है ।

### DocSz: स्ट्रक्चर, पहले, एएलएम द्वितीय

[दो- आयतन्जर](/blog/docsummarizer-tool) इस तत्त्वज्ञान को संपादित करें:

1. **व्याख्या** विस्तृत लाइब्रेरी के साथ दस्तावेज़ों (Xएमएल, मार्क्ड)
2. **कुंक** संक्षिप्त नियमों का उपयोग करते हुए सामग्री (मानिंग, अनुच्छेद, कोड ब्लॉक)
3. **एमुलेट्ड** परवर्ती BERT के साथ रीफ्रेंस
4. **पुनःप्राप्त करें** सदिश खोज के द्वारा संबंधित
5. **सिंथाइज** ओलमा के साथ - एकमात्र प्रवेशात्मक कदम

LM है **अंतिम चरण**पूर्व-वथ सामग्री पर काम करता है. यह असफल हो सकता है - और जब यह करता है, असफलता स्पष्ट है क्योंकि संरचना पहले से ही सही है.

### छोटे: स्थानीय गपशप

[नन्हा- लेल](/blog/texttospeech) स्थानीय LLM प्रयोग को एक विंडोज़ app में दिखाता है. यह समर्थन देता है:

- ओलमा बैकएण्ड
- प्रत्यक्ष जीजीएफ मॉडल लोड किया जा रहा है
- RAG मेमोरी (प्रयोगात्मक वापसी के साथ)

चैट इंटरफेस सहायक है। स्मृति, फ़ाइल नियंत्रण, और राज्य प्रबंधन व्यक्तिगत हैं। एक में विफलता दूसरे को भ्रष्ट नहीं करती।

## तीन सवाल

लेकिन जब जानबूझकर इस्तेमाल किया जाता है तो ये शक्‍तिशाली औज़ार होते हैं । **सच्चाई से समझौता किए बिना या ज़िम्मेदारी के**.

सही सवाल "कौन मॉडल सबसे अच्छा नहीं है?"

यह है:

1. **संभावना कहाँ है?**
2. **भेदभाव का पता लगाने के लिए क्या करना ज़रूरी है?**
3. **यह व्यवस्था कौन - सी विफलताओं से बच सकती है?**

यदि उत्तर में राज्य, पक्ष प्रभाव, पैसा, नीति, या गारंटी - मॉडल शामिल है तो कभी भी ज़िम्मेदारी नहीं लेनी चाहिए । **सही चुनाव**.. आर्थिक एक नहीं।

## पैटर्न: बोर मशीनरी + छोटा मॉडल

यह ऐसी रचना है जो काम करती है:

```
┌─────────────────────────────────────────────────────┐
│                 DETERMINISTIC LAYER                 │
│  State machines, queues, validation, storage        │
│  (DuckDB, Postgres, Redis, file systems)           │
└─────────────────────────────────────────────────────┘
                         │
                         ▼
┌─────────────────────────────────────────────────────┐
│                   INTERFACE LAYER                   │
│  Schema validation, retries, fallbacks             │
│  (Polly, FluentValidation, custom guards)          │
└─────────────────────────────────────────────────────┘
                         │
                         ▼
┌─────────────────────────────────────────────────────┐
│                  PROBABILISTIC LAYER                │
│  Classification, summarisation, hypothesis gen     │
│  (Ollama, ONNX, small local models)                │
└─────────────────────────────────────────────────────┘
```

LM में है **तल**यह प्रस्ताव करता है; अनुमानीय परतों को नष्ट कर देता है ।

## असफलता से दूर रहने के बारे में दृढ़ता नहीं

सभी तीन दृष्टिकोण - प्रश्‍न, पैटर्न, और इस आख़री सिद्धान्त - एक ही नियम को कम करते हैं:

**सुधार असफलता के बारे में है आप बच सकते हैं.**

LLLMMs के साथ, इसका अर्थ है भविष्यात्मक अभ्यासों के माध्यम से अ- निर्दिष्ट अ- निर्दिष्टता का प्रबंधन:

- [आदेश I](/blog/tencommandments): सरकार मॉडल के बाहर रहती है
- [आदेश](/blog/tencommandments): ज़ोर से और उबाऊ बना लीजिए
- [आदेश IX](/blog/tencommandments): पहली बार उबाऊ मशीन बनाओ

छोटे मॉडल यह आसान कर देते हैं क्योंकि उनकी नाकामियाँ कम होती हैं **उच्च**अवैध JSON. स्कीमा उल्लंघन. ये उपहार हैं - वे तुरंत आपको बता रहे हैं कि कुछ गलत हो गया.

मिटाया जाने वाला मॉडल असफल हो गया है **चुप**Cascuting ध्वनि. Cortsss. Carts कि केवल दिखाई देता है जब एक ग्राहक शिकायत करता है या नीडी असफल हो जाता है.

**मैं हर बार ज़ोर से विफल हो जाएगा.**

## संबंधित पढ़ना

### Phico·o·poshy. kgm

- [दस आज्ञाएँ](/blog/tencommandments) - इस ओर के पीछे सिद्धांत
- [क्यों मैं लैंगाइन का उपयोग नहीं करते हैं](/blog/why-i-dont-use-langchain) - जटिलता vss.
- [लेन- देन एआई परियोजनाएँ क्यों दुम्बित हैं](/blog/whycommercialaiprojectsaredumb) - स्थानीय- प्रथम एआई के लिए मामला

### कार्यान्वयन

- [ग्राफ REG: न्यूनतम उतार कार्यान्वयन](/blog/graphrag-minimum-viable-implementation) - तीन निकासी मोड अभ्यास में
- [सेप्टिक खोज ऑन एनएनएक्स तथा क्यूडंट के साथ](/blog/semantic-search-with-onnx-and-qdrant) - सीपीयू-दोस्ती फिटिंग
- [दोएवर्जर औज़ार](/blog/docsummarizer-tool) - सबसे पहले स्ट्रक्चर, एनएम द्वितीय
- [हायपरब्रिएशन खोज तथा स्वचालित सूचीबद्ध किया जा रहा हैName](/blog/rag-hybrid-search-and-indexing) - उत्पाद- बार खोज

### यु. पू.

- [तर्क: विश्‍वासयोग्य होने का दावा करनेवाले के तौर पर इलाज करना](/blog/blog-article-cooking-dise-part3-untrustworthy-gods) - "सच्चे देवताओं" पैटर्न
- [Bot पता लगाने वाले के साथ बोहीज](/blog/botdetection-introduction) - सलाहकार के रूप में, नियंत्रण नहीं
- [शून्य- एनआईपीआई ग्राहकGenericName](/blog/zero-pii-customer-intelligence-part1) - सीमाओं के साथ मौखिक समझ

## बाहरी संसाधन

- [ओलमाjapan. kgm](https://ollama.ai/) - स्थानीय स्तर पर एक कमांड के साथ चलाएँ
- [ऑन NNX रन समय](https://onnxruntime.ai/) - क्रास- बैकअप एमएल इंच
- [LM छात्रो](https://lmstudio.ai/) - स्थानीय प्रवेश के लिए डेस्कटॉप ए एमएलएम
- [विलमा. बीपीपी](https://github.com/ggerganov/llama.cpp) -प्रयोगात्मक सी++