# दोफ्ल्जर पार्ट 2 - उपयोग करने के औज़ार

<!--category-- AI, LLM, RAG, C#, Docling, Ollama, Qdrant, Tools -->
<datetime class="hidden">2025-12-21T11:00</datetime>

[![GiB से बाहर हो रही है](https://img.shields.io/github/v/release/scottgal/mostlylucidweb?filter=docsummarizer*&label=docsummarizer)](https://github.com/scottgal/mostlylucidweb/releases?q=docsummarizer)
[![.नेट](https://img.shields.io/badge/.NET-9.0-512BD4)](https://dotnet.microsoft.com/)
[![संस्करण](https://img.shields.io/badge/version-3.1.0-blue)](https://github.com/scottgal/mostlylucidweb/releases?q=docsummarizer)

यह है **पार्ट 2** दोवीर श्रृंखला का. देखें [पार्ट 1](/blog/building-a-document-summarizer-with-rag) चूँकि क़ुरैश को जाड़े और गर्मी के सफ़र से मानूस कर दिया है [पार्ट 3](/blog/docsummarizer-advanced-concepts) गहरी तकनीकी में प्रवेश करने और पुनः प्राप्त करने में तेज़ी लाने के लिए।

> **दस्तावेज़ों या यूआरएल को सबूतों के रूप में परिवर्तित करें - मनुष्यों के लिए या एआई एजेंटों - बिना बादल में कुछ भी भेजने के लिए.**

हर दावा विश्लेषण योग्य है. हर तथ्य अपने स्रोत को बताता है. स्व-विकृत द्विचर, पूरी तरह से अपने मशीन पर चलाता है.

```bash
# Human-readable summary
docsummarizer -f contract.pdf

# JSON for agents/pipelines
docsummarizer tool -u "https://docs.example.com"
```

**इस लेख में किन बातों पर चर्चा की गयी है?**: संस्थापन, कुंजी मोड्स (स्वा/ हॉर्ट हूग), टैम्प्लेट्स, तथा सामान्य उपयोग मामलों.

**क्या यह कवर नहीं है**: संपूर्ण कमांड संदर्भ, कॉन्फ़िगरेशन विकल्प, मुसीबतों, निर्माण विवरण.

संपूर्ण दस्तावेज़ के लिए, देखें [पढ़ें](https://github.com/scottgal/mostlylucidweb/blob/main/Mostlylucid.DocSummarizer/README.md).. यह आंतरिक रूप से कैसे काम करता है के लिए, देखते हैं [पार्ट 3](/blog/docsummarizer-advanced-concepts).

[TOC]

## यह क्यों अस्तित्व में है

यह आपको देता है *प्रमाण*.

- **हर दावा में शामिल है `[chunk-N]` उल्लेख** स्रोत सामग्री में वापस जाएँ
- **भरोसा स्तर** (स्फीति/ठी) समर्थन के आधार पर आधारभूत
- **संरक्षा JSON आउटपुट** एजेंट एकीकरण के लिए, CICP सर्वर, CCP सर्वर
- **विशेषता विशेषज्ञ** भाग निकलने से पहले उनको पकड़ लिया जाता है

आप की जरूरत है *भरोसा* सारांश - या उसे किसी अन्य तंत्र - उस मामले में खिलाइए ।

## विशेषताएँ

- **UNINT बर्ट Rog पाइप**: उत्पाद दर्द से राहत पाने के लिए
- **बजे स्वतः मोड**: दस्तावेज़ तथा क्वैरी पर आधारित स्मार्ट मोड चयन
- **बर्ट मोड**: शुद्ध साबित करने के लिए - कोई LLLM आवश्यक नहीं, ऑफ़लाइन काम करता है (0-23-5)
- **सबूत्ड आउटपुट**: प्रशस्ति-पत्र, भरोसा स्तर, ट्रेसेबल दावा करनेवाले दावा
- **बहुल मोड्स**: स्वचलित, बर्ट राग, बर्ट, बर्टीब्रेड, नक्शा रीफ, राश, राइस
- **औजार मोड**: LLLM एजेंटों, एमसीपी सर्वरों के लिए साफ JSON, सीआई जांच
- **13 प्रारूप**: डिफ़ॉल्ट, प्रोट्‌ज़, एक छोटी - सी गोली, गोली, अधिकारी, विस्तृत, तकनीकी, शैक्षिक, उल्लेख, बुकर, सभा, सख्त
- **बड़ा दस्तावेज़**: कंटूरिक प्रक्रिया के साथ 500+ पृष्ठों को हैंडल करता है
- **वेब जाँच रहा है**: सुरक्षा- हार्ड्ड (एसआरएफएफ सुरक्षा, एचटीएमएल सिंग)
- **खेलें- दायाँ मोड**: जावास्क्रिप्ट- फ़ॉर्मेट किए गए पृष्ठ के लिए हेडहीन ब्राउज़र (एक्सटीएई, रीएल ए.)
- **ऑन- लाइनिंग**: शून्य-config स्थानीय अंतर्निर्मित - मॉडल स्वचालित उपयोग में
- **विशेषता विश्लेषण**: हाल ही में जाँच की जा रही है ।
- **रेफ़रेंसेल**: पोललीपर आधारित रिफ्ट + सर्किट ब्रेकर के साथ फिर से कोशिश करें
- **सिर्फ स्थानीय**: कुछ भी अपने मशीन छोड़ नहीं

## LM औजार के रूप में उपयोग किया जा रहा है

वह `tool` कमांड विशेष रूप से एआई एजेंटों, एमसीपी सर्वर, और अन्य ऑटो्ड सिस्टमों के साथ एकीकरण के लिए बनाया गया है. यह प्रमाण पत्र REGGCACT या एजेंट उपकरण बनाने के लिए JSON, और अन्य सिस्टमों के साथ चलाने के लिए आउटपुट किया गया है.

### मूल औजार उपयोग

```bash
# Summarize a URL and get JSON output
docsummarizer tool --url "https://example.com/docs.html"

# Summarize a local file
docsummarizer tool -f document.pdf

# With a focus query
docsummarizer tool -f contract.pdf -q "payment terms and conditions"

# Pipe to jq for processing
docsummarizer tool -f doc.pdf | jq '.summary.keyFacts'
```

### औज़ार आउटपुट स्ट्रक्चर

औज़ार कमांड परिणामों की ट्रैक के साथ स्ट्रक्चर बताता है:

```json
{
  "success": true,
  "source": "https://example.com/docs.html",
  "contentType": "text/html",
  "summary": {
    "executive": "Brief summary of the document.",
    "keyFacts": [
      {
        "claim": "The system supports 10,000 TPS.",
        "confidence": "high",
        "evidence": ["chunk-3", "chunk-7"],
        "type": "fact"
      }
    ],
    "topics": [
      {
        "name": "Architecture",
        "summary": "The system uses microservices...",
        "evidence": ["chunk-1", "chunk-2"]
      }
    ],
    "entities": {
      "people": ["John Smith"],
      "organizations": ["Acme Corp"],
      "concepts": ["OAuth 2.0", "REST API"]
    },
    "openQuestions": ["What is the disaster recovery plan?"]
  },
  "metadata": {
    "processingSeconds": 12.5,
    "chunksProcessed": 15,
    "model": "qwen2.5:1.5b",
    "mode": "MapReduce",
    "coverageScore": 0.95,
    "citationRate": 1.2,
    "fetchedAt": "2025-01-15T10:30:00Z"
  }
}
```

### औजार कमांड विकल्प

```bash
docsummarizer tool [options]
```

2002- 2006 विकल्प (c) 2006- 2007 संक्षिप्त वर्णन
|--------|-------|-------------|
| `--url` | `-u` डब्ल्यूएचओएस को लाने और उसका सार देने के लिए
| `--file` | `-f` INVERAT फ़ाइल का विश्लेषण करने के लिए
| `--query` | `-q` पारितोषिक सरल क्वेरी 0. 28
| `--mode` | `-m` वुल्फहाउंड मोड (कंश, बर्ट राग, बर्टरब्लेड, मैप कम, राघाइस)
| `--model` एन्ट्रॉल ऑलमा मॉडल का प्रयोग करने के लिए किये जाने वाले तमाम संक्रिया का प्रयोग करें
| `--config` | `-c` लिबआईएस कॉन्फ़िगरेशन फ़ाइल पथ

### मुख्य डिज़ाइन सिद्धांत

- **सबूत सबूत देते हैं**: हर दावा में शामिल है `evidence` आईडी जिसका संदर्भ स्रोत रीकिंग्स
- **भरोसा स्तर**: मार्टिस की दर कम हो जाती है `high`, `medium`, या `low` समर्थन के आधार पर आधारित
- **आउटपुट साफ करें**: `executive` सारांश में आसान प्रदर्शन के लिए कोई चेक चिह्न नहीं है
- **मेटाडाटा**प्रक्रिया: डिबगिंग और गुण जाँच के साथ मदद
- **सिंकिंग में त्रुटि**: नाकाम वापसी `success: false` किसी के साथ `error` संदेश

### उदाहरण

**पायथन स्क्रिप्ट:**

```python
import subprocess
import json

result = subprocess.run(
    ["docsummarizer", "tool", "-u", "https://example.com/api-docs"],
    capture_output=True, text=True
)
data = json.loads(result.stdout)

if data["success"]:
    for fact in data["summary"]["keyFacts"]:
        if fact["confidence"] == "high":
            print(f"- {fact['claim']}")
```

**शेल भक्‍ति:**

```bash
# Extract high-confidence facts only
docsummarizer tool -f doc.pdf | jq '[.summary.keyFacts[] | select(.confidence == "high")]'

# Get just the executive summary
docsummarizer tool -u "https://example.com" | jq -r '.summary.executive'
```

## क्विक स्टार्ट

### परियोजना विकल्प

प्री- उन्नत देशी एक्जीक्यूटेबल से उपलब्ध हैं [GiB के जारी](https://github.com/scottgal/mostlylucidweb/releases?q=docsummarizer):

लिबआरटीएस प्लेटफॉर्मGolial डाउनलोडGenericName
|----------|--------------|----------|
IMTAN ("1. 464) `docsummarizer-win-x64.zip` |
IMTAN ("1. 464i") `docsummarizer-win-arm64.zip` |
INVI लिनक्स x64i" `docsummarizer-linux-x64.tar.gz` |
INVI लिनक्स (3264) `docsummarizer-linux-arm64.tar.gz` |
IMSCOSओएस x64 (इनलियम) हालत `docsummarizer-osx-x64.tar.gz` |
मार्सल मेपलस्‌ ARM64 (एक लहरें) हालती `docsummarizer-osx-arm64.tar.gz` |

```bash
# Download and extract (Linux/macOS)
curl -L -o docsummarizer.tar.gz https://github.com/scottgal/mostlylucidweb/releases/download/docsummarizer-v3.1.0/docsummarizer-linux-x64.tar.gz
tar -xzf docsummarizer.tar.gz
chmod +x docsummarizer

# Download and extract (Windows PowerShell)
Invoke-WebRequest -Uri "https://github.com/scottgal/mostlylucidweb/releases/download/docsummarizer-v3.1.0/docsummarizer-win-x64.zip" -OutFile "docsummarizer.zip"
Expand-Archive -Path "docsummarizer.zip" -DestinationPath "."
```

### पूर्वपाराईज़

#### बर्ट मोड (कोई बाहरी सेवाएँ नहीं)

चूँकि क़ुरैश को जाड़े और गर्मी के सफ़र से मानूस कर दिया है **कोई बाहरी सेवा आवश्यक नहीं**:

```bash
docsummarizer -f document.md -m Bert
```

NNX मॉडल पहली बार प्रयोग पर HBAT-से- अप चेहरे से स्वचालित उपयोग करने पर. ~3-5 सेकंड में वापसी.

#### TLM मोड (Auto, बर्ट त्रिज्या, नक्शा कम इत्यादि)

बचाव के लिए, ओएलमा की आवश्यकता है:

```bash
# Install Ollama from https://ollama.ai
ollama pull llama3.2:3b        # Default model - good balance of speed/quality
ollama serve
```

> **गति युक्ति**: तेज़ गति के लिए (0-23s vs ~15), प्रयोग करें `--model qwen2.5:1.5b`

#### वैकल्पिक: डोमिंग (ब्लिटरी फॉर्मेट)

पीडीएफ़ के लिए आवश्यक, DCLX, XLSX, एचटीएमएल, छवियों (PFGG/TF/TF), सीएसवी, वीटीटीएस फ़ाइलें. **टुकड़े तथा सादा पाठ फ़ाइलें सीधे पढ़ा जा रहे हैं - कुछ नहीं किए जाने की आवश्यकता नहीं है.**

```bash
docker run -d -p 5001:5001 quay.io/docling-project/docling-serve
```

#### वैकल्पिक: कवरेज (क्शन वेक्टर भंडारण)

डिफ़ॉल्ट से आवश्यक नहीं

```bash
docker run -d -p 6333:6333 -p 6334:6334 qdrant/qdrant
```

फिर में कॉन्फ़िगर करें `docsummarizer.json`:

```json
{
  "bertRag": {
    "vectorStore": "Qdrant",
    "collectionName": "docsummarizer",
    "persistVectors": true
  }
}
```

#### वैकल्पिक: ओलमा एम्बेडिंग

यदि आप पर एम्बेडिंग के लिए ओलमा पसंद करते हैं तो परनएक्स:

```bash
ollama pull nomic-embed-text   # Or mxbai-embed-large
# Then use: --embedding-backend Ollama
```

### सत्यापित किया जा रहा है

```bash
docsummarizer check --verbose
```

वांछित आउटपुट फ़ॉर्मेट फ़ॉर्मेट तालिका दिखाता है:

```
              Dependency Status              
╭─────────┬────────┬────────────────────────╮
│ Service │ Status │ Endpoint               │
├─────────┼────────┼────────────────────────┤
│ Ollama  │   OK   │ http://localhost:11434 │
│ Docling │ Optional │ http://localhost:5001 │
│ Qdrant  │ Optional │ localhost:6333        │
╰─────────┴────────┴────────────────────────╯

        Default Model Info         
╭────────────────┬────────────────╮
│ Property       │ Value          │
├────────────────┼────────────────┤
│ Name           │ llama3.2:3b    │
│ Family         │ llama          │
│ Parameters     │ 3.2B           │
│ Context Window │ 128,000 tokens │
╰────────────────┴────────────────╯

Ready to summarize! Ollama is available.
```

> **टिप्पणी**: डोमिंग और आगल प्रदर्शन चिह्नों के लिए ठीक है.

## उपयोग

### तयशुदा आचरण

चल रहा है `docsummarizer` कोई आर्गुमेंट नहीं होगा:

1. के लिए देखें `README.md` मौजूदा डिरेक्ट्री में
2. इसे प्रयोग कर रहा है **स्वचलित मोड** (मारत मोड चयन)
3. अच्छे पटल यूआई से कंसोल में छापें
4. में स्वचलित- सहेजें `readme.summary.md`

```bash
# Summarize README.md in current directory
docsummarizer

# Shows a formatted panel with:
# - Document info table (file, mode, model)
# - Progress indicators during processing
# - Summary panel with the result
# - Topics tree if available
# - Saved: readme.summary.md
```

### मूल योगीकरण

```bash
# Just run it - Auto mode picks the best approach
docsummarizer -f document.pdf

# Fast mode - no LLM, pure extraction (~3-5s)
docsummarizer -f document.pdf -m Bert

# Production mode - best quality with validated citations
docsummarizer -f document.pdf -m BertRag

# Focused on specific topic
docsummarizer -f manual.pdf -m BertRag --focus "installation steps"

# Verbose progress
docsummarizer -f document.pdf -v
```

## सुजाराइजेशन विधि

"सिर्फ मैप कम करें" से उपकरण प्रोग्रेसन. यहाँ है कि हर मोड वास्तव में क्या करता है:

### स्वतः (डिफ़ॉल्ट)

जो आप के लिए पूछ रहे हैं उस आधार पर सही मोड चुनता है. इसका इस्तेमाल तब तक कीजिए जब तक आपके पास कोई कारण न हो.

```bash
docsummarizer -f doc.pdf
```

### बर्ट त्रिज्या (प्रयोग)

आप उत्पादन के लिए क्या करना चाहते हैं. तीन-फ्पर:

1. **निकालें** - दस्तावेज़ को खण्ड में व्याख्या, BERT के साथ उन्हें एम्बेड करें
2. **पुनःप्राप्त करें** - सम्बन्धित खण्ड को ढूंढें (डिस्किक खोज + सिगिंग)
3. **सिंथाइज** -LLM उन खण्डों से एक प्रभावी सारांश लिखता है

```bash
docsummarizer -f doc.pdf -m BertRag
docsummarizer -f doc.pdf -m BertRag --focus "payment terms"
```

**क्यों इसे प्रयोग करें:** हर निशान का एक स्रोत भाग में वापस लाने का दावा करता है. कोई भी दस्तावेज़ आकार का स्केल नहीं. सिर्फ अंत में ही xL भाग जाता है.

### बर्ट (तेज, कोई तेजएम)

स्थानीय पर स्थानीय मॉडलों का उपयोग कर शुद्ध निकास.

```bash
docsummarizer -f doc.pdf -m Bert
```

**क्यों इसे प्रयोग करें:** ऑफ़लाइन काम करता है. ~3-5 सेकंड में रिटर्न. डेइनिटेंस ( समान इनपुट = एक ही आउटपुट). जल्दी स्कैन के लिए पर्याप्त अच्छा है.

### बर्ट हेब्रिड

बर्ट व बर्ट रोग के बीच मध्य भूमि.

```bash
docsummarizer -f doc.pdf -m BertHybrid
```

### नक्शा रिफ / राइस्डर

फिर भी, बर्ट राग ने ज़्यादातर मामलों के लिए उनकी जगह ली ।

- **मैप कम करें**: 64 विस्तार के लिए समानांतर रीफिंग, अच्छा
- **रघुट**: वेक्टर खोज, ध्यान केंद्रित करने के लिए अच्छा (गार - बर्टर रोग यह बेहतर करता है)
- **इटेरेशन**: सीक्वेंशियल प्रक्रिया, सिर्फ छोटे - छोटे खुराक के लिए इस्तेमाल

```bash
docsummarizer -f doc.pdf -m MapReduce  # Full coverage
docsummarizer -f doc.pdf -m Rag --focus "query"  # Legacy focused mode
```

### क्वैरी मोड

जानकारी देने के बजाय, किसी दस्तावेज़ के बारे में सवाल पूछिए:

```bash
docsummarizer -f manual.pdf --query "How do I install the software?"
```

### वेब यूआरएल ला रहा है

वेब पृष्ठों को सीधे डाउनलोड किए बगैर प्रेषित करें:

```bash
# Summarize a web article
docsummarizer --url "https://example.com/article.html" --web-enabled

# Summarize a remote PDF
docsummarizer --url "https://example.com/document.pdf" --web-enabled

# With structured JSON extraction
docsummarizer --url "https://example.com/api-docs.html" --web-enabled --structured
```

**समर्थित अंतर्वस्तु**: HTML (अनेड), पीडीएफ, मार्क डाउन, छवियों (ओसीआर), दस्तावेज़. बड़ी छवियों का आकार स्वचालित बदल दिया गया.

**सुरक्षा**: SSRF सुरक्षा, डीएनएस फिर से सुरक्षा, सामग्री क़िस्मिंग बम सुरक्षा, HTML SIANARSीकरण.

**जावास्क्रिप्ट-ड पृष्ठ**: इस्तेमाल `--web-mode Playwright` मेन्यू के रूप में तथा रीप्लिकेशन ऐप्ट्स (यू- ऐक्स- ए- ऐप्ट्सिलियम पहले प्रयोग में डालें).

### स्ट्रक्चर मोड

प्रोटेस्टंट के बजाए मशीन पढ़ने योग्य JSON निकालें:

```bash
docsummarizer -f document.pdf --structured -o Json
```

निकालें: एंटिटी, फंक्शन, कुंजी प्रवाह (विश्‍वास के स्तर के साथ), अनिश्‍चित, कोटा - रेखाएँ ।

### सारांश टैम्प्लेट्स (T)

```bash
# Use a template
docsummarizer -f doc.pdf --template executive
docsummarizer -f doc.pdf -t bullets

# Specify custom word count with template:wordcount syntax
docsummarizer -f doc.pdf -t bookreport:500
docsummarizer -f doc.pdf -t executive:100

# Or use --words to override any template's default
docsummarizer -f doc.pdf -t detailed --words 300
```

घड़ू टैम्प्लेट घड़क शब्द सबसे अच्छा के लिए
|----------|-------|----------|
| `default` पारितोषिक विषय (2 पैराग्राफ) के साथ संतुलित सारांश
| `prose` दिखाई दे रहे बहुमुखी सुधार - कोई मेटाडेटा नहीं
| `brief` SUM-50 त्वरित 2-3 वाक्य सारांश
| `oneliner` ROUND ~25 एकल वाक्य सारांश
| `bullets` अतुल्यकालिक स्वचालित बुलेट सूची (5- 7 वस्तुएँ)
| `executive` EXARE( 5050) सिफारिशों के साथ संक्षिप्त
| `detailed` [ पेज 12 पर बड़े अक्षरों में लेख की खास बात]
| `technical` INDECKS ~350 बुरी तकनीकी प्रमाणपत्र जो कार्यान्वयन विवरण के साथ चल रहा है
| `academic` IMSUNT ~abrazil. kgm
| `citations` INBWWK कुंजी सिर्फ श्रोत उद्धरण के साथ उद्धरण देता है
| `bookreport` SICAS ~00 बुक रिपोर्ट (अनुप्रयोग, अक्षर, प्लाट, प्रसंग)
| `meeting` सन 2002- 2003 बैठक में लिखा है (डाइल्स, क्रियाएँ, सवाल)
| `strict` INV ~60 MACACKS, 3 बुलेट अधिकतम, कोई वह समाधान नहीं

सभी उपलब्ध टैम्प्लेटों को वर्णनों के साथ देखने के लिए:

```bash
docsummarizer templates
```

### मॉडल बेचमार्किंग

उपयोग कर एक ही दस्तावेज़ पर मॉडलों की तुलना करें `benchmark` सब कमांड्स:

```bash
docsummarizer benchmark -f doc.pdf -m "qwen2.5:1.5b,llama3.2:3b,ministral-3:3b"
```

संपादन कमांड दस्तावेज़ की व्याख्या एक बार करता है, फिर प्रत्येक मॉडल को उचित तुलना के लिए एक ही बार चलाता है. आउटपुट समय, शब्द गणना, और प्रत्येक मॉडल के लिए शब्द/ सेकंड दिखाता है.

### बैच प्रक्रिया

संपूर्ण डिरेक्ट्रीज़ को प्रोसेस करें:

```bash
# Use BertRag for quality
docsummarizer -d ./documents -m BertRag -v

# Fast offline batch (no LLM needed)
docsummarizer -d ./documents -m Bert -o Json --output-dir ./summaries

# Process only PDFs recursively
docsummarizer -d ./documents -e .pdf --recursive -v
```

### कमांड लाइन विकल्प

2002- 2006 विकल्प (c) 2006- 2007 संक्षिप्त विवरण (c) 2006- 2007, गिल्स काउलिएर
|--------|-------|-------------|---------|
| `--file` | `-f` दस्तावेज़ में पथ (काला, पीडीएफ, MD)
| `--directory` | `-d` बैच प्रक्रिया के लिए निर्देशिका का पथ - सरकशी
| `--url` | `-u` डब्ल्यूएचओ वेब यूआरएल को लाने व उसका सार देने के लिए
| `--web-enabled` Libisofs वेब लाने को सक्रिय करता है (-- कर्ल के लिए आवश्यक है) `false` |
| `--mode` | `-m` mugugion विधि: स्वचलित, बर्ट राग, बर्टHyrod, मैप रिबला, यह exclowald `Auto` |
| `--structured` | `-s` शिर्क किए गए JSON एक्सपोजर मोड का प्रयोग करता हैcolombia. kgm `false` |
| `--focus` RAG मोड के लिए एहदो पैमान क्वेरी
| `--query` | `-q` DTAVERSELLANK मोड के बजाय एमुलेटर
| `--model` एन्ट्रॉल ऑलमा मॉडल का प्रयोग करने के लिए किये जाने वाले तमाम संक्रिया का प्रयोग करें `llama3.2:3b` |
| `--verbose` | `-v` IMTAN( डबल्यू) के साथ विस्तृत प्रगति दिखाएँ `false` |
| `--config` | `-c` विन्यास फ़ाइल जिसे स्वतः विन्यस्त किया जा रहा है का पथ
| `--output-format` | `-o` INBS आउटपुट प्रारूप: कंसोल, पाठ, मार्क डाउन, जेएनएस `Console` |
| `--output-dir` फ़ाइल आउटपुट के लिए Libisofs आउटपुट निर्देशिका
| `--extensions` | `-e` अलग होने के लिए फ़ाइल विस्तार
| `--recursive` | `-r` डिबगिंग सूचनाओं को प्रिंट करें `false` |
| `--template` | `-t` INBS सारांश टैम्प्लेट (डिफ़ॉल्ट, संक्षिप्त, बुलेट, व्यवस्थापक, आदि.) `default` |
| `--words` | `-w` अस्थायी लक्ष्य शब्द गणना करता है (ओक्यूट्स टैम्प्लेट को दोहराता है)

| `--embedding-backend` Altiving बैकेंड: INnx, ओलमा हालत `Onnx` |
| `--embedding-model` INNNX मॉडल नाम (आरजी मोड) `AllMiniLmL6V2` |
| `--web-mode` INRWWW वेब को लाने का मोड: सादा, खेलें [Ctrl+ER] `Simple` |
| `--analyze` | `-a` EXARGERYEAR क्वालिटी विश्लेषण करता है `false` |

## सुजाराइजेशन विधि

### नक्शा रिबूट करें (अनुप्रयोगित)

पूर्ण दस्तावेज़ विस्तार के साथ विस्तृत विस्तार के लिए उत्तम.

```bash
docsummarizer -f document.pdf -m MapReduce -v
```

**यह कैसे काम करता है**:

1. दस्तावेज़ को नया आकार देने वाले भाग में विभाजित करता है ( द्वारा शीर्षकों के द्वारा)
2. एनआईएम का प्रयोग करते हुए हर रीफ्ट को अलग करता है
3. प्रशंसा के साथ प्रशासक सारांश में डिग्री कम करें
4. सभी उल्लेखों को वैध करता है

**लंबे दस्तावेज़ के लिए लघुरूपीकरण**:

बहुत लंबा दस्तावेज़ों के लिए जहाँ शामिल होते हैं मॉडल के संदर्भ विंडो से अधिक, नक्शा स्वचालित रूप से कम प्रयोग करता है:

1. **बैचिंग**: संदर्भ में फिट होने वाले समूह को मिटाया जा रहा है
2. **इंटरेक्शन कमी**: प्रत्येक बैचिंग सारांश में कम करें
3. **अंतिम कमी**: अंतिम आउटपुट में एक कांटिट्यूशन शामिल करता है
4. **रिकर्सिव**: यदि अनुप्रयोग अभी भी बहुत बड़ा है, तो अधिक स्तर जोड़िए

```
100 chunks → 100 summaries → 5 batches → 5 intermediate summaries → final
```

यह दस्तावेज़ विस्तार की बनाए रखता है, लंबाई के हर भाग को अंतिम सारांश में योग देता है. उपकरण अनुमान चिह्नों (0.4 अक्षर/ts) और लक्ष्य 60% संदर्भ विंडो प्रति कटौती जाता है.

**छैतिज पैमाना**: तेज, पूर्ण विस्तार, समानांतर प्रक्रिया, किसी भी दस्तावेज़ लंबाई को संभालता है
**कॉन्न्स**: बहुत लंबा दस्तावेज़ों के लिए धीमी गति से क्रूसों को पार करने की छूट देता है

### RAG (प्रयोगियों के लिए उत्तम)

जब आपको किसी खास विषय पर ध्यान देने की ज़रूरत होती है या एक खास सवाल उठता है, तो अच्छा होगा कि आप उस पर ध्यान दें ।

```bash
docsummarizer -f document.pdf -m Rag --focus "pricing and payment terms" -v
```

**यह कैसे काम करता है**:

1. सूची दस्तावेज़ फिर से बनाई गई वस्तुओं को क्यूवरिंग के रूप में बनाई गई वस्तुओं की सूची
2. दस्तावेज़ शीर्षकों से मुख्य विषय निकालें
3. गणितीय खोज का प्रयोग करते हुए प्रति विषय का खोज निकालता है
4. उद्धरण के साथ केंद्रित सारांश

**मैप कम करने के लिए RAG का उपयोग कब करें**:

अतुल्यकालिक चित्र सर्वोत्तम मोड (x)
|----------|-----------|
तमाम "इस दस्तावेज़ को सार दें"mahjongg map name
"यह सुरक्षा के बारे में क्या कहते हैं?" RAGRGERS
libburn 500-पेज मैनुअल, सभी बातों का मैप रिबूट (आंटा) साझी होने की जरूरत है
ROUND 500-page मैनुअल, विशिष्ट खण्ड 2016 की आवश्यकता है
आयामी तेजी से परिणाम की आवश्यकता है, पैरेंट नक्शा कम नहीं है

RAG है **नहीं** इसके बारे में RG के बारे में क्या? **फ़िल्टरिंग फ़िल्टरName**: जब आप किसी दस्तावेज़ के 90% को नज़रअंदाज़ करना चाहते हैं और अपने खास सवाल पर ध्यान देना चाहते हैं, तो उस पर ध्यान दीजिए ।

**छैतिज पैमाना**: विषय-रूप समझ, पुनः प्रयोग करें सूची, ध्यान केंद्रितियों के लिए तेजी से
**कॉन्न्स**: ध्यान केंद्रित क्षेत्र के बाहर गुम सामग्री की आवश्यकता है, क्यूवेशन की आवश्यकता है, धीमी आरंभिक इंडेक्सिंग

### इटेरेशन

इतिहास के दस्तावेज़ों के लिए उत्तम... ... जहां संदर्भ अनुक्रमीय रूप से प्रवाह करता है.

```bash
docsummarizer -f story.pdf -m Iterative -v
```

**चेतावनी**: धीमा और लंबे दस्तावेज़ों पर संदर्भ खो सकता है (> 10 का टुकड़ा).

## बड़े दस्तावेज़ मार्गदर्शक

### सही मोड चुनने का चयन करें

INB दस्तावेज़ प्रकार AGTEGTY_BAR_
|---------------|------|------|-----|
तमाम तकनीकी स्पेस (50+ पृष्ठों)
INNLNAL/NLLLLLYEALLLLYEARTYYEANK की जरुरत है
लीगल लीगल अनुबंध पूरा सारांश मैप स्मिट कम नहीं कर सकता है
लीगल कानूनी अनुबंध "metion शर्तों"? SRGRGRECOG किसी खास खंड 6 पर फोकस
SIGRT MAT (200 पृष्ठ) DULLYAT "ALAL कैसे काम करता है? "CHALRGES" GTE(200 पेज)
[ पेज 27 पर बड़े अक्षरों में लेख की खास बात]

### फ़िक्शन वी नॉन- फ़िक्स्शन

INVER सामग्री क़िस्म
|--------------|-----------|-------|
| **फ़िक्शन/ निमंस** आवर्धन नक्शा रिफ्पर प्लाट के लिए अनुक्रम संदर्भ कोष्ठक की आवश्यकता है
| **तकनीकी खुराक** नक्शे पर नज़र रखने के लिए चिल्लायी गयी दोनों तरफ का नक्शाREGERGERSE
| **लीगल/ कम्पेटिबिलिटी** Git नक्शा हर खंड के मामले को कम करता है
| **हस्तचालित** [ पेज 9 पर बड़े अक्षरों में लेख की खास बात]

### परफार्मेंस

SMTP दस्तावेज़ आकार (R)
|---------------|-----------|-----|-------|
SIG 10 पेज 0. 15s20LLLLLLLW दोनों तेजी से चढ़ी
50 पेज 45 से 45x50 LRG तेजी से अगर ध्यान केंद्रित किया जा रहा हो
270 200 पेज 3-5 मि. 2 मि. 2 मि.
500+ पेज 0. 20- 15 मि. 2-3 मिनट के बारे में विचार करते हुए बहुत से RAGCKT पर विचार कीजिए

## कॉन्फ़िगरेशन

### डिफ़ॉल्ट कॉन्फ़िगरेशन तैयार करें

```bash
docsummarizer config --output myconfig.json
```

### कॉन्फ़िगरेशन फ़ाइल

कॉन्फ़िगरेशन स्वतः खोज लिया गया है:

1. `--config` विकल्प
2. `docsummarizer.json` मौजूदा डिरेक्ट्री में
3. `.docsummarizer.json` (छुपी फ़ाइलें)
4. `~/.docsummarizer.json` (उपयोक्ता घर)

उदाहरण `docsummarizer.json`:

```json
{
  "embeddingBackend": "Onnx",
  "onnx": {
    "embeddingModel": "AllMiniLmL6V2"
  },
  "ollama": {
    "model": "llama3.2:3b",
    "embedModel": "mxbai-embed-large",
    "baseUrl": "http://localhost:11434",
    "temperature": 0.3,
    "timeoutSeconds": 1200
  },
  "docling": {
    "baseUrl": "http://localhost:5001",
    "timeoutSeconds": 1200,
    "pdfBackend": "pypdfium2",
    "pagesPerChunk": 10,
    "maxConcurrentChunks": 4,
    "enableSplitProcessing": true
  },
  "qdrant": {
    "host": "localhost",
    "port": 6333,
    "collectionName": "documents"
  },
  "processing": {
    "maxHeadingLevel": 2,
    "targetChunkTokens": 1500,
    "minChunkTokens": 200,
    "maxLlmParallelism": 2
  },
  "output": {
    "format": "Console",
    "verbose": false,
    "includeTrace": false
  },
  "webFetch": {
    "enabled": false,
    "mode": "Simple",
    "timeoutSeconds": 30,
    "userAgent": "Mozilla/5.0 DocSummarizer/1.0"
  },
  "batch": {
    "fileExtensions": [".pdf", ".docx", ".md", ".txt", ".html"],
    "recursive": false,
    "continueOnError": true
  }
}
```

### प्रक्रिया विकल्प

2002- 2006 विकल्प (c) 2006- 2007 डिफ़ॉल्ट (c) 2006- 2007@ info: credit
|--------|---------|-------------|
| `maxLlmParallelism` SIGRT 8 मौजूदा कॉनक्शन निवेदन (ओलमा कतार, सिर्फ क़तार में इतना उच्च मूल्य)
| `maxHeadingLevel` H1/H2 पर 2. 3 को उत्तमGodirigiviod के लिए सेट करें
| `targetChunkTokens` IMTART 0 (autoTH) 0- cation आकार की गणना करता है. 0 = call-cing की गणना (उदाहरण के लिए संदर्भ विंडो का 0. 25%)
| `minChunkTokens` IMTAN (autoroz) japan. 0 = 8 लक्ष्य का मान

## आउटपुट फॉर्मेट

### सारांश स्ट्रक्चर

```C:\Blog\mostlylucidweb\Mostlylucid\Markdown\docsummarizer-tool.md
## Executive Summary
- Key finding 1 with specific details [chunk-0]
- Important point 2 with numbers and dates [chunk-3]
- Critical requirement 3 [chunk-5]

## Section Highlights
- Introduction: Overview of the system architecture [chunk-0]
- Requirements: Technical specifications detailed [chunk-3]
...

## Open Questions
- What is the timeline for Phase 2?
- How does the fallback mechanism work?

### Trace

- Document: document.pdf
- Chunks: 12 total, 12 processed
- Topics: 5
- Time: 21.4s
- Coverage: 100%
- Citation rate: 1.20
```

**गेंद का पता लगायें**: कवरेज (% भाग में शामिल हैं), प्रशस्ति-पत्र (संत्र/ दर), क्लैच प्रक्रिया (RGGG) छोड़ सकते हैं.

## मॉडल प्रतिनिधि

कामों के लिए पाठ- से- वार्ताName
|-------|------|-------|---------|----------|
| `qwen2.5:1.5b` यूजीन 96MB बहुत तेज (463s) औद्वीव गति कम करता है
| `gemma3:1b` IMSGRING 815MB तेज (0-210s) 2002- 2006, 2002- 2006 छोटा मॉडल बुरे लग रहा है
| `llama3.2:3b` IMSURT 2GBडीपीआई मध्यम (उदाहरण के लिए) बहुत अच्छा **डिफ़ॉल्ट** - अच्छा संतुलन संतुलन संतुलन
| `ministral-3:3b` IMTAR 2. 9GBडीपीआई मध्यम (18020s) बहुत अच्छा विशेषता- चिल्लानी होगी
| `llama3.1:8b` 0. 7zGB धीमा ( 0. 45s) सर्वोत्तम उत्तम उत्तम उत्तम उत्तम उत्तम उत्तम उच्च- समसंत्रीय

> **आकार बदलें**: तेज़ गति के लिए (0-23s vs ~15), प्रयोग करें `--model qwen2.5:1.5b`कठिन दस्तावेज़ों के लिए जहाँ और भी गुण मामले होते हैं, प्रयोग करें `--model llama3.1:8b`.

## स्रोत से बिल्ड करें

```bash
# Clone the repository
git clone https://github.com/scottgal/mostlylucidweb.git
cd mostlylucidweb/Mostlylucid.DocSummarizer

# Build
dotnet build

# Run
dotnet run -- --help
```

### स्व- बिल्डर

आवश्यकता के बिना उत्पादन तैनात करने के लिए. NET बिल्ड संस्थापना:

```bash
# Build self-contained executable (Windows x64)
dotnet publish -c Release -r win-x64 --self-contained

# Build for Linux
dotnet publish -c Release -r linux-x64 --self-contained

# Build for macOS
dotnet publish -c Release -r osx-x64 --self-contained
```

आउटपुटः `bin/Release/net9.0/<runtime>/publish/docsummarizer`

## ट्रबलिंग

### "ओलमा से कनेक्ट नहीं हो सकता"

- सुनिश्चित करें कि ओलमा चल रहा है: `ollama serve`
- चेक मॉडलों को खींचा गया है: `ollama list`

### "डिचिंग सेवा अनुपलब्ध"

- यह है **केवल PDF/डाकCX फ़ाइलें के लिए आवश्यक हैं**
- प्रमाणपत्र फ़ाइलों के लिए, आप इस त्रुटि को अनदेखा कर सकते हैं
- सही करने के लिए: `docker run -p 5001:5001 quay.io/docling-project/docling-serve`

### "वरेज कनेक्शन असफल"

- यह है **RAG मोड के लिए केवल आवश्यक** (`--mode Rag`)
- नक्शा कम करने के लिए (डिफ़ॉल्ट, आप इस त्रुटि को अनदेखा कर सकते हैं)
- सही करने के लिए: `docker run -p 6333:6333 -p 6334:6334 qdrant/qdrant`

### "रर्मल ब्रेकर खुला है"

- ओसमा भार से ऊपर है या क्रैश हो गया है
- सर्किट ब्रेकर को रीसेट करने के लिए 30 सेकंड तक प्रतीक्षा करें, या फिर ओल्लेमा फिर से शुरू करें
- औज़ार पोलीय नीतियों का उपयोग करता है और स्वचालित- आकार देगा

### "wscv" या कनेक्शन त्रुटियाँ (विंडोज़)

- यह विंडोज़ पर एक ज्ञात ओलमा मुद्दा है (उदा. 14040)
- उपकरण स्वचालित रूप से इस तर्क और कनेक्शन को पुनः प्राप्त करने से जुड़ा हुआ है
- यदि आग्रह किया जाता है, ओलमा फिर से कोशिश करें तथा फिर से कोशिश करें

### "एलएम पीढ़ी समय समाप्त हो गया"

- विन्यास में टाइम- आउट बढ़ाएँ
- बहुत बड़ा दस्तावेज अलग करें
- चेक ओसमा अन्य अनुरोधों के साथ लोड नहीं हुआ है

### रिटेंस या लो- गुणवत्ता एनएसएसेस

**सममितियाँ**: गोली जो तुरंत आ जाती है ("कि केवल गोली बिन्दुओं"), " नियम है..." सामग्री के बजाय.

**कारण**: मॉडल बहुत लंबा होता है या संतुष्ट रहता है ।

**ठीक करें**डिफ़ॉल्ट: `qwen2.5:1.5b` अधिकांश दस्तावेज़ों को अच्छी तरह से संभालता है. समस्याजनक दस्तावेज़ों के लिए, कोशिश करें `--model llama3.2:3b`. देखें [मॉडल प्रतिनिधि](#model-recommendations).

### सारांश दस्तावेज़ सामग्री अनदेखा करता है

यदि सारांश जेनेरिक या संदर्भ नहीं करता है विशिष्ट सामग्री:

- मॉडल शायद अनुचित किया जा रहा है - जाँच की जा सकती है `Citation rate` ट्रेस आउटपुट में
- RAG मोड की कोशिश करें ()`--mode Rag`(R) जो आधार वापस रीग्रेस में है
- प्रयोक्ता `--verbose` देखने के लिए कि क्या फिर से बनाई जा रही है

### प्रशस्ति-पत्र को अनुपस्थित या अवैध

यदि तत्व की कमी है `[chunk-N]` उल्लेख:

- पाठ फ़ॉर्मेटिंग से पहले सामग्री को व्यवस्थित करने के छोटे मॉडल
- निर्देश गति के लिए अधिकतम किया जा रहा है, सख्त सेडेंरेशन अनुपालन नहीं
- सख्त प्रशंसा के लिए, बड़े मॉडलों की तरह इस्तेमाल करें `llama3.2:3b`
- जाँचें `Citation rate` ट्रेस - उच्च मान में बेहतर ट्रेसेस सूचित करता है

## परफ़ॉर्मेंस हार्डवेयर्स

- **मैप कम करें** गति
- **`qwen2.5:1.5b`** गति के लिए, **`llama3.2:3b`** और तुम (जब तौलो तो) ठीक तराज़ू से डन्डी सीधी रखकर तौलो **`llama3.1:8b`** गुणवत्ता के लिए
- **ऑन- लाइनिंग** (डिफ़ॉल्ट) रेज़लमा मोड के लिए तेजी से कर रहे हैं
- निम्नतर **`maxLlmParallelism`** यदि अनुभव समय समाप्ति हो

## संसाधन

- [स्रोत कोड](https://github.com/scottgal/mostlylucidweb/tree/main/Mostlylucid.DocSummarizer)
- [GiB के जारी](https://github.com/scottgal/mostlylucidweb/releases?q=docsummarizer)
- [बदलता है](https://github.com/docling-project/docling) / [सेवा करते वक्‍त](https://github.com/docling-project/docling-serve)
- [स्केल्स](https://qdrant.tech/) - स्थानीय सदिश डाटाबेस
- [ओलमाjapan. kgm](https://ollama.ai/) / [पहाड़ों को ठोस करता है](https://github.com/awaescher/OllamaSharp)
- [पोली](https://github.com/App-vNext/Polly) - वेनॉट और पारफ्ट-गिंग
- [तार. scraslelele](https://spectreconsole.net/) - सुंदर टर्मिनल यूआई

## श्रेणी नेविगेशन

- **[पार्ट 1: RAG के साथ एक दस्तावेज़ बनाने का काम](/blog/building-a-document-summarizer-with-rag)** - निर्माण और पैटर्न
- **[औज़ार का उपयोग कर भाग 2:](/blog/docsummarizer-tool)** ( इस लेख की शुरूआत में दी तसवीर देखिए ।)
- **[भाग ३: विस्तृत पैसे](/blog/docsummarizer-advanced-concepts)** - BERT, पर गहरा रिलिंग, स्कैनिंग्स, और ELLLON खोज में

### संबंधित

- [स्थानीयLLLM के साथ सीएसवी विश्लेषण](/blog/analysing-large-csv-files-with-local-llms)
- [WebLY के साथ वेब कॉन्टेन्ट](/blog/fetching-and-analysing-web-content-with-llms)