दोफ्ल्जर पार्ट 2 - उपयोग करने के औज़ार (हिन्दी (Hindi))

दोफ्ल्जर पार्ट 2 - उपयोग करने के औज़ार

Sunday, 21 December 2025

//

31 minute read

GiB से बाहर हो रही है .नेट संस्करण

यह है पार्ट 2 दोवीर श्रृंखला का. देखें पार्ट 1 चूँकि क़ुरैश को जाड़े और गर्मी के सफ़र से मानूस कर दिया है पार्ट 3 गहरी तकनीकी में प्रवेश करने और पुनः प्राप्त करने में तेज़ी लाने के लिए।

दस्तावेज़ों या यूआरएल को सबूतों के रूप में परिवर्तित करें - मनुष्यों के लिए या एआई एजेंटों - बिना बादल में कुछ भी भेजने के लिए.

हर दावा विश्लेषण योग्य है. हर तथ्य अपने स्रोत को बताता है. स्व-विकृत द्विचर, पूरी तरह से अपने मशीन पर चलाता है.

# Human-readable summary
docsummarizer -f contract.pdf

# JSON for agents/pipelines
docsummarizer tool -u "https://docs.example.com"

इस लेख में किन बातों पर चर्चा की गयी है?: संस्थापन, कुंजी मोड्स (स्वा/ हॉर्ट हूग), टैम्प्लेट्स, तथा सामान्य उपयोग मामलों.

क्या यह कवर नहीं है: संपूर्ण कमांड संदर्भ, कॉन्फ़िगरेशन विकल्प, मुसीबतों, निर्माण विवरण.

संपूर्ण दस्तावेज़ के लिए, देखें पढ़ें.. यह आंतरिक रूप से कैसे काम करता है के लिए, देखते हैं पार्ट 3.

यह क्यों अस्तित्व में है

यह आपको देता है प्रमाण.

  • हर दावा में शामिल है [chunk-N] उल्लेख स्रोत सामग्री में वापस जाएँ
  • भरोसा स्तर (स्फीति/ठी) समर्थन के आधार पर आधारभूत
  • संरक्षा JSON आउटपुट एजेंट एकीकरण के लिए, CICP सर्वर, CCP सर्वर
  • विशेषता विशेषज्ञ भाग निकलने से पहले उनको पकड़ लिया जाता है

आप की जरूरत है भरोसा सारांश - या उसे किसी अन्य तंत्र - उस मामले में खिलाइए ।

विशेषताएँ

  • UNINT बर्ट Rog पाइप: उत्पाद दर्द से राहत पाने के लिए
  • बजे स्वतः मोड: दस्तावेज़ तथा क्वैरी पर आधारित स्मार्ट मोड चयन
  • बर्ट मोड: शुद्ध साबित करने के लिए - कोई LLLM आवश्यक नहीं, ऑफ़लाइन काम करता है (0-23-5)
  • सबूत्ड आउटपुट: प्रशस्ति-पत्र, भरोसा स्तर, ट्रेसेबल दावा करनेवाले दावा
  • बहुल मोड्स: स्वचलित, बर्ट राग, बर्ट, बर्टीब्रेड, नक्शा रीफ, राश, राइस
  • औजार मोड: LLLM एजेंटों, एमसीपी सर्वरों के लिए साफ JSON, सीआई जांच
  • 13 प्रारूप: डिफ़ॉल्ट, प्रोट्‌ज़, एक छोटी - सी गोली, गोली, अधिकारी, विस्तृत, तकनीकी, शैक्षिक, उल्लेख, बुकर, सभा, सख्त
  • बड़ा दस्तावेज़: कंटूरिक प्रक्रिया के साथ 500+ पृष्ठों को हैंडल करता है
  • वेब जाँच रहा है: सुरक्षा- हार्ड्ड (एसआरएफएफ सुरक्षा, एचटीएमएल सिंग)
  • खेलें- दायाँ मोड: जावास्क्रिप्ट- फ़ॉर्मेट किए गए पृष्ठ के लिए हेडहीन ब्राउज़र (एक्सटीएई, रीएल ए.)
  • ऑन- लाइनिंग: शून्य-config स्थानीय अंतर्निर्मित - मॉडल स्वचालित उपयोग में
  • विशेषता विश्लेषण: हाल ही में जाँच की जा रही है ।
  • रेफ़रेंसेल: पोललीपर आधारित रिफ्ट + सर्किट ब्रेकर के साथ फिर से कोशिश करें
  • सिर्फ स्थानीय: कुछ भी अपने मशीन छोड़ नहीं

LM औजार के रूप में उपयोग किया जा रहा है

वह tool कमांड विशेष रूप से एआई एजेंटों, एमसीपी सर्वर, और अन्य ऑटो्ड सिस्टमों के साथ एकीकरण के लिए बनाया गया है. यह प्रमाण पत्र REGGCACT या एजेंट उपकरण बनाने के लिए JSON, और अन्य सिस्टमों के साथ चलाने के लिए आउटपुट किया गया है.

मूल औजार उपयोग

# Summarize a URL and get JSON output
docsummarizer tool --url "https://example.com/docs.html"

# Summarize a local file
docsummarizer tool -f document.pdf

# With a focus query
docsummarizer tool -f contract.pdf -q "payment terms and conditions"

# Pipe to jq for processing
docsummarizer tool -f doc.pdf | jq '.summary.keyFacts'

औज़ार आउटपुट स्ट्रक्चर

औज़ार कमांड परिणामों की ट्रैक के साथ स्ट्रक्चर बताता है:

{
  "success": true,
  "source": "https://example.com/docs.html",
  "contentType": "text/html",
  "summary": {
    "executive": "Brief summary of the document.",
    "keyFacts": [
      {
        "claim": "The system supports 10,000 TPS.",
        "confidence": "high",
        "evidence": ["chunk-3", "chunk-7"],
        "type": "fact"
      }
    ],
    "topics": [
      {
        "name": "Architecture",
        "summary": "The system uses microservices...",
        "evidence": ["chunk-1", "chunk-2"]
      }
    ],
    "entities": {
      "people": ["John Smith"],
      "organizations": ["Acme Corp"],
      "concepts": ["OAuth 2.0", "REST API"]
    },
    "openQuestions": ["What is the disaster recovery plan?"]
  },
  "metadata": {
    "processingSeconds": 12.5,
    "chunksProcessed": 15,
    "model": "qwen2.5:1.5b",
    "mode": "MapReduce",
    "coverageScore": 0.95,
    "citationRate": 1.2,
    "fetchedAt": "2025-01-15T10:30:00Z"
  }
}

औजार कमांड विकल्प

docsummarizer tool [options]

2002- 2006 विकल्प (c) 2006- 2007 संक्षिप्त वर्णन |--------|-------|-------------| | --url | -u डब्ल्यूएचओएस को लाने और उसका सार देने के लिए | --file | -f INVERAT फ़ाइल का विश्लेषण करने के लिए | --query | -q पारितोषिक सरल क्वेरी 0. 28 | --mode | -m वुल्फहाउंड मोड (कंश, बर्ट राग, बर्टरब्लेड, मैप कम, राघाइस) | --model एन्ट्रॉल ऑलमा मॉडल का प्रयोग करने के लिए किये जाने वाले तमाम संक्रिया का प्रयोग करें | --config | -c लिबआईएस कॉन्फ़िगरेशन फ़ाइल पथ

मुख्य डिज़ाइन सिद्धांत

  • सबूत सबूत देते हैं: हर दावा में शामिल है evidence आईडी जिसका संदर्भ स्रोत रीकिंग्स
  • भरोसा स्तर: मार्टिस की दर कम हो जाती है high, medium, या low समर्थन के आधार पर आधारित
  • आउटपुट साफ करें: executive सारांश में आसान प्रदर्शन के लिए कोई चेक चिह्न नहीं है
  • मेटाडाटाप्रक्रिया: डिबगिंग और गुण जाँच के साथ मदद
  • सिंकिंग में त्रुटि: नाकाम वापसी success: false किसी के साथ error संदेश

उदाहरण

पायथन स्क्रिप्ट:

import subprocess
import json

result = subprocess.run(
    ["docsummarizer", "tool", "-u", "https://example.com/api-docs"],
    capture_output=True, text=True
)
data = json.loads(result.stdout)

if data["success"]:
    for fact in data["summary"]["keyFacts"]:
        if fact["confidence"] == "high":
            print(f"- {fact['claim']}")

शेल भक्‍ति:

# Extract high-confidence facts only
docsummarizer tool -f doc.pdf | jq '[.summary.keyFacts[] | select(.confidence == "high")]'

# Get just the executive summary
docsummarizer tool -u "https://example.com" | jq -r '.summary.executive'

क्विक स्टार्ट

परियोजना विकल्प

प्री- उन्नत देशी एक्जीक्यूटेबल से उपलब्ध हैं GiB के जारी:

लिबआरटीएस प्लेटफॉर्मGolial डाउनलोडGenericName

---------- -------------- ----------
IMTAN ("1. 464i") docsummarizer-win-arm64.zip
INVI लिनक्स x64i" docsummarizer-linux-x64.tar.gz
INVI लिनक्स (3264) docsummarizer-linux-arm64.tar.gz
IMSCOSओएस x64 (इनलियम) हालत docsummarizer-osx-x64.tar.gz
मार्सल मेपलस्‌ ARM64 (एक लहरें) हालती docsummarizer-osx-arm64.tar.gz
# Download and extract (Linux/macOS)
curl -L -o docsummarizer.tar.gz https://github.com/scottgal/mostlylucidweb/releases/download/docsummarizer-v3.1.0/docsummarizer-linux-x64.tar.gz
tar -xzf docsummarizer.tar.gz
chmod +x docsummarizer

# Download and extract (Windows PowerShell)
Invoke-WebRequest -Uri "https://github.com/scottgal/mostlylucidweb/releases/download/docsummarizer-v3.1.0/docsummarizer-win-x64.zip" -OutFile "docsummarizer.zip"
Expand-Archive -Path "docsummarizer.zip" -DestinationPath "."

पूर्वपाराईज़

बर्ट मोड (कोई बाहरी सेवाएँ नहीं)

चूँकि क़ुरैश को जाड़े और गर्मी के सफ़र से मानूस कर दिया है कोई बाहरी सेवा आवश्यक नहीं:

docsummarizer -f document.md -m Bert

NNX मॉडल पहली बार प्रयोग पर HBAT-से- अप चेहरे से स्वचालित उपयोग करने पर. ~3-5 सेकंड में वापसी.

TLM मोड (Auto, बर्ट त्रिज्या, नक्शा कम इत्यादि)

बचाव के लिए, ओएलमा की आवश्यकता है:

# Install Ollama from https://ollama.ai
ollama pull llama3.2:3b        # Default model - good balance of speed/quality
ollama serve

गति युक्ति: तेज़ गति के लिए (0-23s vs ~15), प्रयोग करें --model qwen2.5:1.5b

वैकल्पिक: डोमिंग (ब्लिटरी फॉर्मेट)

पीडीएफ़ के लिए आवश्यक, DCLX, XLSX, एचटीएमएल, छवियों (PFGG/TF/TF), सीएसवी, वीटीटीएस फ़ाइलें. टुकड़े तथा सादा पाठ फ़ाइलें सीधे पढ़ा जा रहे हैं - कुछ नहीं किए जाने की आवश्यकता नहीं है.

docker run -d -p 5001:5001 quay.io/docling-project/docling-serve

वैकल्पिक: कवरेज (क्शन वेक्टर भंडारण)

डिफ़ॉल्ट से आवश्यक नहीं

docker run -d -p 6333:6333 -p 6334:6334 qdrant/qdrant

फिर में कॉन्फ़िगर करें docsummarizer.json:

{
  "bertRag": {
    "vectorStore": "Qdrant",
    "collectionName": "docsummarizer",
    "persistVectors": true
  }
}

वैकल्पिक: ओलमा एम्बेडिंग

यदि आप पर एम्बेडिंग के लिए ओलमा पसंद करते हैं तो परनएक्स:

ollama pull nomic-embed-text   # Or mxbai-embed-large
# Then use: --embedding-backend Ollama

सत्यापित किया जा रहा है

docsummarizer check --verbose

वांछित आउटपुट फ़ॉर्मेट फ़ॉर्मेट तालिका दिखाता है:

              Dependency Status              
╭─────────┬────────┬────────────────────────╮
│ Service │ Status │ Endpoint               │
├─────────┼────────┼────────────────────────┤
│ Ollama  │   OK   │ http://localhost:11434 │
│ Docling │ Optional │ http://localhost:5001 │
│ Qdrant  │ Optional │ localhost:6333        │
╰─────────┴────────┴────────────────────────╯

        Default Model Info         
╭────────────────┬────────────────╮
│ Property       │ Value          │
├────────────────┼────────────────┤
│ Name           │ llama3.2:3b    │
│ Family         │ llama          │
│ Parameters     │ 3.2B           │
│ Context Window │ 128,000 tokens │
╰────────────────┴────────────────╯

Ready to summarize! Ollama is available.

टिप्पणी: डोमिंग और आगल प्रदर्शन चिह्नों के लिए ठीक है.

उपयोग

तयशुदा आचरण

चल रहा है docsummarizer कोई आर्गुमेंट नहीं होगा:

  1. के लिए देखें README.md मौजूदा डिरेक्ट्री में
  2. इसे प्रयोग कर रहा है स्वचलित मोड (मारत मोड चयन)
  3. अच्छे पटल यूआई से कंसोल में छापें
  4. में स्वचलित- सहेजें readme.summary.md
# Summarize README.md in current directory
docsummarizer

# Shows a formatted panel with:
# - Document info table (file, mode, model)
# - Progress indicators during processing
# - Summary panel with the result
# - Topics tree if available
# - Saved: readme.summary.md

मूल योगीकरण

# Just run it - Auto mode picks the best approach
docsummarizer -f document.pdf

# Fast mode - no LLM, pure extraction (~3-5s)
docsummarizer -f document.pdf -m Bert

# Production mode - best quality with validated citations
docsummarizer -f document.pdf -m BertRag

# Focused on specific topic
docsummarizer -f manual.pdf -m BertRag --focus "installation steps"

# Verbose progress
docsummarizer -f document.pdf -v

सुजाराइजेशन विधि

"सिर्फ मैप कम करें" से उपकरण प्रोग्रेसन. यहाँ है कि हर मोड वास्तव में क्या करता है:

स्वतः (डिफ़ॉल्ट)

जो आप के लिए पूछ रहे हैं उस आधार पर सही मोड चुनता है. इसका इस्तेमाल तब तक कीजिए जब तक आपके पास कोई कारण न हो.

docsummarizer -f doc.pdf

बर्ट त्रिज्या (प्रयोग)

आप उत्पादन के लिए क्या करना चाहते हैं. तीन-फ्पर:

  1. निकालें - दस्तावेज़ को खण्ड में व्याख्या, BERT के साथ उन्हें एम्बेड करें
  2. पुनःप्राप्त करें - सम्बन्धित खण्ड को ढूंढें (डिस्किक खोज + सिगिंग)
  3. सिंथाइज -LLM उन खण्डों से एक प्रभावी सारांश लिखता है
docsummarizer -f doc.pdf -m BertRag
docsummarizer -f doc.pdf -m BertRag --focus "payment terms"

क्यों इसे प्रयोग करें: हर निशान का एक स्रोत भाग में वापस लाने का दावा करता है. कोई भी दस्तावेज़ आकार का स्केल नहीं. सिर्फ अंत में ही xL भाग जाता है.

बर्ट (तेज, कोई तेजएम)

स्थानीय पर स्थानीय मॉडलों का उपयोग कर शुद्ध निकास.

docsummarizer -f doc.pdf -m Bert

क्यों इसे प्रयोग करें: ऑफ़लाइन काम करता है. ~3-5 सेकंड में रिटर्न. डेइनिटेंस ( समान इनपुट = एक ही आउटपुट). जल्दी स्कैन के लिए पर्याप्त अच्छा है.

बर्ट हेब्रिड

बर्ट व बर्ट रोग के बीच मध्य भूमि.

docsummarizer -f doc.pdf -m BertHybrid

नक्शा रिफ / राइस्डर

फिर भी, बर्ट राग ने ज़्यादातर मामलों के लिए उनकी जगह ली ।

  • मैप कम करें: 64 विस्तार के लिए समानांतर रीफिंग, अच्छा
  • रघुट: वेक्टर खोज, ध्यान केंद्रित करने के लिए अच्छा (गार - बर्टर रोग यह बेहतर करता है)
  • इटेरेशन: सीक्वेंशियल प्रक्रिया, सिर्फ छोटे - छोटे खुराक के लिए इस्तेमाल
docsummarizer -f doc.pdf -m MapReduce  # Full coverage
docsummarizer -f doc.pdf -m Rag --focus "query"  # Legacy focused mode

क्वैरी मोड

जानकारी देने के बजाय, किसी दस्तावेज़ के बारे में सवाल पूछिए:

docsummarizer -f manual.pdf --query "How do I install the software?"

वेब यूआरएल ला रहा है

वेब पृष्ठों को सीधे डाउनलोड किए बगैर प्रेषित करें:

# Summarize a web article
docsummarizer --url "https://example.com/article.html" --web-enabled

# Summarize a remote PDF
docsummarizer --url "https://example.com/document.pdf" --web-enabled

# With structured JSON extraction
docsummarizer --url "https://example.com/api-docs.html" --web-enabled --structured

समर्थित अंतर्वस्तु: HTML (अनेड), पीडीएफ, मार्क डाउन, छवियों (ओसीआर), दस्तावेज़. बड़ी छवियों का आकार स्वचालित बदल दिया गया.

सुरक्षा: SSRF सुरक्षा, डीएनएस फिर से सुरक्षा, सामग्री क़िस्मिंग बम सुरक्षा, HTML SIANARSीकरण.

जावास्क्रिप्ट-ड पृष्ठ: इस्तेमाल --web-mode Playwright मेन्यू के रूप में तथा रीप्लिकेशन ऐप्ट्स (यू- ऐक्स- ए- ऐप्ट्सिलियम पहले प्रयोग में डालें).

स्ट्रक्चर मोड

प्रोटेस्टंट के बजाए मशीन पढ़ने योग्य JSON निकालें:

docsummarizer -f document.pdf --structured -o Json

निकालें: एंटिटी, फंक्शन, कुंजी प्रवाह (विश्‍वास के स्तर के साथ), अनिश्‍चित, कोटा - रेखाएँ ।

सारांश टैम्प्लेट्स (T)

# Use a template
docsummarizer -f doc.pdf --template executive
docsummarizer -f doc.pdf -t bullets

# Specify custom word count with template:wordcount syntax
docsummarizer -f doc.pdf -t bookreport:500
docsummarizer -f doc.pdf -t executive:100

# Or use --words to override any template's default
docsummarizer -f doc.pdf -t detailed --words 300

घड़ू टैम्प्लेट घड़क शब्द सबसे अच्छा के लिए |----------|-------|----------| | default पारितोषिक विषय (2 पैराग्राफ) के साथ संतुलित सारांश | prose दिखाई दे रहे बहुमुखी सुधार - कोई मेटाडेटा नहीं | brief SUM-50 त्वरित 2-3 वाक्य सारांश | oneliner ROUND ~25 एकल वाक्य सारांश | bullets अतुल्यकालिक स्वचालित बुलेट सूची (5- 7 वस्तुएँ) | executive EXARE( 5050) सिफारिशों के साथ संक्षिप्त | detailed [ पेज 12 पर बड़े अक्षरों में लेख की खास बात] | technical INDECKS ~350 बुरी तकनीकी प्रमाणपत्र जो कार्यान्वयन विवरण के साथ चल रहा है | academic IMSUNT ~abrazil. kgm | citations INBWWK कुंजी सिर्फ श्रोत उद्धरण के साथ उद्धरण देता है | bookreport SICAS ~00 बुक रिपोर्ट (अनुप्रयोग, अक्षर, प्लाट, प्रसंग) | meeting सन 2002- 2003 बैठक में लिखा है (डाइल्स, क्रियाएँ, सवाल) | strict INV ~60 MACACKS, 3 बुलेट अधिकतम, कोई वह समाधान नहीं

सभी उपलब्ध टैम्प्लेटों को वर्णनों के साथ देखने के लिए:

docsummarizer templates

मॉडल बेचमार्किंग

उपयोग कर एक ही दस्तावेज़ पर मॉडलों की तुलना करें benchmark सब कमांड्स:

docsummarizer benchmark -f doc.pdf -m "qwen2.5:1.5b,llama3.2:3b,ministral-3:3b"

संपादन कमांड दस्तावेज़ की व्याख्या एक बार करता है, फिर प्रत्येक मॉडल को उचित तुलना के लिए एक ही बार चलाता है. आउटपुट समय, शब्द गणना, और प्रत्येक मॉडल के लिए शब्द/ सेकंड दिखाता है.

बैच प्रक्रिया

संपूर्ण डिरेक्ट्रीज़ को प्रोसेस करें:

# Use BertRag for quality
docsummarizer -d ./documents -m BertRag -v

# Fast offline batch (no LLM needed)
docsummarizer -d ./documents -m Bert -o Json --output-dir ./summaries

# Process only PDFs recursively
docsummarizer -d ./documents -e .pdf --recursive -v

कमांड लाइन विकल्प

2002- 2006 विकल्प (c) 2006- 2007 संक्षिप्त विवरण (c) 2006- 2007, गिल्स काउलिएर |--------|-------|-------------|---------| | --file | -f दस्तावेज़ में पथ (काला, पीडीएफ, MD) | --directory | -d बैच प्रक्रिया के लिए निर्देशिका का पथ - सरकशी | --url | -u डब्ल्यूएचओ वेब यूआरएल को लाने व उसका सार देने के लिए | --web-enabled Libisofs वेब लाने को सक्रिय करता है (-- कर्ल के लिए आवश्यक है) false | | --mode | -m mugugion विधि: स्वचलित, बर्ट राग, बर्टHyrod, मैप रिबला, यह exclowald Auto | | --structured | -s शिर्क किए गए JSON एक्सपोजर मोड का प्रयोग करता हैcolombia. kgm false | | --focus RAG मोड के लिए एहदो पैमान क्वेरी | --query | -q DTAVERSELLANK मोड के बजाय एमुलेटर | --model एन्ट्रॉल ऑलमा मॉडल का प्रयोग करने के लिए किये जाने वाले तमाम संक्रिया का प्रयोग करें llama3.2:3b | | --verbose | -v IMTAN( डबल्यू) के साथ विस्तृत प्रगति दिखाएँ false | | --config | -c विन्यास फ़ाइल जिसे स्वतः विन्यस्त किया जा रहा है का पथ | --output-format | -o INBS आउटपुट प्रारूप: कंसोल, पाठ, मार्क डाउन, जेएनएस Console | | --output-dir फ़ाइल आउटपुट के लिए Libisofs आउटपुट निर्देशिका | --extensions | -e अलग होने के लिए फ़ाइल विस्तार | --recursive | -r डिबगिंग सूचनाओं को प्रिंट करें false | | --template | -t INBS सारांश टैम्प्लेट (डिफ़ॉल्ट, संक्षिप्त, बुलेट, व्यवस्थापक, आदि.) default | | --words | -w अस्थायी लक्ष्य शब्द गणना करता है (ओक्यूट्स टैम्प्लेट को दोहराता है)

--embedding-backend Altiving बैकेंड: INnx, ओलमा हालत Onnx
--web-mode INRWWW वेब को लाने का मोड: सादा, खेलें [Ctrl+ER] Simple
--analyze -a EXARGERYEAR क्वालिटी विश्लेषण करता है false

सुजाराइजेशन विधि

नक्शा रिबूट करें (अनुप्रयोगित)

पूर्ण दस्तावेज़ विस्तार के साथ विस्तृत विस्तार के लिए उत्तम.

docsummarizer -f document.pdf -m MapReduce -v

यह कैसे काम करता है:

  1. दस्तावेज़ को नया आकार देने वाले भाग में विभाजित करता है ( द्वारा शीर्षकों के द्वारा)
  2. एनआईएम का प्रयोग करते हुए हर रीफ्ट को अलग करता है
  3. प्रशंसा के साथ प्रशासक सारांश में डिग्री कम करें
  4. सभी उल्लेखों को वैध करता है

लंबे दस्तावेज़ के लिए लघुरूपीकरण:

बहुत लंबा दस्तावेज़ों के लिए जहाँ शामिल होते हैं मॉडल के संदर्भ विंडो से अधिक, नक्शा स्वचालित रूप से कम प्रयोग करता है:

  1. बैचिंग: संदर्भ में फिट होने वाले समूह को मिटाया जा रहा है
  2. इंटरेक्शन कमी: प्रत्येक बैचिंग सारांश में कम करें
  3. अंतिम कमी: अंतिम आउटपुट में एक कांटिट्यूशन शामिल करता है
  4. रिकर्सिव: यदि अनुप्रयोग अभी भी बहुत बड़ा है, तो अधिक स्तर जोड़िए
100 chunks → 100 summaries → 5 batches → 5 intermediate summaries → final

यह दस्तावेज़ विस्तार की बनाए रखता है, लंबाई के हर भाग को अंतिम सारांश में योग देता है. उपकरण अनुमान चिह्नों (0.4 अक्षर/ts) और लक्ष्य 60% संदर्भ विंडो प्रति कटौती जाता है.

छैतिज पैमाना: तेज, पूर्ण विस्तार, समानांतर प्रक्रिया, किसी भी दस्तावेज़ लंबाई को संभालता है कॉन्न्स: बहुत लंबा दस्तावेज़ों के लिए धीमी गति से क्रूसों को पार करने की छूट देता है

RAG (प्रयोगियों के लिए उत्तम)

जब आपको किसी खास विषय पर ध्यान देने की ज़रूरत होती है या एक खास सवाल उठता है, तो अच्छा होगा कि आप उस पर ध्यान दें ।

docsummarizer -f document.pdf -m Rag --focus "pricing and payment terms" -v

यह कैसे काम करता है:

  1. सूची दस्तावेज़ फिर से बनाई गई वस्तुओं को क्यूवरिंग के रूप में बनाई गई वस्तुओं की सूची
  2. दस्तावेज़ शीर्षकों से मुख्य विषय निकालें
  3. गणितीय खोज का प्रयोग करते हुए प्रति विषय का खोज निकालता है
  4. उद्धरण के साथ केंद्रित सारांश

मैप कम करने के लिए RAG का उपयोग कब करें:

अतुल्यकालिक चित्र सर्वोत्तम मोड (x) |----------|-----------| तमाम "इस दस्तावेज़ को सार दें"mahjongg map name "यह सुरक्षा के बारे में क्या कहते हैं?" RAGRGERS libburn 500-पेज मैनुअल, सभी बातों का मैप रिबूट (आंटा) साझी होने की जरूरत है ROUND 500-page मैनुअल, विशिष्ट खण्ड 2016 की आवश्यकता है आयामी तेजी से परिणाम की आवश्यकता है, पैरेंट नक्शा कम नहीं है

RAG है नहीं इसके बारे में RG के बारे में क्या? फ़िल्टरिंग फ़िल्टरName: जब आप किसी दस्तावेज़ के 90% को नज़रअंदाज़ करना चाहते हैं और अपने खास सवाल पर ध्यान देना चाहते हैं, तो उस पर ध्यान दीजिए ।

छैतिज पैमाना: विषय-रूप समझ, पुनः प्रयोग करें सूची, ध्यान केंद्रितियों के लिए तेजी से कॉन्न्स: ध्यान केंद्रित क्षेत्र के बाहर गुम सामग्री की आवश्यकता है, क्यूवेशन की आवश्यकता है, धीमी आरंभिक इंडेक्सिंग

इटेरेशन

इतिहास के दस्तावेज़ों के लिए उत्तम... ... जहां संदर्भ अनुक्रमीय रूप से प्रवाह करता है.

docsummarizer -f story.pdf -m Iterative -v

चेतावनी: धीमा और लंबे दस्तावेज़ों पर संदर्भ खो सकता है (> 10 का टुकड़ा).

बड़े दस्तावेज़ मार्गदर्शक

सही मोड चुनने का चयन करें

INB दस्तावेज़ प्रकार AGTEGTY_BAR_ |---------------|------|------|-----| तमाम तकनीकी स्पेस (50+ पृष्ठों) INNLNAL/NLLLLLYEALLLLYEARTYYEANK की जरुरत है लीगल लीगल अनुबंध पूरा सारांश मैप स्मिट कम नहीं कर सकता है लीगल कानूनी अनुबंध "metion शर्तों"? SRGRGRECOG किसी खास खंड 6 पर फोकस SIGRT MAT (200 पृष्ठ) DULLYAT "ALAL कैसे काम करता है? "CHALRGES" GTE(200 पेज) [ पेज 27 पर बड़े अक्षरों में लेख की खास बात]

फ़िक्शन वी नॉन- फ़िक्स्शन

INVER सामग्री क़िस्म |--------------|-----------|-------| | फ़िक्शन/ निमंस आवर्धन नक्शा रिफ्पर प्लाट के लिए अनुक्रम संदर्भ कोष्ठक की आवश्यकता है | तकनीकी खुराक नक्शे पर नज़र रखने के लिए चिल्लायी गयी दोनों तरफ का नक्शाREGERGERSE | लीगल/ कम्पेटिबिलिटी Git नक्शा हर खंड के मामले को कम करता है | हस्तचालित [ पेज 9 पर बड़े अक्षरों में लेख की खास बात]

परफार्मेंस

SMTP दस्तावेज़ आकार (R) |---------------|-----------|-----|-------| SIG 10 पेज 0. 15s20LLLLLLLW दोनों तेजी से चढ़ी 50 पेज 45 से 45x50 LRG तेजी से अगर ध्यान केंद्रित किया जा रहा हो 270 200 पेज 3-5 मि. 2 मि. 2 मि. 500+ पेज 0. 20- 15 मि. 2-3 मिनट के बारे में विचार करते हुए बहुत से RAGCKT पर विचार कीजिए

कॉन्फ़िगरेशन

डिफ़ॉल्ट कॉन्फ़िगरेशन तैयार करें

docsummarizer config --output myconfig.json

कॉन्फ़िगरेशन फ़ाइल

कॉन्फ़िगरेशन स्वतः खोज लिया गया है:

  1. --config विकल्प
  2. docsummarizer.json मौजूदा डिरेक्ट्री में
  3. .docsummarizer.json (छुपी फ़ाइलें)
  4. ~/.docsummarizer.json (उपयोक्ता घर)

उदाहरण docsummarizer.json:

{
  "embeddingBackend": "Onnx",
  "onnx": {
    "embeddingModel": "AllMiniLmL6V2"
  },
  "ollama": {
    "model": "llama3.2:3b",
    "embedModel": "mxbai-embed-large",
    "baseUrl": "http://localhost:11434",
    "temperature": 0.3,
    "timeoutSeconds": 1200
  },
  "docling": {
    "baseUrl": "http://localhost:5001",
    "timeoutSeconds": 1200,
    "pdfBackend": "pypdfium2",
    "pagesPerChunk": 10,
    "maxConcurrentChunks": 4,
    "enableSplitProcessing": true
  },
  "qdrant": {
    "host": "localhost",
    "port": 6333,
    "collectionName": "documents"
  },
  "processing": {
    "maxHeadingLevel": 2,
    "targetChunkTokens": 1500,
    "minChunkTokens": 200,
    "maxLlmParallelism": 2
  },
  "output": {
    "format": "Console",
    "verbose": false,
    "includeTrace": false
  },
  "webFetch": {
    "enabled": false,
    "mode": "Simple",
    "timeoutSeconds": 30,
    "userAgent": "Mozilla/5.0 DocSummarizer/1.0"
  },
  "batch": {
    "fileExtensions": [".pdf", ".docx", ".md", ".txt", ".html"],
    "recursive": false,
    "continueOnError": true
  }
}

प्रक्रिया विकल्प

2002- 2006 विकल्प (c) 2006- 2007 डिफ़ॉल्ट (c) 2006- 2007@ info: credit |--------|---------|-------------| | maxLlmParallelism SIGRT 8 मौजूदा कॉनक्शन निवेदन (ओलमा कतार, सिर्फ क़तार में इतना उच्च मूल्य) | maxHeadingLevel H1/H2 पर 2. 3 को उत्तमGodirigiviod के लिए सेट करें | targetChunkTokens IMTART 0 (autoTH) 0- cation आकार की गणना करता है. 0 = call-cing की गणना (उदाहरण के लिए संदर्भ विंडो का 0. 25%) | minChunkTokens IMTAN (autoroz) japan. 0 = 8 लक्ष्य का मान

आउटपुट फॉर्मेट

सारांश स्ट्रक्चर

## Executive Summary
- Key finding 1 with specific details [chunk-0]
- Important point 2 with numbers and dates [chunk-3]
- Critical requirement 3 [chunk-5]

## Section Highlights
- Introduction: Overview of the system architecture [chunk-0]
- Requirements: Technical specifications detailed [chunk-3]
...

## Open Questions
- What is the timeline for Phase 2?
- How does the fallback mechanism work?

### Trace

- Document: document.pdf
- Chunks: 12 total, 12 processed
- Topics: 5
- Time: 21.4s
- Coverage: 100%
- Citation rate: 1.20

गेंद का पता लगायें: कवरेज (% भाग में शामिल हैं), प्रशस्ति-पत्र (संत्र/ दर), क्लैच प्रक्रिया (RGGG) छोड़ सकते हैं.

मॉडल प्रतिनिधि

कामों के लिए पाठ- से- वार्ताName |-------|------|-------|---------|----------| | qwen2.5:1.5b यूजीन 96MB बहुत तेज (463s) औद्वीव गति कम करता है | gemma3:1b IMSGRING 815MB तेज (0-210s) 2002- 2006, 2002- 2006 छोटा मॉडल बुरे लग रहा है | llama3.2:3b IMSURT 2GBडीपीआई मध्यम (उदाहरण के लिए) बहुत अच्छा डिफ़ॉल्ट - अच्छा संतुलन संतुलन संतुलन | ministral-3:3b IMTAR 2. 9GBडीपीआई मध्यम (18020s) बहुत अच्छा विशेषता- चिल्लानी होगी | llama3.1:8b 0. 7zGB धीमा ( 0. 45s) सर्वोत्तम उत्तम उत्तम उत्तम उत्तम उत्तम उत्तम उच्च- समसंत्रीय

आकार बदलें: तेज़ गति के लिए (0-23s vs ~15), प्रयोग करें --model qwen2.5:1.5bकठिन दस्तावेज़ों के लिए जहाँ और भी गुण मामले होते हैं, प्रयोग करें --model llama3.1:8b.

स्रोत से बिल्ड करें

# Clone the repository
git clone https://github.com/scottgal/mostlylucidweb.git
cd mostlylucidweb/Mostlylucid.DocSummarizer

# Build
dotnet build

# Run
dotnet run -- --help

स्व- बिल्डर

आवश्यकता के बिना उत्पादन तैनात करने के लिए. NET बिल्ड संस्थापना:

# Build self-contained executable (Windows x64)
dotnet publish -c Release -r win-x64 --self-contained

# Build for Linux
dotnet publish -c Release -r linux-x64 --self-contained

# Build for macOS
dotnet publish -c Release -r osx-x64 --self-contained

आउटपुटः bin/Release/net9.0/<runtime>/publish/docsummarizer

ट्रबलिंग

"ओलमा से कनेक्ट नहीं हो सकता"

  • सुनिश्चित करें कि ओलमा चल रहा है: ollama serve
  • चेक मॉडलों को खींचा गया है: ollama list

"डिचिंग सेवा अनुपलब्ध"

  • यह है केवल PDF/डाकCX फ़ाइलें के लिए आवश्यक हैं
  • प्रमाणपत्र फ़ाइलों के लिए, आप इस त्रुटि को अनदेखा कर सकते हैं
  • सही करने के लिए: docker run -p 5001:5001 quay.io/docling-project/docling-serve

"वरेज कनेक्शन असफल"

  • यह है RAG मोड के लिए केवल आवश्यक (--mode Rag)
  • नक्शा कम करने के लिए (डिफ़ॉल्ट, आप इस त्रुटि को अनदेखा कर सकते हैं)
  • सही करने के लिए: docker run -p 6333:6333 -p 6334:6334 qdrant/qdrant

"रर्मल ब्रेकर खुला है"

  • ओसमा भार से ऊपर है या क्रैश हो गया है
  • सर्किट ब्रेकर को रीसेट करने के लिए 30 सेकंड तक प्रतीक्षा करें, या फिर ओल्लेमा फिर से शुरू करें
  • औज़ार पोलीय नीतियों का उपयोग करता है और स्वचालित- आकार देगा

"wscv" या कनेक्शन त्रुटियाँ (विंडोज़)

  • यह विंडोज़ पर एक ज्ञात ओलमा मुद्दा है (उदा. 14040)
  • उपकरण स्वचालित रूप से इस तर्क और कनेक्शन को पुनः प्राप्त करने से जुड़ा हुआ है
  • यदि आग्रह किया जाता है, ओलमा फिर से कोशिश करें तथा फिर से कोशिश करें

"एलएम पीढ़ी समय समाप्त हो गया"

  • विन्यास में टाइम- आउट बढ़ाएँ
  • बहुत बड़ा दस्तावेज अलग करें
  • चेक ओसमा अन्य अनुरोधों के साथ लोड नहीं हुआ है

रिटेंस या लो- गुणवत्ता एनएसएसेस

सममितियाँ: गोली जो तुरंत आ जाती है ("कि केवल गोली बिन्दुओं"), " नियम है..." सामग्री के बजाय.

कारण: मॉडल बहुत लंबा होता है या संतुष्ट रहता है ।

ठीक करेंडिफ़ॉल्ट: qwen2.5:1.5b अधिकांश दस्तावेज़ों को अच्छी तरह से संभालता है. समस्याजनक दस्तावेज़ों के लिए, कोशिश करें --model llama3.2:3b. देखें मॉडल प्रतिनिधि.

सारांश दस्तावेज़ सामग्री अनदेखा करता है

यदि सारांश जेनेरिक या संदर्भ नहीं करता है विशिष्ट सामग्री:

  • मॉडल शायद अनुचित किया जा रहा है - जाँच की जा सकती है Citation rate ट्रेस आउटपुट में
  • RAG मोड की कोशिश करें ()--mode Rag(R) जो आधार वापस रीग्रेस में है
  • प्रयोक्ता --verbose देखने के लिए कि क्या फिर से बनाई जा रही है

प्रशस्ति-पत्र को अनुपस्थित या अवैध

यदि तत्व की कमी है [chunk-N] उल्लेख:

  • पाठ फ़ॉर्मेटिंग से पहले सामग्री को व्यवस्थित करने के छोटे मॉडल
  • निर्देश गति के लिए अधिकतम किया जा रहा है, सख्त सेडेंरेशन अनुपालन नहीं
  • सख्त प्रशंसा के लिए, बड़े मॉडलों की तरह इस्तेमाल करें llama3.2:3b
  • जाँचें Citation rate ट्रेस - उच्च मान में बेहतर ट्रेसेस सूचित करता है

परफ़ॉर्मेंस हार्डवेयर्स

  • मैप कम करें गति
  • qwen2.5:1.5b गति के लिए, llama3.2:3b और तुम (जब तौलो तो) ठीक तराज़ू से डन्डी सीधी रखकर तौलो llama3.1:8b गुणवत्ता के लिए
  • ऑन- लाइनिंग (डिफ़ॉल्ट) रेज़लमा मोड के लिए तेजी से कर रहे हैं
  • निम्नतर maxLlmParallelism यदि अनुभव समय समाप्ति हो

संसाधन

श्रेणी नेविगेशन

संबंधित

Finding related posts...
logo

© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.