---
title: बेंचमार्क
description: >-
  दो बेंचमार्क जो दो अलग-अलग प्रश्नों का उत्तर देते हैं — वास्तविक API बचत, और
  बड़े पैमाने पर तंत्र की शुद्धता।
sidebar:
  order: 7
---
रिपॉज़िटरी में `benchmarks/` के अंतर्गत दो बेंचमार्क हैं, और उन्हें जानबूझकर एक ही तरह की चीज़ नहीं बनाया गया है — इनमें से किसी एक को दूसरे का विकल्प न समझें।

## `openrouter-savings` — वास्तविक API कॉल, वास्तविक टोकन गणना

OpenRouter को वास्तविक कॉल करता है और OpenRouter द्वारा लौटाए गए वास्तविक `total_tokens` को रिकॉर्ड करता है। यह जानबूझकर छोटा है — कुछ निर्णय, जिनमें कुछ दोहराए गए हैं — क्योंकि वास्तविक कॉल में पैसे लगते हैं और दर सीमाएँ लागू होती हैं। इसके द्वारा प्रिंट किया गया हर अंक वास्तविक API प्रतिक्रिया से आया है।

```bash
OPENROUTER_API_KEY=sk-... pnpm --filter @runic-labs/benchmarks run start
OPENROUTER_API_KEY=sk-... pnpm --filter @runic-labs/benchmarks run start -- --json
```

फ़ाइल संपादित किए बिना नमूने को विस्तृत करने के लिए दोहराव गणना बढ़ाएँ:

```bash
OPENROUTER_API_KEY=sk-... REPEATS_PER_DECISION=6 pnpm --filter @runic-labs/benchmarks run start -- --json
```

एक वास्तविक रन, बिना किसी बदलाव के:

```json
{
  "model": "openai/gpt-oss-20b:free",
  "decisions": 48,
  "uniqueDecisions": 8,
  "apiCalls": 8,
  "cacheHits": 40,
  "tokensSpent": 2582,
  "tokensSaved": 12910,
  "tokensWithoutRunic": 15492,
  "savingsPercent": 83
}
```

48 निर्णय हल किए गए, केवल 8 वास्तविक कॉल किए गए, और सभी 48 को सामान्य तरीके से हल करने की तुलना में 83% कम टोकन खर्च हुए — अनुमानित नहीं, बल्कि OpenRouter के अपने `usage.total_tokens` से मापा गया।

:::tip
रिपॉज़िटरी में कभी भी वास्तविक API कुंजी कमिट न करें। `OPENROUTER_API_KEY` को केवल पर्यावरण चर के रूप में रखें — इसे `benchmarks/openrouter-savings/index.ts` में `process.env` से पढ़ा जाता है और कहीं नहीं।
:::

## `reuse-sweep` — सिंथेटिक, बड़े पैमाने पर तंत्र को सिद्ध करता है

यह बिल्कुल भी नेटवर्क कॉल नहीं करता। यह एक अधिक संकीर्ण, ईमानदार प्रश्न का उत्तर देने के लिए है: *N निर्णयों और R% की दोहराव दर के आधार पर, क्या कैश ठीक उन्हीं प्रविष्टियों का पुन: उपयोग करता है जिनका उसे करना चाहिए, और क्या लेजर का लेखा-जोखा बिल्कुल सही निकलता है?* यह वास्तविक API प्रतिक्रिया के बजाय प्रति निर्णय एक निश्चित, स्पष्ट रूप से लेबल की गई सिंथेटिक लागत (320 टोकन) का उपयोग करता है — यह शुद्धता का प्रमाण है, वास्तविक दुनिया की बचत का अनुमान नहीं।

```bash
pnpm run benchmark            # table
pnpm run benchmark -- --json  # machine-readable
```

फ़ाइल संपादित किए बिना स्वीप का आकार बदलें:

```bash
SWEEP_DECISIONS=10,50 SWEEP_REUSE_PCTS=0,50,90 pnpm run benchmark
```

एक वास्तविक रन:

```txt
Runic reuse-sweep (synthetic — proves the mechanism, not real-world savings)
Synthetic cost per unique decision: 320 tokens

 decisions  reuse%   unique     hits      spent      saved  savings%
---------- ------- -------- -------- ---------- ---------- ---------
        10       0       10        0       3200          0         0
        10      25        7        3       2240        960        30
        10      50        5        5       1600       1600        50
        10      75        2        8        640       2560        80
        10      90        1        9        320       2880        90
       100       0      100        0      32000          0         0
       100      25       75       25      24000       8000        25
       100      50       50       50      16000      16000        50
       100      75       25       75       8000      24000        75
       100      90       10       90       3200      28800        90
      1000       0     1000        0     320000          0         0
      1000      25      750      250     240000      80000        25
      1000      50      500      500     160000     160000        50
      1000      75      250      750      80000     240000        75
      1000      90      100      900      32000     288000        90
     10000       0    10000        0    3200000          0         0
     10000      25     7500     2500    2400000     800000        25
     10000      50     5000     5000    1600000    1600000        50
     10000      75     2500     7500     800000    2400000        75
     10000      90     1000     9000     320000    2880000        90
```

हर पैमाने पर `savings%` कॉलम का `reuse%` कॉलम को 1:1 ट्रैक करना ही वास्तविक मुद्दा है — यह पुष्टि करता है कि कैश बिल्कुल वही करता है जिसका वह दावा करता है, किसी संख्या का प्रचार नहीं करता।

## अपने उपयोग के मामले के लिए मुझे किस पर भरोसा करना चाहिए?

सीधे तौर पर किसी पर भी नहीं — आपकी वास्तविक बचत इस पर निर्भर करती है कि *आपका* एजेंट कितनी बार उसी निर्णय को फिर से पूछता है, जिसका मॉडल `reuse-sweep` का reuse% कॉलम बनाता है, लेकिन वह आपके लिए इसका पूर्वानुमान नहीं लगा सकता। यदि आप अपने कार्यभार के लिए विशिष्ट संख्या चाहते हैं, तो अपने वास्तविक निर्णय सेट के साथ `openrouter-savings` चलाएँ।

## आगे

- [यह कैसे काम करता है](/how-it-works) — सिग्नेचर और लेजर की वे यांत्रिकताएँ जिनका दोनों बेंचमार्क प्रयोग करते हैं
- [त्वरित शुरुआत](/quickstart) — अपने वास्तविक अंक प्राप्त करने के लिए इसे अपने एजेंट में जोड़ें
