CLI benchmarks, measured release over release
You can't trust a scanner that doesn't measure itself. Every Vibgrate CLI release runs the same pinned benchmark suite as the release before it — scan correctness, code-graph extraction across 19 languages, retrieval accuracy, supply-chain correctness, and performance — and publishes the comparison here, regressions included.
Latest release — v2026.930.1 vs v2026.921.1
| Metric | v2026.921.1 | v2026.930.1 | Change |
|---|---|---|---|
| Languages with extraction | 19 | 19 | no change |
| Definitions extracted (corpus total) | 25,880 | 25,880 | no change |
| Call edges extracted (corpus total) | 17,611 | 17,611 | no change |
| Locate accuracy (top-1) | 94.5% | 94.5% | no change |
| Locate quality (XL corpus resolved) | 100.0% | 100.0% | no change |
| Ask quality (seed relevance, full corpus) | 96.7% | 96.7% | no change |
| DI resolution (all languages) | 76.2% | 76.2% | no change |
| Dependency detection (authored manifest truth) | 96.4% | 96.4% | no change |
| CLI startup (--version, median) | 450.7ms | 454.2ms | no significant change |
| Token reduction vs baseline agent (equal success) | 25.1% | 27.1% | +2.0pp |
2 regressions in this release
- Tasks passed on both arms: 36 → 34 (-5.6%) — under investigation
- Comparable-task rate (both arms passed / total): 94.7% → 89.5% (-5.6%) — under investigation
Measured on the release profile (fast per-release subset), corpus 2026.09-1, 236 metrics compared — both versions run interleaved on the same machine against the identical pinned corpus.
Language coverage — code-graph extraction
Per-language extraction and retrieval on the pinned corpus, with change since the previous release. Definitions and call edges are the reliable coverage signal; locate top-1 is how often the first answer to a ground-truth lookup is the right one.
| Language | Definitions | Call edges | Parse rate | Locate top-1 |
|---|---|---|---|---|
| Shell | 665 | 198 | 100.0% | 97.8% |
| C | 673 | 199 | 100.0% | 95.6% |
| C++ | 714 | 182 | 100.0% | 94.4% |
| C# | 1,072 | 289 | 100.0% | 92.2% |
| Dart | 661 | 212 | 100.0% | 95.6% |
| Elixir | 693 | 184 | 100.0% | 96.7% |
| Go | 883 | 338 | 100.0% | 100.0% |
| Java | 1,018 | 204 | 100.0% | 86.7% |
| JavaScript | 685 | 229 | 100.0% | 94.4% |
| Kotlin | 661 | 195 | 100.0% | 92.2% |
| Lua | 652 | 102 | 100.0% | 97.8% |
| PHP | 658 | 181 | 100.0% | 95.6% |
| Python | 1,571 | 146 | 100.0% | 84.4% |
| Ruby | 674 | 1 | 100.0% | 98.9% |
| Rust | 1,117 | 616 | 100.0% | 93.3% |
| Scala | 687 | 192 | 100.0% | 96.7% |
| Swift | 691 | 176 | 100.0% | 97.8% |
| TypeScript | 11,446 | 13,763 | 100.0% | 89.0% |
| Zig | 659 | 204 | 100.0% | 96.7% |
Previous reports
- v2026.921.1vs v2026.917.1 — 1 regression across 239 metrics2026-09-28
- v2026.917.1vs v2026.916.3 — 5 regressions across 239 metrics2026-09-21
- v2026.916.3vs v2026.916.2 — 5 regressions across 236 metrics2026-09-16
- v2026.916.2vs v2026.916.1 — 5 regressions across 236 metrics2026-09-16
- v2026.916.1vs v2026.914.1 — 5 regressions across 236 metrics2026-09-16
- v2026.914.1vs v2026.911.1 — 5 regressions across 236 metrics2026-09-14
- v2026.911.1vs v2026.910.3 — no regressions across 239 metrics2026-09-14
- v2026.910.3vs v2026.910.2 — no regressions across 236 metrics2026-09-10
- v2026.910.2vs v2026.910.1 — no regressions across 236 metrics2026-09-10
- v2026.910.1vs v2026.909.1 — no regressions across 236 metrics2026-09-10
- v2026.909.1vs v2026.908.2 — no regressions across 236 metrics2026-09-09
- v2026.908.2vs v2026.908.1 — no regressions across 236 metrics2026-09-08
- v2026.908.1vs v2026.903.3 — 1 regression across 236 metrics2026-09-08
- v2026.903.3vs v2026.903.2 — 3 regressions across 187 metrics2026-09-03
- v2026.903.2vs v2026.903.1 — 3 regressions across 187 metrics2026-09-03
- v2026.903.1vs v2026.829.1 — 3 regressions across 187 metrics2026-09-03
- v2026.829.1vs v2026.826.1 — 2 regressions across 187 metrics2026-08-29
- v2026.826.1vs v2026.825.2 — 2 regressions across 187 metrics2026-08-26
- v2026.825.2vs v2026.825.1 — 1 regression across 187 metrics2026-08-25
- v2026.825.1vs v2026.824.3 — 1 regression across 187 metrics2026-08-25
- v2026.824.3vs v2026.819.3 — 8 regressions across 187 metrics2026-08-24
- v2026.819.3vs v2026.819.2 — 1 regression across 189 metrics2026-08-24
- v2026.819.2vs v2026.819.1 — 2 regressions across 189 metrics2026-08-19
- v2026.819.1vs v2026.818.2 — 6 regressions across 189 metrics2026-08-19
- v2026.818.1vs v2026.817.2 — 2 regressions across 189 metrics2026-08-18
- v2026.817.1vs v2026.814.2 — 3 regressions across 189 metrics2026-08-17
- v2026.814.2vs v2026.814.1 — 2 regressions across 189 metrics2026-08-17
- v2026.814.1vs v2026.813.1 — 2 regressions across 189 metrics2026-08-14
- v2026.813.1vs v2026.807.1 — 2 regressions across 189 metrics2026-08-13
- v2026.807.1vs v2026.806.2 — 2 regressions across 189 metrics2026-08-10
- v2026.806.3vs v2026.806.2 — 2 regressions across 189 metrics2026-08-06
- v2026.806.2vs v2026.806.1 — 2 regressions across 189 metrics2026-08-06
- v2026.806.1vs v2026.805.2 — 2 regressions across 189 metrics2026-08-06
- v2026.805.2vs v2026.805.1 — 2 regressions across 189 metrics2026-08-05
- v2026.805.1vs v2026.804.1 — 2 regressions across 189 metrics2026-08-05
- v2026.804.1vs v2026.803.5 — 2 regressions across 189 metrics2026-08-04
- v2026.803.5vs v2026.803.4 — 2 regressions across 189 metrics2026-08-03
- v2026.803.4vs v2026.803.3 — 2 regressions across 189 metrics2026-08-03
- v2026.803.3vs v2026.803.1 — 3 regressions across 189 metrics2026-08-03
- v2026.801.1vs v2026.731.3 — 21 regressions across 182 metrics2026-08-01
- v2026.731.3vs v2026.731.2 — no regressions across 176 metrics2026-07-31
- v2026.731.2vs v2026.731.1 — no regressions across 176 metrics2026-07-31
- v2026.731.1vs v2026.730.2 — no regressions across 176 metrics2026-07-31
- v2026.730.2vs v2026.730.1 — no regressions across 176 metrics2026-07-30
- v2026.730.1vs v2026.729.3 — no regressions across 176 metrics2026-07-30
- v2026.729.3vs v2026.729.2 — no regressions across 176 metrics2026-07-29
- v2026.729.2vs v2026.729.1 — no regressions across 176 metrics2026-07-29
- v2026.729.1vs v2026.728.5 — no regressions across 176 metrics2026-07-29
- v2026.728.5vs v2026.728.4 — no regressions across 176 metrics2026-07-28
- v2026.728.4vs v2026.728.3 — 3 regressions across 176 metrics2026-07-28
- v2026.728.3vs v2026.728.2 — no regressions across 176 metrics2026-07-28
- v2026.728.2vs v2026.727.4 — no regressions across 176 metrics2026-07-28
- v2026.727.4vs v2026.727.3 — no regressions across 176 metrics2026-07-27
- v2026.727.3vs v2026.727.2 — 1 regression across 176 metrics2026-07-27
- v2026.727.2vs v2026.727.1 — no regressions across 176 metrics2026-07-27
- v2026.727.1vs v2026.722.2 — no regressions across 176 metrics2026-07-27
- v2026.722.2vs v2026.722.1 — no regressions across 176 metrics2026-07-22
- v2026.722.1vs v2026.721.3 — no regressions across 176 metrics2026-07-22
- v2026.721.3vs v2026.721.2 — 3 regressions across 176 metrics2026-07-21
- v2026.721.2vs v2026.721.1 — no regressions across 164 metrics2026-07-21
- v2026.721.1vs v2026.720.4 — no regressions across 164 metrics2026-07-21
- v2026.720.4vs v2026.720.3 — no regressions across 157 metrics2026-07-20
- v2026.720.3vs v2026.720.2 — no regressions across 157 metrics2026-07-20
- v2026.720.2vs v2026.720.1 — 1 regression across 157 metrics2026-07-20
- v2026.720.1vs v2026.718.2 — no regressions across 157 metrics2026-07-20
- v2026.718.2vs v2026.717.1 — no regressions across 157 metrics2026-07-20
- v2026.717.1vs v2026.715.1 — no regressions across 157 metrics2026-07-17
- v2026.715.1vs v2026.711.2 — 2 regressions across 157 metrics2026-07-15
- v2026.711.2vs v2026.711.1 — no regressions across 157 metrics2026-07-13
- v2026.711.1vs v2026.710.1 — no regressions across 157 metrics2026-07-11
- v2026.710.1vs v2026.709.2 — no regressions across 157 metrics2026-07-10
- v2026.709.2vs v2026.709.1 — no regressions across 157 metrics2026-07-10
- v2026.709.1vs v2026.708.3 — no regressions across 157 metrics2026-07-09
- v2026.708.3vs v2026.708.2 — no regressions across 157 metrics2026-07-08
- v2026.708.2vs v2026.708.1 — 2 regressions across 157 metrics2026-07-08
- v2026.708.1vs v2026.704.3 — no regressions across 157 metrics2026-07-08
- v2026.704.3vs v2026.704.1 — no regressions across 157 metrics2026-07-06
- v2026.703.7vs v2026.703.5 — no regressions across 157 metrics2026-07-03
- v2026.703.6vs v2026.703.3 — no regressions across 157 metrics2026-07-03
- v2026.703.3vs v2026.703.1 — 3 regressions across 157 metrics2026-07-03
See a real scan run
A replay of the actual CLI running against our test repositories — live progress, real findings, a genuine DriftScore. Nothing executes in your browser.