- 6 public-style documents covering diverse topics - 18 test queries: 6 easy, 6 medium, 6 hard - Easy: exact keyword matches - Medium: semantic/conceptual queries - Hard: partial recall, indirect references - Measures Hit@1, Hit@3, Hit@5 by difficulty - Tests both search (BM25) and query (hybrid) modes Run: bun test/eval-harness.ts 🤖 Generated with [Claude Code](https://claude.com/claude-code) Co-Authored-By: Claude Opus 4.5 <noreply@anthropic.com> |
||
|---|---|---|
| .. | ||
| eval-harness.ts | ||