Reward Atlas
All field guidesEsc to close
Sign in
LLM / AgenticPublicPublishedv1.0Advanced

SQL-Detective-v1

A multi-turn agent answers analytics questions by querying a read-only SQLite sandbox. Tool use, verifiable rewards, 12-turn budget. Maintained by Bhaskar & Jaswanth · updated 28 Aug 2026.

Dataset
2,400 q · 12 DBs
Action
tool call | final answer
Turn cap
12
Best baseline
GRPO-7B 61.4%
10

Dataset, tools & verifier

Dataset

2,400 questions over 12 SQLite databases.

  • train: 2,000 · eval: 400
  • Databases disjoint between splits
  • License: CC BY 4.0

Tools

list_tables · describe_table · run_query · submit_answer

One call per turn; see Step 4 for signatures and guardrails.

Sandbox

Image rewardatlas/sql-detective:1.0

  • Network: off
  • Mount: read-only
  • 5 s query timeout, 512 MB memory

Verifier / rubric

Deterministic Python grader: multiset match, partial column credit, invalid-query penalty and a format canary. No LLM judge.

def grade(submitted, expected, state) -> float:
    if contains_format_canary(submitted):
        return 0.0
    if as_multiset(submitted) == as_multiset(expected):
        score = 1.0
    elif column_overlap(submitted, expected) >= 0.5:
        score = 0.2
    else:
        score = 0.0
    penalty = 0.1 * max(0, state.invalid_queries - 3)
    return max(score - penalty, 0.0)
Guide details
Version
Type
LLM / Agentic
API
OpenEnv
License
Apache-2.0
Seeds
3
Domains
tool-usedatacoding
Install
pip install reward-atlas-sql-detective

Issue with this step? Suggest an edit