Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension


Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
4 changes: 1 addition & 3 deletions packages/evals/ARCHITECTURE.mmd
Original file line number Diff line number Diff line change
Expand Up @@ -4,7 +4,6 @@ flowchart TB
REPL["tui/repl.ts<br/>interactive shell<br/>Esc abort support"]
BuildCLI["scripts/build-cli.ts<br/>bundled dist/cli bin"]
BuildESM["scripts/build-esm.ts<br/>dist/esm + assets + datasets"]
LegacyCLI["cli-legacy.ts / index.eval.ts<br/>--legacy escape hatch"]
end

subgraph TUI["TUI Command Layer"]
Expand Down Expand Up @@ -33,7 +32,7 @@ flowchart TB
BenchPlanner["framework/benchPlanner.ts<br/>model matrix<br/>suite expansion<br/>metadata/tags"]
TaskConfig["taskConfig.ts<br/>default models<br/>agent model entries"]
Datasets[("datasets/*<br/>WebVoyager<br/>OnlineMind2Web<br/>WebTailBench")]
DryRun["dry-run JSON<br/>tasks, skippedTasks,<br/>envOverrides, runOptions"]
DryRun["dry-run JSON<br/>target, normalizedTarget, tasks,<br/>envOverrides, runOptions,<br/>matrix, error?"]
end

subgraph Runner["Unified Runner"]
Expand Down Expand Up @@ -94,7 +93,6 @@ flowchart TB
REPL --> RunCmd
BuildCLI --> CLI
BuildESM --> RuntimePaths
LegacyCLI --> LegacyRunner["legacy runner path<br/>pre-refactor behavior"]

%% TUI and config
ConfigCmd <--> ConfigFile
Expand Down
5 changes: 2 additions & 3 deletions packages/evals/README.md
Original file line number Diff line number Diff line change
@@ -1,6 +1,6 @@
# Stagehand Evals

Agent benchmarks for Stagehand — `act`, `extract`, `observe`, `agent`, plus dataset-backed suites (WebVoyager, OnlineMind2Web, WebTailBench, GAIA).
Agent benchmarks for Stagehand — `act`, `extract`, `observe`, `agent`, plus dataset-backed suites (WebVoyager, OnlineMind2Web, WebTailBench, Odysseys).

Driven by an interactive TUI (`evals`) or single-shot CLI (`evals run …`). Tasks are auto-discovered from `tasks/bench/<category>/` — no registration step.

Expand Down Expand Up @@ -68,10 +68,9 @@ Use `Esc` to abort an in-flight run without exiting the REPL.
| `-e, --env <local\|browserbase>` | Where the browser runs |
| `-t, --trials <n>` | Trials per task |
| `-c, --concurrency <n>` | Max parallel sessions |
| `-m, --model <id>` / `-p, --provider <name>` | Override the model/provider matrix |
| `-m, --model <id>` | Override the model matrix |
| `--api` | Run via the Stagehand API instead of the SDK |
| `--harness <stagehand\|claude_code\|codex>` | Which agent harness drives the bench task |
| `--agent-mode <dom\|hybrid\|cua>` / `--agent-modes <csv>` | Stagehand agent mode (or matrix) |
| `-l, --limit <n>` / `-s, --sample <n>` / `-f, --filter key=value` | Suite shaping for benchmark targets |
| `--preview` | Print the resolved plan and exit — no browser, no LLM calls |

Expand Down
312 changes: 0 additions & 312 deletions packages/evals/args.ts

This file was deleted.

Loading
Loading