Skip to content

Actions: benchflow-ai/awesome-evals

Actions

All workflows

Actions

Loading...
Loading

Showing runs from all workflows
245 workflow runs
245 workflow runs

Filter by Workflow

Filter by Event

Filter by Status

Filter by Branch

Filter by Actor

Eval Scan (audit + update)
Eval Scan (audit + update) #82: Scheduled
1m 48s main
Eval Scan (audit + update)
Eval Scan (audit + update) #81: Scheduled
2m 25s main
Eval Scan (audit + update)
Eval Scan (audit + update) #80: Scheduled
2m 11s main
Eval Scan (audit + update)
Eval Scan (audit + update) #79: Scheduled
2m 12s main
Eval Scan (audit + update)
Eval Scan (audit + update) #78: Scheduled
2m 37s main
Eval Scan (audit + update)
Eval Scan (audit + update) #77: Scheduled
2m 26s main
Eval Scan (audit + update)
Eval Scan (audit + update) #76: Scheduled
39s main
Add Mendmark mutation-testing benchmark
Awesome-Evals Responder #166: Pull request #87 opened by danielgaskins
13s
Eval Scan (audit + update)
Eval Scan (audit + update) #75: Scheduled
2m 15s main
Eval Scan (audit + update)
Eval Scan (audit + update) #74: Manually run by xdotli
3m 1s main
Swap scan/responder model to claude-opus-4-6
Awesome-Evals Responder #165: Pull request #86 opened by xdotli
26s
Eval Scan (audit + update)
Eval Scan (audit + update) #73: Scheduled
22s main
Eval Scan (audit + update)
Eval Scan (audit + update) #72: Scheduled
2m 34s main
Add Proofline to agent-specific evaluation
Awesome-Evals Responder #158: Pull request #82 opened by ceodaradigu
12s
Eval Scan (audit + update)
Eval Scan (audit + update) #71: Scheduled
1m 21s main
Eval Scan (audit + update)
Eval Scan (audit + update) #70: Scheduled
1m 48s main
Eval Scan (audit + update)
Eval Scan (audit + update) #69: Scheduled
3m 45s main