← Benchmarks

Concise output style

felan-concise vs felan-no-output-style

Cost · minimize · Ratio of reduced sums · lower is better

+14.5%primary outcome · Ratio of reduced sums·+7.0% to +19.6%Case range (macro mean)
Costprimary · minimize · Ratio of reduced sums+14.5%Aggregate values: baseline $0.2295; candidate $0.1963 · case mean +14.9%; Case range (macro mean) +7.0% to +19.6%
Output tokenssecondary · minimize · Ratio of reduced sums+16.4%Aggregate values: baseline 4,187 tokens; candidate 3,500 tokens · case mean +16.0%; Case range (macro mean) +12.1% to +21.2%

Metrics

Arm values remain macro means across cases. The objective headline uses the ratio of reduced sums after per-case median trial reduction.

Benchmark metrics by arm
Metricfelan-no-output-stylebaseline · 9/9 runs · 9/9 passedfelan-concisecandidate · 9/9 runs · 9/9 passedDelta
Cost$0.0765$0.0654-$0.0111
Output tokens1,396 tokens1,167 tokens-229 tokens
quality.passRate110
Duration6686548315.6667-18549.3333
Prompt tokens10,460 tokens11,884 tokens+1,423 tokens
Uncached input tokens5,991 tokens4,787 tokens-1,204 tokens
Cache-read input tokens4,480 tokens7,083 tokens+2,603 tokens
Cache-write input tokens0 tokens0 tokens0 tokens
Requests440

Tests

TestBaseline (Median trials; Ratio of reduced sums)Candidate (Median trials; Ratio of reduced sums)vs baseline
output-style-planning$0.08043/3 passed$0.06583/3 passed+18.1%
Attempt 1$0.0804Passed$0.0955Passed-18.7%
Attempt 2$0.0699Passed$0.0658Passed+5.8%
Attempt 3$0.1148Passed$0.0618Passed+46.2%
output-style-review$0.06603/3 passed$0.05313/3 passed+19.6%
Attempt 1$0.0482Passed$0.0531Passed-10.1%
Attempt 2$0.0660Passed$0.0998Passed-51.2%
Attempt 3$0.0781Passed$0.0428Passed+45.1%
output-style-support$0.08323/3 passed$0.07733/3 passed+7.0%
Attempt 1$0.0832Passed$0.0775Passed+6.7%
Attempt 2$0.0913Passed$0.0773Passed+15.3%
Attempt 3$0.0679Passed$0.0574Passed+15.4%