Concise output style
felan-concise vs felan-no-output-style
Cost · minimize · Ratio of reduced sums · lower is better
+14.5%primary outcome · Ratio of reduced sums·+7.0% to +19.6%Case range (macro mean)
Costprimary · minimize · Ratio of reduced sums+14.5%Aggregate values: baseline $0.2295; candidate $0.1963 · case mean +14.9%; Case range (macro mean) +7.0% to +19.6%
Output tokenssecondary · minimize · Ratio of reduced sums+16.4%Aggregate values: baseline 4,187 tokens; candidate 3,500 tokens · case mean +16.0%; Case range (macro mean) +12.1% to +21.2%
Metrics
Arm values remain macro means across cases. The objective headline uses the ratio of reduced sums after per-case median trial reduction.
| Metric | felan-no-output-stylebaseline · 9/9 runs · 9/9 passed | felan-concisecandidate · 9/9 runs · 9/9 passed | Delta |
|---|---|---|---|
| Cost | $0.0765 | $0.0654 | -$0.0111 |
| Output tokens | 1,396 tokens | 1,167 tokens | -229 tokens |
| quality.passRate | 1 | 1 | 0 |
| Duration | 66865 | 48315.6667 | -18549.3333 |
| Prompt tokens | 10,460 tokens | 11,884 tokens | +1,423 tokens |
| Uncached input tokens | 5,991 tokens | 4,787 tokens | -1,204 tokens |
| Cache-read input tokens | 4,480 tokens | 7,083 tokens | +2,603 tokens |
| Cache-write input tokens | 0 tokens | 0 tokens | 0 tokens |
| Requests | 4 | 4 | 0 |
Tests
TestBaseline (Median trials; Ratio of reduced sums)Candidate (Median trials; Ratio of reduced sums)vs baseline
output-style-planning$0.08043/3 passed$0.06583/3 passed+18.1%
Attempt 1$0.0804Passed$0.0955Passed-18.7%
Attempt 2$0.0699Passed$0.0658Passed+5.8%
Attempt 3$0.1148Passed$0.0618Passed+46.2%
output-style-review$0.06603/3 passed$0.05313/3 passed+19.6%
Attempt 1$0.0482Passed$0.0531Passed-10.1%
Attempt 2$0.0660Passed$0.0998Passed-51.2%
Attempt 3$0.0781Passed$0.0428Passed+45.1%
output-style-support$0.08323/3 passed$0.07733/3 passed+7.0%
Attempt 1$0.0832Passed$0.0775Passed+6.7%
Attempt 2$0.0913Passed$0.0773Passed+15.3%
Attempt 3$0.0679Passed$0.0574Passed+15.4%