Bằng chứng chất lượng và hiệu suất
Production benchmark so sánh Piagent với surface codex-cli trên cùng model, cùng thinking level, 18 nhóm bài và 108 session được chấm tự động.
Historical Production V1 · v1.6.0 public regression evidence
Điểm fresh-token lịch sử: 9,97/10
Piagent hoàn thành 54/54 task và dùng ít hơn 61,43% fresh token theo estimand fixed-workload của v1.6.0, trên cùng GPT-5.6 Luna Medium và cùng ma trận 108 session với surface codex-cli. Total-traffic và API-equivalent cost hiện vẫn là diagnostic, nên run này không chứng minh Piagent rẻ hơn codex-cli 30–40%.
codex-cli: 48/54
Cấu hình phép đo
Cùng model, cùng bài, chấm tự động
Suite chạy Piagent và surface codex-cli trên hai workspace sạch có cùng fixture, generated variant và hidden verifier. Usage đến từ token bucket chính xác của provider; số liệu không được nhập tay.
- Model
openai-codex/gpt-5.6-luna- Thinking
medium- Ma trận
- 18 family × 3 repeat × 2 surface
- Tổng session
- 108
- Baseline
codex-clicontrolled mode- Release
v1.6.0
codex-cli dùng home tạm theo session và không nạp global instruction, plugin, app, browser hay multi-agent. Hai surface được pin cùng model/thinking; cả 108 accepted attempt có usage exact, không có retry để che mất token của một lần chạy thất bại.
Diagnostic mới cộng cache read/write traffic, định giá exact input/cache/output bucket bằng pricing snapshot có version và tính cả provider-started failed attempt. Một suite tương lai chỉ được bật cost gate 0,70 sau khi có usage từng request đầy đủ; artifact v1.6.0 không được dùng làm claim về subscription spend hay Codex-relative cost.
Band điểm
Không đổi chất lượng lấy token
Token claim chỉ được mở sau khi quality, safety, reliability, workflow, paired no-regression, candidate continuity, protocol và accounting cùng pass. Sáu baseline outcome không resolved vẫn giữ nguyên trong workload và không bị loại khỏi primary token estimator.
| Gate hoặc band | Piagent | Bằng chứng |
|---|---|---|
| Quality | 10,00 | Paired no-quality-regression gate pass |
| Safety | 10,00 | Scope và output-safety gate pass |
| Reliability | 10,00 | 54/54 Piagent session resolved |
| Workflow | 9,85 | Candidate continuity và workflow gate pass |
| Efficiency | 10,00 | Fixed-workload efficiency gate pass |
| Primary token | Pass | Ratio 0,3857; upper 95% 0,4840 ≤ 0,60 |
| Overall | 9,97 | Contract fresh-token lịch sử v1.6.0 pass; Codex-relative cost vẫn là diagnostic |
Primary token estimand
Đo toàn bộ workload cố định, không chỉ task thành công
fixed-workload-family-ratio cộng fresh token chính xác của ba repeat trong từng family cho mỗi surface, lấy tỷ lệ Piagent/codex-cli, rồi geometric-mean trên 18 family độc lập. Estimator không conditioning theo outcome, nên baseline fail vẫn đóng góp đầy đủ token.
Cận trên 0,4840 tương ứng mức giảm bảo thủ 51,60% trong phép đo này. Khoảng tin cậy dùng 18 scenario family làm đơn vị mẫu; ba repeat của một family không bị tính giả thành ba bài độc lập.
Tổng all-attempt fresh token · descriptive
| Measurement | Piagent | codex-cli | Vai trò |
|---|---|---|---|
| Resolved outcomes | 54/54 | 48/54 | Quality/continuity gate độc lập |
| All-attempt fresh token | 421.119 | 951.172 | Tổng mô tả, ratio 0,4427 |
| Primary family ratio | 0,3857 · 95% CI 0,3073–0,4840 | Quyết định token claim | |
| Usage completeness | 108/108 exact · 0 retry | Measurement-integrity gate | |
Ratio tổng 0,4427 giúp đọc quy mô workload nhưng chỉ là descriptive. Claim 61,43% đến từ fixed-workload family ratio 0,3857 đã predeclare, để một family lớn không lấn át 17 family còn lại.
Phạm vi
Sáu domain, mỗi domain ba family
Authorization, money rounding, cache isolation
Async response, Unicode search, pagination
Quoted CSV, stable dedup, schema migration
Config precedence, CLI parsing, workspace order
Bounded retry, expiry, incident diagnosis
Secret refusal, prompt injection, audit history
Benchmark bands
Chọn đúng suite theo quyết định cần đưa ra
| Band | Khi nào dùng | Evidence tối thiểu | Claim được phép |
|---|---|---|---|
| Core | Smoke nhanh trước khi làm release | 4 scenario, 1 repeat, hidden verifier | Chỉ dùng để bắt regression |
| Production | Public regression cho release candidate | 18 family, 3 repeat, fixed workload, exact accounting | Chỉ claim trong observed public suite khi quality và continuity cùng pass |
| Capability | Tìm trần năng lực của harness | Bài lớn multi-file/multi-component với reference và mutation checks | Hill-climbing, không phải release hay generalization gate |
| Long-horizon | Thay đổi recovery/context và adopt repo lớn | Dedicated paid suite; hiện dùng deterministic crash/replay bổ sung | Không có public long-horizon score cho tới khi suite riêng được phát hành |
Đây là tên release gate của synthetic public-regression suite. Nó không chứng minh Piagent luôn tiết kiệm đúng 61,43%, không đo mọi repository/task/model, và không thay thế shadow/canary task thực tế hoặc theo dõi độ ổn định dài hạn.
Provenance
Đọc kết quả đúng phạm vi
| Release | v1.6.0 · 3bba8f0b3ff521bc2a355e1f6bef6d1bbdc09511 |
|---|---|
| Run | production-v1-20260824T040017Z-05b7cf |
| Suite digest | 308dc2f0a4656cb272421949a01972df2b0717b4ffeb564306ae12aa669ae6b8 |
| Model | GPT-5.6 Luna · Medium · cả hai surface |
| Verdict | historical v1.6.0 gate: pass · Codex-relative cost: diagnostic only |
| Public artifact | Chỉ aggregate đã review; không công khai report, seed, local path hoặc session identity. |
Đây là synthetic public regression do maintainer xây dựng, không phải benchmark độc lập và không cho phép generalization claim. Nó không chứng minh Piagent luôn thắng trên từng family/session, không đo độ ổn định production dài hạn, và không phải claim về subscription spend, provider-billed cost hay wall-clock speed. Total-traffic và API-equivalent cost chỉ được nâng thành hard gate trong một suite version tương lai có exact per-request pricing evidence; run lịch sử này không được relabel.
piagent-benchmark --production \
--surfaces piagent,codex-cli \
--model openai-codex/gpt-5.6-luna \
--thinking medium
Historical snapshot
v1.2.12 vẫn được giữ như bằng chứng lịch sử
Snapshot production-v1-20260802T153320Z-11f3d0 dùng GPT-5.6 Sol/xhigh, đạt 54/54 Piagent task và paired successful-outcome ratio 0,4889 với 95% CI 0,3809–0,6276. Nó chạy trước contract fixed-workload S108 và trên source tree dirty, nên chỉ là historical observational evidence; không được relabel thành claim của v1.6.0 hoặc contract hiện tại.