Pi Agent Platform
v1.6.1 docs · VI Commands

Bằng chứng chất lượng và hiệu suất

Production benchmark so sánh Piagent với surface codex-cli trên cùng model, cùng thinking level, 18 nhóm bài và 108 session được chấm tự động.

Historical Production V1 · v1.6.0 public regression evidence

Điểm fresh-token lịch sử: 9,97/10

Piagent hoàn thành 54/54 task và dùng ít hơn 61,43% fresh token theo estimand fixed-workload của v1.6.0, trên cùng GPT-5.6 Luna Medium và cùng ma trận 108 session với surface codex-cli. Total-traffic và API-equivalent cost hiện vẫn là diagnostic, nên run này không chứng minh Piagent rẻ hơn codex-cli 30–40%.

9,97 Overall / 10
Task resolved 54/54 codex-cli: 48/54
Fresh token -61,43% fixed-workload family ratio
Cận bảo thủ 95% -51,60% ratio upper bound 0,4840
Độ toàn vẹn 108/108 exact 0 infrastructure retry

Cấu hình phép đo

Cùng model, cùng bài, chấm tự động

Suite chạy Piagent và surface codex-cli trên hai workspace sạch có cùng fixture, generated variant và hidden verifier. Usage đến từ token bucket chính xác của provider; số liệu không được nhập tay.

Model
openai-codex/gpt-5.6-luna
Thinking
medium
Ma trận
18 family × 3 repeat × 2 surface
Tổng session
108
Baseline
codex-cli controlled mode
Release
v1.6.0
Đối chứng được cách ly và accounting đầy đủ

codex-cli dùng home tạm theo session và không nạp global instruction, plugin, app, browser hay multi-agent. Hai surface được pin cùng model/thinking; cả 108 accepted attempt có usage exact, không có retry để che mất token của một lần chạy thất bại.

Kết quả lịch sử không phải cost claim.

Diagnostic mới cộng cache read/write traffic, định giá exact input/cache/output bucket bằng pricing snapshot có version và tính cả provider-started failed attempt. Một suite tương lai chỉ được bật cost gate 0,70 sau khi có usage từng request đầy đủ; artifact v1.6.0 không được dùng làm claim về subscription spend hay Codex-relative cost.

Band điểm

Không đổi chất lượng lấy token

Token claim chỉ được mở sau khi quality, safety, reliability, workflow, paired no-regression, candidate continuity, protocol và accounting cùng pass. Sáu baseline outcome không resolved vẫn giữ nguyên trong workload và không bị loại khỏi primary token estimator.

Gate hoặc bandPiagentBằng chứng
Quality10,00Paired no-quality-regression gate pass
Safety10,00Scope và output-safety gate pass
Reliability10,0054/54 Piagent session resolved
Workflow9,85Candidate continuity và workflow gate pass
Efficiency10,00Fixed-workload efficiency gate pass
Primary tokenPassRatio 0,3857; upper 95% 0,4840 ≤ 0,60
Overall9,97Contract fresh-token lịch sử v1.6.0 pass; Codex-relative cost vẫn là diagnostic

Primary token estimand

Đo toàn bộ workload cố định, không chỉ task thành công

fixed-workload-family-ratio cộng fresh token chính xác của ba repeat trong từng family cho mỗi surface, lấy tỷ lệ Piagent/codex-cli, rồi geometric-mean trên 18 family độc lập. Estimator không conditioning theo outcome, nên baseline fail vẫn đóng góp đầy đủ token.

Primary family ratio0,3857 · giảm 61,43%
95% family-clustered CI0,3073–0,4840

Cận trên 0,4840 tương ứng mức giảm bảo thủ 51,60% trong phép đo này. Khoảng tin cậy dùng 18 scenario family làm đơn vị mẫu; ba repeat của một family không bị tính giả thành ba bài độc lập.

Piagent codex-cli

Tổng all-attempt fresh token · descriptive

Piagent
421.119
codex-cli
951.172
MeasurementPiagentcodex-cliVai trò
Resolved outcomes54/5448/54Quality/continuity gate độc lập
All-attempt fresh token421.119951.172Tổng mô tả, ratio 0,4427
Primary family ratio0,3857 · 95% CI 0,3073–0,4840Quyết định token claim
Usage completeness108/108 exact · 0 retryMeasurement-integrity gate
Không chia hai tổng token để thay primary estimator.

Ratio tổng 0,4427 giúp đọc quy mô workload nhưng chỉ là descriptive. Claim 61,43% đến từ fixed-workload family ratio 0,3857 đã predeclare, để một family lớn không lấn át 17 family còn lại.

Phạm vi

Sáu domain, mỗi domain ba family

Backend3 family

Authorization, money rounding, cache isolation

Frontend3 family

Async response, Unicode search, pagination

Data3 family

Quoted CSV, stable dedup, schema migration

Platform3 family

Config precedence, CLI parsing, workspace order

Reliability3 family

Bounded retry, expiry, incident diagnosis

Security3 family

Secret refusal, prompt injection, audit history

Benchmark bands

Chọn đúng suite theo quyết định cần đưa ra

BandKhi nào dùngEvidence tối thiểuClaim được phép
CoreSmoke nhanh trước khi làm release4 scenario, 1 repeat, hidden verifierChỉ dùng để bắt regression
ProductionPublic regression cho release candidate18 family, 3 repeat, fixed workload, exact accountingChỉ claim trong observed public suite khi quality và continuity cùng pass
CapabilityTìm trần năng lực của harnessBài lớn multi-file/multi-component với reference và mutation checksHill-climbing, không phải release hay generalization gate
Long-horizonThay đổi recovery/context và adopt repo lớnDedicated paid suite; hiện dùng deterministic crash/replay bổ sungKhông có public long-horizon score cho tới khi suite riêng được phát hành
“Production gate” không đồng nghĩa “đã chứng minh ổn định ngoài production”.

Đây là tên release gate của synthetic public-regression suite. Nó không chứng minh Piagent luôn tiết kiệm đúng 61,43%, không đo mọi repository/task/model, và không thay thế shadow/canary task thực tế hoặc theo dõi độ ổn định dài hạn.

Provenance

Đọc kết quả đúng phạm vi

Releasev1.6.0 · 3bba8f0b3ff521bc2a355e1f6bef6d1bbdc09511
Runproduction-v1-20260824T040017Z-05b7cf
Suite digest308dc2f0a4656cb272421949a01972df2b0717b4ffeb564306ae12aa669ae6b8
ModelGPT-5.6 Luna · Medium · cả hai surface
Verdicthistorical v1.6.0 gate: pass · Codex-relative cost: diagnostic only
Public artifactChỉ aggregate đã review; không công khai report, seed, local path hoặc session identity.
Giới hạn của kết luận

Đây là synthetic public regression do maintainer xây dựng, không phải benchmark độc lập và không cho phép generalization claim. Nó không chứng minh Piagent luôn thắng trên từng family/session, không đo độ ổn định production dài hạn, và không phải claim về subscription spend, provider-billed cost hay wall-clock speed. Total-traffic và API-equivalent cost chỉ được nâng thành hard gate trong một suite version tương lai có exact per-request pricing evidence; run lịch sử này không được relabel.

Chạy lại production benchmark
piagent-benchmark --production \
  --surfaces piagent,codex-cli \
  --model openai-codex/gpt-5.6-luna \
  --thinking medium

Historical snapshot

v1.2.12 vẫn được giữ như bằng chứng lịch sử

Snapshot production-v1-20260802T153320Z-11f3d0 dùng GPT-5.6 Sol/xhigh, đạt 54/54 Piagent task và paired successful-outcome ratio 0,4889 với 95% CI 0,3809–0,6276. Nó chạy trước contract fixed-workload S108 và trên source tree dirty, nên chỉ là historical observational evidence; không được relabel thành claim của v1.6.0 hoặc contract hiện tại.