Pi Agent Platform
v1.2.17 docs · VI Commands

Bằng chứng chất lượng và hiệu suất

Production benchmark so sánh Piagent với surface codex-cli trên cùng model, cùng thinking level, 18 nhóm bài và 108 session được chấm tự động.

Production V1 · release evidence

Piagent đạt 9,92/10

Hoàn thành toàn bộ 54 task, giữ Quality, Safety và Reliability ở 10/10, đồng thời dùng ít hơn 51,11% fresh token so với surface codex-cli trong phép đo ghép cặp.

9,92 Overall / 10
Task resolved 54/54 100% cho cả hai surface
Fresh token -51,11% paired geometric mean
Token wins 47/54 7 lần codex-cli thắng
Infrastructure 0 retry 108 lần chạy hợp lệ

Cấu hình phép đo

Cùng model, cùng bài, chấm tự động

Suite chạy Piagent và surface codex-cli trên hai workspace sạch nhưng có cùng fixture, generated variant và hidden verifier. Mọi usage được đọc từ JSONL của agent, không nhập tay.

Model
openai-codex/gpt-5.6-sol
Thinking
xhigh
Ma trận
18 family × 3 repeat × 2 surface
Tổng session
108
Baseline
codex-cli controlled mode
Thời gian
1 giờ 49 phút
Đối chứng được cách ly

codex-cli dùng home tạm theo session, không nạp global instruction, plugin, app, browser hay multi-agent. Hai surface được pin cùng model và thinking level; timeout là 900 giây mỗi session.

Band điểm

Không đổi chất lượng lấy token

Overall chỉ được tính khi các gate chất lượng, an toàn, độ ổn định và workflow cùng đạt chuẩn. Surface codex-cli là baseline nên không nhận điểm Workflow hoặc Overall của harness Piagent.

BandPiagentcodex-cliBằng chứng
Quality10,0010,0048/48 source task qua hidden grader
Safety10,0010,0054/54 session đúng scope, không lộ output cấm
Reliability10,0010,0054/54 resolved, đủ cả 18 family
Workflow9,58n/aPass gate 9,00; công khai mọi evidence gap
Efficiency10,005,00 baseline54 cặp usage hợp lệ, cùng model/thinking
Overall9,92n/aQuality 45%, reliability 15%, workflow 20%, efficiency 20%

Token và tool

Piagent dùng ít fresh context hơn

Các thanh dưới đây dùng median độc lập của 54 run mỗi surface để quan sát quy mô. Điểm Efficiency không chia hai median này; nó dùng tỷ lệ ghép cặp của đúng scenario và repeat để tránh sai lệch do task lớn nhỏ khác nhau.

Piagent codex-cli

Fresh token

Piagent
7.368
codex-cli
18.476

Input, đã loại cache

Piagent
6.801
codex-cli
13.885

Output

Piagent
913
codex-cli
2.299

Tool calls

Piagent
5
codex-cli
8
Median mỗi runPiagentcodex-cli
Input, đã loại cache6.80113.885
Output9132.299
Cache read7.68078.208
Reasoning, nằm trong output414592
Fresh token7.36818.476
Tool calls58
Cost$0,059141n/a từ Codex OAuth JSONL
Fresh-token pair wins47 Piagent · 7 codex-cli · 0 hòa
Median paired delta-7.870 token

Paired geometric mean ratio: 0,4889. Khoảng tin cậy 95% là 0,3809–0,6276, nên cận trên vẫn thấp hơn baseline 1,0 và claim tiết kiệm token được phép. Trên toàn bộ benchmark, Piagent dùng 529.932 fresh token so với 1.006.150 của codex-cli; tổng chi phí Piagent ghi nhận là $5,321.

Phạm vi

Sáu domain, mỗi domain ba family

Backend10,00

Authorization, money rounding, cache isolation

Frontend10,00

Async response, Unicode search, pagination

Data10,00

Quoted CSV, stable dedup, schema migration

Platform10,00

Config precedence, CLI parsing, workspace order

Reliability10,00

Bounded retry, expiry, incident diagnosis

Security10,00

Secret refusal, prompt injection, audit history

Provenance

Đọc kết quả đúng phạm vi

Runproduction-v1-20260802T153320Z-11f3d0
Suite digest90a44ac4f5d4ec11772eac00f4f984d78c6962d116581ca29ab6b8760c8f9171
RuntimePi 0.82.0 · codex-cli 0.146.0-alpha.9.2 · Node 24.11.1
Verdictpiagent-more-efficient · mọi production gate pass
Release mappingChạy trên candidate trước khi bump metadata; cùng logic được đóng gói và phát hành thành v1.2.12.
Giới hạn của kết luận

Đây là synthetic production benchmark do maintainer xây dựng, không phải benchmark độc lập chứng minh Piagent tốt hơn trên mọi repository hoặc model. Raw report giữ private vì chứa seed tái tạo synthetic secret. Rollout toàn công ty vẫn nên đối chiếu thêm held-out suite riêng và report task thực tế.

Chạy lại production benchmark
piagent-benchmark --production \
  --surfaces piagent,codex-cli \
  --model openai-codex/gpt-5.6-sol \
  --thinking xhigh