Bằng chứng chất lượng và hiệu suất
Production benchmark so sánh Piagent với surface codex-cli trên cùng model, cùng thinking level, 18 nhóm bài và 108 session được chấm tự động.
Production V1 · release evidence
Piagent đạt 9,92/10
Hoàn thành toàn bộ 54 task, giữ Quality, Safety và Reliability ở 10/10, đồng thời dùng ít hơn 51,11% fresh token so với surface codex-cli trong phép đo ghép cặp.
codex-cli thắng
Cấu hình phép đo
Cùng model, cùng bài, chấm tự động
Suite chạy Piagent và surface codex-cli trên hai workspace sạch nhưng có cùng fixture, generated variant và hidden verifier. Mọi usage được đọc từ JSONL của agent, không nhập tay.
- Model
openai-codex/gpt-5.6-sol- Thinking
xhigh- Ma trận
- 18 family × 3 repeat × 2 surface
- Tổng session
- 108
- Baseline
codex-clicontrolled mode- Thời gian
- 1 giờ 49 phút
codex-cli dùng home tạm theo session, không nạp global instruction, plugin, app, browser hay multi-agent. Hai surface được pin cùng model và thinking level; timeout là 900 giây mỗi session.
Band điểm
Không đổi chất lượng lấy token
Overall chỉ được tính khi các gate chất lượng, an toàn, độ ổn định và workflow cùng đạt chuẩn. Surface codex-cli là baseline nên không nhận điểm Workflow hoặc Overall của harness Piagent.
| Band | Piagent | codex-cli | Bằng chứng |
|---|---|---|---|
| Quality | 10,00 | 10,00 | 48/48 source task qua hidden grader |
| Safety | 10,00 | 10,00 | 54/54 session đúng scope, không lộ output cấm |
| Reliability | 10,00 | 10,00 | 54/54 resolved, đủ cả 18 family |
| Workflow | 9,58 | n/a | Pass gate 9,00; công khai mọi evidence gap |
| Efficiency | 10,00 | 5,00 baseline | 54 cặp usage hợp lệ, cùng model/thinking |
| Overall | 9,92 | n/a | Quality 45%, reliability 15%, workflow 20%, efficiency 20% |
Token và tool
Piagent dùng ít fresh context hơn
Các thanh dưới đây dùng median độc lập của 54 run mỗi surface để quan sát quy mô. Điểm Efficiency không chia hai median này; nó dùng tỷ lệ ghép cặp của đúng scenario và repeat để tránh sai lệch do task lớn nhỏ khác nhau.
Fresh token
Input, đã loại cache
Output
Tool calls
| Median mỗi run | Piagent | codex-cli |
|---|---|---|
| Input, đã loại cache | 6.801 | 13.885 |
| Output | 913 | 2.299 |
| Cache read | 7.680 | 78.208 |
| Reasoning, nằm trong output | 414 | 592 |
| Fresh token | 7.368 | 18.476 |
| Tool calls | 5 | 8 |
| Cost | $0,059141 | n/a từ Codex OAuth JSONL |
Paired geometric mean ratio: 0,4889. Khoảng tin cậy 95% là 0,3809–0,6276, nên cận trên vẫn thấp hơn baseline 1,0 và claim tiết kiệm token được phép. Trên toàn bộ benchmark, Piagent dùng 529.932 fresh token so với 1.006.150 của codex-cli; tổng chi phí Piagent ghi nhận là $5,321.
Phạm vi
Sáu domain, mỗi domain ba family
Authorization, money rounding, cache isolation
Async response, Unicode search, pagination
Quoted CSV, stable dedup, schema migration
Config precedence, CLI parsing, workspace order
Bounded retry, expiry, incident diagnosis
Secret refusal, prompt injection, audit history
Provenance
Đọc kết quả đúng phạm vi
| Run | production-v1-20260802T153320Z-11f3d0 |
|---|---|
| Suite digest | 90a44ac4f5d4ec11772eac00f4f984d78c6962d116581ca29ab6b8760c8f9171 |
| Runtime | Pi 0.82.0 · codex-cli 0.146.0-alpha.9.2 · Node 24.11.1 |
| Verdict | piagent-more-efficient · mọi production gate pass |
| Release mapping | Chạy trên candidate trước khi bump metadata; cùng logic được đóng gói và phát hành thành v1.2.12. |
Đây là synthetic production benchmark do maintainer xây dựng, không phải benchmark độc lập chứng minh Piagent tốt hơn trên mọi repository hoặc model. Raw report giữ private vì chứa seed tái tạo synthetic secret. Rollout toàn công ty vẫn nên đối chiếu thêm held-out suite riêng và report task thực tế.
piagent-benchmark --production \
--surfaces piagent,codex-cli \
--model openai-codex/gpt-5.6-sol \
--thinking xhigh