Raw agent
Dwa świeże konteksty, surowy harness i plikowy stan przekazania między poprzednikiem a następcą.
- Model
- gpt-5.6-luna
- Harness
- Claude Code 2.1.126
- Transport
- Codex CLI 0.154.0
raw agent vs ten sam agent + Czak
Dwa świeże agenty miały kolejno zapamiętać zatwierdzone warunki i przygotować ofertę. W obu ramionach użyliśmy tego samego modelu, tego samego zadania i tych samych danych. Zmieniliśmy tylko sposób przeniesienia wiedzy: surowy harness albo Czak.
Odpowiedź
Ramię B dostarczyło dziesięć poprawnych ofert i nie wysłało ani jednego pytania do operatora. Ramię A dostarczyło pięć poprawnych ofert i wysłało cztery pytania.
Mediana sparowana wskazała jednocześnie 59,9% mniej tokenów, 57,1% mniej wywołań modelu i 50,5% mniej czasu po stronie Czaka.
Nastawy
Dwa świeże konteksty, surowy harness i plikowy stan przekazania między poprzednikiem a następcą.
Dwa świeże konteksty, te same wejścia i model oraz capability współdzielonej wiedzy Czaka.
Claude Code był wyłącznie surowym harnessem ramienia A. Jego wywołania modelu zostały skierowane do tego samego gpt-5.6-luna przez ten sam zamrożony transport Codex. To nie jest porównanie modelu Claude z modelem Codex.
Wszystkie obserwacje
| Para | Kolejność | Raw | Czak | Tokeny raw / Czak | Wywołania raw / Czak | Czas raw / Czak | Operator raw / Czak |
|---|---|---|---|---|---|---|---|
| 01 | A→B | FAIL | PASS | 128 255 / 54 005 | 7 / 3 | 52,9 s / 32,0 s | 0 / 0 |
| 02 | B→A | FAIL | PASS | 128 497 / 53 797 | 7 / 3 | 60,4 s / 26,9 s | 0 / 0 |
| 03 | B→A | FAIL | PASS | 143 816 / 54 032 | 8 / 3 | 64,4 s / 34,3 s | 0 / 0 |
| 04 | A→B | FAIL | PASS | 128 299 / 49 088 | 7 / 3 | 57,7 s / 33,1 s | 0 / 0 |
| 05 | A→B | PASS | PASS | 128 869 / 53 923 | 7 / 3 | 66,1 s / 29,3 s | 1 / 0 |
| 06 | B→A | FAIL | PASS | 148 192 / 53 746 | 8 / 3 | 61,3 s / 29,0 s | 2 / 0 |
| 07 | A→B | PASS | PASS | 169 361 / 53 877 | 9 / 3 | 70,3 s / 29,2 s | 1 / 0 |
| 08 | B→A | PASS | PASS | 123 286 / 54 039 | 7 / 3 | 51,8 s / 31,3 s | 0 / 0 |
| 09 | B→A | PASS | PASS | 128 360 / 53 910 | 7 / 3 | 56,7 s / 29,3 s | 0 / 0 |
| 10 | A→B | PASS | PASS | 195 750 / 53 887 | 9 / 3 | 79,8 s / 34,2 s | 0 / 0 |
Tokeny obejmują wszystkie raportowane kategorie. Czas obejmuje przygotowanie profilu. A = raw, B = Czak.
Paczka dowodowa
Paczka zawiera zamrożone dane wejściowe, 10 zanonimizowanych receiptów, agregat, prerejestrację i bez-zależnościowy weryfikator w Pythonie.
Weryfikacja offline
tar -xzf m1-c1-v3-evidence-public-1.0.0.tar.gz
cd m1-c1-v3-evidence-public-1.0.0
python3 verify.pya40e9bcc36e9d0083941cfb4c5d47394cc75f1fad2867ea5d3510aa9e2cc3a0c2273fd2e7762c15ceb21096ef31359fdf6b461cePubliczna paczka niezależnie przelicza agregat z receiptów. Nie uruchamia ponownie modelu i nie pozwala niezależnie ocenić pierwotnych plików ofert: surowe artefakty i prywatne raporty nie zostały zachowane w formie nadającej się do publikacji. Ich hashe pozostają związane z każdym receiptem. To jest jawna granica dowodu.
Granice wyniku
To jedno syntetyczne zadanie ofertowe, a nie przekrój całej pracy organizacji.
To jeden model i przypięte wersje narzędzi; wynik nie przenosi się automatycznie na inne modele.
Dziesięć par daje mocny sygnał opisowy, ale nie wystarcza do uniwersalnego wniosku statystycznego.
Eksperyment porównuje produkt, nie izoluje pamięci jako jedynej możliwej przyczyny różnicy.
Zerowy krańcowy rachunek w subskrypcji nie jest dowodem ekonomiki jednostkowej produktu.
Pomiar wykonał producent. Publiczna paczka pozwala przeliczyć liczby, ale pełny replay i niezależna atestacja pozostają kolejnymi bramami.