czak.by ITm8czak LABOpisz problem
Eksperyment № 001M1-C1 v3

raw agent vs ten sam agent + Czak

Raw: 5/10.
Z Czakiem: 10/10.

Dwa świeże agenty miały kolejno zapamiętać zatwierdzone warunki i przygotować ofertę. W obu ramionach użyliśmy tego samego modelu, tego samego zadania i tych samych danych. Zmieniliśmy tylko sposób przeniesienia wiedzy: surowy harness albo Czak.

  • 10 prerejestrowanych par
  • Przeliczalne offline
  • Jeden model · jedno zadanie

Czak wygrał tę kampanię bez proszenia operatora o pomoc.

Ramię B dostarczyło dziesięć poprawnych ofert i nie wysłało ani jednego pytania do operatora. Ramię A dostarczyło pięć poprawnych ofert i wysłało cztery pytania.

Mediana sparowana wskazała jednocześnie 59,9% mniej tokenów, 57,1% mniej wywołań modelu i 50,5% mniej czasu po stronie Czaka.

Co dokładnie porównaliśmy

A

Raw agent

Dwa świeże konteksty, surowy harness i plikowy stan przekazania między poprzednikiem a następcą.

Model
gpt-5.6-luna
Harness
Claude Code 2.1.126
Transport
Codex CLI 0.154.0

Claude Code był wyłącznie surowym harnessem ramienia A. Jego wywołania modelu zostały skierowane do tego samego gpt-5.6-luna przez ten sam zamrożony transport Codex. To nie jest porównanie modelu Claude z modelem Codex.

  1. Pierwszy agent dostawał zatwierdzone warunki handlowe bez wiedzy o przyszłym zamówieniu.
  2. Po zamrożeniu przekazania drugi, świeży agent dostawał zamówienie i miał zbudować ofertę.
  3. Deterministyczny operator mógł odpowiedzieć na najwyżej dwa pytania na ramię; wszystkie pytania policzono.
  4. Deterministyczny oracle oceniał zamknięty JSON: pozycje, rabaty, podatki, sumy, termin i źródło.
  5. Wykonano 10 par z naprzemienną kolejnością A/B i czterema świeżymi kontekstami w każdej parze.

Dziesięć par, bez wybierania wygodnych prób.

ParaKolejnośćRawCzakTokeny raw / CzakWywołania raw / CzakCzas raw / CzakOperator raw / Czak
01A→BFAILPASS128 255 / 54 0057 / 352,9 s / 32,0 s0 / 0
02B→AFAILPASS128 497 / 53 7977 / 360,4 s / 26,9 s0 / 0
03B→AFAILPASS143 816 / 54 0328 / 364,4 s / 34,3 s0 / 0
04A→BFAILPASS128 299 / 49 0887 / 357,7 s / 33,1 s0 / 0
05A→BPASSPASS128 869 / 53 9237 / 366,1 s / 29,3 s1 / 0
06B→AFAILPASS148 192 / 53 7468 / 361,3 s / 29,0 s2 / 0
07A→BPASSPASS169 361 / 53 8779 / 370,3 s / 29,2 s1 / 0
08B→APASSPASS123 286 / 54 0397 / 351,8 s / 31,3 s0 / 0
09B→APASSPASS128 360 / 53 9107 / 356,7 s / 29,3 s0 / 0
10A→BPASSPASS195 750 / 53 8879 / 379,8 s / 34,2 s0 / 0

Tokeny obejmują wszystkie raportowane kategorie. Czas obejmuje przygotowanie profilu. A = raw, B = Czak.

Pobierz. Rozpakuj. Przelicz.

Paczka zawiera zamrożone dane wejściowe, 10 zanonimizowanych receiptów, agregat, prerejestrację i bez-zależnościowy weryfikator w Pythonie.

Weryfikacja offline

tar -xzf m1-c1-v3-evidence-public-1.0.0.tar.gz
cd m1-c1-v3-evidence-public-1.0.0
python3 verify.py
SHA256 paczki
a40e9bcc36e9d0083941cfb4c5d47394cc75f1fad2867ea5d3510aa9e2cc3a0c
Commit kontrolera
2273fd2e7762c15ceb21096ef31359fdf6b461ce

Publiczna paczka niezależnie przelicza agregat z receiptów. Nie uruchamia ponownie modelu i nie pozwala niezależnie ocenić pierwotnych plików ofert: surowe artefakty i prywatne raporty nie zostały zachowane w formie nadającej się do publikacji. Ich hashe pozostają związane z każdym receiptem. To jest jawna granica dowodu.

Czego ten wynik nie dowodzi

To jedno syntetyczne zadanie ofertowe, a nie przekrój całej pracy organizacji.

To jeden model i przypięte wersje narzędzi; wynik nie przenosi się automatycznie na inne modele.

Dziesięć par daje mocny sygnał opisowy, ale nie wystarcza do uniwersalnego wniosku statystycznego.

Eksperyment porównuje produkt, nie izoluje pamięci jako jedynej możliwej przyczyny różnicy.

Zerowy krańcowy rachunek w subskrypcji nie jest dowodem ekonomiki jednostkowej produktu.

Pomiar wykonał producent. Publiczna paczka pozwala przeliczyć liczby, ale pełny replay i niezależna atestacja pozostają kolejnymi bramami.