ANYAGENT · JOURNEY · github.com/wjlgatech/FDE-os
Every delivery graded, with evidence — where we came from, where we are, where we're heading
Self-updating from graded, evidence-backed deliveries. As of 2026-07-24.
📍 Where we are on the roadmap
19 deliveries · latest sec-filing-brief.vercel.app password-gated (edge middleware, env-held secret, HMAC cookie); gate page doubles as the founding-member funnel graded 1.00 (sandbagged?) · week avg 0.93 ↑ +0.93 (improving)
✅ What we achieved this time
sec-filing-brief.vercel.app password-gated (edge middleware, env-held secret, HMAC cookie); gate page doubles as the founding-member funnel — Case study #2 private until the interview / member access
🎯 Where we're heading next
Close the gap to target 0.70 (currently 0.93, improving).
🧭 Why
Every delivery is graded so momentum and direction stay honest and visible.
Momentum
day
0.95
↑ +0.95 improving
9 deliveries · prior 0.00
week
0.93
↑ +0.93 improving
19 deliveries · prior 0.00
month
0.93
↑ +0.93 improving
19 deliveries · prior 0.00
quarter
0.93
↑ +0.93 improving
19 deliveries · prior 0.00
Trend — grade vs the 0.70 target
Play the journey
Dark hubs = objectives · dots = graded deliveries (size & color by grade) · dashed blue = the path through time. Click a delivery to jump to it.
Deliveries
2026-07-24sec-filing-brief.vercel.app password-gated (edge middleware, env-held secret, HMAC cookie); gate page doubles as the founding-member funnel1.00sandbagged?
everything locked without password1.00evidence: live curls: 401/401/401; wrong pw 401 · target: page+data+APIs 401
password opens everything1.00evidence: unlock 204 → page 200, data.js served, /api/ask answers; secret only in Vercel env, not in the public repo · target: verified
2026-07-24Case study #2 live as an agentic webapp: sec-filing-brief.vercel.app — 5 tabs + Playground running the REAL SEC pipeline via /api/ask (PR #66); portfolio entry merged (PR #120)1.00sandbagged?
live playground = real pipeline, drift-gated1.00evidence: /api/ask: Apple $416,161M exact; headline question refuses; vendored copy byte-equality-tested (suite 223→225) · target: verified on prod
copilot honest on anonymity + embeddings1.00evidence: names no company (vault-only); explains coordinate-parsing over embeddings from corpus · target: probed live
portfolio linked with live cover1.00evidence: agentic-portfolio PR #120, top of Writing · target: merged
2026-07-24Take-home #2 (SEC Filing Intelligence) shipped + both take-homes converted to case studies: public de-branded, private vault created, founding-member hook live on the community page0.97sandbagged?
SEC pipeline vs acceptance criteria1.00evidence: ACCEPTANCE.md; 26-case golden eval 4 gates all 1.0; reconcile.py exact on real cross-filing identities; suite 216→223 (PR #62) · target: every term mapped
company name removed from public surfaces0.90evidence: dir renamed, enterprise-triage-brief.vercel.app live (playground verified), old project deleted (404); historical report-card JSON + git history retain the name — noted honestly · target: swept + redeployed
private vault + no-brainer hook1.00evidence: fde-case-studies PRIVATE (verified); contribute.html vault section + prefilled founding-member issue CTA (rendered, zero console errors) · target: live
2026-07-24Loop rebuilt from default branch (Deloitte playbook baked in, app running pid-verified); loop-pack: KB upload blocked by OpenAI quota (both keys insufficient_quota) → deep layer injected into playbook.md between managed markers; 7-tab TALKING_POINTS.md opened in VS Code0.67progress
rebuild + install + relaunch1.00evidence: release build 1m55s from c6842e3 (PR #33); TCC blocked mv, Finder route worked; build stamp 2026-07-24 08:44; pid verified · target: new build running
loop-pack in the RAG KB0.00evidence: HONEST FAIL: text-embedding-3-small returns 429 insufficient_quota on BOTH env and Loop-settings keys — no embeddings possible today; DB backed up, untouched · target: embedded upload
deep grounding available anyway1.00evidence: 26.5KB curated block (golden ledger + reasoner + graph + eval source) between deloitte-pack markers; same pattern as the repo's own sync-fmos-kb.py · target: playbook.md injection
2026-07-24Loop wired to the take-home in 3 layers: live playbook.md cheat-sheet (applies to every request now), built-in 'Deloitte Agentic AI Take-Home' playbook (loop PR #33, exact existing format, cargo-check clean), RAG knowledge pack (11 files, FDE-os PR #58)0.93sandbagged?
durable playbook in existing format1.00evidence: loop PR #33 → default branch feature/loop-ai-assistant; compiles (Finished dev profile) · target: merged
live channel active without rebuild1.00evidence: delimited DELOITTE-TAKEHOME block appended (57.1→60.7KB), removable in one cut · target: playbook.md
deep-RAG pack ready0.80evidence: FDE-os PR #58 merged; upload requires the OpenAI key in Loop (embeddings) — one manual minute, honest gap · target: 11 curated files
2026-07-24Docs refreshed for the golden dataset (PR #56): take-home README (59 cases, honest two-phase history, playground link), both brief corpora (216 tests, golden paragraphs), AGENTS.md; both briefs redeployed1.00sandbagged?
docs merged with CI green1.00evidence: 7dd058c on main; 216 passed · target: PR #56
live copilots answer golden-eval questions1.00evidence: prod probe: copilot explains the exit-2 first run and both defects from the corpus · target: verified
2026-07-24Golden dataset (47 cases, 11 tag families) + honest two-phase eval: found 2 real defects (unimplemented bids rule, invalid-request crash), fixed both, all metrics 1.0 (PR #54)1.00sandbagged?
phase-1 honest eval reported red1.00evidence: escalation_recall 0.889, bids tag 8/10 — not hidden, led the report · target: FAIL exit 2 published
phase-2 all gates green + no regression1.00evidence: all five metrics 1.0, 11/11 tags, suite 212→216, golden run now a CI gate · target: 47/47 and 12/12
live playground enforces the fixed rule1.00evidence: POST /api/triage 80k sole-source → escalate competitive-bids, cites procurement-policy-v3.md · target: verified on prod
2026-07-24Playground shipped: the real triage agent playable at deloitte-triage-brief.vercel.app/#play (PR #52)1.00sandbagged?
live agent behind /api/triage, not a mock1.00evidence: vendored copy byte-equality-tested; suite 208→212 · target: same gated modules
experiments verified on prod1.00evidence: routine approve, split-purchase flip, time-machine Mar/May flip, injection flagged-not-obeyed, prohibited deny, 10000/10001 boundary flip · target: 7/7
2026-07-24/FDE-os master tool built + demoed live: front-door skill routing 13 engines, 14 CI-verified demos, brief live at https://fde-os-master.vercel.app (PR #50)1.00sandbagged?
master skill exists and routes every engine1.00evidence: skills/fde-os/SKILL.md routing table; paths validated by test_master_examples.py · target: 13/13
every demo re-executed by CI with documented exit code1.00evidence: make check 208 passed (was 206); demos include honest BLOCK exit 1 and hub exit 2 · target: 14/14
brief live with working copilot1.00evidence: index 200; live POST /api/chat explains the BLOCK and denies embeddings correctly; offline fallback labeled · target: page + API verified
2026-07-21Portfolio deploy verified live: the brief entry serves on agentic-portfolio-lovat.vercel.app (settles rc0009's pending KR)1.00sandbagged?
brief link live on the deployed portfolio1.00evidence: curl of agentic-portfolio-lovat.vercel.app contains deloitte-triage-brief link after PR #110 auto-deploy · target: observed
2026-07-21Take-home brief linked on the agentic portfolio (Writing section, top entry, with live-captured cover) — portfolio PR #110 merged0.83on-track
portfolio entry merged + YAML valid1.00evidence: agentic-portfolio PR #110 squash-merged; yaml.safe_load OK, 20 articles · target: top of Writing
live verification on the deployed portfolio0.50evidence: pending at card time — verifier running; settles next card if needed · target: link present
conflict + stale-checkout hygiene1.00evidence: rebuilt on fresh branch from main; 9 stale untracked files removed only after byte-identical diff vs main; 2 differing files backed up to /tmp/portfolio-stale-backup · target: resolved safely
2026-07-21Agentic brief webapp for the Deloitte take-home LIVE at https://deloitte-triage-brief.vercel.app — 6 tabs, term-by-term requirement check (6 domains + 9 responsibilities + 8 qualifications), corpus-grounded copilot, 10X proposal clearly PROPOSAL-only0.97sandbagged?
playbook quality gates1.00evidence: data.js parses + single corpus source; 6/6 tabs render, zero console errors; toggle switches; offline fallback labeled; 8/8 citation URLs fetched 200 · target: all
live surface verified1.00evidence: index 200, data.js 200, POST /api/chat returns corpus-grounded answer; honesty probe: copilot refuses to call the 10X implemented · target: page + API
term-by-term completeness0.90evidence: 6 domains + 9/9 responsibilities + 8 technical qualifications tabled with honest statuses; degree/tenure rows excluded as résumé matter · target: every technical JD row
2026-07-21Auto-deploy proven end to end: merge 3b857bf → git-sourced Vercel production deploy → rc0006 served live with no manual step (settles rc0006's pending KR)1.00sandbagged?
merge to main triggers automatic production deploy1.00evidence: Vercel API: deployment source=git sha=3b857bf READY; live curl: rc0006 FOUND · target: observed
2026-07-21Vercel git integration wired: fde-os-journey auto-deploys from main (repo FDE-os, rootDirectory=web)0.75on-track
project connected to GitHub + rootDirectory set1.00evidence: vercel git connect: Connected; API PATCH confirmed rootDirectory=web, branch main · target: link live
merge to main triggers an automatic production deploy0.50evidence: pending — graded 0.5 until the deployment for this merge appears (evidence lands next card) · target: this very PR
2026-07-21FDE-os Journey deployed to production: https://fde-os-journey.vercel.app (project fde-os-journey, scope wjlgatechs-projects)1.00sandbagged?
live prod URL serves all recorded cards to an anonymous visitor1.00evidence: curl 200 + content check: Deloitte/OpenSpace/hub-drift/Accountability all FOUND · target: 4/4 cards
2026-07-21Accountability loop bootstrapped in FDE-os: anyagent updated (doctor-verified), Journey webapp scaffolded (web/), 4 cards recorded + synced0.95sandbagged?
CLI current with source1.00evidence: anyagent doctor: 66da38551674 both sides · target: fingerprints match
Journey webapp exists for FDE-os0.90evidence: web/ (18 files) + web/data/collection.json; not yet deployed to Vercel (human gate) · target: scaffolded + data synced
2026-07-21hub-drift cron first real firing: drift detected, graphs rebuilt, bot/hub-refresh pushed; PR #41 opened manually0.70on-track
cron detects drift → rebuild → PR0.70evidence: branch + rebuild automatic; gh pr create step failed (GITHUB_TOKEN limitation) — PR #41 opened by hand · target: fully automatic
2026-07-21Deloitte take-home built head-to-head: take-home/deloitte-agentic-triage (durable graph, gated tools, hybrid RAG w/ verifiable citations, session memory, eval gate) — merged PR #401.00sandbagged?
decisions vs labeled ground truth1.00evidence: scripts/eval.py exit 0: all five metrics 1.0 · target: 12/12
repo suite grows and stays green both harness modes1.00evidence: make check 206 passed; CI green on PR #40 · target: 158→206
gap audit + 10X thesis shipped1.00evidence: docs/field-notes/2026-07-21-deloitte-take-home-gap-audit.md · target: field note
2026-07-21OpenSpace v2.0.0 trial: source-install (py3.12 venv), all 12 FDE-os skills registered, 3 tasks run with quality records (backfilled)0.87on-track
task answers vs direct-run ground truth1.00evidence: true-scorer 6/12 BLOCK, criteria-scorer 4/4, outcome-contract GO — logs/recordings/task_*/ · target: 3/3 exact
evolution engine gated before touching repo files1.00evidence: git status skills/ clean; admission rejects in .openspace/evidence.db · target: 0 mutations
headless permission model mastered0.60evidence: allow-rule grammar never matched; passing runs used workspace-local bypassPermissions · target: scoped allow rules
19 cards · data contract: reportcards/collection.json · rendered by the same grading logic as the anyagent report CLI.