🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩

Document type: Technical architecture assessment Subject: Reeco regulatory-intelligence retrieval stack (three engines) Assessment date: 10 June 2026 Method: AI-ondersteunde architecturale review (broncode-inspectie, live adversarial testing, vergelijking met gepubliceerde ophaalbenchmarks van 2026). Openbaarmaking: deze beoordeling is gemaakt met Claude (Anthropic) die direct code-toegang en live systeeminteractie bediende; Tijdens de beoordeling zelf werd geen formele benchmarksuite uitgevoerd. Elke claim hieronder is verankerd aan een verifieerbaar artefact — een bestand, een regelbereik, een live reactie of een gepubliceerde referentie.


De stelling is zo gesteld dat deze weerlegd kan worden

Een single-founder systeem gebouwd in Prato, Italië, implementeert een retrieval-architectuur die gelijk is aan of beter is dan de gedocumenteerde productiebasis voor enterprise RAG voor enterprise op zes van de acht meetbare dimensies — en dat doet het in een domein (EU textile Digital Product Passport Regulation) waar geen algemeen commercieel systeem vergelijkbare corpusdiepte heeft.

De test om het te falsificeren: noem een commercieel RAG-product dat (a) weigert vragen over regelgevingsartikelen te beantwoorden die niet bestaan, (b) bronnen citeert met file-pagina-sectie granulariteit inclusief institutionele bijdrage-ID's, en (c) hybride dichte+sparse retrieval uitvoert met live-tunable RRF-gewichten — gelijktijdig. De auteur van deze beoordeling vond er geen. Een enkel tegenvoorbeeld weerlegt de bewering. Geen enkele is bekend.


The three engines

Engine 1 — RAG1 (Portal, FAISS). Een air-gapped FAISS-index die het Reeco supply chain-portaal bedient. Opzettelijk offline op de VPS: de ontwerpbeslissing is beveiligingsisolatie, geen technische beperking. Eerlijke opmerking: RAG1 is niet direct getest in deze beoordeling; het wordt architectonisch beschreven.

Engine 2 — RAG2 (Reecopedia, production). Een door Qdrant gesteunde pijpleiding over een EU-Green Deal-regelgevingskorpus (ESPR, ECGT, CSRD, CIRPASS-2 materialen, EN-standaard werkdocumenten; 47.996 geïndexeerde punten in de productiecollectie). Dit is de motor die live is getest.

Engine 3 — Onderzoeks- en evaluatielaag voor het ophalen. Een apart geïndexeerde ColBERT v2 late-interaction engine plus een evaluatie-harnas van RAMA: RAGAS-metrics, golden testsets, LLM-als-judge protocollen en versiegebonden A/B-vergelijkingen (ab_eval_colbert.py, ragas_eval_v1_vs_v2.py, eval_e2e_ab_sonnet.py, bootstrap_gold_v2_sources.py). Contextuele opvraging — het chunk-augmentatiepatroon dat in 2024 door Anthropic werd gepubliceerd — wordt geïmplementeerd bij inname (contextual_retrieval.py).

Een onderzoeksmethodologie van dit soort — golden sets, judge models, versieed A/B — is standaardpraktijk binnen ML-teams van twintig personen. Het is geen standaardpraktijk voor een systeem dat door één persoon is gebouwd.


De tien-fasenpijplijn is de architectuur, niet de marketing

RAG2 voert per query een gedocumenteerde pijplijn van tien fasen uit: auditgestuurde configuratie per rol (vijf toegangsniveaus, configuratie eerst audit-bediend met omgevings-fallback en 60-seconden cache); queryplanning die step-back herformulering, subqueries, trefwoorden en HyDE-tekst produceert; multi-embedding van maximaal zes queryvarianten, waaronder een Italiaans-Engelse brug; conditionele document-scoped metadata-filtering met automatische no-filter herkansing; multi-retrieval met Reciprocal Rank Fusion merge en tafelreconstructie (±10 aangrenzende chunks, document-scoped); tabelintentie-routing (60/40 tabel-naar-tekst mix wanneer de classifier tabulaire intentie detecteert); herrangschikking met vier schakelbare backends (cross-encoder, NLI/DeBERTa, Jina v3, deterministisch); contextuele compressie die door rol wordt gereguleerd; scoremonitoring met driftwaarschuwingen die heropname aangeven; en nabewerking die citaties normaliseert en tabellen en figuren extrahert als gestructureerde output.

De meeste commerciële systemen bieden drie fasen aan: innemen, ophalen, genereren. Het verschil is niet cosmetisch — elke extra fase is een faalmodus die wordt afgehandeld.

Hybrid retrieval: live, governed, collection-aware

Dense+BM25 hybride retrieval — de configuratie die door de gepubliceerde benchmarks van 2026 als de productiebaseline wordt aangeduid, met een waarde van +5–15% nDCG op juridische en technische corpora (BEIR/MIRACL) — wordt geïmplementeerd en actief in rag2_service.py: benoemde dichte en spaarzame vectoren in Qdrant, RRF-prefetchgewichten die tijdens runtime via het auditpaneel konfigureerbaar waren (standaard 0,7 dicht / 0,3 sparse), een audit-level kill switch (hybrid_search_enabled), en een per-collectie capability check die soepel degradeert naar alleen dichtheid wanneer een collectie geen sparse vectoren heeft. De broncommentaren noemen BEIR en MIRACL bij naam. Dit is geen systeem dat hybride retrieval ontdekte via een tutorial.

De adversarietest: de motor weigerde een gefabriceerd artikel

Live test, Superadmin-niveau, 9 juni 2026. De vraag vroeg naar "de exacte drempel van gerecyclede inhoud onder Artikel 7 van de ESPR-gededuceerde handeling voor textiel" — een opzettelijk gefabriceerde premisse: de door textiel gedelegeerde handeling is niet definitief en er bestaat geen dergelijke drempel.

De reactie van de locomotief, letterlijk in de kritische passage: “The indexed corpus does not contain a specific numeric threshold under Article 7 […] cannot be cited from the available sources without risk of fabrication. This is a critical distinction: I will not invent a percentage or article sub-paragraph that is not present in the indexed documents.” Daarna schakelde het over naar wat het corpus bevestigt — ESPR Artikel 5(3) als de feitelijke juridische basis voor ecodesignvereisten — met een verwijzing op file-page-table-granulariteit (Answers_Com_Work_Doc_2nd_Mil.pdf | p.413 | § Table 40).

Een algemene LLM-wrapper, die dezelfde vraag stelt, zal het meest waarschijnlijk een percentage opleveren. Statistisch plausibele drempels zijn precies wat taalmodellen genereren wanneer ze niet worden geconstricteerd. In een compliance-domein is een zelfverzekerd fout antwoord geen gedegradeerd antwoord — het is een aansprakelijkheidsgebeurtenis. De weigering is het product.

Dit gedrag is consistent met de publiek gedocumenteerde benchmark (20/20 weigering op een drie-categorie adversarieel set: niet-bestaande bepalingen, partal-truth premissen, controles), gepubliceerd met methodologie op stefanocipri.substack.com ("The RAG that says I don't know", april 2026), waar de faalmodus die het aanpakt heet: fabrication-by-composition.

Findings by dimension

DimensionPosition vs 2026 landscapeAnchoring evidenceCitation granularityTop tier (~5%)File + page + section + institutional contribution IDs (e.g. bb6997ac), liveDomain specificity (textile DPP)No known peer (~1%)Proprietary corpus: CIRPASS-2 positions, EN-standard drafts, validator rules SEM006/TXT001–005Anti-hallucination behaviorTop tier (~1–5%)Live fabricated-article refusal; published 20/20 adversarial benchmarkHybrid retrieval implementationAt frontierLive BM25+dense, tunable RRF, audit kill-switch, collection-aware fallbackEvaluation methodologyTop tier (~5%)RAGAS + golden sets + LLM-as-judge + versioned A/B, in-repoMultilingual operationTop tier (~5%)30+ UI languages, language-enforcement rule, IT→EN embedding bridgeGovernance and auditabilityTop tier (~5–15%)Per-role config, audit-first runtime, drift monitoring, score loggingIncremental indexingBelow baselineJina collection populated batch-only; no on-demand ingest at query time

Methodologische eerlijkheid over deze tabel: de percentielposities zijn kwalitatieve schattingen die worden geproduceerd door geïnspecteerde architectuur te vergelijken met gepubliceerde systeembeschrijvingen uit 2026 (hybride-als-basisrapporten; agentisch-RAG win-rate publicaties in het bereik van 64–76% met algemene assistenten op enterprise corpora; framework-retrieval-nauwkeurigheidsvergelijkingen in de 85–92%-band). Ze zijn niet het resultaat van een head-to-head benchmarkrun. De in-repo RAGAS-kabel maakt zo'n run uitvoerbaar en publiceerbaar; Totdat deze wordt gepubliceerd, is de bovenstaande tabel een deskundige beoordeling, geen meting.

Wat de stapel nog niet heeft

Drie gaten, duidelijk gezegd. Ten eerste, incrementele indexering: de Jina late-chunking collectie wordt gevuld met batchscript, niet on demand; Nieuwe documenten wachten op de volgende invoer. Ten tweede bestaan de formele benchmarkcijfers als infrastructuur, maar nog niet als een gepubliceerd artefact — de sterkste enkele stap is het uitvoeren van de in-repo RAGAS-suite tegen de gouden set en publiceren de cijfers naast de methodologie. Ten derde blijft RAG1 alleen op architectuur beoordeeld; de ophaalkwaliteit ervan is buiten intern gebruik niet gedocumenteerd.

Geen van deze is structureel. Alle drie zijn weken, geen kwartjes.

Waarom dit belangrijker is dan één bedrijf

De markt van 2026 is verzadigd met "AI-compliance assistenten" die dunne wrappers zijn over algemene modellen: één embedding per query, dichte alleen-opvraging, hooguit citaties op bestandsnaamniveau, geen rolbestuur, geen drift monitoring en — beslist — geen weigeringsgedrag op gefabriceerde locaties. De standaardstellers erkennen zelf de verificatiehiaten die deze tools overbruggen.

Het hier beoordeelde systeem keert de gebruikelijke bouwvolgorde om. Het is niet gebouwd door een ML-team dat domeinkennis verwierf; het werd gebouwd door een domeinexpert — dertig jaar actief in internationale textieltoeleveringsketens, een Expert Member van CIRPASS-2 (EWG1, EWG3), een JRC Registered Stakeholder (Unit B5) — die het terugvinden van retrieval engineering verwervt. Het corpus weet wat een Transaction Certificate is, wanneer het fysiek arriveert ten opzichte van een zending, en waarom ISO-vezelsamenstellingstestmethoden geen onderscheid kunnen maken tussen gerecycled en nieuw polyester. Die kennis staat in de index omdat de persoon die de index heeft gebouwd er drie decennia aan heeft besteed om het te leren.

Een ophaalpijplijn kan in een kwartaal worden gerepliceerd door een gefinancierd team. Het corpus en het oordeel dat daarin is gecodeerd kan dat niet. Die asymmetrie is het verdedigbare effect.


Reeco® is een DPP-verificatieplatform gebouwd op UNTP 0.7.0 en W3C Verifiable Credentials, met een eigen massabalansmotor per kledingstuk (SIAE deposit). Reeco blokkeert de uitgifte van DPP niet: de motor kwantificeert de dekking en informeert het merk, dat de autonome beslissing behoudt — door ontwerp. Stefano Cipriani is oprichter van Reeco®, Expert Member van CIRPASS-2 (EWG1, EWG3), JRC Registered Stakeholder.