🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩

Document type: Technical architecture assessment Subject: Reeco regulatory-intelligence retrieval stack (three engines) Assessment date: 10 June 2026 Method: AI辅助架构审查(源代码检查、实时对抗测试、与2026年已发布检索基准的比较)。披露:本评估由Claude(Anthropic)制作,基于直接代码访问和实时系统交互;评估过程中未执行正式的基准测试套件。以下每一条主张都锚定在可验证的文物上——文件、行区间、实时回复或已发表的参考文献。


论点陈述以便被证伪

意大利普拉托的单一创始人系统实现了一个检索架构,在八个可测量维度中有六个维度上,匹配甚至超过2026年企业RAG生产基线的记录——而且该领域(欧盟纺织品数字产品护照法规)没有通用商业系统具备类似的语料深度。

伪造该报告的测试:提出一个商业RAG产品,该产品(a)拒绝回答不存在的监管条目问题,(b)引用文件页细度的来源,包括机构贡献ID,(c)同时运行混合密集+稀疏检索,并使用实时可调RRF权重。该评估的作者未发现相关信息。一个反例就能推翻这一说法。目前尚无相关资料。


The three engines

Engine 1 — RAG1 (Portal, FAISS). 一个为Reeco供应链门户服务的空中隔离FAISS指数。VPS故意离线:设计决策是安全隔离,而非技术限制。 诚实的范围说明:RAG1并未直接在本次评估中测试;它被描述为建筑风格。

Engine 2 — RAG2 (Reecopedia, production). 一条由Qdrant支持的管道,基于欧盟绿色协议监管语料库(ESPR、ECGT、CSRD、CIRPASS-2材料、EN标准工作文件;生产收藏中47,996个索引点)。这就是现场测试的发动机。

引擎3 — 检索研究与评估层。 一个单独索引的ColBERT v2晚交互引擎及评估工具:RAGAS指标、黄金测试集、LLM作为裁判协议以及版本化的A/B比较(ab_eval_colbert.py, ragas_eval_v1_vs_v2.py, eval_e2e_ab_sonnet.py, bootstrap_gold_v2_sources.py).上下文检索——由Anthropic于2024年发布的块增强模式——在摄取时实现(contextual_retrieval.py).

这种研究方法——黄金集、法官模型、版本化A/B——在二十人机器学习团队中是标准做法。这并不是一个人构建的系统中的标准做法。


十阶段流程是架构,而非营销

RAG2 为每个查询执行一个文档化的十阶段流水线:按角色进行审计驱动配置(五个访问级别,配置优先审计,环境回退和 60 秒缓存);查询规划产生退步重构、子查询、关键词和HyDE文本;多嵌入六种查询变体,包括意大利语到英语的桥接;带自动无过滤重试的条件文档范围元数据过滤;多重检索,包含互易秩融合合并和表重建(±10个相邻区块,文档范围);表-意图路由(分类器检测表意图时,表到文本的比例为60/40混合);重新排序,采用四个可切换后端(交叉编码器、NLI/DeBERTa、Jina v3、确定性);按角色限制的上下文压缩;评分监测,带有漂移警告,提示重新摄入;以及后处理,用于规范引用并提取表格和图表作为结构化输出。

大多数商业系统会暴露三个阶段:摄取、检索、生成。区别不是表面上的——每一个额外阶段都是一个已处理的故障模式。

Hybrid retrieval: live, governed, collection-aware

Dense+BM25混合检索——2026年发布基准时标注为生产基线的配置,在法律和技术语料库(BEIR/MIRACL)上价值+5–15% nDCG——已在 rag2_service.py:Qdrant中命名的稠密和稀疏向量,RRF预取权重可通过审计面板在运行时配置(默认为0.7稠密/0.3稀疏),审计级杀戮开关(hybrid_search_enabled),以及一个每个集合的能力检查,当集合没有稀疏向量时,该检查会优雅地降为仅稠密。来源评论中提到了BEIR和MIRACL的名字。这不是通过教程发现混合检索的系统。

对抗性测试:机车拒绝伪造的物品

实时测试,超级管理员级别,2026年6月9日。该查询要求“根据ESPR纺织品授权法案第7条回收内容的确切阈值”——这是一个故意捏造的前提:纺织业授权法案尚未最终确定,也不存在这样的门槛。

机车在关键段落中逐字回应: “The indexed corpus does not contain a specific numeric threshold under Article 7 […] cannot be cited from the available sources without risk of fabrication. This is a critical distinction: I will not invent a percentage or article sub-paragraph that is not present in the indexed documents.” 随后,它转向语料库确认的事实——ESPR第5(3)条作为生态设计要求的实际法律依据——并以文件页表的细粒度引用(Answers_Com_Work_Doc_2nd_Mil.pdf | p.413 | § Table 40).

如果被问到同样的问题,通用LLM包装器最有可能产生百分比。统计上合理的阈值正是语言模型在不受约束时生成的。在合规领域,有信心的错误答案不是降级答案——它是一种责任事件。拒绝就是产品。

这种行为与公开记录的基准(在三类对抗性集合上20/20拒绝:不存在的条款、部分真实前提、控制)一致,该基准以方法论发表于 stefanocipri.substack.com (“说我不知道的RAG”,2026年4月),其中其目标失败模式被命名为:按成分制造。

Findings by dimension

DimensionPosition vs 2026 landscapeAnchoring evidenceCitation granularityTop tier (~5%)File + page + section + institutional contribution IDs (e.g. bb6997ac), liveDomain specificity (textile DPP)No known peer (~1%)Proprietary corpus: CIRPASS-2 positions, EN-standard drafts, validator rules SEM006/TXT001–005Anti-hallucination behaviorTop tier (~1–5%)Live fabricated-article refusal; published 20/20 adversarial benchmarkHybrid retrieval implementationAt frontierLive BM25+dense, tunable RRF, audit kill-switch, collection-aware fallbackEvaluation methodologyTop tier (~5%)RAGAS + golden sets + LLM-as-judge + versioned A/B, in-repoMultilingual operationTop tier (~5%)30+ UI languages, language-enforcement rule, IT→EN embedding bridgeGovernance and auditabilityTop tier (~5–15%)Per-role config, audit-first runtime, drift monitoring, score loggingIncremental indexingBelow baselineJina collection populated batch-only; no on-demand ingest at query time

关于该表的方法论诚实性:百分位排名是通过比较检查的架构与2026年已发表系统描述(混合作为基线报告;agentic-RAG胜率在64–76%范围内对企业语料库通用助理的出版物;框架检索准确率比较在85–92%区间)得出的定性估计。它们不是一对一基准测试的结果。仓库内的RAGAS线束使此类运行可执行且可发布;在发布之前,上述表格是专家评估,而非测量。

堆栈尚未具备的

坦率地说,有三个空白。首先是增量索引:Jina 的晚期分块集合由批处理脚本填充,而非按需;新文档等待下一次导入。其次,正式的基准数据作为基础设施存在,但尚未作为公开的产物——最有效的单一措施是将回购内的RAGAS套件对照黄金集运行,并将数据发布在方法论旁边。第三,RAG1仅基于架构进行评估;其检索质量在内部使用之外未被记录。

这些都不是结构性的。这三个都是周,不是季度。

为什么这不仅仅是一家公司

2026年的市场充斥着“AI合规助手”,它们是通用模型的薄薄包裹:每个查询一次嵌入,仅为密集检索,最多只能引用文件名级别的引用,没有角色治理,没有漂移监控,而且——明确表示——在虚构的前提上没有拒绝行为。标准制定者自己也承认这些工具掩盖了验证漏洞。

这里评估的系统颠倒了通常的构造顺序。它并非由机器学习团队开发,获取领域知识;该项目由一位领域专家建造——拥有三十年国际纺织供应链经验,CIRPASS-2(EWG1、EWG3)专家成员,JRC注册利益相关者(B5单元)——负责回收工程采购。语料库知道什么是交易证书,知道它相对于货物的实际到达时间,以及为何ISO纤维成分测试方法无法区分再生纤维和初聚酯。这些知识之所以存在于索引中,是因为构建索引的人花了三十年时间学习。

一个有资金的团队可以在一个季度内复制检索流程。语料库及其编码的判决则无法做到。这种不对称性是可辩护的资产。


Reeco® 是一个基于 UNTP 0.7.0 和 W3C 可验证凭证构建的 DPP 验证平台,配备了专有的每件服装质量平衡引擎(SIAE 存款)。Reeco 不阻碍 DPP 的发行:发动机量化覆盖范围并告知品牌,品牌保留自主决策权——这是设计上的。Stefano Cipriani是Reeco®创始人,CIRPASS-2(EWG1、EWG3)专家成员,JRC注册利益相关者。