El problema
Un sistema RAG es tan bueno como el texto que le das. El HTML sin procesar arrastra navegación, anuncios y marcado que inflan el número de tokens y contaminan los embeddings, y cada sitio de documentación está maquetado de forma distinta, así que ningún parser único sirve para todos.