Tech
Réduction des coûts de tokens RAG via l'optimisation du web scraping
- Le traitement brut du HTML dans un pipeline RAG augmente les coûts de tokens LLM.
- Un article ou une page produit peut dépasser 2 Mo de données brutes.
- L'utilisation de tiktoken (OpenAI) génère environ 30 000 tokens par page.