Deduplikace na úrovni dokumentů
Odstranění redundantních informací je klíčové pro snížení výpočetních nákladů. Opakující se texty v tréninkové sadě způsobují, že model přikládá určitým vzorcům nepřiměřenou váhu, což vede k overfittingu. Naše analýza ukazuje, že odstranění 30 % duplicit může zvýšit efektivitu o 15 %.