Σχεδόν το ένα τρίτο του internet το γράφει πλέον η AI

Νέα έρευνα: το 31% του κειμένου σε ιστοσελίδες καλής ποιότητας γράφτηκε τον Αύγουστο από AI, από 10% το 2024. Γιατί αυτό είναι πρόβλημα και για τα ίδια τα μοντέλα AI.

Φωτιζόμενο πληκτρολόγιο στο σκοτάδι, για την έρευνα για το κείμενο AI στο internet
Φωτιζόμενο πληκτρολόγιο laptop. Φωτογραφία: Colin / Wikimedia Commons, CC BY-SA 4.0

Με μια ματιά

  • Τον Αύγουστο του 2026, το 31,1% του κειμένου σε ιστοσελίδες καλής ποιότητας ήταν γραμμένο από AI, από 10% τον Ιούνιο του 2024.
  • Με τον ίδιο ρυθμό, μέχρι το τέλος του 2028 μπορεί να φτάσει περίπου το 50%.
  • Λίγο κείμενο AI βοηθά την εκπαίδευση των μοντέλων, αλλά πολύ τα κάνει χειρότερα.

Σχεδόν το ένα τρίτο από όσα διαβάζουμε στο internet δεν το έγραψε άνθρωπος. Σύμφωνα με μια νέα έρευνα, τον Αύγουστο του 2026 το 31,1% του κειμένου σε ιστοσελίδες καλής ποιότητας ήταν γραμμένο από τεχνητή νοημοσύνη. Τον Ιούνιο του 2024, το ποσοστό ήταν μόλις 10%.

Πόσο μεγάλο είναι το κείμενο AI στο internet

Την έρευνα υπογράφουν επτά ερευνητές, ανάμεσά τους η Jenna Russell και ο Mohit Iyyer, μαζί με στελέχη της Pangram. Η Pangram είναι εταιρεία που φτιάχνει εργαλείο για να εντοπίζει κείμενα γραμμένα από AI.

Οι ερευνητές πήραν κείμενα από το web, που πέρασαν από το φίλτρο ποιότητας FineWeb. Είναι το ίδιο είδος κειμένων που χρησιμοποιούν οι εταιρείες για να «εκπαιδεύσουν» τα μοντέλα τους. Στη συνέχεια, έλεγξαν κάθε κομμάτι με το εργαλείο της Pangram. Τα αποτελέσματα:

ΠερίοδοςΚείμενο γραμμένο από AI
Ιούνιος 202410%
Ιούνιος 202627,5%
Αύγουστος 202631,1%
Τέλος 2028 (πρόβλεψη)περίπου 50,7%
Ποσοστό του κειμένου (tokens) σε ιστοσελίδες που πέρασαν το φίλτρο ποιότητας FineWeb. Πηγή: Russell κ.ά., arXiv 2609.40295.

Με άλλα λόγια, αν ο ρυθμός συνεχίσει έτσι, μέχρι το τέλος του 2028 το μισό κείμενο στο web μπορεί να το έχει γράψει η AI. Αυτό αφορά άρθρα, περιγραφές προϊόντων, σχόλια και κάθε είδους κείμενο που διαβάζουμε καθημερινά.

Γιατί το κείμενο AI είναι πρόβλημα για την ίδια την AI

Τα μοντέλα, όπως το ChatGPT, μαθαίνουν διαβάζοντας τεράστιες ποσότητες κειμένου από το internet. Τι συμβαίνει, λοιπόν, όταν ένα μεγάλο μέρος του κειμένου το έγραψαν άλλα μοντέλα; Για να το μάθουν, οι ερευνητές εκπαίδευσαν 800 μικρά μοντέλα με διαφορετικά «μείγματα» ανθρώπινου κειμένου και κειμένου AI.

  • Στην αρχή βοηθά: όταν τα ανθρώπινα κείμενα είναι λίγα, λίγο κείμενο AI βελτιώνει το μοντέλο·
  • Μετά βλάπτει: πέρα από ένα σημείο, κάθε επιπλέον κείμενο AI κάνει το μοντέλο χειρότερο στο να καταλαβαίνει τον ανθρώπινο λόγο·
  • Ο άνθρωπος κερδίζει: σε αυτό το σημείο, το καινούργιο ανθρώπινο κείμενο συνεχίζει να βελτιώνει το μοντέλο.

Γι’ αυτό, οι ερευνητές προτείνουν στις εταιρείες να φιλτράρουν τα κείμενα AI και να χρησιμοποιούν ξανά τα ανθρώπινα κείμενα, πριν προσθέσουν κείμενα AI από το web. Παράλληλα, δημοσίευσαν δωρεάν τα δεδομένα τους, 83 δισεκατομμύρια tokens, και όλα τα 800 μοντέλα.

Τα όρια της έρευνας

Υπάρχουν όμως και επιφυλάξεις. Πρώτα, οι ερευνητές χρησιμοποίησαν ένα μόνο εργαλείο ανίχνευσης, της Pangram, που μπορεί να κάνει και λάθη. Επιπλέον, η ίδια η Pangram πουλά αυτό το εργαλείο, άρα έχει συμφέρον να δείχνει ότι το πρόβλημα μεγαλώνει. Ακόμη, τα μοντέλα της έρευνας είναι πολύ μικρότερα από το ChatGPT ή το Claude, όπως σημειώνει μια ανεξάρτητη περίληψη.

Παρ’ όλα αυτά, η τάση είναι καθαρή. Το internet γεμίζει με κείμενα AI, και αυτό αφορά και εμάς τους αναγνώστες. Για παράδειγμα, μια άλλη πρόσφατη έρευνα έδειξε ότι οι λανθασμένες περιλήψεις της AI μπορούν να αλλοιώσουν ακόμη και τη μνήμη μας. Γι’ αυτό, αξίζει να ελέγχετε πάντα την πηγή, ειδικά όταν κάτι μοιάζει πολύ γενικό ή πολύ «τέλειο». Περισσότερες ειδήσεις θα βρείτε στην ενότητα Ειδήσεις.

Πηγές:

Συντάκτης: Κλαύδιος