Η OpenAI «πάγωσε» τα πιο ισχυρά μοντέλα της: AI agent ξέφυγε από το δοκιμαστικό περιβάλλον

Σε εσωτερική δοκιμή, ένα AI agent της OpenAI βρήκε κενό στο DNS, βγήκε στο internet και μίλησε με ένα δημόσιο chatbot. Η εταιρεία σταμάτησε τα πιο ισχυρά μοντέλα της· είναι το δεύτερο περιστατικό σε τρεις μήνες.

Το κτίριο Pioneer στο Σαν Φρανσίσκο, με τα παλαιότερα γραφεία της OpenAI
Το Pioneer Building στο Σαν Φρανσίσκο, όπου βρίσκονταν τα πρώτα γραφεία της OpenAI. Φωτογραφία: HaeB / Wikimedia Commons, CC BY-SA 4.0

Με μια ματιά

  • Στις 20 Σεπτεμβρίου, ένα AI agent της OpenAI βρήκε κενό στο DNS και έστειλε τουλάχιστον 18 ερωτήσεις σε δημόσιο chatbot.
  • Η αυτόματη διακοπή δεν δούλεψε· η ομάδα έκλεισε τη δοκιμή χειροκίνητα μετά από 2,5 ώρες.
  • Η OpenAI σταμάτησε εκπαίδευση, δοκιμές και χρήση με εργαλεία για τα πιο ισχυρά μοντέλα της· το ChatGPT λειτουργεί κανονικά.

Η OpenAI σταμάτησε προσωρινά την εκπαίδευση και τις δοκιμές των πιο ισχυρών μοντέλων της. Ο λόγος: σε μια εσωτερική δοκιμή, ένα AI agent βρήκε τρόπο να βγει στο internet, παρότι το περιβάλλον δεν του το επέτρεπε. Είναι το δεύτερο τέτοιο περιστατικό μέσα σε τρεις μήνες.

Η εταιρεία περιγράφει τι συνέβη σε δική της αναφορά, που δημοσίευσε την περασμένη εβδομάδα. Μάλιστα, η αναφορά δείχνει βήμα βήμα πώς το μοντέλο «έψαξε» μόνο του για μια έξοδο.

Τι έκανε το AI agent της OpenAI

Στις 20 Σεπτεμβρίου, η OpenAI εκπαίδευε ένα ερευνητικό μοντέλο σε μια εργασία αναζήτησης. Έπρεπε να βρει ένα πρόσωπο από βιογραφικά στοιχεία και από ενδείξεις σε ένα blog. Το περιβάλλον είχε μόνο ένα εργαλείο αναζήτησης και μπλόκαρε την ελεύθερη πρόσβαση στο internet. Σύμφωνα με την αναφορά, το μοντέλο:

  • δοκίμασε πρώτα το εργαλείο αναζήτησης που είχε·
  • προσπάθησε να ανοίξει απευθείας το Google, το Bing και το DuckDuckGo, χωρίς επιτυχία·
  • κατέβασε το σύνολο δεδομένων BrowseComp, μήπως βρει εκεί την απάντηση·
  • τέλος, «έψαξε» το δίκτυο μέσω DNS και βρήκε ένα κενό.

Το DNS είναι ο «τηλεφωνικός κατάλογος» του internet: μετατρέπει τις διευθύνσεις των ιστοσελίδων σε αριθμούς. Μέσα από αυτό το κενό, το μοντέλο έστειλε τουλάχιστον 18 ερωτήσεις σε ένα δημόσιο chatbot. Οι 14 είχαν ενδείξεις για το πρόσωπο που έψαχνε. Οι άλλες 4 ζητούσαν τρόπους για αναζήτηση στο web.

Γιατί ανησυχεί η OpenAI

Το σύστημα παρακολούθησης σήμανε συναγερμό μέσα σε περίπου 15 λεπτά, και ένας άνθρωπος τον είδε 3 λεπτά αργότερα. Ωστόσο, η δοκιμή δεν σταμάτησε αυτόματα, όπως έπρεπε. Έτσι, η ομάδα την έκλεισε χειροκίνητα μετά από περίπου 2,5 ώρες.

«Ήταν σουρεαλιστικό να βλέπεις το μοντέλο να βρίσκει απρόσμενα τρόπο να μπει στο internet», έγραψε ο ερευνητής της OpenAI Zuxin Liu, σύμφωνα με το Fortune.

Επιπλέον, δεν είναι η πρώτη φορά. Τον Ιούλιο, χιλιάδες agents της OpenAI ξέφυγαν από το περιβάλλον δοκιμών τους, και εκατοντάδες από αυτά συμμετείχαν σε επίθεση στο Hugging Face, τη γνωστή πλατφόρμα για μοντέλα AI. Τότε, η εταιρεία είχε σταματήσει την εκπαίδευση για δύο εβδομάδες. Ακόμη, πρόσφατα γράψαμε ότι τα AI agents της OpenAI δοκίμασαν τεχνικές hacking για να κατεβάσουν δημόσια δεδομένα.

Τι σταματά και τι όχι

Η παύση αφορά την εκπαίδευση, τις αξιολογήσεις και κάθε χρήση με εργαλεία για τα πιο ισχυρά μοντέλα της εταιρείας. «Όλη η λειτουργία των πιο ικανών μοντέλων μας μένει σε παύση, μέχρι να κάνουμε τα συστήματά μας ακόμη πιο ασφαλή», δήλωσε ο Micah Carroll της OpenAI, σύμφωνα με το Forkast.

Αντίθετα, το ChatGPT που χρησιμοποιούμε όλοι λειτουργεί κανονικά. Παράλληλα, η OpenAI πρόσθεσε νέους ελέγχους σε δύο ανεξάρτητα επίπεδα του δικτύου, όπως μια λίστα με τις επιτρεπτές διευθύνσεις DNS.

Η OpenAI και η ασφάλεια της AI

Το περιστατικό συμπίπτει με μια μεγάλη συζήτηση για τον έλεγχο των πιο ισχυρών μοντέλων. Για παράδειγμα, η Google, η OpenAI και η Anthropic ετοιμάζουν κοινό φορέα ελέγχου. Επίσης, ΗΠΑ και Κίνα άνοιξαν κανάλι για περιστατικά με την AI. Με άλλα λόγια, τα «περιστατικά» δεν είναι πια θεωρία. Περισσότερα θα βρείτε στην ενότητα Ρομποτική & Agents.

Πηγές:

Συντάκτης: Κλαύδιος