← Все статьи

Η μάσκα δεν είναι το μοντέλο: Η αναλλοίωτη μεταβλητότητα του προθέματος ελέγχου εντοπίζει διαρροές σε Zamba2 και Nemotron-H

Η μάσκα δεν είναι το μοντέλο: Η αναλλοίωτη μεταβλητότητα του προθέματος ελέγχου εντοπίζει διαρροές σε Zamba2 και Nemotron-H

Μια κορεατική ομάδα εκκίνησης στο VIDRAFT ανακάλυψε ότι ο τυπικός έλεγχος μάσκας αιτιολογικής προσοχής στα μοντέλα υβριδικής γλώσσας δεν είναι παρά μια ψευδαίσθηση ασφάλειας: διαρροές πληροφοριών από το μέλλον περνούν μέσω σαρώσεων, κανονικοποίησης και συνάθροισης, και κανένα από τα 192 ελαττώματα που εγχύθηκαν δεν εντοπίστηκε από έναν τέτοιο έλεγχο.

Το έγγραφο για το arXiv (2608.22876) επισημοποιεί την αναλλοίωτη του προθέματος — την απαίτηση ότι η αναπαράσταση ενός διακριτικού στη θέσηtδεν πρέπει να εξαρτάται από εισόδους στη θέσηt + 1και παραπέρα. Στους καθαρούς μετασχηματιστές, οι μάσκες αιτιολογικής προσοχής το επιβάλλουν αυτό, αλλά οι σύγχρονες αρχιτεκτονικές αναμειγνύουν όλο και περισσότερο την προσοχή με μοντέλα χώρου κατάστασης (Mamba, Mamba-2), τεμαχισμένες σαρώσεις και συνελίξεις. Κάθε τέτοιος τελεστής έχει τη δική του διαδρομή εκτέλεσης και η μάσκα προσοχής δεν τον αγγίζει.

Ο προτεινόμενος έλεγχος εκτελείται σε δύο μπροστινά περάσματα χωρίς εκπαίδευση ή κλίσεις. Πάρτε δύο πανομοιότυπες εισόδους που διαφέρουν μόνο στο τελευταίο διακριτικό, εκτελέστε τις ανεξάρτητα και συγκρίνετε τις ενεργοποιήσεις επίπεδο προς επίπεδο. Εάν αλλάξουν οι αναπαραστάσεις πρώιμης θέσης, η αιτιότητα σπάει και το επίπεδο στο οποίο εμφανίζεται για πρώτη φορά είναι το ένοχο. Η μέθοδος εντοπίζει τη διαρροή σε ένα συγκεκριμένο στρώμα σε δευτερόλεπτα.

Στο πείραμα, 192 συνθετικά σφάλματα εγχύθηκαν σε οκτώ σημεία ελέγχου διαφορετικών αρχιτεκτονικών. Η κλασική επιθεώρηση μάσκας δεν εντόπισε καμία. Ο νέος έλεγχος βρήκε και τα 192 και εντόπισε το ακριβές επίπεδο. Επιπλέον, η στατική και δυναμική ανάλυση του τεμαχισμένου κώδικα σάρωσης σε μετασχηματιστές αποκάλυψε το ίδιο ελάττωμα σε Zamba2 (Zyphra) και Nemotron-H (NVIDIA) — ένα σφάλμα μεταξύ των αξόνων που διορθώθηκε μέσω της υλοποίησης αναφοράς.

Γιατί η μάσκα προσοχής δεν είναι πια αρκετή

Για πολύ καιρό το «causal mask = αιτιακό μοντέλο» ήταν αξίωμα. Στους μετασχηματιστές μόνο με αποκωδικοποιητή, η μάσκα κλείνει πραγματικά όλα τα μονοπάτια: η προσοχή είναι ο μόνος μηχανισμός ανάμειξης διακριτικών. Αλλά τα υβριδικά μοντέλα εισήγαγαν παράλληλες υπολογιστικές διαδρομές. Η επανάληψη SSM, οι συνελικτικοί πυρήνες και οι τελεστές τμηματικής σάρωσης επεξεργάζονται την ακολουθία με τους δικούς τους κανόνες. Η μάσκα προσοχής απλά δεν εφαρμόζεται εκεί — και μελλοντικές πληροφορίες μπορεί να διαρρεύσουν από οποιαδήποτε από αυτές τις διαδρομές.

Οι συγγραφείς το αποδεικνύουν αυτό στο Nemotron-H: η τεμαχισμένη σάρωση μέσα στο μπλοκ προσοχής χρησιμοποιεί λάθος άξονα για τη συσσώρευση κατάστασης στα κομμάτια. Το αποτέλεσμα — τα διακριτικά από το επόμενο κομμάτι επηρεάζουν τις αναπαραστάσεις στο τρέχον. Η μάσκα προσοχής παραμένει απόλυτα σωστή γιατί η διαρροή δεν περνάει από την προσοχή.

Πώς λειτουργεί ο έλεγχος στην πράξη

Ο αλγόριθμος είναι φθηνός και φορητός:

  1. Προετοιμάστε ένα ζεύγος εισόδων: ένα βασικό ένα και ένα με τροποποιημένο τελευταίο διακριτικό.
  2. Εκτελέστε και τα δύο μέσα από το μοντέλο σε λειτουργία συμπερασμάτων.
  3. Συγκρίνετε τις κρυφές καταστάσεις επίπεδο προς στρώμα (π.χ. απόσταση L2).
  4. Το πρώτο επίπεδο με μη μηδενική διαφορά είναι το σημείο παραβίασης αναλλοίωτης προθέματος.

Καμία λεπτομέρεια, καμία κλίση, δεν λειτουργεί σε οποιαδήποτε αρχιτεκτονική όπου είναι προσβάσιμες οι ενδιάμεσες ενεργοποιήσεις. Οι συγγραφείς παρέχουν μια υλοποίηση αναφοράς που ταιριάζει σε μία σελίδα κώδικα.

Τι σημαίνει αυτό για τους προγραμματιστές μοντέλων

Εάν εκπαιδεύετε ή χρησιμοποιείτε υβριδικές αρχιτεκτονικές (όπως Zamba, Nemotron-H, Mamba-2 με προσοχή ή οποιεσδήποτε μίξεις προσοχής + SSM + συνέλιξης) — ο έλεγχος της μάσκας προσοχής δίνει μια ψευδή αίσθηση ασφάλειας. Ο έλεγχος VIDRAFT διαρκεί μερικά δευτερόλεπτα και μπορεί να εξοικονομήσει μήνες από τον εντοπισμό σφαλμάτων περίεργων τεχνουργημάτων γενιάς που είναι στην πραγματικότητα διαρροές από το μέλλον.

Η ομάδα έχει ήδη ενσωματώσει αυτόν τον έλεγχο στο πλαίσιο AX-RAY για συνεχή διάγνωση αιτιότητας. Για όλους τους άλλους — απλώς προσθέστε δύο περάσματα προς τα εμπρός στον αγωγό CI πριν απελευθερώσετε ένα σημείο ελέγχου.

Περιορισμοί και επόμενα βήματα

Η μέθοδος εντοπίζει διαρροές, αλλά δεν ταξινομεί αυτόματα τον τύπο τους — πρέπει να εξετάσετε την αρχιτεκτονική του ενόχου επιπέδου. Απαιτεί επίσης πρόσβαση σε εσωτερικές ενεργοποιήσεις, η οποία δεν είναι διαθέσιμη σε κλειστά API (OpenAI, Anthropic). Οι συγγραφείς σχεδιάζουν να επεκτείνουν την προσέγγιση σε κβαντισμένα και αραιωμένα μοντέλα, όπου η αριθμητική αστάθεια μπορεί να μεταμφιεστεί ως αιτιώδεις διαρροές.

Χαρτί:The Mask is not the Model: Auditing Prefix Invariance in Attention, State-Space και Hybrid Sequence Models(arXiv:2608.22876, 24 Αυγούστου 2026). Υλοποίηση αναφοράς και πλαίσιο AX-RAY — στο αποθετήριο VIDRAFT.

Prefix invariance audit diagram: two identical inputs with different last token, two forward passes, layer-wise activation comparison