← Все статьи

„Chmura myśli”: jak zbudować pamięć użytkownika, która łączy ludzi i nie traci prywatności

„Chmura myśli”: jak zbudować pamięć użytkownika, która łączy ludzi i nie traci prywatności

Krótko o najważniejszym (BLUF)

Zapamiętywanie użytkownika to zadanie o podwójnym dnie: łączenie ludzi z ich przemyśleniami jest przydatne, ale jeden wyciek na zawsze zabija zaufanie do produktu. Pokazujemy, jak ułożone są warstwy „Chmury Myśli”, dlaczego zamknięcie awaryjne jest ważniejsze niż się wydaje i które kanały ujawniania są bardziej rygorystyczne niż inne.

O samym produkcie - „Chmura myśli” w NeuralSpace — już Ci mówiliśmy: system zbiera to, co o Tobie wie i za obopólną zgodą zrzesza tych, którzy mają takie same zainteresowania („Poszukuję modelarza 3D” ↔ „Robię 3D”). Tutaj - o strona inżynierska: Jak zapobiec wyciekowi użytecznej pamięci użytkownika. Okazało się to ciekawsze niż sama funkcja.

Problem z podwójnym dnem

Chcę dwóch rzeczy jednocześnie, a one są ze sobą sprzeczne:

  1. Bogaty profil. Aby ludzi łączyć, trzeba znać fakty: czym się zajmuje, czego szuka, co oferuje.
  2. Domyślnie prywatność. Nikt nie zgodził się, aby jego korespondencja została upubliczniona. Wyciek = utrata zaufania i naruszenie 152-FZ.

Naiwna implementacja („zbierzmy wszystko i rozpocznijmy mecz”) natychmiast psuje punkt 2. Wokół buduje się dobrą architekturę zamknięte: Domyślnie zamknięte, ujawniane wyłącznie za wyraźną zgodą i weryfikowane na poziomie kodu, a nie „obiecujemy”.

Warstwy

Fail-closed: fakty bez zgody nie są fizycznie uwzględniane w profilu, a nie „wprowadzane i ukrywane”
Fail-closed: fakty bez zgody nie są fizycznie uwzględniane w profilu, a nie „wprowadzane i ukrywane”

1. Gromadzenie faktów. Dwa źródła: fakty strukturalne (rodzaje generacji, działalność - bezosobowe) i ekstrakcja z korespondencji na czacie. Drugi jest najbardziej czuły, więc jest bramkowany oddzielny przełącznik pamięci czatu u użytkownika. Wyłączyłem - wyodrębnianie z korespondencji w ogóle nie następuje. Ważne: ta brama Nie powiązany z subskrypcją płatnych funkcji – prywatności nie należy sprzedawać.

2. Kategorie są zabronione. Żądanie pobrania systemu wyklucza kategorie wrażliwe poniżej 152-FZ (poglądy zdrowotne, polityczne, religijne itp.) – nie wpadają w chmurę, nawet jeśli pojawiają się w rozmowie. To nie jest filtr końcowy, ale zasada obowiązująca na etapie ekstrakcji.

3. Dopasowanie podwójnej zgody. Dwie osoby mają te same zainteresowania – system Nie automatycznie pokazuje kontakty. Przedstawia obie strony; styk otwiera się tylko wtedy, gdy Zarówno Zgoda. Chroni to przed scenariuszem „moja prośba o czat pojawiła się u nieznajomego wraz z moim numerem telefonu”.

4. Wyjątek dla wyraźnych deklaracji. Subtelny punkt. Jeśli ktoś sam publicznie na czacie powie „sprzedaję usługę, kto potrzebuje, niech napisze @nick” – proszenie o zgodę po raz drugi jest absurdem, już ją wyraził. Taki publicznie dozwolony kontakt jest rozpoznawany odrębnie i natychmiast ujawniany zainteresowanej stronie. Kontakt jest powszechnie rozpoznawany (telegram z @ i bez, telefon w dowolnym formacie, linki), ale warunek ujawnienia - dokładnie wyraźne pozwolenie publiczne, a nie tylko obecność kontaktu w tekście.

Dlaczego zamknięcie awaryjne jest ważniejsze, niż się wydaje

Istnieje pokusa zapewnienia ochrony za pomocą flagi „pokaż/nie pokazuj” na poziomie interfejsu. To nieprawda: każdy błąd w logice interfejsu użytkownika = wyciek. Zrobiliśmy to inaczej - fakty, na które nie ma zgody, nie są fizycznie zawarte w profilu na etapie jego montażu. Brak umowy - teksty żądań i referencji w piśmie oraz dopasowanie nie uderzaj wcale, a nie „docierają tam, ale my je ukrywamy”. Różnica jest zasadnicza: w pierwszym przypadku zapomniany czek = wyciek, w drugim – po prostu brak danych.

Zasada, którą dalibyśmy każdemu, kto buduje taki system, brzmi: domyślnie - zamknięte, ujawnienie - pozytywne działanie użytkownika, weryfikacja - jak najbliżej źródła danych, a nie ekranu.

Kanały ujawnienia – o różnym nasileniu

  • Na czacie, na prośbę samego użytkownika - bezosobowe fakty i już publiczne tropy są łatwiej dostępne: sama osoba zadała pytanie.
  • Poczta proaktywna (sam system pisze „jest dopasowanie”) - bardziej rygorystyczne, tylko w ramach subskrypcji i podwójnej zgody.

Logika jest prosta: im mniej użytkownik oczekuje ujawnienia, tym wyższa poprzeczka dla zgody.

Konkluzja

Najtrudniejszą rzeczą tutaj nie jest uczenie maszynowe, ale dyscyplina przepływu danych. Jeśli wydajesz rekomendacje lub dopasowujesz dane użytkownika, warto omówić, gdzie umieszczasz kontrolę zgody. W sekcji możesz zobaczyć, co system wie o Tobie prywatność.

Fail-closed: fakty bez zgody nigdy nie trafiają do profilu, zamiast wchodzić i być ukrywane
Fail-closed: fakty bez zgody nigdy nie trafiają do profilu, zamiast wchodzić i być ukrywane

Często zadawane pytania (FAQ)

Pytanie: Jak uzyskać najlepszy wynik z sieci neuronowej?
Odpowiedź: Używaj szczegółowych podpowiedzi (opisów) w języku angielskim, ustalaj styl i szczegóły sceny.

Pytanie: Czy te materiały można wykorzystać do celów komercyjnych?
Odpowiedź: Tak, wygenerowana treść jest całkowicie Twoja.