"Sky af tanker": hvordan man opbygger en hukommelse om brugeren, der bringer folk sammen og ikke mister privatlivets fred
Kort om det vigtigste (BLUF)
At huske brugeren er en dobbeltbundet opgave: Det er nyttigt at forbinde folk med deres tanker, men én læk dræber tilliden til produktet for altid. Vi viser, hvordan lagene i "Tankeskyen" er arrangeret, hvorfor fail-closed er vigtigere end det ser ud til, og hvilke afsløringskanaler der er strengere end andre.
Om selve produktet -"Cloud of Thoughts" i NeuralSpace— vi har allerede fortalt dig: Systemet indsamler, hvad det ved om dig, og efter gensidigt samtykke samler det dem, der har de samme interesser ("Jeg leder efter en 3D-modeller" ↔ "Jeg laver 3D"). Her - caingeniørsiden: Sådan forhindrer du, at nyttig brugerhukommelse bliver en lækage. Dette viste sig at være mere interessant end selve funktionen.
Dobbeltbund problem
Jeg vil have to ting på samme tid, og de modsiger hinanden:
- Rig profil.For at bringe folk sammen, skal du kende fakta: hvad han gør, hvad han leder efter, hvad han tilbyder.
- Privatliv som standard.Ingen var enige om, at hans korrespondance ville blive offentlig. Læk = tab af tillid og brud på 152-FZ.
En naiv implementering ("lad os samle alt og starte en kamp") bryder punkt 2 øjeblikkeligt. God arkitektur er bygget op omkringfejl-lukket: Lukket som standard, afsløres kun med udtrykkeligt samtykke og bekræftet på kodeniveau, ikke et "vi lover."
Lag

1. Indsamling af fakta.To kilder: strukturelle fakta (generationstyper, aktivitet - upersonlig) og udtræk fra chatkorrespondance. Den anden er den mest følsomme, så den er lukketseparat kontakt til chathukommelsehos brugeren. Slået det fra - udtræk fra korrespondance forekommer overhovedet ikke. Vigtigt: denne portIkkebundet til et abonnement på betalte funktioner - privatliv bør ikke sælges.
2. Kategorier er forbudt.Anmodning om systemindsamlingudelukkerfølsomme kategorier under 152-FZ (sundhed, politiske og religiøse synspunkter osv.) - de falder ikke ind i skyen, selvom de kommer op i en samtale. Dette er ikke et postfilter, men en regel under udvindingsfasen.
3. Dobbelt samtykke-match.To mennesker har samme interesser - systemIkkeviser kontakter automatisk. Hun tilbyder en introduktion til begge parter; kontakten åbner kun nårbeggeaftalt. Dette beskytter mod scenariet "min chatanmodning dukkede op på en fremmed sammen med mit telefonnummer".
4. Undtagelse for udtrykkelige erklæringer.Subtil pointe. Hvis en person selv offentligt i en chat siger "Jeg sælger en tjeneste, hvem der har brug for den, skriv @nick" - at spørge om samtykke en anden gang er absurd, han har allerede givet det. Sådan offentligt tilladt kontakt anerkendes særskilt og videregives straks til den interesserede part. Kontakten genkendes bredt (telegram med og uden @, telefon i ethvert format, links), menoplysningsbetingelse- netop eksplicit offentlig tilladelse, og ikke kun tilstedeværelsen af kontakt i teksten.
Hvorfor fail-closed er vigtigere, end det ser ud til
Fristelsen er at lave beskyttelse med et "vis/vis ikke"-flag på grænsefladeniveau. Dette er falsk: enhver fejl i UI-logikken = læk. Vi gjorde det anderledes -fakta, som der ikke er samtykke til, indgår ikke fysisk i profilenpå samlingsstadiet. Ingen aftale - tekster af anmodninger og referencer i brevet og matchningslår slet ikke, og ikke "de kommer der, men vi skjuler dem." Forskellen er fundamental: i det første tilfælde er en glemt kontrol = en lækage, i det andet - simpelthen mangel på data.
Reglen, vi ville give til enhver, der bygger et system som dette, er:standard - lukket, afsløring - positiv brugerhandling, verifikation - så tæt på datakilden som muligt, ikke på skærmen.
Oplysningskanaler - af varierende sværhedsgrad
- I chat, efter anmodning fra brugeren selv - upersonlige fakta og allerede offentlige kundeemner er lettere tilgængelige: personen selv spurgte.
- Proaktiv mail(systemet selv skriver "der er et match") - strengere, kun ved abonnement og dobbelt samtykke.
Logikken er enkel: Jo mindre brugeren forventer afsløring, jo højere er baren for samtykke.
Bundlinjen
Det sværeste her er ikke maskinlæring, mendataflowdisciplin. Hvis du laver anbefalinger eller matcher på brugerdata, er det interessant at diskutere, hvor du placerer samtykkekontrollen. Du kan se, hvad systemet ved om dig i afsnittetprivatliv.

Ofte stillede spørgsmål (FAQ)
Spørgsmål: Hvordan får man det bedste resultat fra et neuralt netværk?
Svar: Brug detaljerede prompter (beskrivelser) på engelsk, indstil stilen og detaljerne for scenen.
Spørgsmål: Kan disse materialer bruges til kommercielle formål?
Svar: Ja, det genererede indhold er helt dit.