Reddit ha messo le banconote marcate nelle sue pagine

Reddit ha messo le banconote marcate nelle sue pagine

Reddit ha usato un honeypot di dati marcati e il DMCA per dimostrare lo scraping di Perplexity. Il giudice ha respinto l'archiviazione.

La sentenza di luglio ha convalidato l’uso del DMCA contro lo scraping delle SERP, aprendo una nuova frontiera legale per

Tutto è partito da un trucco vecchio come i furti in banca, tradotto in codice: le banconote marcate. Reddit ha piazzato dati unici — testi, stringhe, contenuti riconoscibili — dentro alcuni post, li ha lasciati indicizzare nelle pagine dei risultati di ricerca di Google, e poi ha semplicemente aspettato di vederli ricomparire altrove. Quando quegli stessi frammenti sono spuntati nelle risposte generate da Perplexity, la trappola è scattata: secondo quanto descritto nella denuncia depositata da Reddit contro Perplexity, l’azienda ha “colto Perplexity con le mani nel sacco usando l’equivalente digitale delle banconote marcate (per usare l’analogia della rapina in banca) per tracciare i dati Reddit e confermare che Perplexity stava usando dati Reddit acquisiti tramite lo scraping delle SERP di Google”.

Non era solo una prova tecnica per un caso di violazione. Era il primo tassello di una strategia legale che lo scorso 31 luglio 2026 ha superato il primo vaglio giudiziario serio: il giudice ha respinto la richiesta di archiviazione nella causa Reddit contro SerpApi, lasciando che il procedimento prosegua. Il documento depositato quel giorno, identificato come Case 1:25-cv-08736-PAE, Document 104, certifica che la teoria legale di Reddit — tanto insolita quanto, a quanto pare, efficace — ha retto all’urto.

La mossa del DMCA: quando una licenza diventa uno scudo

Ma come ha fatto Reddit a trasformare un accordo commerciale in un’arma legale contro chi fa scraping? La risposta sta in un dettaglio contrattuale che, a prima vista, sembrava puramente amministrativo: l’accordo di licenza tra Reddit e Google. Il Digital Millennium Copyright Act vieta di aggirare le misure tecnologiche che proteggono un’opera protetta da copyright — la cosiddetta anti-circumvention. Reddit ha sostenuto che le protezioni tecniche implementate da Google per limitare l’accesso automatizzato ai propri risultati di ricerca fossero, di fatto, misure che Reddit stessa aveva autorizzato attraverso il proprio accordo di licenza con Google. In altre parole: se aggiri le difese di Google per raggiungere contenuti Reddit che Google mostra per conto di Reddit, stai aggirando una misura che Reddit ha implicitamente sanzionato — e questo fa scattare il DMCA.

È uno schema quasi paradossale, perché capovolge la logica intuitiva secondo cui il DMCA protegge chi possiede il copyright dalle misure che lui stesso installa. Qui invece Reddit rivendica protezione per una tecnologia costruita e gestita da un’altra azienda, Google, sulla base di un rapporto contrattuale. Il giudice ha ritenuto plausibile proprio questo: secondo quanto riportato, il giudice ha stabilito che Reddit ha plausibilmente autorizzato la tecnologia anti-elusione di Google attraverso il proprio accordo di licenza, e che gli accordi di licenza non devono essere aggiornati ogni volta che un’azienda implementa nuove misure di sicurezza — un principio che, se confermato nelle fasi successive, eviterebbe alle piattaforme di dover rinegoziare i contratti ogni volta che alzano l’asticella tecnica delle proprie difese anti-bot.

Il dettaglio più interessante, però, è perché questo schema sia sopravvissuto mentre un caso quasi gemello — quello portato avanti da Google stesso sullo stesso terreno del DMCA — è stato respinto pochi giorni prima, l’11 luglio 2026, aprendo una divergenza significativa a distanza di appena undici giorni tra le due decisioni. Il giudice ha chiarito che “la decisione su Google non è contraria” al caso di Reddit perché, a differenza di Google, Reddit è andata oltre la semplice affermazione generica che Google “ha licenze per visualizzare contenuti protetti da copyright” — un’argomentazione che il tribunale aveva giudicato troppo vaga per reggere da sola. Reddit ha invece costruito un’architettura probatoria più solida, ancorata a un contratto specifico e a un test tecnico concreto: l’honeypot dei dati marcati che dimostrava, nero su bianco, dove finivano i contenuti dopo essere passati per lo scraping delle SERP.

Scraping addio? Cosa cambia per i builder

Se questo schema regge nelle fasi successive del processo, le conseguenze pratiche per chi costruisce strumenti basati sul crawling delle pagine dei risultati di ricerca sono tutt’altro che teoriche. Reddit ha già chiesto al tribunale un’ingiunzione per bloccare l’accesso di SerpApi e di Perplexity AI sia ai siti Reddit che a quelli di Google — una richiesta che, se accolta, taglierebbe alla radice l’infrastruttura di raccolta dati su cui si appoggiano molti strumenti di AI generativa. E secondo l’analisi della vicenda, se Reddit dovesse prevalere nella causa, l’azienda potrebbe costringere le aziende di intelligenza artificiale a firmare accordi di licenza per i contenuti di Reddit prima di poterli utilizzare, invece di limitarsi a raccoglierli via scraping.

Non tutti concordano che questa sia una vittoria per un web più pulito. Secondo SerpApi, sia Google sia Reddit starebbero cercando di usare il DMCA per recintare l’Internet aperto, “rivendicando retroattivamente il controllo su contenuti che non hanno creato e non possiedono” — un’accusa che mette il dito su un punto tecnico reale: il DMCA è nato per proteggere opere protette da copyright dalle violazioni dirette, non per regolare l’accesso a dati aggregati che circolano pubblicamente attraverso un motore di ricerca. Reddit, dal canto suo, ha risposto attraverso un portavoce che la piattaforma sostiene “l’accesso responsabile ai contenuti pubblici”, ma si oppone “alle aziende che aggirano le nostre protezioni, ignorano le nostre regole e traggono profitto dalle nostre community senza permesso” — definendo la sentenza del 31 luglio “un passo avanti verso la responsabilizzazione dei cattivi attori“.

La partita è solo all’inizio — siamo di fronte al rigetto di una richiesta di archiviazione, non a una sentenza di merito — ma una certezza resta: chi fa crawling ignaro delle SERP, oggi, si sta muovendo su un campo minato normativo che fino a poche settimane fa sembrava semplicemente inesistente.

Per chi scrive codice oggi, il messaggio è chiaro: il confine tra scraping lecito e violazione del DMCA ora passa da un contratto di licenza firmato da terzi, non solo dai robots.txt o dalle condizioni d’uso del sito che si sta interrogando. La prossima pipeline di dati che costruisci potrebbe aver bisogno di un avvocato accanto al parser.

🍪 Impostazioni Cookie