La ricerca su Google non è più limitata alla classica sequenza di parole digitate all’interno di una casella. Immagini, fotocamera, voce, testo, video e altri contenuti possono diventare contemporaneamente elementi di una ricerca.
È questo il principio della ricerca multimodale: permettere all’utente di esprimere ciò che sta cercando utilizzando più modalità di input e consentire ai sistemi di intelligenza artificiale di interpretarle insieme.
Nel 2026 questo approccio è diventato ancora più importante con l’evoluzione di Google Lens, Circle to Search, AI Overviews e AI Mode.
Google ha infatti progressivamente integrato i modelli Gemini nella Ricerca, permettendo di formulare domande più lunghe e complesse e di utilizzare contenuti visivi come punto di partenza della ricerca. AI Mode è disponibile anche in Italia e in italiano.
Che cos’è una ricerca multimodale
Una ricerca tradizionale potrebbe essere:
“casco motocross nero Acerbis”
La richiesta è composta esclusivamente da testo.
Con una ricerca multimodale, invece, l’utente potrebbe fotografare un casco e chiedere:
“Dove posso comprare questo modello?”
Oppure:
“Trovami questo casco in nero, taglia L, disponibile in Italia.”
In questo caso Google deve interpretare contemporaneamente:
- l’immagine;
- l’oggetto presente nell’immagine;
- il marchio, quando riconoscibile;
- colore e caratteristiche visive;
- il testo della domanda;
- l’intenzione dell’utente.
Google Lens permette già di utilizzare una fotografia, un’immagine presente sul dispositivo o persino una porzione specifica dell’immagine come base della ricerca. I risultati possono comprendere informazioni sull’oggetto, immagini simili e siti che contengono la stessa immagine o immagini correlate.
Dalla parola chiave all’oggetto
Questo cambiamento è particolarmente importante per l’e-commerce.
Nel modello classico il commerciante cerca di posizionarsi per parole chiave come:
“bobina accensione Tourmax Kawasaki KX 250”
Con la ricerca multimodale l’utente potrebbe invece fotografare direttamente la bobina smontata dalla moto.
Potrebbe quindi chiedere:
“Che ricambio è?”
e successivamente:
“Dove posso comprarlo?”
oppure:
“Trovami quello compatibile con Kawasaki KX 250 del 1998.”
Il motore deve passare dall’immagine all’identificazione dell’oggetto e successivamente collegare quell’oggetto a informazioni presenti sul web.
Diventano quindi estremamente importanti elementi come:
immagine → nome → marca → codice produttore → caratteristiche → compatibilità → prezzo → disponibilità → venditore.
Google Lens
Google Lens rappresenta uno dei principali strumenti di ricerca visuale di Google.
Da computer è possibile caricare un’immagine, trascinarla nella ricerca oppure utilizzare l’URL dell’immagine. Da smartphone è possibile fotografare direttamente un oggetto o selezionare una parte dell’immagine.
Supponiamo di avere davanti una leva frizione per motocross.
Invece di conoscere preventivamente:
- produttore;
- modello;
- codice;
- moto compatibili;
possiamo fotografarla.
Successivamente possiamo aggiungere:
“È compatibile con KTM EXC 250 2023?”
La ricerca non riguarda più soltanto il riconoscimento visivo della leva. L’immagine fornisce un contesto e la domanda testuale aggiunge un secondo livello di significato.
AI Mode e ricerca multimodale
AI Mode porta questo concetto ancora più avanti.
Google descrive AI Mode come un’esperienza capace di combinare ragionamento, multimodalità, domande successive e collegamenti al web. In Italia il servizio è stato introdotto nell’ottobre 2025.
L’utente può quindi partire da un’immagine e continuare la conversazione.
Immaginiamo questa sequenza:
Utente: fotografa un casco.
Domanda: “Che tipo di casco è?”
Poi: “Trovami qualcosa di simile per motocross.”
Poi: “Solo nero.”
Poi: “Sotto 180 euro.”
Poi: “Disponibile in Italia.”
La ricerca diventa progressivamente più specifica senza obbligare l’utente a ricominciare da zero.
Google ha spiegato che AI Mode utilizza anche una tecnica definita query fan-out: la richiesta può essere suddivisa in sottotemi e Google può eseguire più ricerche parallelamente per costruire la risposta.
Il visual search fan-out
Un’evoluzione particolarmente interessante riguarda il cosiddetto visual search fan-out.
Invece di limitarsi a riconoscere il soggetto principale di una fotografia, il sistema può analizzare differenti elementi e dettagli presenti nella scena ed effettuare più ricerche.
Google ha spiegato che questa tecnica permette ad AI Mode di riconoscere anche dettagli e oggetti secondari e di eseguire diverse query in background.
Facciamo un esempio legato al motocross.
Una fotografia potrebbe mostrare:
- moto;
- casco;
- maschera;
- stivali;
- guanti;
- paramani.
La domanda potrebbe essere:
“Che accessori monta questo pilota?”
Una ricerca visuale evoluta non deve necessariamente interpretare l’intera fotografia come un unico oggetto. Può cercare di comprendere le diverse componenti della scena.
Nel febbraio 2026 Google ha inoltre annunciato per Circle to Search la possibilità di cercare più oggetti presenti nella stessa immagine, inizialmente su dispositivi selezionati.
Circle to Search
Circle to Search elimina persino la necessità di salvare l’immagine.
Supponiamo di vedere su Instagram, YouTube o una pagina web una motocicletta con dei paramani interessanti.
È possibile selezionare visivamente l’oggetto sullo schermo e avviare la ricerca.
Il comportamento dell’utente cambia radicalmente.
Prima: vedo prodotto → cerco di capire il nome → apro Google → digito il nome.
Ora: vedo prodotto → seleziono prodotto → cerco.
Nel 2026 Google ha esteso ulteriormente questa idea permettendo, sui dispositivi supportati, di selezionare più elementi della stessa scena.
Un esempio e-commerce completo
Immaginiamo che una persona possieda una:
Kawasaki KX 250 del 1998.
Smonta una bobina di accensione e la fotografa.
Potrebbe chiedere:
“Trova questa bobina per Kawasaki KX 250 1998.”
Il sistema potrebbe cercare di riconoscere:
- tipologia del componente;
- eventuale marchio;
- eventuali scritte;
- forma;
- connettori;
- caratteristiche visive.
Contemporaneamente dispone dell’informazione testuale:
Kawasaki + KX 250 + 1998.
A questo punto diventa estremamente utile trovare sul web una pagina prodotto che dichiari chiaramente:
Prodotto: Bobina accensione
Marca: Tourmax
MPN: IGN-424
Moto: Kawasaki
Modello: KX 250
Anni: 1995-2002
Prezzo: 37 €
Disponibilità: disponibile
La fotografia aiuta a individuare il prodotto.
I dati strutturati e il contenuto della pagina aiutano a capire esattamente quale prodotto sia e se soddisfi la richiesta.
Perché le immagini dei prodotti diventano ancora più importanti
Per anni le immagini sono state considerate principalmente una componente estetica della scheda prodotto.
Con la ricerca multimodale diventano anche informazione ricercabile.
Per un e-commerce è quindi consigliabile evitare di trattare le fotografie come semplici elementi decorativi.
Una scheda dovrebbe possibilmente contenere:
- fotografia principale nitida;
- vista laterale;
- vista frontale;
- retro;
- dettagli;
- confezione;
- eventuali codici o etichette visibili;
- prodotto montato, quando utile.
Un ricambio fotografato bene offre al sistema più elementi per stabilire una corrispondenza visuale.
Nome dei file immagine
Anche il nome del file dovrebbe essere descrittivo quando possibile.
Meglio:
bobina-accensione-tourmax-ign-424-kawasaki-kx250.jpg
rispetto a:
IMG_839203.jpg
Il nome del file da solo non garantisce alcun posizionamento, ma fa parte di una strategia nella quale tutte le informazioni concordano tra loro.
Lo stesso vale per alt:
<img
src="bobina-accensione-tourmax-ign-424-kawasaki-kx250.jpg"
alt="Bobina accensione Tourmax IGN-424 per Kawasaki KX 250">
L’obiettivo non è inserire parole chiave artificialmente, ma descrivere correttamente ciò che l’immagine rappresenta.
Immagini e dati prodotto devono raccontare la stessa cosa
La situazione ideale è:
IMMAGINE
Bobina Tourmax
↓
ALT
Bobina accensione Tourmax IGN-424
↓
TITOLO
Bobina accensione Tourmax IGN-424 Kawasaki KX 250
↓
MPN
IGN-424
↓
BRAND
Tourmax
↓
COMPATIBILITÀ
Kawasaki KX 250 1995-2002
↓
OFFERTA
37 € - disponibile
Più queste informazioni sono coerenti, meno ambiguo diventa il prodotto.
Schema.org e ricerca multimodale
Per un e-commerce rimangono importanti anche i dati strutturati.
Un esempio semplificato:
{
"@context": "https://schema.org",
"@type": "Product",
"name": "Bobina accensione Tourmax IGN-424",
"sku": "1078174",
"mpn": "IGN-424",
"brand": {
"@type": "Brand",
"name": "Tourmax"
},
"image": [
"https://example.com/images/tourmax-ign-424.jpg"
],
"offers": {
"@type": "Offer",
"price": "37.00",
"priceCurrency": "EUR",
"availability": "https://schema.org/InStock"
}
}
Lo Schema non sostituisce una buona pagina prodotto e non garantisce che il prodotto venga scelto da un sistema AI.
Serve però a fornire informazioni esplicite e strutturate sull’entità presente nella pagina.
Il codice produttore diventa fondamentale
Per i ricambi tecnici, uno degli elementi più importanti è l’MPN, cioè il codice assegnato dal produttore.
Prendiamo:
Tourmax IGN-424
Un negozio può assegnargli internamente:
1078174
un altro:
BOB-2948
un altro ancora:
TMAX00123.
Sono SKU differenti.
Ma:
IGN-424
rimane il riferimento del produttore.
Per questo, quando disponibile, è utile dichiarare separatamente:
"sku": "1078174",
"mpn": "IGN-424"
Questo rende più semplice distinguere il codice interno del negozio dall’identificatore del prodotto.
Compatibilità: il vero vantaggio dei ricambisti specializzati
Per un negozio di ricambi non basta descrivere bene il prodotto.
Bisogna descrivere bene a cosa serve.
Per esempio:
Tourmax IGN-424
Compatibile con:
Kawasaki KX 250
1995
1996
1997
1998
1999
2000
2001
2002
Un utente difficilmente vuole semplicemente:
“una bobina”.
Vuole:
“la bobina corretta per la mia KX 250 del 1998.”
Questa differenza è enorme.
La ricerca multimodale rende ancora più interessante la combinazione tra riconoscimento dell’oggetto e database di compatibilità.
Ricerca multimodale e Shopping
La ricerca visuale sta diventando particolarmente importante anche nello shopping.
Google ha descritto AI Mode come capace di mostrare risultati visuali acquistabili partendo anche da descrizioni conversazionali. Il sistema combina comprensione visiva, linguaggio e Shopping Graph per individuare prodotti pertinenti.
Questo significa che una ricerca potrebbe essere:
“Voglio un casco simile a questo, ma nero, sotto i 150 euro.”
Non abbiamo più necessariamente:
casco + marca + modello + nero + prezzo
come sequenza rigida di keyword.
Abbiamo un’intenzione espressa attraverso immagine e linguaggio naturale.
Dal SEO tradizionale all’ottimizzazione delle entità
Questo non significa che la SEO tradizionale sia morta.
Titoli, contenuti, link interni, performance, indicizzazione, canonical e struttura tecnica continuano ad avere importanza.
Ma bisogna iniziare a ragionare anche in termini di entità.
Una pagina dovrebbe rendere evidente:
COS'È?
Bobina accensione
CHI LA PRODUCE?
Tourmax
QUALE?
IGN-424
PER COSA?
Kawasaki KX 250
QUALI ANNI?
1995-2002
QUANTO COSTA?
37 €
È DISPONIBILE?
Sì
COME APPARE?
Immagini prodotto
DOVE POSSO COMPRARLA?
URL canonico della scheda prodotto
Questo approccio è utile sia alla ricerca classica sia ai sistemi basati sull’AI.
Un secondo esempio: cercare senza conoscere il nome
Immaginiamo un motociclista che non sappia che un componente si chiama registro frizione.
Con la ricerca tradizionale ha un problema: non conosce la parola da cercare.
Potrebbe provare:
“coso per regolare filo frizione moto”
Con la ricerca visuale può invece fotografarlo.
Poi chiedere:
“Cos’è questo pezzo?”
e successivamente:
“Trovamelo per la mia moto.”
Questo è uno dei vantaggi fondamentali della multimodalità: riduce la necessità che l’utente conosca preventivamente il nome esatto dell’oggetto.
Un terzo esempio: ricerca per dettaglio
Supponiamo di avere una fotografia completa di una motocicletta.
L’utente è interessato soltanto ai paramani.
Google Lens permette di restringere la selezione a una parte dell’immagine; Google suggerisce esplicitamente di selezionare un’area più piccola per ottenere risultati più specifici.
Possiamo quindi passare da:
moto
a:
paramani presenti sulla moto
e successivamente aggiungere:
“Trovami questi in rosso.”
Questa combinazione di selezione visuale e linguaggio naturale rappresenta molto bene il concetto di ricerca multimodale.
Nel 2026 la ricerca va oltre immagini + testo
La direzione indicata da Google va ormai oltre la semplice combinazione fotografia/testo.
Nel maggio 2026 Google ha presentato una nuova esperienza di ricerca capace di utilizzare come input testo, immagini, file, video e schede di Chrome.
Google aveva inoltre già mostrato Search Live, che consente di interagire con la Ricerca attraverso la fotocamera e una conversazione in tempo reale.
Il concetto di “query” sta quindi diventando molto più ampio.
Non è più necessariamente:
una stringa di testo.
Può diventare:
immagine + voce + contesto + domanda + successive precisazioni.
Come preparare un e-commerce alla ricerca multimodale
Un negozio online dovrebbe lavorare contemporaneamente su quattro livelli.
1. Informazioni prodotto
Ogni prodotto dovrebbe avere, quando disponibili:
- nome preciso;
- marca;
- SKU;
- MPN;
- GTIN/EAN;
- categoria;
- descrizione;
- caratteristiche;
- varianti;
- compatibilità;
- prezzo;
- valuta;
- disponibilità.
2. Immagini
Le immagini dovrebbero essere:
- reali;
- nitide;
- sufficientemente grandi;
- pertinenti;
- accessibili ai crawler;
- accompagnate da
alt descrittivi;
- possibilmente disponibili in più viste.
3. Dati strutturati
È utile implementare correttamente:
Product;
ProductGroup quando esistono varianti;
Offer;
Brand;
AggregateRating solo quando esistono realmente recensioni valide;
- proprietà aggiuntive pertinenti.
4. Architettura tecnica
Bisogna inoltre verificare:
- URL canoniche;
- sitemap;
- indicizzazione;
- robots.txt;
- performance;
- accessibilità delle immagini;
- link interni;
- eventuali CDN/firewall che potrebbero impedire ai crawler di accedere alle risorse.
API e feed pubblici: possono aiutare?
Un catalogo pubblico strutturato può essere utile come ulteriore rappresentazione dei dati, soprattutto quando consente di collegare chiaramente:
SKU
MPN
brand
nome
descrizione
prezzo
disponibilità
immagini
varianti
compatibilità
URL canonica
Non bisogna però considerarlo una scorciatoia garantita per entrare nelle risposte AI.
Un endpoint JSON pubblico non implica automaticamente che Google o qualsiasi altra AI lo utilizzerà.
La priorità rimane rendere le pagine web pubbliche, le immagini e i dati strutturati facilmente accessibili e comprensibili.
Un feed può essere un livello aggiuntivo, non il sostituto della pagina prodotto.
Esempio di catalogo machine-readable
Una rappresentazione pubblica potrebbe essere:
{
"sku": "1078174",
"mpn": "IGN-424",
"brand": "Tourmax",
"name": "Bobina accensione Tourmax IGN-424",
"description": "Bobina di accensione per applicazioni Kawasaki...",
"price": 37.00,
"currency": "EUR",
"availability": "in_stock",
"product_url": "https://example.com/prodotto/tourmax-ign-424",
"images": [
{
"url": "https://example.com/images/tourmax-ign-424.jpg",
"primary": true,
"alt": "Bobina accensione Tourmax IGN-424"
}
],
"vehicle_compatibility": [
{
"make": "Kawasaki",
"model": "KX 250",
"year_from": 1995,
"year_to": 2002
}
]
}
Questa struttura non è uno standard universale imposto da Google, ma mostra bene il principio: rendere esplicite le relazioni tra prodotto, identificatori, immagini, prezzo e compatibilità.
La ricerca multimodale cambierà le keyword?
Non spariranno.
Cambierà però il loro ruolo.
Una persona può iniziare da:
fotografia di un componente
e aggiungere: “per KTM EXC 250”
poi: “2023”
poi: “disponibile subito”
poi: “meno di 100 euro”.
La query finale non è una singola keyword.
È il risultato dell’interazione tra immagine, prodotto riconosciuto, moto, anno, disponibilità e prezzo.
Per chi gestisce un e-commerce, questo significa che ottimizzare soltanto una pagina per una frase specifica sarà sempre meno sufficiente.
Bisogna costruire una scheda prodotto semanticamente completa.
Il futuro della ricerca è contestuale
Per oltre vent’anni abbiamo imparato a tradurre le nostre necessità nel linguaggio del motore di ricerca.
Volevamo un ricambio? Dovevamo conoscere il nome.
Volevamo un prodotto visto per strada? Dovevamo descriverlo.
Volevamo identificare un componente? Dovevamo trovare le parole corrette.
La ricerca multimodale ribalta progressivamente questo rapporto.
Possiamo mostrare ciò che vediamo e spiegare ciò che vogliamo.
Google può quindi combinare comprensione visuale, linguaggio naturale, informazioni presenti sul web e sistemi di intelligenza artificiale.
Per siti editoriali ed e-commerce questo significa che SEO, immagini, dati strutturati e qualità delle informazioni non possono più essere considerate discipline completamente separate.
Una fotografia ben realizzata, un MPN corretto, una compatibilità precisa, una descrizione utile e una pagina tecnicamente accessibile contribuiscono tutti a descrivere la stessa entità.
Ed è probabilmente questa la trasformazione più importante della ricerca multimodale:
non ottimizziamo più soltanto una pagina affinché corrisponda a una parola chiave; dobbiamo descrivere un prodotto, un oggetto o un argomento in modo sufficientemente completo perché un motore possa comprenderlo anche quando l’utente non conosce le parole esatte con cui cercarlo.