- Google Gemini és la família de models d'IA multimodal de Google, successora de PaLM i base de la seva estratègia d'intel·ligència artificial a tots els seus productes.
- Ofereix diverses versions (Ultra, Pro, 1.5 Flash i Nano) amb enormes finestres de context, capacitats avançades de raonament i desplegament tant al núvol com en dispositius mòbils.
- Gemini s'integra a l'app pròpia, a la Cerca, a Workspace ia Google Cloud, permetent crear assistents, generar contingut, analitzar documents i desenvolupar agents personalitzats.
- Els plans Google AI Pro i Ultra donen accés ampliat als models més potents, a Deep Research ia funcions com a generació de vídeo, orientades a usuaris avançats i empreses.

Google Gemini s'ha convertit en el gran salt de Google en intel·ligència artificial , una família de models que vol ser a tot arreu: al mòbil, al cercador, a les apps de productivitat, al núvol ia les eines per a desenvolupadors. No és només “un altre chatbot”, sinó una plataforma completa pensada per crear assistents, generar contingut, raonar sobre informació complexa i fins i tot interpretar vídeo, àudio i imatges alhora.
En els darrers mesos, hem vist com Gemini s'integrava a l'app específica de Google, a Workspace, a la Cerca amb AI Overviews i en productes per a programadors i empreses . Alhora, Google ha anat llançant noves versions (1.0, 1.5, 2, 2.5 i ara 3), models especialitzats com Flash o Nano, i plans de pagament amb funcions avançades com Deep Research, generació de vídeo o contextos gegantins de fins a 2 milions de tokens.
Què és Google Gemini i per què és tan important

Google Gemini és la família de models d'intel·ligència artificial generativa més avançada de Google , dissenyada per competir a l'elit dels LLM (models de llenguatge) i, sobretot, per servir com a base de tota la seva estratègia d'IA. És el successor directe de PaLM, el model que impulsava Bard, i ara és la tecnologia que hi ha darrere del chatbot Gemini, de la pròpia app de Gemini i de moltes experiències intel·ligents dins de l'ecosistema Google.
A diferència de generacions anteriors, Gemini va néixer des del primer dia com un model multimodal . Això vol dir que no només processa text, sinó també imatges, àudio, vídeo i codi, relacionant tots aquests formats de forma nativa. No es tracta d'un model de text al qual després s'enganxen mòduls de visió o d'àudio: el seu entrenament ja integra tot això des de la base.
Google ha mostrat que Gemini pot superar altres models capdavanters en molts benchmarks d'IA , especialment en tasques de comprensió de llenguatge natural, resolució de problemes complexos, generació de codi i anàlisi multimodal. Versions com Gemini Ultra han arribat a rendir millor que equips d'especialistes humans en proves com ara MMLU, que avaluen coneixement general i raonament.
L'objectiu estratègic de la companyia és clar: unificar sota la marca Gemini tant els models d'IA com les experiències d'usuari . Bard ha quedat enrere com a nom comercial i, a partir d'ara, quan parlem de la IA de Google parlem directament de Gemini, tant si ens referim a la tecnologia interna com a l'assistent que fem servir al mòbil oa la web.
De Bard a Gemini: canvi de nom, canvi denfocament

Durant un temps, Bard va ser la cara visible de la IA conversacional de Google , però en realitat era només la capa d'interfície sobre els models PaLM. Amb el llançament de Gemini, Google ha decidit simplificar el missatge i deixar de separar marca de xatbot i marca de model.
El moviment consisteix que la mateixa paraula “Gemini” s'usi per a tot : per als models de llenguatge que s'entrenen als seus centres de dades, per a les APIs que usen els desenvolupadors i per a l'app que qualsevol usuari obre al mòbil. Aquesta unificació fa que la proposta sigui més clara i reforça la idea duna única plataforma dIA, en lloc de productes dispersos.
A més del canvi de nom, la transició de Bard a Gemini porta millores tècniques de fons . Bard es va anar migrant progressivament des de PaLM a Gemini Pro, i després es va llançar Gemini Advanced (avui integrat a Google AI Pro/Ultra), que dóna accés als models més potents per a tasques complexes, projectes llargs i un nivell de raonament molt superior.
Aquesta evolució també ha permès que les noves capacitats multimodals s'integrin de manera més natural . On Bard estava més centrat en text i només tenia funcions visuals limitades, Gemini està preparat per entendre documents extensos, imatges detallades, àudio, vídeos llargs i fins i tot combinacions de tot això en una mateixa conversa.
Versions de Google Gemini: Ultra, Pro, Flash i Nano
La família Gemini es divideix en diversos models pensats per a diferents usos i nivells de potència . No tothom està orientat a l'usuari final; molts són peces que es fan servir a través de l'app, de l'API o de serveis com Google AI Studio o Vertex AI.
Gemini Ultra és la versió més potent de la primera generació (Gemini 1.0 Ultra) i ha estat el gran vaixell insígnia a benchmarks. Està dissenyada per a tasques especialment exigents: raonament profund, problemes matemàtics avançats, programació complexa o anàlisi de grans volums dinformació. En proves com GSM8K (matemàtiques), HumanEval (codi) i MMLU (comprensió de llenguatge), Gemini Ultra ha superat models com GPT-4, Claude 2 o Flama 2 en força indicadors , arribant fins i tot a batre experts humans en MMLU.
Gemini Pro és l'opció intermèdia i el model que s'ha fet servir de base per al chatbot accessible al gran públic. Està disponible a versions 1.0 i 1.5 a través de l'app de Gemini, Google AI Studio i Vertex AI. La versió Gemini 1.5 Pro és multimodal i accepta text, imatges, àudio i vídeo al mateix prompt , oferint a més finestres de context molt àmplies, de fins a 2 milions de tokens en les configuracions més avançades.
Gemini 1.5 Flash és un model més lleuger i ràpid, optimitzat per a costos reduïts i respostes gairebé immediates, mantenint una finestra de context enorme al voltant d'1 milió de tokens. Està pensat per a aplicacions que necessiten molta velocitat i volum , com a serveis que processen grans quantitats de text o que donen respostes en temps real, però sense renunciar a capacitats multimodals.
Gemini Nano és la versió compacta del model, orientada a executar-se directament en dispositius amb recursos limitats, com ara smartphones. La seva gran novetat és que pot funcionar en local sense connexió constant al servidor , cosa que millora la privadesa, redueix la latència i obre la porta a funcions d'IA integrades en el sistema, com resums d'àudio, suggeriments intel·ligents o generació de text al propi mòbil. Està integrat, per exemple, al Pixel 8 Pro a través del servei AICore i pot ser utilitzat per apps de tercers.
Com funciona Gemini per dins i què la fa diferent
Els models d'intel·ligència artificial com Gemini s'entrenen amb enormes quantitats de dades extretes de la web, de repositoris de codi, de documents, imatges, àudio i vídeo. Durant l'entrenament, el sistema aprèn patrons: com s'estructuren les frases, com es relacionen conceptes, quin aspecte tenen els objectes en imatges o com sona una paraula en llengües diferents.
En el cas de Gemini, Google insisteix que el seu disseny és multimodal des de zero . En lloc d'entrenar primer un model de text i després afegir mòduls que converteixin imatges o àudio en text, el model aprèn alhora de diverses fonts de dades. Això us permet combinar informació visual, textual i auditiva de forma més natural, per exemple, analitzant un document escanejat que contingui diagrames, text escrit a mà i gràfics, o raonant sobre un vídeo a partir dels fotogrames i de l'àudio.
Una de les peces interessants de l'ecosistema és AlphaCode2, el sistema de generació de codi integrat a Gemini . Aquest mòdul millora la comprensió de problemes de programació i de matemàtiques avançades, incrementa la qualitat del raonament i redueix les “al·lucinacions” típiques dels LLM (respostes inventades però convincents). Es tradueix en solucions de codi més fiables i en una millor ajuda en programar.
La capacitat de context és una altra de les grans cartes de Gemini . Ja amb Gemini 1.5 Pro, Google va introduir finestres de context d'1 milió de tokens, equivalents a 8 o 9 llibres complets o una hora de vídeo amb força detall. Més tard, va anunciar l'ampliació fins a 2 milions de tokens per a certs usos a Gemini Advanced ia Google AI Studio. Aquesta escala permet carregar documents enormes, conjunts de transcripcions, repositoris de codi complets o grans bases de coneixement i demanar anàlisis i resums globals.
Segons Google, internament ja han treballat amb finestres de context superiors als 10 milions de tokens , cosa que encara no s'ha generalitzat públicament però que marca cap a on va la investigació: models que pràcticament poden “llegir-ho tot” de cop i raonar-hi sense necessitat de dividir-ho en trossos petits.
Gemini 1.5, Flash i l'evolució de la família
Al maig de 2024, durant l'esdeveniment Google I/O, la companyia va anunciar un gran salt amb Gemini 1.5 Pro i el nou model 1.5 Flash . La idea és oferir diferents opcions dins de la mateixa família, cobrint des d'usos d'alta potència fins a necessitats de rapidesa i eficiència.
Gemini 1.5 Pro va millorar la seva capacitat de context fins als 2 milions de tokens per a usuaris de Gemini Advanced i per a desenvolupadors a través de Google AI Studio. Això va suposar doblegar la ja impressionant finestra d'1 milió de tokens, col·locant-ho molt per sobre de models competidors com GPT-4 o Claude 3 en aquest aspecte concret.
D'altra banda, Gemini 1.5 Flash va arribar com un model lleuger i extremadament ràpid , pensat per a integracions a gran escala, on el cost de processar cada milió de tokens és un factor crític. Google va esmentar preus molt ajustats per 1M de tokens processats a través de l'API, enfocats que les empreses puguin treballar amb volums massius de dades de forma econòmica.
Tant Gemini 1.5 Pro com 1.5 Flash aconsegueixen rendiments comparables o fins i tot superiors a Gemini 1.0 Ultra a diferents benchmarks, mantenint un alt nivell de qualitat fins i tot quan s'aprofiten finestres de context gegants. Això demostra que no es tracta només de posar més tokens, sinó de mantenir la capacitat de raonament quan la quantitat d'informació es dispara.
Aquest enfocament modular es complementa amb altres llançaments de Google en el terreny de la IA oberta i especialitzada, com PaliGemma (model de visió de codi obert) o Gemma 2 en variants de 2B, 7B i 27B paràmetres, orientades a que desenvolupadors i empreses puguin tenir models optimitzats per als seus propis casos d'ús i, en alguns casos.
Gemini 3: la nova generació i la visió de Google
Amb l'arribada de Gemini 3, Google parla del seu model més intel·ligent fins ara . Segons explica Sundar Pichai, CEO de Google i Alphabet, cada generació de Gemini s'ha construït sobre l'anterior, ampliant tant els tipus d'informació que pot fer servir com la profunditat de raonament.
Gemini 1 va obrir la porta a un maneig avançat i multimodal de dades; Gemini 2 es va centrar en les capacitats agèntiques , és a dir, que la IA pogués realitzar tasques més complexes i treballar amb objectius, no només donar respostes aïllades. Models com Gemini 2.5 Pro han encapçalat durant mesos rànquings com LMArena gràcies a la seva capacitat de raonament.
Ara, amb Gemini 3, Google vol combinar totes les funcions clau de la família en un únic model que entengui millor el context i la intenció de lusuari . La idea és que necessitis menys missatges per arribar al resultat desitjat, perquè el sistema capta millor allò que vols des del principi, fins i tot quan les teves peticions són vagues o barregen diversos objectius.
Una altra part important del missatge de Google és que Gemini ja no només llegeix text i imatges, sinó que pretén llegir l'ambient : interpretar les subtileses d'una idea creativa, percebre les capes d'un problema complicat o adaptar-se al to de la situació. Aquestes capacitats es despleguen a gran escala en productes com ara la Cerca (Mode IA), l'app de Gemini, AI Studio, Vertex AI i la nova plataforma de desenvolupament d'agents, Google Antigravity.
Segons les dades que comparteix la companyia, l'adopció de Gemini està sent massiva : la Vista Creada amb IA a la Cerca arriba a uns 2000 milions d'usuaris al mes, l'app de Gemini supera els 650 milions d'usuaris mensuals, més del 70% dels clients de Google Cloud utilitza IA generativa i uns 13 milions de desenvolupadors han creat. Tot plegat recolzat en l'estratègia “full-stack” de Google: des de la seva pròpia infraestructura fins als productes finals, passant pels seus models i eines.
Què pots fer amb l'app de Gemini al dia a dia
L'app de Gemini és avui la porta d'entrada més directa a la IA de Google , disponible al mòbil i, en molts casos, integrada amb el mateix sistema. En activar-la, fins i tot podeu reemplaçar Google Assistant com a assistent principal del telèfon (encara que sempre podeu tornar a canviar-lo als paràmetres) o comparar-lo amb l' assistent d'Apple.
Una de les funcions més cridaneres és Gemini Live , que et permet mantenir converses de veu més naturals, fins i tot compartint la càmera o la pantalla. Pots obrir l'app, prémer el botó de Live i demanar-li que analitzi el que veu la càmera o el contingut de la pantalla en temps real , ja sigui per preparar una presentació, entendre un gràfic complicat o fer una entrevista de treball.
Una altra novetat interessant és Canvas, un espai creatiu des del qual podeu passar d'una idea escrita a un prototip . Des d'aquí podeu generar esborranys d'apps, jocs senzills, pàgines web, infografies, resums d'àudio o esquemes interactius. La idea és que no et quedis només al text: Gemini pot ajudar-te a construir estructures, dissenys i materials visuals que després pots refinar.
La integració amb l'ecosistema de Google és un dels seus punts forts: Gemini es connecta amb Cerca, YouTube, Google Maps, Gmail, Documents, Drive i altres serveis . Això permet, per exemple, fer cerques avançades a la safata d'entrada, demanar resums de fils llargs, crear esborranys de correus, organitzar documents o generar rutes de viatge que combinin informació de Maps amb recomanacions extretes de la web.
Al terreny de l'estudi i la formació, Gemini pot generar qüestionaris, targetes de memòria (flashcards), exemples pràctics i visualitzacions interactives . També és capaç de convertir arxius en una mena de “podcast” que pots escoltar quan vulguis, per repassar apunts, informes o articles mentre fas altres coses.
Generació d'imatges, vídeo i contingut creatiu
La família Gemini no es queda al text. Google ha desenvolupat models de generació d'imatges integrats a l'app que permeten crear il·lustracions, logotips, cartells o composicions visuals a partir de descripcions senzilles.
Des de la pantalla principal de l'app, pots prémer “Crear imatge” i triar el mode de pensament adequat al menú de models . A partir d'aquí, només cal escriure o combinar text i imatges de referència per obtenir noves creacions. És possible jugar amb estils molt variats, des d'estètica animi fins a pintura a l'oli o disseny minimalista, i descarregar la imatge al moment o compartir-la.
A més de generar imatges des de zero, els models més avançats permeten editar, barrejar i compondre : combinar diverses fotos per crear un mockup de producte, dissenyar un pòster amb text nítid, muntar esquemes visuals o transformar una idea inicial en diferents variants. Tot plegat recolzat en els models de gamma alta (com Gemini Pro o els seus successors) i, en el terreny del vídeo, en models com Veo 3.1 Fast.
En els plans de subscripció més potents, Gemini ofereix generació de vídeo i capacitats de recerca profunda (Deep Research) , que analitzen grans conjunts d'informació, tornen resums estructurats i enllacen les fonts consultades. D'aquesta manera, podeu passar d'un munt d'informes dispersos a una anàlisi raonada amb referències.
També s'han introduït els anomenats Gems, que són equivalents als “GPT” personalitzats d'altres sistemes . Bàsicament, són perfils o agents configurats per a tasques concretes, com a “professor de matemàtiques”, “entrenador d'escriptura” o “expert en guitarres Yamaha”. Pots crear els teus propis Gems, connectar-los amb el teu Gmail o Google Drive i fer que treballin amb la teva informació personal o de treball, sempre respectant els permisos que configuris.
Gemini a tot l'ecosistema Google: cerca, Workspace i més
Més enllà de l'app, el pla de Google és que Gemini estigui present a pràcticament tots els seus productes clau . Algunes de les integracions ja anunciades o en marxa inclouen Gmail, Documents, Fulls de càlcul, Presentacions, Google Ads, Google Chrome i, per descomptat, el cercador.
A Gmail, per exemple, Gemini ajuda a redactar correus, resumir cadenes molt llargues i localitzar informació amagada a la safata d'entrada . A Documents i altres eines de Workspace, podeu generar esborranys de textos, taules, resums executius o idees de contingut a partir d'arxius existents, presentacions prèvies o documentació pujada.
A la Cerca, la gran novetat són els AI Overviews (Vistes creades amb IA) , respostes generades per Gemini que apareixen a la part superior de les pàgines de resultats. Aquestes vistes combinen informació sintetitzada amb enllaços a llocs web i, quan escau, amb dades de Maps o altres serveis. És un canvi important pel que fa al paradigma clàssic de “deu enllaços blaus”, perquè la IA passa a tenir un paper actiu a l'hora d'organitzar la informació.
A l'àmbit publicitari i per a empreses, Gemini s'integra amb Google Ads i amb Google Cloud , oferint eines de generació de creativitats, anàlisi de campanyes, suport conversacional per a clients i aplicacions personalitzades desenvolupades sobre Vertex AI. Més del 70% dels clients de Cloud ja estan utilitzant d'una manera o altra aquests models generatius.
Per a desenvolupadors, Google AI Studio i Vertex AI són els principals punts d'accés als models Gemini . Des d'aquí podeu provar, afinar i desplegar solucions que aprofitin Gemini 1.5 Pro, Flash o altres variants, utilitzant APIs, SDKs i eines d'avaluació. La nova plataforma Google Antigravity va un pas més enllà, enfocant-se al desenvolupament d'agents que poden executar tasques complexes i coordinar diferents accions.
Plans, preus i diferències entre Google AI Pro i Ultra
Pel que fa al cost, hi ha parts de Gemini que es poden fer servir gratis i altres que requereixen subscripció . Per exemple, models com Gemini 1.0 Pro segueixen estant disponibles sense cost directe a través de la plataforma pública de Gemini, mentre que Gemini 1.5 Pro també s'ha pogut utilitzar gratuïtament en alguns contextos mitjançant Google AI Studio (sobretot mentre estava en fase més experimental).
Per a usuaris que necessiten més potència, contextos enormes i funcions de recerca avançada, Google ofereix plans de subscripció com Google AI Pro i Google AI Ultra , que inclouen accés ampliat als models més capaços (com 3 Pro i Gemini 3 Deep Think), Deep Research i generació de vídeo amb Veo 3.1 Fast, entre altres avantatges.
En certs mercats, plans com Gemini Advanced (integrat a Google AI Pro) tenen un cost mensual fix . A través d'ells s'accedeix a la finestra d'1 milió de tokens (o més, segons vagi evolucionant l'oferta), a un ús intensiu dels models topall de gamma ia límits més alts quant a nombre de peticions i volum d'informació manejada.
Els plans empresarials, com Google AI Ultra per a Business, s'ofereixen com a complements a clients de Google Workspace . Això permet que les companyies afegeixin capacitats avançades d'IA als comptes de treball, amb opcions de seguretat, compliment i administració adaptades a l'entorn corporatiu.
En tot cas, Google manté documentació específica sobre privadesa per a les apps de Gemini , detallant com es tracten les dades, què es fa servir per millorar models i quins controls té l'usuari. És recomanable revisar l'Avís de Privadesa de les apps de Gemini per entendre com es manegen els continguts que puges o les converses que mantenes amb la IA.
Rendiment de Gemini davant d'altres models i usos pràctics
En avaluacions públiques, Gemini Ultra ha quedat per sobre de models com Claude 2, GPT-4 o Flama 2 en diversos benchmarks clau . Per exemple, destaca a GSM8K (raonament matemàtic), HumanEval (generació de codi) i MMLU (comprensió de llenguatge natural en múltiples camps de coneixement).
A MMLU, de fet, Gemini Ultra ha aconseguit superar fins i tot panells d'experts humans , cosa que Google ha utilitzat com a indicador de la maduresa del model en tasques de coneixement general. Tot i això, no guanya en tots els fronts: a la prova HellaSwag, centrada en sentit comú i comprensió de llenguatge quotidià, GPT-4 segueix aconseguint resultats lleugerament millors.
Al terreny multimodal, les proves internes de Google mostren que Gemini Ultra rendeix millor que altres models en comprensió de documents, anàlisi d'imatges i reconeixement automàtic de veu . També supera altres LLM en benchmarks de traducció de veu, subtitulat de vídeo en anglès, raonament multimodal i resposta a preguntes basades en vídeo, encara que la pròpia companyia admet que encara hi ha marge de millora en aquests àmbits.
Per la seva banda, Gemini 1.5 Pro i 1.5 Flash ofereixen un rendiment molt proper o superior al de Gemini 1.0 Ultra a molts escenaris, amb l'avantatge afegit de les seves enormes finestres de context. A mesura que augmenta el nombre de tokens que poden manejar, mantenen una qualitat alta en la comprensió i la generació, una cosa clau quan es treballa amb documents llargs o projectes plens de detalls.
En situacions reals, això es tradueix en casos d'ús molt variats: des d'analitzar presentacions de centenars de diapositives fins a revisar contractes, informes tècnics, repositoris de codi o fitxers de recerca . Per exemple, podeu pujar un document de 1500 pàgines i demanar a Gemini que tregui idees per a una sèrie d'articles de bloc, que redacti els titulars, que proposi estructures per a pàgines web o que generi copys per a xarxes socials basats en aquesta informació.
Exemple pràctic: personalitzar Gemini i aprofitar-ne la visió
Per entendre millor de què és capaç, imaginem un escenari on utilitzes Gemini des de Google AI Studio per crear un assistent especialitzat . Li demanes que actuï com un expert en guitarres Yamaha, configurant la seva “personalitat” perquè doni explicacions tècniques però properes, recomani models segons estils musicals i resolgui dubtes habituals de principiants.
A continuació, li proporciones imatges de diferents guitarres, fitxes tècniques i fragments de ressenyes . Gemini analitza tant la informació textual com visual: reconeix formes, models, detalls del cos i del pal, i combina això amb allò que sap dels productes. A partir d'aquí podeu respondre preguntes com “quin s'adapta millor per a jazz?”, “quines diferències hi ha entre aquestes dues guitarres?” o “quin manteniment necessita aquest model concret?”.
Aquest exemple il·lustra com la multimodalitat converteix Gemini en alguna cosa més que un chatbot que respon text . Es comporta com un assistent superdotat que entén conceptes, imatges i contextos, i que es pot adaptar a nínxols molt concrets. Aquesta mateixa lògica es pot aplicar a altres camps: anàlisi de documents legals, suport tècnic, revisió de codi, assessoria financera o creació de continguts educatius.
Amb el temps, a mesura que Google segueixi ampliant les capacitats de Gemini i afinant models com Gemini 3, veurem cada cop més aplicacions pràctiques a la vida diària i en entorns professionals . Des de funcions integrades al mòbil fins a agents complexos que gestionin projectes, la família Gemini apunta a ser una peça central en la manera com interactuem amb la informació i amb la tecnologia.
Tot aquest ecosistema de models, apps, integracions i plans de subscripció fa que Google Gemini es consolidi com una plataforma d'IA molt completa, amb solucions per a usuaris corrents, empreses i desenvolupadors , capaç de generar text, imatges i vídeo, raonar sobre contextos gegantins i funcionar tant al núvol com directament al dispositiu.