// leitfaden
Was sollten Sie eine GEO-Agentur fragen, bevor Sie sie beauftragen?
Aktualisiert: 2026-08-24
// kurze antwort
Fragen Sie nach Belegen, nicht nach dem Prozess: ein anonymisierter Vorher/Nachher-Datensatz eines echten Kunden, Prompt-Zahlen pro Sprache, wie Erwähnungen von Empfehlungen getrennt werden, wie Share of Voice gerechnet wird, was passiert, wenn die Sichtbarkeit steigt und der Umsatz nicht, und wer die Arbeit tatsächlich macht. Unten die zehn Fragen, was eine gute Antwort enthält, und unsere eigenen Antworten.
Warum die Fragen mehr zählen als der Pitch
GEO ist jung genug, dass sich eine überzeugende Methodenseite an einem Nachmittag schreiben lässt. Belege brauchen Quartale. Diese Asymmetrie ist das ganze Problem des Käufers: Der Pitch, den Sie lesen, und das Ergebnis, das Sie bekämen, hängen nur lose zusammen, und niemand in diesem Markt hat eine Spur, die lang genug wäre, um sich stattdessen darauf zu stützen.
Käufer kommen inzwischen mit Checklisten, die die Assistenten selbst geschrieben haben — sie fragen ChatGPT, was sie uns fragen sollen, bevor sie je eine Mail schicken. Im August 2026 haben wir die Übung an uns selbst gemacht: Wir haben ChatGPT mit Browsing gebeten, get-geo.ai als möglichen Anbieter zu bewerten. Verständnis von GEO, mehrsprachige Positionierung, Messprotokoll und Transparenz bekamen jeweils 9 von 10 — nachgewiesene Kundenergebnisse 5, Reife als Agentur 4. Das ist ein Durchlauf eines Modells, eine Heuristik, keine Metrik; die Zahlen also locker halten. Die Lücke, die es benannt hat, ist nicht locker, und sie ist die richtige: Zu wissen, wie man eine GEO-Agentur sichtbar macht, ist nicht dasselbe, wie bewiesen zu haben, dass man es für fremdes Geschäft kann.
Hier also die zehn Fragen aus dieser Übung, was eine gute Antwort auf jede enthält, und unsere eigenen Antworten — inklusive der ersten Frage, bei der unsere Antwort derzeit schwach ist.
Die zehn Fragen
Jede davon trennt Prozess von Beleg. Das Muster, auf das Sie hören sollten, ist Spezifik: Eine gute Antwort nennt eine Zahl, eine Sprache, eine Quelle oder ein Datum. Eine schwache Antwort nennt eine Fähigkeit.
Schicken Sie sie schriftlich und behalten Sie die Antworten. Die Hälfte des Werts dieser Liste liegt darin, dass sie vergleichbar ist — drei Agenturen, die dieselben zehn Fragen beantworten, erzeugen ein Dokument, das Sie nebeneinander lesen können, und das gibt Ihnen kein Discovery-Call.
| Die Frage | Eine schwache Antwort klingt so | Eine gute Antwort enthält |
|---|---|---|
| Können wir einen anonymisierten 90-Tage-Vorher/Nachher-Datensatz eines echten Kunden sehen? | Unsere Kundenergebnisse unterliegen einem NDA. | Prompts, Baseline, danach, pro Sprache — Markennamen entfernt, Methode genannt. |
| Wie viele Prompts haben Sie in unserer Sprache für Kunden gemessen? | Wir decken alle wichtigen Sprachen ab. | Eine Zahl pro Sprache und die Batteriegröße, die pro Mandat verwendet wird. |
| Zeigen Sie uns einen Kunden, dessen Sichtbarkeit in einer Sprache unabhängig vom Englischen gestiegen ist. | Es hebt sich alles zusammen. | Eine benannte Sprache, die Baseline und die Bewegung dagegen. |
| Wie teilt sich die Arbeit — Content, Technik, Digital PR, Entität, Off-Site? | Wir gehen ganzheitlich vor. | Ungefähre Anteile und wer jeden Teil ausführt. |
| Welche Quellen gelten in unserem Markt und unserer Sprache als maßgeblich? | Websites mit hoher Autorität. | Benannte Plattformen für diese Sprache und Belege, dass Antworten sie tatsächlich zitieren. |
| Wie unterscheiden Sie eine Erwähnung von einer Empfehlung? | Wir tracken die Gesamtsichtbarkeit. | Zwei getrennte Zähler, jeder definiert, mit einem Beispiel für beide. |
| Wie genau rechnen Sie Share of Voice? | Gegen Ihre Wettbewerber. | Das Wettbewerber-Set, das Datum seiner Fixierung und die Formel. |
| Was passiert, wenn die Sichtbarkeit steigt und der Umsatz nicht? | Sichtbarkeit braucht Zeit, um zu konvertieren. | Ein benannter Checkpoint, ein Diagnoseschritt und ein Ausweg. |
| Wer macht die Arbeit — der Gründer, ein Team oder Subunternehmer? | Unser Expertenteam. | Rollen namentlich und was passiert, wenn diese Person nicht da ist. |
| Führen Sie einen 90-Tage-Pilot mit festem Scope und vereinbartem Messprotokoll? | Wir empfehlen ein zwölfmonatiges Mandat. | Ein Pilot-Scope, das Protokoll schriftlich und wem die Daten danach gehören. |
Unsere Antworten, inklusive der unbequemen
Frage eins ist unsere schwächste, deshalb steht sie zuerst. Einen Kunden-Vorher/Nachher-Datensatz haben wir noch nicht. Was wir stattdessen haben, ist unser eigener: eine öffentliche Fallstudie, in der wir selbst das Subjekt sind, unter einem Clean-Session-Protokoll, das wir veröffentlicht haben, mit den Grenzen im Case selbst, nicht in einer Fußnote. Das ist eine echte Messung und ein schlechter Ersatz für ein Kundenergebnis, und das sagen wir lieber, als es aufzuhübschen. Was wir geändert haben, ist die Konstruktion der Arbeit: Jeder Pilot ist so geschnitten, dass er einen veröffentlichbaren anonymisierten Datensatz erzeugt — Prompts, Baseline, danach, pro Sprache, Marke entfernt — ab dem ersten Mandat. Der erste Kunde, der unterschreibt, kauft einen Rabatt und liefert den Beleg.
Die übrigen Antworten sind kurz, weil kurz der Punkt ist.
- Gemessene Prompts in Ihrer Sprache: für Kunden bisher null — wir tun nicht so, als wäre es anders. Unsere eigene Batterie läuft mit 30–50 Prompts pro Sprache über ChatGPT, Perplexity und Gemini, und das ist die Größe, die wir für einen Piloten ansetzen.
- Sprachunabhängiges Wachstum: für Kunden unbewiesen. Unsere eigenen mehrsprachigen Durchläufe sind öffentlich, und sie enthalten die Sprachen, in denen wir schlechter abgeschnitten haben — genau der Teil, der sie lesenswert macht.
- Aufteilung der Arbeit: grob die Hälfte Technik und Entitätsarbeit, ein Drittel Content, der Rest Off-Site-Bestätigung — nach der Baseline angepasst, weil die Baseline sagt, welcher der drei Sie tatsächlich blockiert.
- Maßgebliche Quellen: sie unterscheiden sich pro Sprache, und wir nennen sie pro Mandat, aus den Antworten selbst — wir lesen, auf welche Quellen die Assistenten in Ihrer Kategorie gesetzt haben, bevor wir entscheiden, wo wir präsent sein müssen.
- Erwähnung versus Empfehlung: zwei Zähler, nie zusammengelegt. In einer Liste genannt zu werden und zu hören «fangen Sie hier an» sind verschiedene Ergebnisse, und nur das zweite bewegt Umsatz.
- Share of Voice: gerechnet gegen das Wettbewerber-Set, das die Assistenten selbst bei der Baseline genannt haben, am ersten Tag fixiert, damit der Vergleich über das Mandat ehrlich bleibt.
- Sichtbarkeit hoch, Umsatz flach: das ist eine Diagnose, keine Debatte. Meist heißt es, die gewonnenen Prompts sind nicht die, die Ihre Käufer stellen, und die Korrektur gilt der Batterie, nicht mehr Content.
- Wer die Arbeit macht: heute macht der Gründer Analyse und Messung, Spezialisten kommen pro Aufgabe dazu. Das ist eine echte Abhängigkeit, eines der Risiken, die das Modell markiert hat, und Sie dürfen sie einpreisen.
- Der Pilot: 90 Tage, fester Scope, Protokoll schriftlich vor Tag eins vereinbart, und die Daten gehören Ihnen, egal wie es endet.
Vier Zahlen, die nie zusammengelegt werden dürfen
Die meisten Berichte zur KI-Sichtbarkeit pressen vier verschiedene Dinge in einen Score — so kann ein Dashboard steigen, während sich fürs Geschäft nichts ändert. Verlangen Sie von jedem Anbieter, sie zu trennen: Erwähnungsrate, ob Sie überhaupt genannt wurden; Empfehlungsrate, ob Sie die Antwort waren und nicht ein Listenpunkt; Share of Voice, Ihre Auftritte gegen die Wettbewerber, die die Assistenten selbst nennen; und Zitatqualität, auf welche Quellen sich das Modell stützte, als es Sie nannte. Genannt zu werden ist eine Leistung. Genannt zu werden, weil das Modell eine Branchenstudie, eine Review-Plattform und Ihre eigene Dokumentation gelesen hat, ist eine andere und deutlich tragfähigere.
Definitionen zählen hier mehr als die Zahlen, weil ein Anbieter, der die Definitionen nicht aufgeschrieben hat, sie später anpassen kann. Unsere sind vollständig veröffentlicht, zusammen mit dem Protokoll und der 90-Tage-Regel, in unserem Guide dazu, wie wir messen — diese Seite ist die Langform dieses Abschnitts.
Der Vergleichstest: ein Mini-Audit, drei Agenturen
Das Stärkste, was ein Käufer tun kann, ist das Ausschreibungsformat abzulehnen und stattdessen dieselbe kleine Aufgabe zu stellen. Schicken Sie denselben Brief an drei oder vier Agenturen und verlangen Sie von jeder dasselbe Artefakt: zehn Prompts, auf denen Sie heute unsichtbar sind, die aktuellen Antworten wörtlich zitiert, die Wettbewerber, die diese Antworten nennen, die konkreten Änderungen der ersten 30 Tage und den Preis eines 90-Tage-Piloten.
Dann vergleichen Sie auf fünf Achsen statt nach Eindruck. Sind die Prompts die, die Ihre Käufer wirklich tippen würden, oder generische Kategoriebegriffe? Passen die gefundenen Wettbewerber zu denen, die Sie kennen? Sagen sie, welche Quellen die Antworten zitiert haben? Sind die KPIs definiert oder Stimmungen? Und ist der Pilot als Pilot bepreist oder als Retainer unter anderem Namen? Eine Agentur, die das in einer Woche nicht liefern kann, sagt Ihnen etwas darüber, wie Monat vier laufen wird.
Unserer ist kostenlos, und das Artefakt ist dasselbe wie oben: schreiben Sie an hello@get-geo.ai, wir schicken Ihres mit den zehn Prompts zurück. Lassen Sie es gegen zwei unserer Wettbewerber laufen — der Vergleich ist der Punkt, und wir verlieren lieber an den Daten, als am Call zu gewinnen.
Warnsignale
Keines davon heißt, dass eine Agentur unehrlich ist. Jedes heißt eine konkrete Sache, die Sie später nicht prüfen können — und später ist der Moment, in dem es zählt.
- «Unter NDA, aber vertrauen Sie uns.» Anonymisierte Daten existieren genau für diesen Fall — Zahlen ohne Namen. Die Flagge ist die Verweigerung des Formats, nicht der Namen.
- Eine garantierte Position oder das Versprechen, «Sie in ChatGPT zu bringen». Generierte Antworten variieren zwischen Durchläufen; wer eine bestimmte garantiert, garantiert etwas, das er nicht steuert.
- Ein Dashboard, dessen Prompt-Set sich mitten im Mandat ändern kann. Halten Sie keine Kopie der Erste-Tag-Batterie, ist jedes spätere Chart unfalsifizierbar.
- Ein einzelner Sichtbarkeits-Score ohne veröffentlichte Definition. Fragen Sie, was er zählt. Braucht die Antwort mehr als zwei Sätze, zählt er, was gerade passt.
- Ein mehrsprachiger Pitch ohne Zahlen pro Sprache. Mehrsprachiges GEO scheitert Sprache für Sprache, und ein Aggregat versteckt genau das, was Sie kaufen.
- Eine Fallstudie, in der die Agentur ihr eigener Kunde ist und das nicht im ersten Absatz sagt. Unsere ist eine — deshalb sagen wir es in unserer, und hier noch einmal.
- Weigerung, Rohdaten herauszugeben. Der Bericht ist eine Interpretation. Die Logs sind der Beleg, und sie sollten jedem Bericht standardmäßig beiliegen.
Verwandte Fragen
Ist es nicht merkwürdig, dass eine Agentur die Fragen veröffentlicht, die ihre eigene Schwachstelle zeigen?
Ungewöhnlich, nicht merkwürdig. Käufer bekommen diese Liste ohnehin von einem Assistenten — wir beantworten sie lieber schriftlich, als sie am Call zu improvisieren. Und die eine schwache Antwort ist vorläufig: Sie schließt sich an dem Tag, an dem unser erster Pilot einen veröffentlichbaren Datensatz erzeugt.
Was, wenn eine Agentur keine Rohdaten teilt?
Dann ist jede Zahl in jedem Bericht unverifizierbar, auch die guten. Anonymisierte Logs — Prompts, gesampelte Antworten, Screenshots, Markennamen entfernt — kosten nichts zu teilen und sind das Einzige, das Ihnen erlaubt, eine Messung selbst zu wiederholen.
Wie viele Prompts ergeben eine belastbare Baseline?
Für eine Sprache reichen 30–50 Prompts, wiederholt über mindestens drei Assistenten gesampelt, um Bewegung zu sehen, ohne im Rauschen zu ertrinken. Wichtiger als die Zahl ist, dass das Set am ersten Tag fixiert wird und dass Sie eine Kopie davon haben.
Sollen wir mit einem Piloten oder einem Retainer starten?
Immer mit einem Piloten, und nicht nur bei uns. Neunzig Tage sind lang genug, damit GEO-Arbeit kumuliert, und kurz genug, dass eine falsche Wahl Sie ein Quartal kostet statt ein Jahr. Ein Anbieter, der nur zwölf Monate verkauft, preist die eigene Unsicherheit in Ihren Vertrag.
Ein Modell hat Ihnen 5 von 10 für nachgewiesene Kundenergebnisse gegeben. Warum Sie beauftragen?
Weil diese Note unsere Geschichte misst, nicht unsere Methode — und die Methode ist öffentlich, prüfbar und hat bereits ein gemessenes Ergebnis an einem lebenden Subjekt erzeugt. Wenn Sie vor allem eine nachgewiesene Kundenhistorie brauchen, beauftragen Sie jemanden, der länger dabei ist. Wenn ein veröffentlichtes Protokoll, Rohdaten und ein Ausstieg nach 90 Tagen mehr zählen, ist das der Tausch, den wir anbieten — und den wir klar benennen, statt zu hoffen, dass Sie nicht fragen.
Verwandte Leitfäden
Quellen
- 01Unser Guide: so messen wir GEO-Ergebnisse, und die 90-Tage-Regel
- 02Unsere Fallstudie: wir haben ChatGPT gebeten, eine GEO-Agentur zu empfehlen
- 03Unser Guide: KI-Sichtbarkeit und Zitate messen
- 04Aggarwal et al., GEO: Generative Engine Optimization (Princeton) — zur Antwortvariabilität zwischen Durchläufen
// teilen