Sanity check przed spotkaniem z klientem

Moduł 1 — merytoryczny ślad cyfrowy CMO

Raport opiera się wyłącznie na runie WhiteSpy z 21.08.2026, 13:01–17:21 (4 h 20 min) — zrzut cmo_whitespy_raw_20260821.xlsx — zestawionym z listą 12 CMO od klienta i z założeniami briefingu. Wszystkie liczby są policzone z surowych danych, nie z szacunków.

1. Wniosek w jednym akapicie

Pipeline działa, ale mierzy nie to, co trzeba. Run przeczytał 57 stron z 18 źródeł i wyprodukował 3036 czystych, udokumentowanych wzmianek o 2634 osobach — ekstrakcja i normalizacja są sprawne. Problem leży wyżej: dla listy 12 CMO klienta znaleziono w sumie 10 sygnałów, 5 osób ma zero, żadna osoba nie ma sygnału z więcej niż jednego źródła, a żaden z 10 sygnałów nie daje się przypisać do roku 2025 — czyli do okresu, który ranking ma oceniać. Na tych danych scoring z zakładki „Metodologia” jest technicznie policzalny, ale merytorycznie nie odróżnia CMO od siebie. Powód jest jeden i jest naprawialny: run był crawlem po zadanej liście rejestrów, a nie discovery per osoba. To dokładnie ryzyko, które klient nazwał w punkcie 4A briefingu.

Zostało to sprawdzone i naprawione. Warstwa A jest zbudowana i uruchomiona na tej samej liście 12 osób: 22 zapytań zamieniło 10 sygnałów w 65, 11 z 12 CMO ma sygnał wobec 7 wcześniej, a sygnałów przypisanych do roku 2025 jest 8 zamiast zera. Diagnoza poniżej opisuje stan sprzed tej zmiany — czytaj ją razem z wynikiem testu warstwy A.

7/12

CMO z jakimkolwiek sygnałem

10

sygnałów łącznie dla 12 osób

0

sygnałów datowanych na 2025

4/18

źródeł, które trafiły w kogokolwiek z listy

2. Co run faktycznie zrobił

Skala i jakość techniczna — tu nie ma problemu.

18

źródeł

57

stron (100% Completed)

3036

wzmianek

2634

unikalnych osób

45/57

stron z najwyższą oceną ewaluatora

670 min

sumaryczny czas crawlu

Mediana czasu na stronę to 12 min, 24 z 57 stron wymagało drugiego podejścia i wszystkie zakończyły się sukcesem. Pętla evaluator → retry działa i jest to realny atut w rozmowie z klientem: mamy audytowalny ślad jakości dla każdej strony.

3. Wynik dla listy 12 CMO

To jest test, który się liczy: nie ile wzmianek zebraliśmy, tylko ile z nich dotyczy osób z listy klienta.

OsobaFirma / branżaSygnałyŹródłoCo znaleziono
Leszek KurnickiPGEenergetyka0Brak jakiejkolwiek wzmianki w 18 przeszukanych źródłach.
Barbara PasterczykINGfinanse1IAACzłonkostwo w stowarzyszeniu (IAA, grupa Reklamodawcy). Stan, nie aktywność. Bez daty.
Daniel RogińskiAllegroe-commerce0Brak jakiejkolwiek wzmianki w 18 przeszukanych źródłach.
Michał SzanieckiVolkswagenautomotive2SAR_MBSKadra Szkoły MBS + prowadzący moduł „1.3 Evidence-based marketing”. Jedyne sygnały z datą — ale edycja z 4.12.2026. Uwaga: źródło podaje afiliację „Volkswagen Group Australia”, wymaga potwierdzenia tożsamości.
Joanna Staude-PotockaŻabkaretail0Brak jakiejkolwiek wzmianki w 18 przeszukanych źródłach.
Izabela Karolczyk-SzafrańskaInPostlogistyka2IAACzłonkostwo (lista członków) + funkcja w organie IAA. Dwa zapisy nazwiska („Karolczyk – Szafrańska Izabela”) scalone poprawnie. Bez daty.
Piotr ChęcielewskiCarlsberg Polskaalko1Rada ReklamyArbiter Komisji Etyki Reklamy, grupa reklamodawców. Rola cykliczna, bez daty kadencji.
Aleksandra DanelSolar Companyodzież0Brak jakiejkolwiek wzmianki w 18 przeszukanych źródłach.
Luiza NowakowskaKrossrowery0Brak jakiejkolwiek wzmianki w 18 przeszukanych źródłach.
Jolanta BorowskaNestlé PolskaFMCG2IAACzłonkostwo + funkcja w organie IAA. Warianty „Borowska Jolanta” / „Jolanta Borowska” scalone poprawnie. Bez daty.
Michał AramentMcDonald's Polskafood1EFFIEJuror EFFIE, Grupa XII Long Term — edycja 2026, nie 2025.
Małgorzata RokitaP&G PolskaFMCG1Rada ReklamySekcja „Arbitrzy w historii Komisji” — sygnał jawnie historyczny, bez możliwości przypisania do roku.

Przewiń tabelę w bok, aby zobaczyć wszystkie kolumny →

Zero sygnałów mają wyłącznie osoby spoza kręgu organizacji marketingowych: PGE, Allegro, Żabka, Solar Company, Kross. Wszystkie trafienia pochodzą z czterech źródeł — IAA, Rada Reklamy, SAR MBS, EFFIE — i w pięciu przypadkach na dziesięć są to członkostwa, czyli stan, a nie aktywność w danym roku.

4. Pięć luk, które trzeba zamknąć

L1
krytyczna
Brak discovery — crawlujemy tylko to, co sami wskazaliśmy

Run przeszedł po zamkniętej liście rejestrów. 14 z 18 źródeł nie trafiło w nikogo z listy klienta, a 5 osób nie istnieje w zbiorze w ogóle. Klient wprost mówi, że nie poda nam listy konferencji i organizacji — więc wartość WhiteSpy musi leżeć w odkrywaniu źródeł. Dopóki tego nie pokażemy, demo odpowiada na inne pytanie niż zadane.

L2
krytyczna
Brak wymiaru czasu — 6,4% wzmianek ma datę

Data lub edycja jest wypełniona w 193 z 3036 wzmianek, i praktycznie wyłącznie w Złotych Spinaczach i szkołach SAR. Strony rejestrów pokazują stan „dziś”, a jedyne datowane sygnały dla listy POC wskazują na edycję z grudnia 2026. Briefing zakłada ocenę zamkniętego roku 2025 — na obecnych danych świeżość i częstotliwość w scoringu są niepoliczalne.

L3
wysoka
Skrzywienie populacji — góra rankingu to agencje, nie brand-side

Osoby o najszerszym pokryciu w zbiorze to w większości ludzie agencji i mediów (Synergion, WPP Media, Wavemaker, Biuro Reklamy TVP), bo to oni obsadzają jury, rady i panele. Ranking zbudowany na samych rejestrach mierzyłby „obecność w obiegu organizacji branżowych”, a nie wpływ CMO. To ten sam błąd co scoring po LinkedInie, tylko z inną osią.

L4
średnia
Entity resolution — działa lokalnie, nietestowane na trudnych przypadkach

Scalanie wariantów zapisu działa: 189 rekordów ma warianty, a „Borowska Jolanta” i „Jolanta Borowska” trafiły do jednej osoby. Ale firma jest wypełniona w 77% wzmianek, a rola w 66% — to za mało, żeby rozstrzygać homonimy. Widać to na przypadku Michała Szanieckiego, gdzie źródło podaje afiliację „Volkswagen Group Australia”: bez drugiego atrybutu nie da się automatycznie potwierdzić, że to ta sama osoba co CMO z listy.

L5
wysoka
Pokrycie typów sygnałów — cztery z jedenastu

Briefing wymienia jedenaście klas sygnałów. Run pokrywa realnie cztery: jury, organy i członkostwa, prelegent, wykładowca. Publikacje, raporty, fundacje, uczelnie i role eksperckie w mediach nie mają w tym runie ani jednego źródła. Do tego cała oś „prelegent” stoi na dwóch stronach — infoShare (88% wszystkich wystąpień) i Forum IAB — przy czym infoShare to konferencja technologiczna, więc dla rankingu CMO jest w dużej mierze szumem.

5. Pokrycie typów sygnałów z briefingu

jury konkursów branżowych

EFFIE, MIXX, KTR, Złote Spinacze, DMR — 473 wzmianki

rady i organizacje branżowe

IAA, IAB, SAR, POR, e-Izba, Rada Reklamy — 309 funkcji w organach + 273 członkostwa

speaker / panelista / moderator

1910 wzmianek, ale całość pochodzi z dwóch stron: infoShare (88%) i Forum IAB

wykłady / uczelnie

tylko 50 wzmianek, wyłącznie szkoły SAR — brak uczelni

publikacje eksperckie / naukowe

brak źródła w runie

autorstwo raportów

brak źródła w runie

występowanie jako ekspert (media)

21 wzmianek, wyłącznie „ekspert IAB”

fundacje

brak źródła w runie

rady nadzorcze / role społeczne

brak KRS i źródeł spoza marketingu

6. Jakość schematu normalizacji

Schemat z briefingu (Person / Signal type / Organisation / Role / Date / Source / Confidence) jest odwzorowany. Różnice są w wypełnieniu pól.

PoleWypełnienieZnaczenie dla scoringu
Cytat (dowód)100%każda wzmianka ma evidence snippet
Firma77%kluczowe dla entity resolution
Rola65,9%wejście do wagi roli w scoringu
Link do biogramu60,5%druga warstwa dowodu
Grupa / sesja38,6%kontekst wydarzenia
Data / edycja6,4%blokuje wymiar czasu i świeżość
Tytuły0,7%pole praktycznie puste

Przewiń tabelę w bok, aby zobaczyć wszystkie kolumny →

Warto podkreślić przed klientem dwie rzeczy: 100% wzmianek ma cytat-dowód, a 40 rekordów zostało świadomie zablokowanych jako kontekst niekwalifikujący (sponsor, uczestnik) — czyli filtr kontekstu już działa i jest widoczny w danych. Brakującym elementem jest pole confidence: dziś status dopasowania jest binarny (Matched / Unmatched), a scoring zakłada wartość ciągłą.

7. Długi ogon — dlaczego 2634 osoby to za mało

Rozkład wzmianek na osobę pokazuje, że zbiór jest szeroki, ale płytki.

2334

1 wzmianka

229

2 wzmianki

50

3 wzmianki

14

4 wzmianki

6

5 wzmianek

1

6 wzmianek

88,6% osób ma dokładnie jedną wzmiankę, a tylko 27 osób pojawia się w trzech lub więcej źródłach. Powtarzalność obecności — jeden z komponentów scoringu wskazanych w briefingu — jest dziś mierzalna dla ok. 1% zbioru.

Osoba o najszerszym pokryciuOrganizacjaStrona rynkuŹródłaWzmianki
Magdalena KosińskaVersuni / Philips DA
brand
56
Teresa WierzbowskaCyfrowy Polsat
media
55
Michał KociankowskiSynergion
agencja
45
Michał SzczurWPP Media / Mindshare
agencja
45
Dariusz MaciołekBNP Paribas
brand
44
Paweł GalaWavemaker
agencja
44
Marek ZaborowskiBNP Paribas
brand
44
Wojciech KowalczykBiuro Reklamy TVP
media
44

Przewiń tabelę w bok, aby zobaczyć wszystkie kolumny →

To jest lista, którą wypluje dziś ranking. Żadna z tych osób nie jest na liście klienta.

8. Rekomendowana architektura — trzy warstwy zamiast jednej

Obecny run to jedna warstwa z trzech potrzebnych. Nie trzeba go wyrzucać — trzeba go obudować.

Warstwa A · Person-centric discovery
do zbudowania

Wachlarz zapytań na osobę (nazwisko × firma × rola × typ sygnału × rok) do search API, potem crawl trafień. To jest ta warstwa, która odpowiada na pytanie klienta „czy znajdziecie źródła, których nie wskażemy”. Dziś jej nie ma — i to jedyny powód, dla którego 5 z 12 CMO ma zero sygnałów.

Warstwa B · Registry crawl (rejestry branżowe)
działa

Obecny run. Wysoka precyzja, dobre dowody, tani rerun. Zostaje jako warstwa bazowa i jako źródło prawdy o rolach formalnych (jury, rady, arbitrzy, członkostwa).

Warstwa C · Warstwa czasowa (archiwa edycji)
do zbudowania

Rejestry pokazują stan „dziś”. Żeby ocenić rok 2025 w 2026, trzeba sięgnąć po archiwalne strony edycji i snapshoty (Wayback) — inaczej wymiar czasu w scoringu jest niepoliczalny.

Docelowy pipeline per osoba

seed (imię + nazwisko + firma + rola + warianty)
→ discovery (wachlarz zapytań × typ sygnału × rok → kandydaci na źródła)
→ crawl + ekstrakcja (obecny silnik WhiteSpy)
→ entity resolution (nazwisko + firma + rola + kontekst branżowy)
→ klasyfikacja sygnału (11 typów z briefingu)
→ datowanie (strona edycji / archiwum / snapshot)
→ confidence (ciągłe, nie binarne)
→ dedup zdarzeń między źródłami
→ scoring (moduł „Metodologia”)

Kroki 3–9 są już zbudowane albo prawie zbudowane. Realna praca do POC to kroki 1, 2 i 6.

9. Klasy źródeł do dołożenia

Konkretna mapa tego, czego brakuje, żeby pokryć jedenaście typów sygnałów z briefingu.

Konferencje marketingowe

Forum Marketingu, Kongres Profesjonalistów PR, Impact, Wolves Summit, Mama Marketing, Digital Champions, konferencje branżowe wertykałów (retail, finanse, energetyka)

Uczelnie i studia podyplomowe

SGH, ALK, UW, Uniwersytet SWPS, Collegium Civitas, WSIiZ — sylabusy, wykaz wykładowców, gościnne wykłady

Prasa i portale branżowe

Wirtualnemedia, Press, MarketingPrzykawie, NowyMarketing, Media Marketing Polska — komentarze eksperckie i wywiady

Raporty i publikacje

raporty IAB/SAR/Deloitte/PwC z listą autorów, publikacje uczelniane, Google Scholar

Fundacje i NGO

KRS + rejestr stowarzyszeń, strony fundacji korporacyjnych, rady programowe organizacji społecznych

Podcasty i wystąpienia wideo

YouTube branżowy, podcasty marketingowe — opisy odcinków z afiliacją gościa

Wertykały poza marketingiem

energetyka (Kurnicki), rowery (Nowakowska), moda (Danel) — te osoby żyją w źródłach swojej branży, nie w IAA/IAB

10. Pareto completeness — jak to zmierzyć uczciwie

Klient wie, że nie udowodnimy kompletności. Zamiast tego proponujemy mierzalny recall proxy.

Golden set

Dla 3 osób z listy zbieramy ręcznie możliwie pełny ślad (2–3 h na osobę). To jest mianownik. Pipeline liczymy jako % golden setu odnaleziony automatycznie.

Nasycenie źródeł

Mierzymy, po ilu zapytaniach na osobę przestają pojawiać się nowe źródła. Punkt nasycenia definiuje koszt na osobę i jest twardym argumentem w rozmowie o cenie.

Stabilność między runami

Ten sam seed uruchomiony dwa razy powinien dać ten sam zbiór sygnałów. Powtarzalność jest tym, czego klient realnie potrzebuje do obrony rankingu.

Deklarujemy wobec klienta poziom kompletności, nie kompletność: np. „≥80% golden setu przy nasyceniu po N zapytaniach”. To jest obietnica, której da się dotrzymać i którą da się zweryfikować.

11. Co proponuję na POC (5–10 osób)

Lista 12 osób od klienta jest dobrym zestawem testowym właśnie dlatego, że jest tak zróżnicowana.

  1. Dobór osób. Trzy profile: obecny w obiegu branżowym (Arament, Karolczyk-Szafrańska), obecny formalnie ale bez aktywności (Pasterczyk, Rokita), niewidoczny w rejestrach marketingowych (Kurnicki, Nowakowska, Danel). Ostatnia grupa jest najważniejsza — to ona rozstrzyga, czy metoda w ogóle działa.
  2. Golden set na trzech osobach — ręcznie, żeby mieć mianownik do recall.
  3. Warstwa A (discovery) na całej dziesiątce, z twardym oknem czasowym 2025.
  4. Wynik do pokazania: tabela sygnałów z dowodem i confidence + recall względem golden setu + koszt i czas na osobę. Bez tych trzech liczb rozmowa o wycenie 50–60 osób jest zgadywanką.

Czego nie obiecywać na spotkaniu: że pokryjemy każdą osobę równie dobrze. Dla CMO spoza kręgu marketingowego (energetyka, rowery, moda) ślad merytoryczny może być obiektywnie cienki — i to jest wynik badania, nie jego porażka. Ranking musi umieć powiedzieć „ta osoba nie zostawia publicznego śladu”, zamiast dorabiać jej punkty.

Wyszukiwanie po osobach — wynik

Punktem wyjścia jest osoba, a źródła są wynikiem. Uruchomione na 12 CMO z listy klienta, 22 zapytaniami.

11/12

CMO z sygnałem

wcześniej 7/12

65

sygnałów łącznie

wcześniej 10

38

nowych źródeł

domen spoza listy startowej

MiaraWyszukiwanie po rejestrachWyszukiwanie po osobach
CMO z jakimkolwiek sygnałem7/1211/12
sygnałów łącznie1065
sygnałów z datą016
sygnałów w oknie 202508
pokrytych klas sygnałów (z 11 w briefingu)48
nakład57 stron22 zapytań

Przewiń tabelę w bok, aby zobaczyć wszystkie kolumny →

CMOFirmaZapytaniaSygnały
Leszek KurnickiPGE · energetyka207
Barbara PasterczykING · finanse219
Daniel RogińskiAllegro · e-commerce202
Michał SzanieckiVolkswagen · automotive127
Joanna Staude-PotockaŻabka · retail404
Izabela Karolczyk-SzafrańskaInPost · logistyka1210
Piotr ChęcielewskiCarlsberg Polska · alko113
Aleksandra DanelSolar Company · odzież204
Luiza NowakowskaKross · rowery300
Jolanta BorowskaNestlé Polska · FMCG125
Michał AramentMcDonald's Polska · food2110
Małgorzata RokitaP&G Polska · FMCG114

Przewiń tabelę w bok, aby zobaczyć wszystkie kolumny →

Nowe źródła spoza listy startowej (38)

goldenarrow.pl
addays.pl
proto.pl
nowa-energia.com.pl
ceo.com.pl
mmponline.pl
nowymarketing.pl
eecpoland.eu
bcc.org.pl
kongres.oees.pl
kongresbps.pl
rp.pl
esgtrends.pl
pwc.pl
effie.org
media.ing.pl
signs.pl
infowire.pl
bank.pl
wirtualnemedia.pl
press.pl
marketerplus.pl
mentors4starters.pl
tvnmedia.pl
ue.poznan.pl
fashionbiznes.pl
lamode.info
dynks.poznan.pl
mbs.effie.pl
dlahandlu.pl
portalspozywczy.pl
retailwork.pl
handelextra.pl
pulshr.pl
rejestr.io
mycompanypolska.pl
kreatura.pl
samar.pl

Pełna rozpiska sygnał po sygnale: Warstwa A — wyszukiwanie po osobach.

12. Pytania do klienta

  • Czy członkostwo w organizacji (stan) i wystąpienie na konferencji (zdarzenie) mają w scoringu ważyć tak samo? Dziś 5 z 10 znalezionych sygnałów to stany, nie aktywność.
  • Czy okno oceny to twardy rok kalendarzowy 2025, czy „ostatnie 24 miesiące”? Twardy rok wymaga warstwy archiwalnej i podnosi koszt.
  • Czy ranking ma obejmować wyłącznie brand-side, czy także agencje i media? Na obecnych danych góra listy to agencje — to zmienia definicję populacji, nie tylko wagi.
  • Jaki próg dowodowy klient akceptuje: czy jedna strona rejestru bez daty to wystarczający dowód sygnału?
  • Czy klient udostępni listę 50–60 osób wcześniej — bez niej nie da się przygotować warstwy A ani zmierzyć recall.

Podstawa: cmo_whitespy_raw_20260821.xlsx (arkusze „Wzmianki (raw)”, „Osoby (agregacja)”, „Strony”) oraz briefing „Ranking najbardziej wpływowych CMO w Polsce”. Raport dotyczy wyłącznie Modułu 1; Moduł 2 (Share of Search) jest opisany osobno.