Moduł 1 — merytoryczny ślad cyfrowy CMO
Raport opiera się wyłącznie na runie WhiteSpy z 21.08.2026, 13:01–17:21 (4 h 20 min) — zrzut cmo_whitespy_raw_20260821.xlsx — zestawionym z listą 12 CMO od klienta i z założeniami briefingu. Wszystkie liczby są policzone z surowych danych, nie z szacunków.
1. Wniosek w jednym akapicie
Pipeline działa, ale mierzy nie to, co trzeba. Run przeczytał 57 stron z 18 źródeł i wyprodukował 3036 czystych, udokumentowanych wzmianek o 2634 osobach — ekstrakcja i normalizacja są sprawne. Problem leży wyżej: dla listy 12 CMO klienta znaleziono w sumie 10 sygnałów, 5 osób ma zero, żadna osoba nie ma sygnału z więcej niż jednego źródła, a żaden z 10 sygnałów nie daje się przypisać do roku 2025 — czyli do okresu, który ranking ma oceniać. Na tych danych scoring z zakładki „Metodologia” jest technicznie policzalny, ale merytorycznie nie odróżnia CMO od siebie. Powód jest jeden i jest naprawialny: run był crawlem po zadanej liście rejestrów, a nie discovery per osoba. To dokładnie ryzyko, które klient nazwał w punkcie 4A briefingu.
Zostało to sprawdzone i naprawione. Warstwa A jest zbudowana i uruchomiona na tej samej liście 12 osób: 22 zapytań zamieniło 10 sygnałów w 65, 11 z 12 CMO ma sygnał wobec 7 wcześniej, a sygnałów przypisanych do roku 2025 jest 8 zamiast zera. Diagnoza poniżej opisuje stan sprzed tej zmiany — czytaj ją razem z wynikiem testu warstwy A.
7/12
CMO z jakimkolwiek sygnałem
10
sygnałów łącznie dla 12 osób
0
sygnałów datowanych na 2025
4/18
źródeł, które trafiły w kogokolwiek z listy
2. Co run faktycznie zrobił
Skala i jakość techniczna — tu nie ma problemu.
18
źródeł
57
stron (100% Completed)
3036
wzmianek
2634
unikalnych osób
45/57
stron z najwyższą oceną ewaluatora
670 min
sumaryczny czas crawlu
Mediana czasu na stronę to 12 min, 24 z 57 stron wymagało drugiego podejścia i wszystkie zakończyły się sukcesem. Pętla evaluator → retry działa i jest to realny atut w rozmowie z klientem: mamy audytowalny ślad jakości dla każdej strony.
3. Wynik dla listy 12 CMO
To jest test, który się liczy: nie ile wzmianek zebraliśmy, tylko ile z nich dotyczy osób z listy klienta.
| Osoba | Firma / branża | Sygnały | Źródło | Co znaleziono |
|---|---|---|---|---|
| Leszek Kurnicki | PGEenergetyka | 0 | — | Brak jakiejkolwiek wzmianki w 18 przeszukanych źródłach. |
| Barbara Pasterczyk | INGfinanse | 1 | IAA | Członkostwo w stowarzyszeniu (IAA, grupa Reklamodawcy). Stan, nie aktywność. Bez daty. |
| Daniel Rogiński | Allegroe-commerce | 0 | — | Brak jakiejkolwiek wzmianki w 18 przeszukanych źródłach. |
| Michał Szaniecki | Volkswagenautomotive | 2 | SAR_MBS | Kadra Szkoły MBS + prowadzący moduł „1.3 Evidence-based marketing”. Jedyne sygnały z datą — ale edycja z 4.12.2026. Uwaga: źródło podaje afiliację „Volkswagen Group Australia”, wymaga potwierdzenia tożsamości. |
| Joanna Staude-Potocka | Żabkaretail | 0 | — | Brak jakiejkolwiek wzmianki w 18 przeszukanych źródłach. |
| Izabela Karolczyk-Szafrańska | InPostlogistyka | 2 | IAA | Członkostwo (lista członków) + funkcja w organie IAA. Dwa zapisy nazwiska („Karolczyk – Szafrańska Izabela”) scalone poprawnie. Bez daty. |
| Piotr Chęcielewski | Carlsberg Polskaalko | 1 | Rada Reklamy | Arbiter Komisji Etyki Reklamy, grupa reklamodawców. Rola cykliczna, bez daty kadencji. |
| Aleksandra Danel | Solar Companyodzież | 0 | — | Brak jakiejkolwiek wzmianki w 18 przeszukanych źródłach. |
| Luiza Nowakowska | Krossrowery | 0 | — | Brak jakiejkolwiek wzmianki w 18 przeszukanych źródłach. |
| Jolanta Borowska | Nestlé PolskaFMCG | 2 | IAA | Członkostwo + funkcja w organie IAA. Warianty „Borowska Jolanta” / „Jolanta Borowska” scalone poprawnie. Bez daty. |
| Michał Arament | McDonald's Polskafood | 1 | EFFIE | Juror EFFIE, Grupa XII Long Term — edycja 2026, nie 2025. |
| Małgorzata Rokita | P&G PolskaFMCG | 1 | Rada Reklamy | Sekcja „Arbitrzy w historii Komisji” — sygnał jawnie historyczny, bez możliwości przypisania do roku. |
Przewiń tabelę w bok, aby zobaczyć wszystkie kolumny →
Zero sygnałów mają wyłącznie osoby spoza kręgu organizacji marketingowych: PGE, Allegro, Żabka, Solar Company, Kross. Wszystkie trafienia pochodzą z czterech źródeł — IAA, Rada Reklamy, SAR MBS, EFFIE — i w pięciu przypadkach na dziesięć są to członkostwa, czyli stan, a nie aktywność w danym roku.
4. Pięć luk, które trzeba zamknąć
Run przeszedł po zamkniętej liście rejestrów. 14 z 18 źródeł nie trafiło w nikogo z listy klienta, a 5 osób nie istnieje w zbiorze w ogóle. Klient wprost mówi, że nie poda nam listy konferencji i organizacji — więc wartość WhiteSpy musi leżeć w odkrywaniu źródeł. Dopóki tego nie pokażemy, demo odpowiada na inne pytanie niż zadane.
Data lub edycja jest wypełniona w 193 z 3036 wzmianek, i praktycznie wyłącznie w Złotych Spinaczach i szkołach SAR. Strony rejestrów pokazują stan „dziś”, a jedyne datowane sygnały dla listy POC wskazują na edycję z grudnia 2026. Briefing zakłada ocenę zamkniętego roku 2025 — na obecnych danych świeżość i częstotliwość w scoringu są niepoliczalne.
Osoby o najszerszym pokryciu w zbiorze to w większości ludzie agencji i mediów (Synergion, WPP Media, Wavemaker, Biuro Reklamy TVP), bo to oni obsadzają jury, rady i panele. Ranking zbudowany na samych rejestrach mierzyłby „obecność w obiegu organizacji branżowych”, a nie wpływ CMO. To ten sam błąd co scoring po LinkedInie, tylko z inną osią.
Scalanie wariantów zapisu działa: 189 rekordów ma warianty, a „Borowska Jolanta” i „Jolanta Borowska” trafiły do jednej osoby. Ale firma jest wypełniona w 77% wzmianek, a rola w 66% — to za mało, żeby rozstrzygać homonimy. Widać to na przypadku Michała Szanieckiego, gdzie źródło podaje afiliację „Volkswagen Group Australia”: bez drugiego atrybutu nie da się automatycznie potwierdzić, że to ta sama osoba co CMO z listy.
Briefing wymienia jedenaście klas sygnałów. Run pokrywa realnie cztery: jury, organy i członkostwa, prelegent, wykładowca. Publikacje, raporty, fundacje, uczelnie i role eksperckie w mediach nie mają w tym runie ani jednego źródła. Do tego cała oś „prelegent” stoi na dwóch stronach — infoShare (88% wszystkich wystąpień) i Forum IAB — przy czym infoShare to konferencja technologiczna, więc dla rankingu CMO jest w dużej mierze szumem.
5. Pokrycie typów sygnałów z briefingu
jury konkursów branżowych
EFFIE, MIXX, KTR, Złote Spinacze, DMR — 473 wzmianki
rady i organizacje branżowe
IAA, IAB, SAR, POR, e-Izba, Rada Reklamy — 309 funkcji w organach + 273 członkostwa
speaker / panelista / moderator
1910 wzmianek, ale całość pochodzi z dwóch stron: infoShare (88%) i Forum IAB
wykłady / uczelnie
tylko 50 wzmianek, wyłącznie szkoły SAR — brak uczelni
publikacje eksperckie / naukowe
brak źródła w runie
autorstwo raportów
brak źródła w runie
występowanie jako ekspert (media)
21 wzmianek, wyłącznie „ekspert IAB”
fundacje
brak źródła w runie
rady nadzorcze / role społeczne
brak KRS i źródeł spoza marketingu
6. Jakość schematu normalizacji
Schemat z briefingu (Person / Signal type / Organisation / Role / Date / Source / Confidence) jest odwzorowany. Różnice są w wypełnieniu pól.
| Pole | Wypełnienie | Znaczenie dla scoringu |
|---|---|---|
| Cytat (dowód) | 100% | każda wzmianka ma evidence snippet |
| Firma | 77% | kluczowe dla entity resolution |
| Rola | 65,9% | wejście do wagi roli w scoringu |
| Link do biogramu | 60,5% | druga warstwa dowodu |
| Grupa / sesja | 38,6% | kontekst wydarzenia |
| Data / edycja | 6,4% | blokuje wymiar czasu i świeżość |
| Tytuły | 0,7% | pole praktycznie puste |
Przewiń tabelę w bok, aby zobaczyć wszystkie kolumny →
Warto podkreślić przed klientem dwie rzeczy: 100% wzmianek ma cytat-dowód, a 40 rekordów zostało świadomie zablokowanych jako kontekst niekwalifikujący (sponsor, uczestnik) — czyli filtr kontekstu już działa i jest widoczny w danych. Brakującym elementem jest pole confidence: dziś status dopasowania jest binarny (Matched / Unmatched), a scoring zakłada wartość ciągłą.
7. Długi ogon — dlaczego 2634 osoby to za mało
Rozkład wzmianek na osobę pokazuje, że zbiór jest szeroki, ale płytki.
2334
1 wzmianka
229
2 wzmianki
50
3 wzmianki
14
4 wzmianki
6
5 wzmianek
1
6 wzmianek
88,6% osób ma dokładnie jedną wzmiankę, a tylko 27 osób pojawia się w trzech lub więcej źródłach. Powtarzalność obecności — jeden z komponentów scoringu wskazanych w briefingu — jest dziś mierzalna dla ok. 1% zbioru.
| Osoba o najszerszym pokryciu | Organizacja | Strona rynku | Źródła | Wzmianki |
|---|---|---|---|---|
| Magdalena Kosińska | Versuni / Philips DA | brand | 5 | 6 |
| Teresa Wierzbowska | Cyfrowy Polsat | media | 5 | 5 |
| Michał Kociankowski | Synergion | agencja | 4 | 5 |
| Michał Szczur | WPP Media / Mindshare | agencja | 4 | 5 |
| Dariusz Maciołek | BNP Paribas | brand | 4 | 4 |
| Paweł Gala | Wavemaker | agencja | 4 | 4 |
| Marek Zaborowski | BNP Paribas | brand | 4 | 4 |
| Wojciech Kowalczyk | Biuro Reklamy TVP | media | 4 | 4 |
Przewiń tabelę w bok, aby zobaczyć wszystkie kolumny →
To jest lista, którą wypluje dziś ranking. Żadna z tych osób nie jest na liście klienta.
8. Rekomendowana architektura — trzy warstwy zamiast jednej
Obecny run to jedna warstwa z trzech potrzebnych. Nie trzeba go wyrzucać — trzeba go obudować.
Wachlarz zapytań na osobę (nazwisko × firma × rola × typ sygnału × rok) do search API, potem crawl trafień. To jest ta warstwa, która odpowiada na pytanie klienta „czy znajdziecie źródła, których nie wskażemy”. Dziś jej nie ma — i to jedyny powód, dla którego 5 z 12 CMO ma zero sygnałów.
Obecny run. Wysoka precyzja, dobre dowody, tani rerun. Zostaje jako warstwa bazowa i jako źródło prawdy o rolach formalnych (jury, rady, arbitrzy, członkostwa).
Rejestry pokazują stan „dziś”. Żeby ocenić rok 2025 w 2026, trzeba sięgnąć po archiwalne strony edycji i snapshoty (Wayback) — inaczej wymiar czasu w scoringu jest niepoliczalny.
Docelowy pipeline per osoba
seed (imię + nazwisko + firma + rola + warianty)
→ discovery (wachlarz zapytań × typ sygnału × rok → kandydaci na źródła)
→ crawl + ekstrakcja (obecny silnik WhiteSpy)
→ entity resolution (nazwisko + firma + rola + kontekst branżowy)
→ klasyfikacja sygnału (11 typów z briefingu)
→ datowanie (strona edycji / archiwum / snapshot)
→ confidence (ciągłe, nie binarne)
→ dedup zdarzeń między źródłami
→ scoring (moduł „Metodologia”)Kroki 3–9 są już zbudowane albo prawie zbudowane. Realna praca do POC to kroki 1, 2 i 6.
9. Klasy źródeł do dołożenia
Konkretna mapa tego, czego brakuje, żeby pokryć jedenaście typów sygnałów z briefingu.
Konferencje marketingowe
Forum Marketingu, Kongres Profesjonalistów PR, Impact, Wolves Summit, Mama Marketing, Digital Champions, konferencje branżowe wertykałów (retail, finanse, energetyka)
Uczelnie i studia podyplomowe
SGH, ALK, UW, Uniwersytet SWPS, Collegium Civitas, WSIiZ — sylabusy, wykaz wykładowców, gościnne wykłady
Prasa i portale branżowe
Wirtualnemedia, Press, MarketingPrzykawie, NowyMarketing, Media Marketing Polska — komentarze eksperckie i wywiady
Raporty i publikacje
raporty IAB/SAR/Deloitte/PwC z listą autorów, publikacje uczelniane, Google Scholar
Fundacje i NGO
KRS + rejestr stowarzyszeń, strony fundacji korporacyjnych, rady programowe organizacji społecznych
Podcasty i wystąpienia wideo
YouTube branżowy, podcasty marketingowe — opisy odcinków z afiliacją gościa
Wertykały poza marketingiem
energetyka (Kurnicki), rowery (Nowakowska), moda (Danel) — te osoby żyją w źródłach swojej branży, nie w IAA/IAB
10. Pareto completeness — jak to zmierzyć uczciwie
Klient wie, że nie udowodnimy kompletności. Zamiast tego proponujemy mierzalny recall proxy.
Golden set
Dla 3 osób z listy zbieramy ręcznie możliwie pełny ślad (2–3 h na osobę). To jest mianownik. Pipeline liczymy jako % golden setu odnaleziony automatycznie.
Nasycenie źródeł
Mierzymy, po ilu zapytaniach na osobę przestają pojawiać się nowe źródła. Punkt nasycenia definiuje koszt na osobę i jest twardym argumentem w rozmowie o cenie.
Stabilność między runami
Ten sam seed uruchomiony dwa razy powinien dać ten sam zbiór sygnałów. Powtarzalność jest tym, czego klient realnie potrzebuje do obrony rankingu.
Deklarujemy wobec klienta poziom kompletności, nie kompletność: np. „≥80% golden setu przy nasyceniu po N zapytaniach”. To jest obietnica, której da się dotrzymać i którą da się zweryfikować.
11. Co proponuję na POC (5–10 osób)
Lista 12 osób od klienta jest dobrym zestawem testowym właśnie dlatego, że jest tak zróżnicowana.
- Dobór osób. Trzy profile: obecny w obiegu branżowym (Arament, Karolczyk-Szafrańska), obecny formalnie ale bez aktywności (Pasterczyk, Rokita), niewidoczny w rejestrach marketingowych (Kurnicki, Nowakowska, Danel). Ostatnia grupa jest najważniejsza — to ona rozstrzyga, czy metoda w ogóle działa.
- Golden set na trzech osobach — ręcznie, żeby mieć mianownik do recall.
- Warstwa A (discovery) na całej dziesiątce, z twardym oknem czasowym 2025.
- Wynik do pokazania: tabela sygnałów z dowodem i confidence + recall względem golden setu + koszt i czas na osobę. Bez tych trzech liczb rozmowa o wycenie 50–60 osób jest zgadywanką.
Czego nie obiecywać na spotkaniu: że pokryjemy każdą osobę równie dobrze. Dla CMO spoza kręgu marketingowego (energetyka, rowery, moda) ślad merytoryczny może być obiektywnie cienki — i to jest wynik badania, nie jego porażka. Ranking musi umieć powiedzieć „ta osoba nie zostawia publicznego śladu”, zamiast dorabiać jej punkty.
Wyszukiwanie po osobach — wynik
Punktem wyjścia jest osoba, a źródła są wynikiem. Uruchomione na 12 CMO z listy klienta, 22 zapytaniami.
11/12
CMO z sygnałem
wcześniej 7/12
65
sygnałów łącznie
wcześniej 10
38
nowych źródeł
domen spoza listy startowej
| Miara | Wyszukiwanie po rejestrach | Wyszukiwanie po osobach |
|---|---|---|
| CMO z jakimkolwiek sygnałem | 7/12 | 11/12 |
| sygnałów łącznie | 10 | 65 |
| sygnałów z datą | 0 | 16 |
| sygnałów w oknie 2025 | 0 | 8 |
| pokrytych klas sygnałów (z 11 w briefingu) | 4 | 8 |
| nakład | 57 stron | 22 zapytań |
Przewiń tabelę w bok, aby zobaczyć wszystkie kolumny →
| CMO | Firma | Zapytania | Sygnały |
|---|---|---|---|
| Leszek Kurnicki | PGE · energetyka | 2 | 0→7 |
| Barbara Pasterczyk | ING · finanse | 2 | 1→9 |
| Daniel Rogiński | Allegro · e-commerce | 2 | 0→2 |
| Michał Szaniecki | Volkswagen · automotive | 1 | 2→7 |
| Joanna Staude-Potocka | Żabka · retail | 4 | 0→4 |
| Izabela Karolczyk-Szafrańska | InPost · logistyka | 1 | 2→10 |
| Piotr Chęcielewski | Carlsberg Polska · alko | 1 | 1→3 |
| Aleksandra Danel | Solar Company · odzież | 2 | 0→4 |
| Luiza Nowakowska | Kross · rowery | 3 | 0→0 |
| Jolanta Borowska | Nestlé Polska · FMCG | 1 | 2→5 |
| Michał Arament | McDonald's Polska · food | 2 | 1→10 |
| Małgorzata Rokita | P&G Polska · FMCG | 1 | 1→4 |
Przewiń tabelę w bok, aby zobaczyć wszystkie kolumny →
Nowe źródła spoza listy startowej (38)
Pełna rozpiska sygnał po sygnale: Warstwa A — wyszukiwanie po osobach.
12. Pytania do klienta
- Czy członkostwo w organizacji (stan) i wystąpienie na konferencji (zdarzenie) mają w scoringu ważyć tak samo? Dziś 5 z 10 znalezionych sygnałów to stany, nie aktywność.
- Czy okno oceny to twardy rok kalendarzowy 2025, czy „ostatnie 24 miesiące”? Twardy rok wymaga warstwy archiwalnej i podnosi koszt.
- Czy ranking ma obejmować wyłącznie brand-side, czy także agencje i media? Na obecnych danych góra listy to agencje — to zmienia definicję populacji, nie tylko wagi.
- Jaki próg dowodowy klient akceptuje: czy jedna strona rejestru bez daty to wystarczający dowód sygnału?
- Czy klient udostępni listę 50–60 osób wcześniej — bez niej nie da się przygotować warstwy A ani zmierzyć recall.
Podstawa: cmo_whitespy_raw_20260821.xlsx (arkusze „Wzmianki (raw)”, „Osoby (agregacja)”, „Strony”) oraz briefing „Ranking najbardziej wpływowych CMO w Polsce”. Raport dotyczy wyłącznie Modułu 1; Moduł 2 (Share of Search) jest opisany osobno.