Hvor trygge er vi egentlig?

Direktionen gennemgår et af de initiativer, strategien hviler tungest på. Milepælene for den nuværende fase er nået, forbruget ligger inden for rammen, og de åbne punkter er kendte. Ingen af tallene overrasker.

Så drejer samtalen over på næste fase, som er større og mere tværgående. CEO'en stiller et spørgsmål, som ingen af rapporterne på bordet er bygget til at besvare: »Hvor trygge er vi egentlig ved, at organisationen kan bære næste fase?«

Fire stemmer omkring bordet
  • CCO »Kommercielt synes jeg, vi ser okay ud.«
  • COO »Jeg er mindre tryg ved kapaciteten.«
  • CTIO »Teknologisk er jeg mere bekymret end sidste måned.«
  • Strategichef »Men hvordan følger vi egentlig, om den vurdering bevæger sig?«

De tre første svar kan alle være relevante, men de er svære at holde op mod hinanden. De handler om forskellige dele af næste fase, de bruger forskellige målestokke, og det tredje sammenligner med en vurdering, som ingen har skrevet ned.

Det oplagte svar på strategichefens spørgsmål er en skala. CFO'en er skeptisk, og med god grund: »Jeg er ikke sikker på, at jeg har lyst til at sætte et 1–5-tal på det. Så ser det straks mere præcist ud, end det er.«

CEO'en svarer: »Det er jeg enig i. Men hvis vi ikke strukturerer vurderingen på nogen måde, hvordan ved vi så om en måned, om vores billede faktisk har ændret sig?«

Begge har ret, og det er hele problemet. Et tal kan give en løs vurdering en præcision, den ikke har. Men uden nogen struktur er det svært at se, om vurderingen bevæger sig, og svært at udfordre den med andet end en anden fornemmelse.

Antag, at direktionen alligevel indfører skalaen. Så er problemet ikke løst. Det har skiftet form:

  • Hvad betyder et 3-tal?
  • Hvem skal svare, og hvilken periode gælder svaret?
  • På hvilket grundlag svarer de?
  • Hvad gør vi, når svarene er uenige?
  • Er et 4-tal mere end et 3-tal på en meningsfuld måde, og hvor meget mere?
  • Kan næste måneds svar sammenlignes med denne måneds?
  • Og hvad må vi egentlig konkludere?

Det er de spørgsmål, dette paper handler om.

Et tal gør ikke vurderingen objektiv

Paper 01 skelnede mellem resultatindsigt og eksekveringsindsigt. Paper 02 viste, at én statusfarve ikke nødvendigvis rummer hele billedet af eksekveringen, og sluttede med et spørgsmål: Kan vurderinger af kapacitet, friktion, tiltro og kompetenceparathed overhovedet gøres systematiske uden at blive til falsk objektivitet? Dette paper svarer ja — men kun hvis vi er præcise om, hvad tallet er.

Når relevante forhold i eksekveringen ikke findes som registrerede tal, står ledelsen med noget andet: vurderinger, erfaring, bekymringer, tiltro, parathed og risikovurderinger. Den information bruges allerede. Den bliver sagt i direktionsmødet, den kan præge beslutningerne, og den kan være væk igen, når mødet slutter.

Tesen er min egen syntese, ikke et forskningsresultat: Det kvalitative mister ikke sin usikkerhed, fordi det får et tal. Gevinsten ved kvantificering er ikke sandhed. Gevinsten er struktur.

Struktur betyder her noget ganske bestemt: at det er klart, hvad der blev spurgt om, hvem der svarede, hvad svarmulighederne betyder, og hvad svaret skal bruges til. Det er en mere beskeden ambition end objektivitet, men det er en ambition, tallet faktisk kan leve op til.

Et tal gør ikke en vurdering objektiv. Men en klart defineret skala kan gøre vurderingen synlig nok til at blive sammenlignet, udfordret og fulgt over tid.— Thomas Friisnæs

Paperet forsøger altså ikke at gøre mavefornemmelser til fakta. Det forsøger nærmest det modsatte: at gøre det tydeligt, hvornår et tal bygger på en vurdering, så ingen forveksler det med en registreret hændelse, og så vurderingen får den plads i ledelsesinformationen, den kan bære. Hverken mere eller mindre.

Titlen er lidt upræcis med vilje

»Det kvalitative kan godt kvantificeres« er en ledelsestitel, ikke en metodebeskrivelse. I forskningsmetodisk forstand er interviewtekst, åbne kommentarer, fortællinger og observationsnoter eksempler på kvalitative data. Når en leder svarer »4« på et spørgsmål om tiltro, er vurderingen allerede registreret som strukturerede ordinale data: svar i ordnede kategorier, der er givet et tal.

I hverdagens ledelsessprog kalder vi ofte tiltro, parathed og oplevet kapacitet for »bløde« eller kvalitative størrelser. Metodisk er pointen mere præcis: Vi kan strukturere en subjektiv vurdering og registrere den numerisk. Det gør vurderingen kvantificerbar. Det gør ikke automatisk det underliggende fænomen objektivt målt.

Skellet betyder noget, fordi »at kvantificere det kvalitative« kan dække over tre forskellige ting:

Tre måder at kvantificere det kvalitative
  • 1 · Kode observationer tilbagevendende observationer eller tekst sorteres i definerede kategorier, som kan tælles.
  • 2 · Strukturere vurderinger en person placerer sin vurdering på en ordnet svarskala med definerede ankre.
  • 3 · Kombinere mål flere tal lægges sammen til én samlet score.

Dette paper handler primært om nummer 2. Nummer 3 rejser sine egne metodespørgsmål og får sit eget paper senere i serien.

Titlen peger derfor på et andet skel end det mellem kvalitativt og kvantitativt. En vurdering kan være formuleret i ord og stadig være skarp, og et tal kan stå på et dashboard og stadig være uklart.

I ledelsesopfølgning er et vigtigere skel ofte, om vurderingen er implicit eller gjort efterprøvbar.— Thomas Friisnæs

Fire slags tal

I en ledelsesrapport kan alle tal se ens ud, men de kan bygge på vidt forskellige slags observationer.

Model · Evidenstype
Fire slags tal

Illustrative eksempler, ikke tal fra en bestemt organisation.

Slags talHvad tallet hviler på
Registrerede hændelser»7 åbne beslutninger«En optælling efter en registreringsregel. Du skal vide, hvad der tæller som en åben beslutning.
Forholdstal»en lukkerate på 80 %«En tæller og en nævner. Du skal vide, hvad der tæller som lukket, og hvad de 80 % er en andel af.
Ordinale vurderinger»4 på en defineret skala for tiltro«En persons placering af sin vurdering i ordnede kategorier. Du skal vide, hvem der har svaret, hvad kategorierne betyder, og hvilken periode svaret gælder.
Sammensatte indeks»en score bygget på flere signaler«Flere tal, der er lagt sammen efter en række metodevalg. Du skal vide, hvad der indgår, og hvordan det er lagt sammen.
At alle fire ender som tal, betyder ikke, at de har samme evidensstatus.

Det er for enkelt at kalde de to første »hårde data« og de to sidste »bløde«. Også registrerede tal hviler på definitioner. En åben beslutning afhænger af, hvornår en beslutning tæller som rejst, og hvornår den tæller som truffet. En nået milepæl afhænger af baseline og af reglerne for ændringer i planen. En risikohændelse afhænger af, hvad der bliver registreret. Og en lukkerate afhænger af nævneren.

Forskellen er ikke mellem tal, der er sande, og vurderinger, der er subjektive. Forskellen er, hvilken slags observation tallet bygger på, og hvilken usikkerhed det bærer.— Thomas Friisnæs

Definitionerne gør dog ikke alle tal til samme slags evidens. Omsætning og likviditet hviler på regnskabsregler og kontroller, og en lukkerate eller en milepælsdato kan efterprøves mod det, der er registreret. En vurdering af tiltro kan ikke efterprøves på samme måde. Et 4-tal på en vurderingsskala har derfor en anden evidensstatus end en lukkerate på 80 %. Det gør ikke vurderingen irrelevant, men den skal læses som det, den er. Findes der andre registrerede data, der belyser det samme ledelsesspørgsmål, bør de ses sammen med vurderingen. Hvilken evidenstype der er mest direkte, afhænger af det fænomen, vi forsøger at vide noget om.

Forskellen i evidensstatus betyder især noget for den fjerde slags tal: Når flere forskellige evidenstyper kombineres i ét tal, begynder et nyt metodisk problem.

Strategisk observabilitet kræver ikke, at alt kan observeres på samme måde. Den kræver, at vi ved, hvilken type observation vi står med.

Hvornår er et tal en måling?

Ordet »måling« bliver brugt løst i ledelsessprog, og det er et problem, fordi ordet kan love mere, end en struktureret vurdering kan holde. Det hjælper at skille fire ting ad.

Det, nogen mener

Vurdering

En persons eller en gruppes bedømmelse af et forhold. »Vi er ret trygge ved næste fase« er en vurdering.

Det, der bliver skrevet ned

Registrering

Den form, vurderingen fastholdes i: tekst, kategori, tal eller skala. Et 4-tal er en registrering.

Det, der skal kunne forsvares

Måling

En langt stærkere påstand: at registreringen giver forsvarlig information om et bestemt fænomen til et bestemt formål.

Det, ingen score bliver af sig selv

Sandhed

Ikke noget, en score automatisk bliver. Heller ikke når den er konsistent og vises med decimaler.

Samuel Messick argumenterede i 1995 for en samlet forståelse af validitet, der både omfatter betydningen af en score og de fortolkninger og handlinger, scoren bruges til, herunder konsekvenserne af brugen. Artiklens titel siger det kort: Validering handler om de slutninger, vi drager af personers svar, og om, hvad scoren betyder.

Forskningsgrundlag (måle- og validitetsteori): Messick (1995), »Validity of psychological assessment: Validation of inferences from persons' responses and performances as scientific inquiry into score meaning«, American Psychologist, 50(9), 741–749: teoretisk artikel om validitet i uddannelses- og psykologisk måling, ikke et empirisk studie og ikke om ledelsesdata. Bruges alene til princippet om, at validitet angår scorens betydning, fortolkning og anvendelse.

De amerikanske Standards for Educational and Psychological Testing formulerer et tilsvarende princip som professionel standard. Validitet defineres som den grad, hvormed evidens og teori understøtter fortolkningen af testscorer til den tilsigtede anvendelse, og standarderne understreger, at det er fortolkningen til en bestemt anvendelse, der vurderes, ikke testen selv. De tilføjer, at hvor meget og hvilken evidens der er tilstrækkelig, kan afhænge af, hvad der står på spil.

Professionel standard: AERA, APA & NCME (2014), Standards for Educational and Psychological Testing, kapitel 1 om validitet (s. 11–13), frit tilgængelig: standarder for uddannelses- og psykologisk testning, ikke for ledelsesinformation. Bruges kun overordnet til princippet om, at fortolkningen til et bestemt formål skal underbygges, og at evidenskravet kan afhænge af, hvad der står på spil. Overførslen til eksekveringssignaler er min.

Oversat til ledelsesbrug bliver pointen enkel: Et tal er ikke validt i sig selv. Det afgørende er, hvilken fortolkning og anvendelse tallet forventes at kunne bære — og hvilken evidens der understøtter det.

Forestil dig, at teamets svar på et spørgsmål om tiltro til næste fase er lavere end sidst.

Tre påstande ud fra det samme tal
  • Svag påstand »Teamets rapporterede tiltro er lavere end sidste gang, det samme spørgsmål blev stillet til de samme personer.« Kan være forsvarlig, hvis skalaen og ankrene også er de samme.
  • Stærkere påstand »Teamet har mistet evnen til at levere.« Kræver en helt anden slags evidens.
  • Meget stærkere påstand »Strategien vil fejle.« Kan ikke læses ud af scoren alene.

Jo stærkere påstand du vil lave ud fra et tal, desto stærkere evidens skal tallet kunne bære.— Thomas Friisnæs

Reliabilitet handler om konsistensen og præcisionen i de scorer, en måleprocedure producerer under relevante betingelser. Den fortæller ikke i sig selv, om scoren repræsenterer det fænomen, vi tror. Validitet handler om, hvorvidt den tilgængelige evidens understøtter den fortolkning og brug, vi giver scoren. Et spørgsmål kan give konsistente scorer og stadig fange respondenternes generelle optimisme snarere end deres vurdering af næste fase. Et konsistent tal kan stadig fortælle dig noget andet end det, du tror, det fortæller dig.

Subjektiv betyder ikke værdiløs

Den modsatte fejl ligger lige for: at afskrive alt, der ikke er registreret, som »bare holdninger«. Mange strategisk vigtige forhold rummer oplevelse og vurdering: tiltro til en lancering, oplevet parathed i salget, oplevet friktion og forventninger til næste fase. De kan være relevante, netop fordi de er oplevelser. Spørger ledelsen »Hvor sikker føler teamet sig på, at næste fase kan leveres under de nuværende betingelser?«, er teamets subjektive tiltro ikke støj i svaret. Den er selve det fænomen, der bliver spurgt om.

Men så skal man også holde fast i, hvad svaret er. Tiltro er ikke det samme som kapabilitet. Tiltro er ikke en sandsynlighed. Og tiltro er ikke det fremtidige udfald. Et team med høj tiltro kan tage fejl, og et team med lav tiltro kan levere. Svaret fortæller, hvordan de, der svarede, rapporterede deres vurdering under spørgsmålets definition, ikke hvordan det vil gå. En struktureret selvvurdering kan gøre tiltroen eksplicit. Den kan ikke fortælle dig, om tiltroen er velkalibreret.

Det samme gælder parathed. En vurdering af kompetenceparatheden til næste fase er ikke en færdighedstest, et assessment center eller dokumenteret kompetence, men en struktureret vurdering af paratheden i forhold til de krav, der er defineret. Hvilken evidens der kan understøtte den, går serien i dybden med senere.

Derfor holder jeg fast i en enkel sætning: Subjektive data bliver ikke objektive af at få et tal. De kan blive mere eksplicitte, mere ensartede i formen og lettere at sammenligne. De bliver ikke automatisk mere korrekte.

Operationel opfølgning kan godt bruge ét enkelt spørgsmål med beskrevne ankre til at følge, om en vurdering bevæger sig. Men så skal det kaldes det, det er: et signal, en struktureret vurdering, ikke en valideret måling af hele det fænomen, spørgsmålet peger på.

Tallet skal heller ikke fortrænge ordene. Nogle oplysninger mister værdi, hvis de reduceres til en score. En kommentar kan forklare en afvigelse, bringe et problem frem, som ingen havde spurgt til, og afsløre, at spørgsmålet selv mangler noget. En score med en kort begrundelse kan være mere brugbar end hver af dem alene. Tallet gør bevægelsen synlig. Kommentaren kan gøre den forståelig.

Det fører til en pointe, enhver direktion kan holde op mod sin egen praksis: Hvis kvalitative vurderinger allerede påvirker jeres strategiske beslutninger, er spørgsmålet ikke, om de eksisterer. Spørgsmålet er, om de er strukturerede nok til, at I kan se, når de ændrer sig.

Hvad betyder et 3-tal?

En vurderingsskala ser enkel ud: fem tal på en række. Men i det øjeblik svarkategorier som »i lav grad«, »i nogen grad« og »i høj grad« bliver til 1, 2 og 3, er der truffet et valg, som er let at overse. Rækkefølgen er kendt. Afstandene er det ikke automatisk.

Lukas Sönning gennemgår i en metodeartikel fra 2024, hvordan ordnede svarskalaer bruges og analyseres. I den sprogforskning, artiklen behandler, bliver svarene normalt omsat til tal, hvorefter der beregnes gennemsnit, som om afstandene mellem kategorierne var kendte. Ifølge Sönning er de som regel ukendte, og den oplevede afstand mellem to kategorier afhænger først og fremmest af, hvordan respondenterne forstår etiketterne.

Forskningsgrundlag (metodeartikel): Sönning (2024), »Ordinal response scales: Psychometric grounding for design and analysis«, Research Methods in Applied Linguistics, 3(3), 100156: gennemgang af brugen af ordnede svarskalaer i sprogforskning og af den psykometriske litteratur om, hvordan skalaetiketter opfattes, med et casestudie. Konteksten er anvendt lingvistik, ikke ledelse. Bruges alene til den generelle pointe om rækkefølge og afstande på ordnede skalaer.

Et 4-tal er højere end et 3-tal på en ordnet skala. Det betyder ikke automatisk, at forskellen mellem 3 og 4 er den samme som mellem 1 og 2. Og et 4-tal er ikke dobbelt så meget tiltro som et 2-tal. Det kræver ingen statistik at tage højde for det, kun at man ikke læser mere ind i tallene, end skalaen giver grundlag for.

Her kommer ankrene ind. Hvis det ikke er defineret, hvad 1, 3 og 5 betyder, kan to respondenter besvare forskellige spørgsmål med det samme tal. Den ene læser 3 som »det går nok«, den anden som »jeg er bekymret, men vil ikke slå alarm«. Ankre fjerner ikke subjektiviteten, og de validerer ikke skalaen. De kan give respondenterne et mere fælles udgangspunkt for svaret.

Tag spørgsmålet »Hvor trygge er vi ved at kunne levere næste fase under de kapacitets- og afhængighedsforhold, vi kender i dag?« En nøgen skala fra 1 til 5 overlader betydningen til den enkelte. En skala, hvor i det mindste yderpunkterne og midten er beskrevet, kunne for eksempel se sådan ud:

Illustration · ankre til ét spørgsmål
  • 1 Vi kan ikke se, hvordan næste fase kan leveres under de forhold, vi kender i dag.
  • 3 Vi vurderer, at næste fase kan leveres, men kun hvis bestemte kendte forudsætninger holder.
  • 5 Vi vurderer, at næste fase kan leveres under de kendte forhold uden væsentlige forbehold.

Eksemplet bruger fem kategorier, men det er ikke en anbefaling af fem frem for tre eller syv. Ankrene viser kun forskellen på et tal og et defineret tal.

Respondenten er en del af data

Et svar på en vurderingsskala er ikke kun information om det, der spørges om. Det er også formet af, hvem der svarer, hvordan og hvornår.

Podsakoff og kolleger samlede i 2024 forskningen i common method bias: skævheder, der kan opstå, når målingerne deler metode, for eksempel fordi den samme kilde svarer på flere spørgsmål. Titlen er et resumé i sig selv: Problemet er skadeligt, komplekst, udbredt og ikke let at løse. Ifølge forfatterne har skævhederne flere kilder, hvoraf adskillige sandsynligvis er til stede i ethvert studie.

Forskningsgrundlag (forskningsoversigt): Podsakoff, Podsakoff, Williams, Huang & Yang (2024), »Common Method Bias: It's Bad, It's Complex, It's Widespread, and It's Not Easy to Fix«, Annual Review of Organizational Psychology and Organizational Behavior, 11, 17–61: oversigt over årsager, konsekvenser og håndtering af common method bias i organisationsforskning. Handler om forskningsdesign, ikke om ledelsesinformation. Bruges til pointen, at metodeskævheder har flere mulige kilder og ikke kan fjernes med ét greb, ikke som argument for, at selvrapporterede data (self-report) er upålidelige.

Oversat til eksekveringssignaler: Hvis den samme person på det samme tidspunkt og i det samme format vurderer både tiltro, kapacitet og risiko, kan svarene dele påvirkninger, der ikke har med de tre forhold at gøre. Det kan være personens måde at bruge skalaen på, dagsformen, situationen omkring besvarelsen eller et ønske om at fremstå konsistent. Det gør ikke svarene ubrugelige. Men det betyder, at når flere selvrapporterede signaler bevæger sig sammen, må det ikke automatisk læses som uafhængig bekræftelse. Tre signaler, der falder samtidig fra den samme kilde, er ikke nødvendigvis tre uafhængige advarsler.

Det naturlige modtræk er at hente andre perspektiver ind, for eksempel andre respondenter eller registrerede hændelser. Det kan være klogt, men der findes ingen regel om, at et signal kræver tre kilder, og hvad der giver mening, afhænger af formålet. Et ekstra perspektiv kan øge informationsværdien. Det bliver ikke automatisk sandheden, bare fordi flere er enige.

Omvendt er uenighed mellem respondenter ikke automatisk et tegn på manglende alignment, manglende selvindsigt eller dysfunktion. Ser den initiativansvarlige og teamet næste fase forskelligt, kan de have forskellig information, forskellig afstand til arbejdet eller forskellige forventninger. En forskel er et spørgsmål, ikke en dom.

To praktiske forhold hører med. Svarbetingelserne kan påvirke, hvor villige folk er til at svare ærligt, så hvem der ser svarene, og hvad de bruges til, er en del af designet. Og manglende svar er et datakvalitetsspørgsmål i sig selv. De er ikke det samme som lav tiltro, og de fortæller ikke, hvad den, der ikke svarede, mener.

Samme gennemsnit, forskelligt billede

Antag, at fem ledere i hver af to ledergrupper svarer på det samme spørgsmål om tiltro til næste fase på en skala med beskrevne ankre, og at svarene kodes som tal fra 1 til 5. Jeg bruger her det aritmetiske gennemsnit af de numerisk kodede svar som en velkendt operationel opsummering — ikke som en påstand om, at afstandene mellem skalaens kategorier er dokumenteret lige store.

Illustration · fem svar på den samme skala fra 1 til 5
Samme tal. Forskelligt billede.
Gruppe A
33333
Numerisk gennemsnit
af kodede svar3
Alle fem placerer sig i midten.
Gruppe B
12345
Numerisk gennemsnit
af kodede svar3
Svarene spænder over hele skalaen.
Niveau uden spredning fortæller ikke hele historien.

Det samme numeriske gennemsnit kan dække over meget forskellig svarfordeling. Og i en gruppe på fire, der svarer 1, 1, 5 og 5, har ingen overhovedet svaret det gennemsnit, der står i rapporten.

Et gennemsnit uden spredning kan skjule den vigtigste information: om organisationen faktisk ser det samme billede. Spredningen er ikke et risikosignal i sig selv, men den er en invitation til at spørge, hvad de forskellige respondenter ser, som de andre ikke ser. Princippet kræver ingen statistik: Vis både niveau og uenighed, når uenigheden er ledelsesrelevant.

Når tallet flytter sig

Det samme forbehold gælder bevægelser. Stiger det numeriske gennemsnit fra 3,2 til 3,6, er det en ændring i organisationens valgte operationelle opsummering af de kodede svar, ikke en direkte målt ændring på en intervalskala. Og det er ikke en fremgang på 12,5 procent, uanset hvad et regneark foreslår. Bevægelsen kan afspejle en reel ændring i tiltroen. Men den kan også skyldes, at andre personer har svaret, at spørgsmålet er blevet forstået anderledes, at referencepunktet har flyttet sig, at noget midlertidigt har præget besvarelsen, eller at der blot er tale om tilfældig variation. »Steget signifikant« hører kun hjemme i rapporten, hvis det faktisk er testet. Selv da siger bevægelsen ikke, hvad årsagen er.

Alligevel kan bevægelsen være vigtig. Et gennemsnit på 3 kan være mindre interessant end et numerisk gennemsnit, der under sammenlignelige forhold går fra 4,2 over 3,8 til 3,3. I eksekveringsopfølgning kan bevægelsen nogle gange være mere ledelsesrelevant end selve niveauet. Men en tendens er ikke en diagnose. Den kan fortælle, at noget er værd at undersøge, men ikke hvad.

Og så er der decimalerne. Viser et dashboard tiltroen som 3,742, er det værd at spørge, om den præcision er begrundet. Tre decimaler kan få en usikker vurdering til at ligne en præcis måling. De gør den ikke mere præcis. Visningen bør ikke love mere præcision, end vurderingen kan bære. Paper 02 viste, at præcision og dækningsgrad ikke er det samme. Præcision i visningen er heller ikke det samme som præcision i målingen.

Sammenlignelighedskontrakten

At følge en vurdering over tid forudsætter, at man sammenligner noget sammenligneligt. Jeg kalder det sammenlignelighedskontrakten: To opgørelser er lettere at fortolke, jo mere af følgende der er uændret.

Sammenlignelighedskontrakten
  • Samme spørgsmål det samme fænomen, formuleret på samme måde
  • Samme ankre kategorierne betyder det samme som sidst
  • Samme horisont svaret gælder den samme tidsramme
  • Sammenlignelige respondenter det er i det væsentlige de samme, der svarer
  • Samme metode indsamling og opgørelse er uændret

Kontrakten er et praktisk ideal, ikke et krav om perfekt sammenlignelighed. Ændres noget, skal det dokumenteres. En bedre formulering kan forbedre signalet og samtidig bryde sammenligneligheden med det, der kom før. Det er ikke en grund til at lade være, men en grund til ikke at sammenligne i det stille, som om tidsserien var uændret.

Hvor tit spørgsmålet skal stilles, afhænger af, hvor hurtigt fænomenet meningsfuldt kan ændre sig, og hvor hurtigt ledelsen realistisk kan handle. For et nyt signal kan den mest forsvarlige første brug være at følge den samme organisation eller det samme initiativ over sammenlignelige perioder frem for at foregive at kende en universel »god« score. Og en tærskel som »under 3 er rødt« kan være en bevidst valgt styringskonvention, men den skal kaldes det og ikke fremstå som et forskningsresultat.

Stringensen ligger ikke i tallet

To eksempler fra praksis viser, hvor meget arbejde der kan ligge bag en score, og hvad scoren alligevel ikke beviser.

McKinseys Organizational Health Index (OHI) er et surveybaseret instrument, der opgør organisatorisk sundhed på ni dimensioner med en række ledelsespraksisser under hver. Ifølge en artikel fra 2024 omfattede den seneste fornyelse en forskningsindsats i flere faser i 2023 med deltagelse af knap 9.000 medarbejdere verden over. Indsatsen skulle validere spørgsmål til nye begreber og forfine de eksisterende, så den opdaterede survey kunne stilles til rådighed for bred brug i 2024.

Spørgsmålene retter sig mod konkrete ledelsespraksisser frem for en vag, generel stemning, men svarene er stadig medarbejdernes rapporterede observationer og oplevelser. Pointen er ikke, at en stor rådgivningsvirksomhed har gjort oplevelser objektive. Pointen er, at en seriøs metode ikke bliver stringent af at bede om scorer. Begreberne og spørgsmålene udvikles, testes og revideres over tid.

Praktikerevidens (McKinsey & Company, 2024): De Smet, Gast, Goldstein & Steele, »Healthy organizations keep winning, but the rules are changing fast«, McKinsey Quarterly, 2. august 2024: virksomhedens egen beskrivelse af opdateringen af OHI; proprietær praktikermetode, ikke uafhængig validering. Artiklens udsagn om sundhed og afkast bruges ikke. Bruges alene som eksempel på det udviklings- og testarbejde, der kan ligge bag en survey.

Gallups Q12-instrument er det andet eksempel. Ifølge Gallup bygger instrumentet på mere end 30 års kvantitativ og kvalitativ forskning, og både reliabiliteten og evidensen for konvergent og kriterierelateret validitet er undersøgt i stort omfang, ligesom en række studier har set på instrumentets egenskaber på tværs af kulturer. Den 11. udgave af Gallups meta-analyse fra 2024 samler 736 studier fra 347 organisationer i 53 brancher med medarbejdere i 90 lande, i alt 183.806 forretnings- og arbejdsenheder med 3.354.784 medarbejdere, og undersøger sammenhængen mellem engagement og en række forretningsudfald på enhedsniveau.

Det er stor og metodisk omfattende praktikerforskning, men den har tydelige grænser. Studierne er udført af Gallup som proprietær forskning for de deltagende organisationer, rapporten adresserer ifølge forfatterne ikke direkte spørgsmålet om årsagssammenhænge, og den validerer hverken andre medarbejderundersøgelser eller vurderinger af tiltro og kompetenceparathed.

Praktikerforskning (Gallup, 2024): Harter, Tatel, Agrawal, Blue, Plowman, Asplund, Yu & Kemp, The Relationship Between Engagement at Work and Organizational Outcomes: Q12® Meta-Analysis, 11th Edition, maj 2024 (revideret juli 2024): meta-analyse af Gallups egne, proprietære studier på enhedsniveau. Instrumentets spørgsmål og rapportens effektstørrelser gengives ikke. Bruges alene som eksempel på den udviklings- og valideringsdisciplin, der kan ligge bag ét surveyinstrument.

Sammen viser de to eksempler noget snævert, men vigtigt: Store rådgivnings- og analysevirksomheder omsætter allerede oplevelser og observerede praksisser til strukturerede scorer. Stringensen kommer fra definitionen af begreberne, designet af spørgsmålene, gentagen test, validering og disciplineret fortolkning, ikke fra, at der står et tal. Det gælder også sammenligninger. En benchmark giver kun mening, når spørgsmål, ankre og populationer er sammenlignelige.

Advarslen er ikke ny. I 2003 beskrev Christopher Ittner og David Larcker i Harvard Business Review, hvordan virksomheder i stigende grad målte ikke-finansielle forhold som kundeloyalitet og medarbejdertilfredshed, men også, hvordan mange af dem ikke knyttede målene til strategien eller efterprøvede de sammenhænge, de antog. Blandt de fejl, de fremhævede, var mål uden tilstrækkelig statistisk validitet og reliabilitet. Problemet var ikke de ikke-finansielle mål, men hvordan de blev valgt, analyseret og brugt. Et blødt mål bliver ikke strategisk nyttigt, blot fordi det står på et dashboard.

Praktikerartikel (Harvard Business Review, 2003): Ittner & Larcker, »Coming Up Short on Nonfinancial Performance Measurement«, Harvard Business Review, 81(11), 88–95, 139: artikel for ledere baseret på forfatternes feltforskning, ikke et fagfællebedømt eksperimentelt studie. Bruges som påmindelse om, at ikke-finansielle mål skal kobles til strategien og efterprøves, ikke som evidens for, at bestemte mål er ledende.

Fra vurdering til signal

De fem bevægelser nedenfor er min praktiske refleksionsramme, ikke en score og ikke en modenhedsmodel. De bruges på én tilbagevendende vurdering ad gangen.

Framework
Fra vurdering til signal
Thomas Friisnæs' praktiske refleksionsramme til at gøre én vurdering efterprøvbar. Ingen score, intet indeks og ingen forudsigelse.
1

Fænomenet

Hvad er det præcis, vi forsøger at vide noget om? »Hvordan går det?« er for bredt til at kunne følges meningsfuldt over tid. »Hvor stor er teamets rapporterede tiltro til at kunne levere næste fase under de forudsætninger, vi kender i dag?« kommer tættere på. Ét fænomen og ét spørgsmål ad gangen.

2

Ankeret

Hvad betyder svarmulighederne? En nøgen række fra 1 til 5 er svagere end en skala med beskrevne ankre. Definér som minimum den lave ende, den høje ende og midten, hvis skalaen har en. Der findes ingen universel skalalængde.

3

Kilden

Hvem vurderer — og på hvilket grundlag? Er det den initiativansvarlige, teamet, flere funktioner eller sponsoren, og hvilken periode gælder svaret? Det samme svar fra forskellige kilder kan betyde forskellige ting.

4

Mønstret

Hvad viser niveau, spredning og udvikling over tid? Se efter bevægelse, vedvarende forskelle, polarisering, manglende svar og ændringer i, hvem der svarer. Det kræver ingen avanceret statistik, kun at gennemsnittet ikke står alene.

5

Prøven

Hvilken anden information ville få os til at styrke, svække eller ændre vores fortolkning? Det kan være registrerede hændelser, udviklingen i milepælene, begrundelserne i svarene, en anden respondentgruppe eller et senere udfald. Det gør scoren til evidens, der kan styrke eller svække en fortolkning, ikke til sandhed.

Rammen ender ikke i et indeks, en årsagspåstand eller en forudsigelse. Den ender i seks linjer: ét defineret fænomen, ét struktureret spørgsmål, ét svarformat med beskrevne ankre, én kendt kilde, én fortolkningsregel og ét evidenstjek.

Illustration
Den samme vurdering i tre versioner
Version 1

Ustruktureret

»Vi er ret trygge ved næste fase.«

Ledelsen ved
At nogen oplever det sådan lige nu. Ikke hvem, hvor trygge eller i forhold til hvad.
Version 2

Struktureret

»Hvor trygge er I ved at kunne levere næste fase under de kapacitets- og afhængighedsforhold, I kender i dag?« Svar: 4 på en skala, hvor 1, 3 og 5 er beskrevet.

Ledelsen ved
Hvad der blev spurgt om, og hvad svaret betyder på skalaen.
Version 3

Kvalificeret

Samme spørgsmål og skala. Fem ledere med ansvar for næste fase har svaret med de kommende 90 dage som horisont. Svarene ligger mellem 3 og 5, og to af begrundelserne peger på den samme integration.

Ledelsen ved
Hvem der har svaret, for hvilken periode, hvor enige de er, og hvad begrundelserne peger på.
Den tredje version er ikke sandheden. Den er bedre specificeret information.

Hellere en gennemsigtig, struktureret vurdering end en præcist udseende score uden definition.

Læringssløjfen
  1. Definér
  2. Observér
  3. Sammenlign
  4. Konfrontér med anden evidens
  5. Justér definitionen, hvis det er nødvendigt
Et godt signalsystem bliver ikke kun brugt. Det bliver også lært på.

Det betyder ikke løbende metodeskift. Sammenlignelighedskontrakten gælder også her.

Når en vurdering får et fælles spørgsmål, fælles ankre og en gennemsigtig metode, bliver informationen lettere at dele, og ledelsen bliver mindre afhængig af én persons oversættelse af »det ser egentlig fint ud«. Det gør ikke metodearbejdet mindre vigtigt. Tværtimod: Jo lettere et signal bliver at dele med ledelsen, desto vigtigere bliver det, at nogen ejer definitionen bag det. Her kan et stærkt Strategy Office skabe værdi gennem definitioner, metode, regler for, hvem der svarer, kadence, sammenlignelighed, datakvalitet og kvalificeret fortolkning.

Hvad kunne du se tidligere?

Den første faste rubrik handler i Paper 03 om vurderinger, der allerede bliver sagt, men som endnu ikke kan sammenlignes fra gang til gang.

Seriens signatur · Paper 03
Hvad kunne du se tidligere?
Det, der bliver sagtEn mulig struktureret observation
»Teamet virker mindre trygt.«En sammenlignelig ændring i teamets svar på det samme definerede spørgsmål om tiltro
»Vi er ikke helt sikre på kompetencerne.«En vurdering af parathed i forhold til definerede krav, med usikkerhed og begrundelse
»Kapaciteten ser stram ud.«En defineret vurdering af, om den planlagte kapacitet er realistisk
»Risikoen ved lanceringen føles højere.«En konsistent vurdering af lanceringsrisikoen på en skala med beskrevne ankre

Illustrative operationaliseringer — ikke validerede ledende indikatorer.

Tabellen påstår ikke, at de strukturerede observationer forudsiger noget. Den viser kun, hvordan en vurdering, der i dag bliver i samtalen, kan blive synlig nok til at blive fulgt og udfordret.

Hvad må du ikke konkludere?

Den anden faste rubrik er særlig vigtig her, fordi et tal på en vurdering let bliver læst som mere, end det er.

Seriens signatur · Paper 03
Hvad må du ikke konkludere?

Ud fra en lav tiltroscore alene kan du ikke konkludere …

  • at leverancen vil fejle
  • at teamet mangler kompetence
  • at ledelsen er svag

Ud fra en høj tiltroscore alene kan du ikke konkludere …

  • at leverancen sandsynligvis lykkes

Ud fra en høj parathedsscore alene kan du ikke konkludere …

  • at den nødvendige kapabilitet objektivt er til stede
  • at de fremtidige krav er kendt

Ud fra en bevægelse i scoren alene kan du ikke konkludere …

  • hvad årsagen er
  • hvad det betyder for forretningen
  • at ændringen er statistisk signifikant

Ud fra enighed alene kan du ikke konkludere …

  • at vurderingen er sand

Ud fra et tal alene kan du ikke konkludere …

  • at vurderingen bag er objektiv
Et tal kan gøre en vurdering lettere at følge. Det gør ikke vurderingen mere sikker, end dens metode tillader.

Det gælder hele vejen op. En bestyrelse har normalt ikke brug for rå svar fra pulsundersøgelser. Men eskaleres et kvalitativt eksekveringssignal, bør bestyrelsen kunne se, hvad signalet betyder, om det er en tendens eller en enkelt observation, og hvilken usikkerhed det bærer. Jo stærkere beslutning der skal træffes på baggrund af et tal, desto stærkere skal evidensen bag fortolkningen være.

Gør én vurdering efterprøvbar

Individuel øvelse · CEO, direktionsmedlem eller strategiansvarlig · Skriftlig
⏱ Cirka 10 minutter · Ingen score og ingen modenhedsvurdering. Øvelsen skal ende i ét efterprøvbart signaldesign for én vurdering.

Vælg én formulering fra jeres seneste strategidrøftelser, for eksempel »Vi er rimeligt trygge ved næste fase«. Svar skriftligt og i rækkefølge.

  1. Hvad er det præcis, vi vurderer?
  2. Hvorfor er vurderingen relevant for en strategisk beslutning?
  3. Hvem har bedst grundlag for at svare?
  4. Hvilken tidshorisont gælder?
  5. Hvilke ord skal definere den lave ende af skalaen?
  6. Hvad betyder midten?
  7. Hvad betyder den høje ende?
  8. Skal svaret ledsages af en kort begrundelse?
  9. Hvilken anden information kan udfordre vurderingen?
  10. Hvad ville ledelsen realistisk gøre anderledes, hvis signalet ændrede sig?

Øvelsen ender ikke i en vurdering af, hvor modne I er, men i et design: én vurdering omsat til ét efterprøvbart signal. Kan I ikke besvare spørgsmål 10, er det også et svar.

Afvis ikke fornemmelsen. Spørg til den.

⏱ 2 minutter · ved næste strategimøde

To spørgsmål. Ingen ny software og intet surveyprojekt.

Når nogen siger »Jeg tror …«, »Jeg føler …«, »Det virker som …« eller »Vi er ret sikre på …«, så afvis det ikke. Spørg: »Hvis vi skulle kunne se, om den vurdering ændrer sig næste gang, hvad præcis skulle vi så spørge om?«

Derefter: »Hvad skulle et lavt og et højt svar betyde?«

Og stop så der. Spørgsmålene gør ikke vurderingen til en måling. De viser kun, om den kan gøres efterprøvbar.

Gør det konkret — og fortsæt din vej gennem serien

Paper 03 · Det kvalitative kan godt kvantificeres Ikke gennemført endnu

Serien er bygget til at blive brugt, ikke bare læst. Skriv ét konkret næste skridt; det gemmes kun lokalt i din browser.

Skriv fænomenet, hvem der skal svare, skalaen og dens ankre, tidshorisonten, den begrundelse eller evidens, der skal følge med svaret, og den beslutning, signalet skal kunne informere. Eksempel: »Tiltroen til næste fase i initiativ X. De ledere, der er ansvarlige for næste fase, svarer på det samme spørgsmål på en skala, hvor 1, 3 og 5 er beskrevet, med de kommende 90 dage som horisont og med en kort begrundelse. Signalet skal hjælpe direktionen med at afgøre, om integrationsplanen skal drøftes særskilt.« Eksemplet er en illustration, ikke en anbefaling, og det indeholder ingen tærskel.

✓ Gemt lokalt
Din vej gennem Strategien sker mellem kvartalerne0 af 10 gennemført
Se alle serier i Executive Library →

FAQ

Gør et tal ikke bare en mavefornemmelse mere videnskabelig, end den er? +
Jo, det er præcis risikoen. Derfor skal kvantificeringen gøre usikkerheden synlig, ikke skjule den: hvad der blev spurgt om, hvem der svarede, hvad skalaen betyder, og hvor enige svarene er (se afsnit 02).
Kan man overhovedet tage gennemsnittet af en skala fra 1 til 5? +
Ja, et numerisk gennemsnit af de kodede svar kan bruges som praktisk opsummering. Men kategorierne på en ordnet skala har ikke automatisk lige store afstande, så gennemsnittet må ikke få en stærkere metrisk fortolkning, end skaladesignet kan bære. Fordelingen af svarene og ankrene kan være lige så vigtige som gennemsnittet (se afsnit 07 og 09).
Er selvrapporterede data ikke upålidelige? +
Det findes der ikke ét generelt svar på. Selvrapportering er én type evidens med kendte mulige skævheder. Om den er egnet, afhænger af, hvad I vil vide, og af, hvordan spørgsmålet er designet og brugt. Spørger I til teamets tiltro, er teamets eget svar den relevante kilde, men det er stadig formet af, hvordan og under hvilke betingelser der bliver spurgt (se afsnit 06 og 08).
Hvorfor ikke bare bruge fritekst? +
Fritekst bevarer nuancerne, men gør det sværere at sammenligne og se udviklingen over tid. En score med en kort begrundelse kan være mere brugbar end hver af dem alene.
Hvor mange skal svare? +
Det afhænger af, hvad I spørger om, og hvad svaret skal bruges til. Der findes ikke ét universelt antal. Et snævert spørgsmål til den ansvarlige kan være nok til ét formål, mens et spørgsmål om et helt teams oplevelse kræver noget andet.
Er fem svarmuligheder bedre end tre eller syv? +
Der findes ikke et universelt svar. Det afgørende er, om kategorierne er meningsfulde for dem, der svarer, og for det, svaret skal bruges til, og om de samme kategorier bruges, når svarene sammenlignes.
Hvad hvis lederne og teamet vurderer situationen forskelligt? +
Så skal forskellen ikke automatisk regnes væk i et gennemsnit. Den kan være relevant information i sig selv: Hvad ser den ene gruppe, som den anden ikke ser? (se afsnit 09).
Betyder en høj tiltroscore, at vi sandsynligvis leverer? +
Nej. Scoren beskriver den rapporterede tiltro under spørgsmålets definition. Den er hverken en sandsynlighed for levering eller et forventet forretningsresultat, og et 4-tal på en skala fra 1 til 5 er ikke det samme som 80 % chance for at lykkes.
Beviser McKinsey OHI og Gallup Q12, at det her virker? +
Nej. De viser, hvordan disciplineret udvikling og validering af instrumenter, der bygger på rapporterede oplevelser og observationer, kan se ud. Begge er proprietære praktikermetoder, og ingen af dem validerer andre instrumenter eller signaler (se afsnit 10).
Handler det her om at bygge et samlet indeks? +
Nej. Paperet handler om evidensdisciplinen omkring strukturerede vurderinger. Hvordan flere signaler kan kombineres til ét samlet tal, er et andet metodisk problem, som får sit eget paper senere i serien.
Hvad gør jeg på mandag? +
Tag én tilbagevendende kvalitativ vurdering og definér, hvad et sammenligneligt, struktureret svar ville kræve. Diagnosen i afsnit 14 tager cirka 10 minutter.

Fra analyse til handling

Spørgsmålet, paperet efterlader, kræver ikke et værktøj: Hvilken kvalitativ vurdering bruger I allerede, som I i dag ikke kan sammenligne fra den ene gennemgang til den næste?

Det er alligevel rimeligt at sige, hvor jeg selv arbejder med spørgsmålet, og at jeg har en kommerciel interesse i det værktøj, jeg nævner her. Strategy Execution Observatory™ arbejder også med signaler, der ikke alle har samme datakarakter. Registrerede hændelser, leveranceforhold og strukturerede vurderinger skal ikke behandles, som om de var samme type evidens. Når en vurdering som teamets tiltro eller kompetenceparathed indgår, er ambitionen ikke at gøre den »objektiv«, men at gøre definitionen, retningen og ændringerne synlige nok til kvalificeret ledelsesfortolkning.

Signalerne er min praktiske operationalisering, ikke validerede målinger, og principperne i dette paper gælder også mit eget arbejde: Skalaer, ankre og regler for, hvem der svarer, er metodevalg, der skal kunne efterprøves, forbedres og dokumenteres. Et signal er et udgangspunkt for fortolkning, ikke en konklusion.

Samtale

Hvilken vurdering styrer I allerede på uden at følge den?

Vælg én tilbagevendende vurdering i jeres strategieksekvering — tiltro, parathed, kapacitet eller noget helt andet. På 20 minutter kan vi skille spørgsmålet fra antagelsen og se, om vurderingen kan gøres til et brugbart signal uden at foregive mere sikkerhed, end den kan bære.

20 min. Ét problem. Én plan. →

Næste problem

Når ledelsen først accepterer, at kvalitative vurderinger kan struktureres omhyggeligt, melder COO'ens bekymring fra åbningscasen sig straks igen: Har vi reelt kapaciteten til at levere det, planen forudsætter? Planen kan fortælle, hvor meget arbejde vi har lagt ind. Den kan ikke alene fortælle, om organisationen realistisk kan bære det. Det kræver næste skel: Planlagt kapacitet er ikke det samme som reel kapacitet.

Kilder og forskningsgrundlag
Validitet og måling
Metodeforskning om svar og skalaer
Ikke-finansielle mål
Praktikerkilder

Tesen om, at gevinsten ved kvantificering er struktur, sætningen om tal og objektivitet, skellet mellem vurdering, registrering, måling og sandhed som praktisk ramme, modellen »Fire slags tal«, formuleringen af reglen om påstandens og evidensens styrke, illustrationen »Samme tal. Forskelligt billede.«, sammenlignelighedskontrakten, læringssløjfen, de fem bevægelser i »Fra vurdering til signal«, diagnosen »Gør én vurdering efterprøvbar« og rubrikkerne »Hvad kunne du se tidligere?« og »Hvad må du ikke konkludere?« er Thomas Friisnæs' egne praktiske begreber og rammer, ikke validerede modeller; reglen og skellet er inspireret af validitetslitteraturen, men ingen af delene er Messicks eller standardernes egen model. Validitetslitteraturen kommer fra uddannelses- og psykologisk måling, metodeforskningen fra organisationsforskning og anvendt lingvistik, og praktikerkilderne er proprietære; ingen af dem handler om strategiske eksekveringssignaler. Skalaer, ankre og tal i eksemplerne er illustrative. Åbningscasen er et konstrueret, illustrativt eksempel. Danske gengivelser af engelske formuleringer er egne oversættelser.

Strategien sker mellem kvartalerne — serien

Ti papers om strategisk observabilitet

Serien handler om, hvad ledelsen kan se af strategiens eksekvering, mens den stadig er i gang, og om at gøre det synligt uden at forveksle signaler med sandhed. Alle 10 papers er udgivet.

Serie 06Strategien sker mellem kvartalerne

Fra informationsgabet over signaler, kapacitet, beslutninger og friktion til kompetencer, metode og governance.

  1. Strategien sker mellem kvartalerne
  2. Grøn er ikke det samme som sund
  3. Det kvalitative kan godt kvantificeres — du læser dette
  4. Kapacitet findes ikke i planen
  5. Beslutninger er en del af produktionsapparatet
  6. Friktion er data
  7. Før resultatet flytter sig
  8. Ved vi, om vi kan det, strategien kræver?
  9. Et indeks er ikke sandheden
  10. Demokratisér udsynet. Centralisér metoden.
Tag paperet med dig
Download som PDF
Hele paperet i A4 — klar til at læse, gemme eller tage med til næste strategimøde i direktionen eller bestyrelsen.
Åbner din browsers udskriv-dialog — vælg “Gem som PDF” som destination.

Læs også

Næste i serien · Paper 04 Kapacitet findes ikke i planen: Hvad kan organisationen reelt bære? Strategien sker mellem kvartalerne · Paper 01 Strategien sker mellem kvartalerne: Hvor meget ved I om eksekveringen, før resultatet fortæller jer det? C-Level Serien · Paper 06 Modspillet der mangler: Når topledere tier stille Executive Library Alle serier og papers — strategi, hold, eksekvering og kapacitet