구조화된 전문가 판단: 고전적 모델
Structured expert judgment: the classical model이 글은 위키백과의 품질 기준을 준수하기 위해 다시 작성해야 할 수도 있습니다. 글의 스타일이 위키백과에 적합하지 않기 때문입니다.(2022년 7월) |
전문가 판단(EJ)은 문서화되지 않은 단일 의견에서 선호도 조사를 통해 전문가 확률 평가의 외부 검증을 통한 공식 도출에 이르기까지 광범위한 기술을 나타냅니다.최근에 나온 책들은.[1][2]원자력 안전 분야에서 라스무센은 과학적 검토를 위해 전문가 도출 과정의 모든 단계를 문서화함으로써 EJ를 공식화했습니다.이는 전문가 평가에서 광범위하게 확산되고 전문가 판단의 검증 및 종합과 관련된 질문을 유발했습니다.원자력 안전 커뮤니티는 나중에 [4]외부 검증에 의해 뒷받침되는 전문가 판단 기법을 채택했습니다. 경험적 검증은 과학의 특징이며 확률론적 [5]예측의 고전적 모델의 중심을 형성합니다. 유럽 네트워크는 워크숍을 조정합니다.적용 분야에는 원자력 안전, 투자 은행, 화산학, 공중 보건, 생태학, 엔지니어링, 기후 변화 및 항공/항공우주가 포함됩니다.2006년까지의 애플리케이션에 대한 설문 조사는 을 참조하고[6][7] 권장되는[8] 개요를 제공합니다.세계보건기구에 의한 최근 대규모 구현은 에 설명되어 있습니다.[9][10] 몬세라트 화산 관측소에서 장기간 실행되는 응용 프로그램은 에 설명되어 있습니다.[11][12][13]고전적인 모델은 통계적 정확도(때로는 보정이라고도 함)와 정보성 [14]측면에서 전문가의 성과를 채점합니다.이 용어들은 "정확성 및 정확성"과 혼동되어서는 안 됩니다.정확도는 "시스템 오류의 설명"인 반면, 정밀도는 "임의 오류의 설명"입니다.고전적 모델에서 통계적 정확도는 전문가의 확률 평가가 통계적으로 정확하다는 가설을 잘못 기각하는 p-값 또는 확률로 측정됩니다.낮은 값(0에 가까운 값)은 전문가의 확률 진술과 관측된 결과 사이의 불일치가 우연히 발생할 가능성이 매우 낮다는 것을 의미합니다.정보성은 분석가가 제공한 배경 측정과 관련하여 섀넌 상대 정보(또는 쿨백 라이블러 발산)로 측정됩니다.섀넌 상대 정보는 척도 불변, 꼬리 무감각, 느리고 친숙하기 때문에 사용됩니다.기본적으로 표준 편차 또는 예측 구간의 폭과 같은 물리적 차원의 측정은 단위(미터 대 킬로미터)의 변경이 일부 변수에는 영향을 미치지만 다른 변수에는 영향을 미치지 않기 때문에 심각한 문제를 야기합니다.각 전문가에 대한 통계적 정확성과 정보성의 산출물은 그들의 종합 점수입니다.전문가가 가중치를 부여하지 않는 통계적 정확도 임계값을 최적으로 선택할 수 있는 경우, 종합 점수는 장기적으로 "엄격하게 적절한 점수 규칙"입니다. 전문가는 자신의 진정한 신념을 진술함으로써 장기적으로 최대 예상 점수를 달성합니다.고전적인 모델은 성능 가중(PW) 조합을 도출합니다.이는 균등 가중(EW) 조합과 최근에는 조화 가중(HW) 조합 및 개별 전문가 평가와 비교됩니다.
일부 수학자와 의사결정 분석가들은 전문가의 판단을 결합하는 것을 수학적인 문제로 여기지만, 고전적인 모델은 전문가의 결합을 공학적인 문제에 더 가깝다고 생각합니다.자전거는 뉴턴의 법칙을 따르지만 그 법칙을 따르지는 않습니다.제약 조건 하에서 성능을 최적화하도록 설계되었습니다.마찬가지로 전문가 판단 조합은 수학적 및 결정 이론적 제약 조건에서 성능 측정을 최적화하여 합리적인 합의를 가능하게 하는 도구로 간주됩니다.합리적인 합의 [15][16]이론은 에 요약되어 있습니다.
실제 전문가 판단 연구는 연구나 학술적 연습과는 많은 면에서 다릅니다.전문가들은 일반적으로 연구 주제에 대한 지식과 참여를 바탕으로 추적 가능한 동료 지명 과정에서 채용되며, 보수를 받을 수 있습니다.모든 경우에 전문가의 추론이 문서화되고, 그들의 이름과 소속이 보고의 일부입니다.그러나 솔직한 판단을 장려하기 위해 개인의 응답은 그룹 내에서 교환되지 않으며 이름과 평가의 연관성은 공개 문헌에 보고되지 않고 문제 소유자가 동료 검토를 할 수 있도록 보존됩니다.
도출은 일반적으로 몇 시간 동안 지속됩니다. 도출 프로토콜은 공식화되고 공개 보고의 일부입니다.전체 브리핑 및 교육이 있든 없든, "감독된 전체"를 포함한 대면 인터뷰를 포함하여 도출 방식은 실무자마다 다릅니다.원격 도출은 거의 사용되지 않지만, 최근의 일부 연구에서는 온라인 대면 도구를 사용합니다.
유효성을 확인해야 합니다.
관심의 양이 불확실할 때 전문가가 호출되기 때문에 구조화된 전문가 판단의 목표는 불확실성의 방어 가능한 정량화입니다.불확실성에 직면하여, 사회 전반은 항상 예언자, 신탁, 전문가, 블루 리본 패널, 과거에 잘 수행한 것으로 알려진 군중 지혜에 귀를 기울일 것입니다.대조적으로 과학자와 엔지니어는 일반적으로 경험적 검증을 피하는 모든 방법론에 반대합니다.대부분의 전문가 판단 발동은 술어 "전문가"가 충분히 검증된 것처럼 어떠한 형태의 검증도 시도하지 않습니다.고전적 모델은 검증에 중점을 두고 있으며, 이는 차별화된 특징입니다.실제 전문가와 실제 응용 프로그램을 사용하는 사실상 모든 검증 데이터는 고전적 모델을 사용하는 실무자에 의해 생성되었습니다.
경험이 많고 경험이 없는 전문가를 대상으로 한 최초의 연구 중 하나는 전문 분야의 질문에 대한 전문가의 성과가 "연감 질문"에 대한 그들의 성과에 의해 예측되지 않는다는 것을 보여주었습니다.경험이 풍부한 전문가와 경험이 부족한 전문가는 자신의 분야 밖의 질문에 대해 유사한 수행을 했지만, 경험이 풍부한 전문가는 자신의 분야의 질문에 대해 훨씬 더 잘 수행했습니다.따라서 검증은 전문가 분야의 불확실한 양에 대한 평가를 기반으로 해야 하며, 이는 연구의 시간 범위 내에서 실제 값을 알고 있거나 알 수 있습니다.이러한 양을 "보정" 또는 "시드" 변수라고 합니다.
좋은 보정 변수를 찾는 것은 어렵고 당면한 주제에 대한 심층적인 연구가 필요합니다.교정 품질과 교정 변수에 대한 성능은 전체 연구의 신뢰성을 뒷받침합니다.결국 문제 소유자는 "전문가 A가 교정 변수에 대해 매우 우수한 성능을 보이는 반면, 전문가 B는 매우 저조한 성능을 보인다면, 제가 그 차이를 무시할 것인가요?"라고 물을 것입니다.소유자의 대답이 "예"이면 보정 변수의 목적이 실패하고 노력이 헛수고가 됩니다.
유효성 검사
전문가 판단의 타당성을 입증하는 가장 좋은 논거는 전문가 판단 자료 자체입니다.2006년 이전 데이터에는 전문가 수와 교정 변수 수에 대한 광범위한 변화가 포함되어 있지만, 2006년 이후에 전문적으로 계약된 33개의 독립적인 도출물은 설계가 더 균일하고, 자원이 더 우수하며, 문서화되고, 집계 프레젠테이션에 더 적합합니다.데이터는 총 320명의 전문가로 구성되어 있습니다.그림 1은 평가된 교정 변수의 수에 대한 전문가의 분포를 보여줍니다.
p-값은 통계 검정의 검정력과 교정 변수의 수에 민감합니다.이 수치는 2006년 이후 데이터의 전문가와 대략 비교할 수 있습니다.그림 2는 2006년 이후 모든 전문가의 p-값을 최상에서 최악으로 정렬한 것을 보여줍니다.
이 요약에서 320명의 전문가 중 227명이 단순 가설 검정에 대한 전통적인 기각 임계값인 0.05 미만의 통계 정확도 점수를 가지고 있습니다.전문가의 절반은 0.005 이하의 점수를 받고, 대략 3분의 1은 0.0001 이하의 최악의 범위에 들어갑니다.이러한 수치는 서술어 "전문가"가 불확실성 정량화와 관련하여 품질을 보장한다는 가정에 이의를 제기합니다.
하지만 320명의 전문가 중 93명이 5% 수준의 통계적 가설로 거부되지 않을 것이라는 긍정적인 측면이 있습니다.그림 3은 각 33개 연구에 대한 최고 전문가와 두 번째로 우수한 전문가의 통계적 정확도를 보여줍니다."최고"는 통계적 정확성과 정보성을 모두 설명하는 개인의 종합 점수로 정의되지만 통계적 정확성에 의해 결정됩니다.플롯 배열은 최고의 전문가에서 최악의 전문가까지입니다.
33개 연구 중 25개 연구에 최소 1개 이상의 전문가가 있으며, 일반적으로 통계적 정확도가 허용되는 전문가가 2명 이상 있습니다.단순히 그 전문가들을 식별하고 그들에게 의존하는 것은 검증되지 않은 전문가의 판단보다 더 큰 개선이 될 것입니다(성능을 측정하지 않고 좋은 성과를 발견하는 것은 어리석은 [17]짓입니다).
자주 듣는 제안은 '전문가들에게 서로의 무게를 재도록 요청하는 것이 어떻습니까?'입니다.그들은 종종 서로의 일을 알고, 누구의 의견이 가장 중요한지에 대해 의견이 일치할 수 있습니다.그러나 잠시 동안의 성찰 위원회는 주의를 기울입니다.실적이 저조한 전문가가 실적이 우수한 다른 전문가들을 식별할 수 있을까요?이 질문에 대한 데이터는 드물지만, 몇 가지 연구에서 전문가들에게 서로를 평가하도록 요청했고,[18] "그룹 상호 순위"는 성과 측면에서 순위와 부정적인 상관관계가 있었습니다. 다양한 가중치 체계의 성과 비교,전문가의 인용 번호에 기초한 "표준 가중치"를 포함하고 동일한 가중치와 유사한 성능을 발견했습니다.
검체 내 유효성 검사
전문가 성능을 측정하는 데 사용되는 데이터는 조합 방식의 성능을 측정하는 데도 사용될 수 있습니다.PW와 관련하여 검증 데이터는 조합 모델을 초기화하는 데도 사용되기 때문에 표본 내 비교입니다.PW가 샘플 내에서 우수하지 않으면 샘플 외 검증을 수행하는 데 의미가 거의 없습니다.[20] 전문가의 평균 분위수가 EW보다 더 우수할 수 있음을 나타냅니다.평균 분위수는 분포를 평균하는 것보다 계산하기 쉬우며 부주의한 의사가 자주 사용합니다.평균 분위수는 수학적으로 분포의 HW(Harmonically Weighted) 조합과 동일합니다.그림 4는 2006년 이후 33개 연구에 대한 PW, EW 및 HW의 p-값과 결합된 점수를 PW 점수에 따라 정렬한 것입니다.종합점수는 EW가 3건, HW가 4건, PW가 26건입니다.18개의 경우(55%)에서 HW가 통계적으로 정확하다는 가설은 0.05 수준에서 기각됩니다.8개의 경우 거부 반응은 0.001 수준입니다.
샘플 외 유효성 검사
관심 있는 변수가 연구의 시간 범위 내에서 거의 관찰되지 않기 때문에, 샘플 외 검증은 대부분 교차 검증으로 감소하며, 모델은 교정 변수의 하위 집합(훈련 세트)에서 초기화되고 보완 세트(테스트 세트)에서 점수가 매겨집니다.교육/테스트 세트 분할을 선택하는 데 어려움이 있습니다.훈련 세트가 작으면 전문가 성과를 해결할 수 있는 능력이 작고 각 훈련 세트의 PW가 실제 연구의 PW와 잘 닮지 않습니다.테스트 세트가 작으면 조합 방식의 차이를 해결하는 기능이 작습니다.즉, 교육/테스트 세트의 모든 분할을 고려하여[21] PW가 샘플 외 EW를 능가하는 것으로 나타났습니다.
PW의 통계적 정확도 점수에는 표본 외 패널티가 있습니다.그림 5(왼쪽)는 훈련 세트 크기의 함수로서 PW와 EW의 샘플 외 통계 정확도를 보여줍니다.두 점수 모두 검정 세트의 통계 검정력 손실로 인해 증가하지만 PW는 더 빨리 증가합니다.샘플 외 PW는 전문가 성능을 더 잘 해결할 수 있기 때문에 샘플 내 PW에 접근합니다.결합된 점수(오른쪽)는 PW의 표본 외 우세가 훈련 세트 크기에 따라 증가한다는 것을 보여줍니다.
보정 변수를 사용할 경우 총 분할 수(빈 세트와 전체 세트 제외)는 입니다. 이는 관리할 수 없게 됩니다.최근 연구에 따르면 교육 세트에 80%의 교정 변수를 사용하는 것이 경쟁 관심사를 잘 절충한 것으로 나타났습니다.그림 6은 교육 세트의 교정 변수의 80%로 모든 분할에 걸쳐 집계된 연구당 PW/EW의 결합 점수 비율을 보여줍니다.
성능 가중치 PW는 성능 데이터를 사용하지 않는 단순 조합 체계(EW, HW)보다 훨씬 우수합니다.그러나 PW는 의미 있는 교정 변수를 생성하고 방법과 결과를 설명하는 것과 관련하여 분석가에게 더 큰 요구를 합니다.유능하고 경험이 풍부한 분석가를 찾는 것은 애플리케이션의 가장 큰 병목 현상입니다.성능 측정을 개선하고 교차 검증 방법 및 소프트웨어를 개선하는 것도 환영할 것입니다.
웹사이트
http://rogermcooke.net 모든 수학적 세부 사항, 2006년 이후 응용 프로그램의 개요, 최근 출판물 및 데이터 링크는 온라인으로 제공됩니다.
소프트웨어
레퍼런스
- ^ Burgman, M.A. (2016). Trusting judgments; How to get the best out of experts. Cambridge: Cambridge University Press. p. 214.
- ^ Ungar, L.; Mellers, B.; Satopää, V.; Tetlock, P.; Tetlock, J. (2012). The Good Judgment Project: A Large Scale Test of Different Methods of Combining Expert Predictions. AAAI Fall Symposium Series (RSS).
- ^ Rasmussen, N.C. (1975). "Reactor safety study. An assessment of accident risks in U. S. commercial nuclear power plants" (PDF). Wash-1400 (Nureg-75/014). doi:10.2172/7134131.
- ^ Cooke, R.M. (2012). "Uncertainty Analysis Comes to Integrated Assessment Models for Climate Change…and Conversely". Climatic Change. 117 (3 2013): 467–479. doi:10.1038/nclimate2466.
- ^ a b Cooke, R.M. (1991). Experts in Uncertainty; Opinion and Subjective Probability in Science. New York Oxford: Oxford University Press. pp. 321.
- ^ Cooke, R.M.; Goossens, L.H.J. (2008). "TU Delft Expert Judgment Data Base". Reliability Engineering & System Safety. 117 (93): 657–674. doi:10.1016/j.ress.2007.03.005.
- ^ Aspinall, W.P. (2010). "A route to more tractable expert advice". Nature. 463 (7279): 657–674. doi:10.1038/463294a. PMID 20090733. S2CID 205052636.
- ^ Sutherland, W.J.; Burgman, M. (2015). "Use experts wisely". Nature. 526 (7573): 317–318. doi:10.1038/526317a. PMID 26469026.
- ^ Aspinall, W.P.; Cooke, R.M.; Havelaar, A.H.; Hoffmann, S.; Hald, T. (1 March 2016). "Evaluation of a Performance-Based Expert Elicitation: WHO Global Attribution of Foodborne Diseases". PLOS ONE. 11 (3): e0149817. doi:10.1371/journal.pone.0149817. PMC 4773223. PMID 26930595.
- ^ Hald, T.; Aspinall, W.P.; Devleesschauwer, B.; Cooke, R.M.; Corrigan, T.; Havelaar, A.H.; Gibb, H.; Torgerson, P.; Kirk, M.; Angulo, F.; Lake, R.; Speybroeck, N.; Hoffmann, S. (2015). "World Health Organization estimates of the relative contributions of food to the burden of disease due to selected foodborne hazards: a structured expert elicitation". PLOS ONE. 11 (1): e0145839. doi:10.1371/journal.pone.0145839. PMC 4718673. PMID 26784029.
- ^ Aspinall, W.P.; Loughlin, S.C.; Michael, F.V.; Miller, A.D.; Norton, K.C.; Sparks, R.S.J.; Young, S.R. (2002). "The Montserrat Volcano Observatory: its evolution, organisation, role and activities". In Druitt, T.H.; Kokelaar, B.P. (eds.). The eruption of Soufrière Hills Volcano, Montserrat, from 1995 to 1999. Geological Society, London, Memoir. pp. 71–92.
- ^ Aspinall, W.P. (2006). "Structured elicitation of expert judgment for probabilistic hazard and risk assessment in volcanic eruptions". In Mader, H.M.; Coles, S.G.; Connor, C.B.; Connor, L.J. (eds.). Statistics in Volcanology. London: IAVCEI. pp. 15–30.
- ^ Wadge, G.; Aspinall, W.P. (2014). "A Review of Volcanic Hazard and Risk Assessments at the Soufrière Hills Volcano, Montserrat from 1997 to 2011". In Wadge, G.; Robertson, R.E.A.; Voight, B. (eds.). The Eruption of Soufrière Hills Volcano, Montserrat, from 2000 to 2010: Geological Society Memoirs, Vol. 39. London: Geological Society. pp. 439–456.
- ^ a b Cooke, R.M.; Mendel, M.; Thijs, W. (1988). "Calibration and Information in Expert Resolution". Automatica. 24: 87–94. doi:10.1016/0005-1098(88)90011-8.
- ^ Cooke, R.M.; Wittmann, M.E.; Rothlisberger, J.D.; Rutherford, E.S.; Zhang, H.; Mason, D.; Lodge, D.M. (2014). "Structured expert judgment to forecast species invasions: Bighead and Silver Carp in Lake Erie". Conservation Biology. 29 (1): 187–197. doi:10.1111/cobi.12369. hdl:2027.42/110571. PMID 25132396.
- ^ Cooke, R.M. (2015). "Messaging climate change uncertainty (with supplementary Online Material)". Nature Climate Change. 5: 8–10. doi:10.1038/nclimate2466.
- ^ Flandoli, F.; Giorgi, E.; Aspinall, W.P.; Neri, A. (2011). "Comparison of a new expert elicitation model with the Classical Model, equal weights and single experts, using a cross-validation technique". Reliability Engineering and System Safety. 96 (7): 1292–1310. doi:10.1016/j.ress.2011.05.012.
- ^ Cooke, R.M.; Aspinall, W.P. (2013). "Quantifying scientific uncertainty from expert judgement elicitation". In Hill, L.; Rougier, J.C.; Sparks, R.S.J. (eds.). Risk and Uncertainty assessment in Natural Hazards. Cambridge University Press. pp. 64–99.
- ^ Cooke, R.M.; ElSaadany, S.; Xinzheng Huang, X. (2008). "On the Performance of Social Network and Likelihood Based Expert Weighting Schemes". Reliability Engineering and System Safety. 93 (5): 745–756. CiteSeerX 10.1.1.486.2435. doi:10.1016/j.ress.2007.03.017.
- ^ Lichtendahl Jr., K.C.; Grushka-Cockayne, Y.; Winkler, R.L. (July 2013). "Is It Better to Average Probabilities or Quantiles?". Management Science. 59 (7): 1594–1611. doi:10.1287/mnsc.1120.1667. ISSN 1526-5501.
- ^ Eggstaff, J.W.; Mazzuchi, T.A.; Sarkani, S. (2014). "The Effect of the Number of Seed Variables on the Performance of Cooke's Classical Model". Reliability Engineering and System Safety. 121: 72–82. doi:10.1016/j.ress.2013.07.015.
- ^ Cooke, R.M; Marti, H.D.; Mazzuchi, T.A. (2021). "Expert forecasting with and without uncertainty quantification and weighting: What do the data say?". International Journal of Forecasting. 37: 378--387. doi:10.1016/j.ijforecast.2020.06.007.
