**AI 시대 데이터 활용 연작 · 1편 · 보완판 v2.1 · 2026년 9월 14일**
**AI가 데이터를 처리할 수 있다는 것과, 그 결과를 내가 연구나 의사결정의 근거로 사용할 수 있다는 것은 다르다. 데이터 리터러시는 이 차이를 판단하는 능력이다.**
이 글은 학술연구자, 정책전문가, 데이터전문가가 데이터를 활용할 때 알아야 할 사항을 다룬다. 여기서 **데이터전문가는 조사회사와 조사·자료처리·분석을 담당하는 실무자**를 뜻한다.
1. 같은 데이터를 사용해도 하려는 일은 다르다
청년 취업지원 프로그램에 관한 자료를 생각해 보자. 학술연구자는 참여와 취업의 관계가 어떤 설명을 뒷받침하는지 묻는다. 정책전문가는 프로그램을 확대할지, 다른 대안을 선택할지 판단하려 한다. 데이터전문가는 누구를 조사하고, 어떤 문항과 처리 기준으로, 어느 정도의 품질을 가진 결과를 제공할지 결정한다.
입장중심 질문중요한 산출물발생할 수 있는 오류
| **학술연구자** | 무엇을 새롭게 알았으며, 어떤 설명을 얼마나 지지하는가? | 연구질문·측정·설계·결과·한계가 연결된 논문과 재현 자료 | 측정한 것보다 큰 개념을 주장하거나 관련성을 원인으로 바꾸는 것 |
| **정책전문가** | 누구의 어떤 문제를, 어느 대안으로, 어떤 비용과 부담을 감수하며 해결할 것인가? | 대안·효과·비용·형평성·위험·실행 조건을 비교한 판단 자료 | 기술적으로 계산한 순위를 가치중립적인 정답으로 제시하는 것 |
| **데이터전문가** | 필요한 정보를 어떻게 정확하게 생산·처리·분석하고 반복 제공할 것인가? | 자료·메타데이터·분석결과·품질 근거·변경 이력 | 코드의 정상 실행을 측정·표본·처리·해석의 정확성으로 오인하는 것 |
2. 데이터는 현실 그 자체가 아니라 현실을 기록한 결과다
어떤 제도의 수급자 명부는 제도에 등록된 사람을 보여준다. 지원이 필요하지만 신청하지 않은 사람까지 모두 보여주는 것은 아니다. 한 플랫폼의 거래기록은 그 플랫폼에서 기록된 거래를 보여준다. 그 기록 수가 곧 전체 소비자 수가 되는 것은 아니다.
이는 특정 자료가 나쁘다는 뜻이 아니다. **무엇을 포착하도록 만들어진 자료인지 이해하고 그 범위에 맞게 써야 한다는 뜻**이다.
예를 들어 다음 네 문장은 서로 다른 수준의 주장이다.
주장필요한 확인
| “조사 응답자의 40%가 서비스 A를 선호했다.” | 어떤 문항에 응답한 누구의 비율인가? |
| “전체 국민의 40%가 서비스 A를 선호한다.” | 표집·포괄·무응답·가중치와 모집단 일반화의 근거가 있는가? |
| “서비스 A를 도입하면 이용이 40% 증가한다.” | 실제 이용의 변화와 적절한 비교설계가 있는가? |
| “그러므로 서비스 A를 전국에 도입해야 한다.” | 효과 외에 비용·대안·형평성·집행 조건을 검토했는가? |
위 수치는 모두 설명용이다. 뒤로 갈수록 추가 근거가 필요해진다.
3. 질문을 네 가지로 구분하면 과장을 줄일 수 있다
데이터로 하려는 일을 우선 기술, 예측, 인과로 구별하는 것이 유용하다. 각각의 목적마다 필요한 가정이 달라진다.
목적질문의 예그것만으로 답하지 못하는 것
| **현황·관계 기술** | 어느 집단의 취업률이 낮은가? | 왜 낮은지, 무엇을 바꾸면 높아지는지 |
| **예측** | 누가 앞으로 취업하기 어려울 가능성이 큰가? | 그 사람에게 특정 지원을 하면 얼마나 도움이 되는지 |
| **인과효과 검토** | 이 지원 때문에 취업 가능성이 얼마나 달라졌는가? | 그 지원이 다른 정책보다 우선되어야 하는지 |
| **대안 선택·판단** | 한정된 예산으로 어떤 지원을 선택할 것인가? | 가치 기준 없이 모든 사람에게 동일한 최선의 답 |
정책은 현실의 문제를 해결하기 위한 개입이다. 따라서 현황만이 아니라 개입의 효과, 비용과 위험, 영향을 받는 집단을 함께 검토해야 한다.
**데이터는 선택을 돕지만 선택의 가치 기준을 자동으로 정하지 않는다.** 가령 전체 평균의 개선을 우선할지, 가장 취약한 집단의 개선을 우선할지는 숨겨진 기본값이 아니라 드러난 판단 기준이어야 한다. 그리고
4. 좋은 질문은 분야지식과 자료 이해에서 나온다
“좋은 프롬프트를 작성하라”는 조언보다 앞서는 질문이 있다. **무엇이 중요한 질문인지 어떻게 아는가?**
관심 현상과 제도, 기존 연구, 가능한 측정과 비교를 알아야 한다. ‘왜 이 결과가 예상과 다른가’를 묻기 위해서는 무엇을 예상했으며 그 예상에 어떤 근거가 있었는지 알아야 한다. 반대로 데이터가 기존 예상과 다르다고 잘못된 데이터로 단정해서도 안 된다.
실제 작업은 다음과 같이 왕복한다.
분야지식·기존 근거 ↔ 문제와 질문 ↔ 자료의 의미·한계
↓
설계·분석·검증
↓
설명 수정·새 질문·후속 자료
AI는 후보 질문, 변수, 비교 방법을 제시할 수 있다. 이용자의 역할은 그중에서 **중요하면서 자료로 검토 가능한 질문**을 선택하는 것이다. 기존 자료를 먼저 살펴보며 연구질문을 발전시키는 것도 정당한 탐색이다.
숫자의 의미는 맥락에서 나온다
만족도가 100점 만점에 70점이라고 하자. 이 정도면 좋은 결과일까. 같은 문항으로 조사한 작년 점수가 50점이었다면 상당히 나아진 것이고, 90점이었다면 크게 떨어진 것이다. 비슷한 기관들의 평균이 60점인지 80점인지에 따라서도 평가는 달라진다. 점수는 그대로인데 무엇과 비교하느냐에 따라 읽히는 의미가 달라지는 것이다.
여기서 숫자의 의미를 두 층으로 나누어 볼 수 있다. 먼저 무엇을 어떤 단위로 측정한 값인지 알아야 한다. ‘100명’은 인원이라는 정보를 담고 있다. 그러나 100명이 많거나 적은지, 사업의 성과로서 충분한지는 모집단의 크기, 과거 실적, 사업 목표 등을 알아야 판단할 수 있다. 숫자의 측정상 의미와 그 숫자에 대한 평가는 연결되지만 같지는 않다. ‘숫자의 의미는 맥락에서 나온다’는 말은 특히 후자의 판단을 설명한다.
비교에 쓰는 준거는 여러 가지다. 다음은 모두 가상 사례다.
비교의 준거살펴볼 내용같은 숫자를 읽는 예
| 시간적 비교 | 과거보다 어떻게 달라졌는가 | 만족도 70점이 작년 50점에서 오른 것인지, 90점에서 내려온 것인지 |
| 준거집단과의 비교 | 비슷한 조건의 다른 집단에서는 어떤가 | 유사 기관의 평균이 60점이라면 상대적으로 높고, 80점이라면 낮음 |
| 목표·이상적 상태·기준과의 비교 | 달성하려던 수준이나 필요한 최소 수준에 도달했는가 | 사전에 정한 목표가 80점이면 70점은 10점 미달 |
| 다른 구성요소와의 비교 | 같은 대상의 어떤 부분이 상대적으로 강하거나 약한가 | 처리속도 만족도 70점을 친절도 85점, 접근성 55점과 함께 검토 |
| 이론·예상과의 비교 | 알려진 관계나 조건을 고려할 때 예상한 수준인가 | 여건을 고려한 예상치가 60점이었다면 70점이 나온 이유를 추가로 탐색 |
비교한다고 언제나 해석이 좋아지는 것은 아니다. 기관을 비교할 때 이용자의 여건이 크게 다르거나, 연도 사이에 문항과 응답 대상이 바뀌었다면 그 차이를 함께 고려해야 한다. 구성요소도 점수 범위가 같다는 이유만으로 바로 비교할 수는 없다. 문항의 의미와 척도 방향, 응답 방식이 비교에 맞는지 살펴야 한다. 목표와 이상적 상태는 관측된 사실이 아니라 별도로 정한 기준일 수 있으므로, 누가 어떤 이유로 정했는지도 밝혀야 한다.
비교하지 않고 바로 이해한 것처럼 보이는 경우에도 준거가 암묵적으로 작동할 수 있다. ‘민원 처리를 두 시간 기다렸다’는 말을 듣고 길다고 느꼈다면, 평소 대기시간이나 적절하다고 생각하는 서비스 수준을 떠올렸을 수 있다. 준거를 말하지 않았을 뿐, 판단에서 준거가 사라진 것은 아니다.
카너먼과 트버스키의 전망이론(prospect theory)은 결과를 최종 상태만으로 평가하기보다 준거점에 대한 이득과 손실로 평가하는 경향을 설명한다. 기대했던 상태가 준거가 되면 똑같은 결과도 이득이나 손실로 다르게 받아들일 수 있으며, 이득과 손실에 대한 반응도 대칭적이지 않을 수 있다. .[6](#ref-6)
표현 방식도 판단에 영향을 준다. 트버스키와 카너먼의 프레이밍 연구는 실질적으로 같은 선택 문제를 어떻게 제시하느냐에 따라 선호가 달라질 수 있음을 보였다.[7](#ref-7) 가령 ‘목표 달성 70%’와 ‘목표 미달 30%’가 같은 대상과 기준의 결과라면 서로 다른 수치적 사실이 아니다. 어느 면을 앞세워 전달했는지의 차이다. 이는 앞의 연구 결과를 설명하기 위한 예이며, 이 문구로 실험한 결과를 뜻하지 않는다.
분석자가 할 일은 비교 대상과 선택 이유를 밝히고, 다른 적절한 준거를 적용하면 평가가 어떻게 달라지는지도 살펴야 한다. 전년보다 나아졌지만 목표에는 못 미쳤다는 두 판단은 함께 성립할 수 있다. 전년보다 나아졌다는 사실만으로 개입의 효과가 입증되는 것은 아니라는 점도 남는다.
AI에게 결과 해석을 맡길 때도 원자료의 값만 전달해서는 부족하다. 비교할 시점과 집단, 목표, 관련 구성요소와 예상의 근거를 함께 제공해야 한다. 그 정보가 없으면 ‘높다’, ‘낮다’, ‘양호하다’는 말에 어떤 기준이 숨어 있는지 확인하기 어렵다. 좋은 질문을 만드는 능력에는 숫자에 붙일 적절한 준거를 찾고 설명하는 능력도 포함된다.
5. 언제나 원자료를 새로 분석해야 하는 것은 아니다
필요한 지표가 공표 통계에 이미 있다면 정의와 대상·시점을 확인해 사용하면 된다. 새로운 교차집단이나 변수 조합이 필요하면 개별 관측자료를 분석할 수 있다. 특정 개입의 효과를 판단하려면 직접 분석보다 기존 연구들의 설계와 결과를 비교하는 일이 먼저일 수 있다.
**새 계산을 했다는 사실보다 질문에 적합한 근거를 선택했는지가 중요하다.**
자료의 부족도 구분해야 한다. 파일을 아직 구하지 못한 경우, 필요한 변수를 측정하지 않은 경우, 비교집단이 없는 경우, 이용 허락이 없는 경우는 해결 방법이 다르다. 계산 능력이 충분해도 자료에 없는 정보가 새로 생기지는 않는다. 합성자료는 가정과 모형을 탐색하는 데 쓸 수 있지만, 관찰하지 않은 사람에게서 실제 응답을 얻은 것으로 취급할 수 없다.
6. 정확한 계산과 타당한 분석은 다르다
평균 계산이 맞아도 잘못된 대상을 평균냈다면 질문에 답하지 못한다. 회귀계수가 정확하게 계산되어도 변수의 의미나 비교설계가 잘못되면 해석은 부적절할 수 있다. 자료처리가 아무 오류 없이 끝나도 원래 조사에서 특정 집단을 놓쳤다면 그 문제는 남는다.
이용자는 적어도 다음 종류를 구분해야 한다.
확인 영역핵심 질문
| **측정과 포착** | 알고 싶은 개념과 대상을 실제로 기록했는가? |
| **자료 구성** | 중복·연계·결측·제외·파생변수를 적절하게 처리했는가? |
| **추정과 모형** | 질문에 맞는 계산이며 필요한 설계와 가정을 반영했는가? |
| **불확실성** | 표본 변동·모형·측정·미확인 정보 중 무엇을 반영하고 무엇을 반영하지 못했는가? |
| **해석과 이용** | 결과의 범위를 넘어 원인·미래·전체 집단·정책 선택을 주장하지 않았는가? |
표본을 추출했기 때문에 생기는 변동은 누군가의 실수와 다르다. 가정 아래 계산한 신뢰구간도 모든 종류의 편향과 오류를 포함하는 것은 아니다. 특히 복합표본 조사에서는 단순히 가중치를 적용하는 것과 표본설계에 맞게 분산을 계산하는 것을 구분해야 한다. [3](#ref-3)
‘유의하다’는 말 하나로 중요성이 정해지지도 않는다. 효과의 크기, 불확실성, 대상과 실제 활용 조건을 함께 읽어야 한다. 작은 차이가 통계적으로 뚜렷할 수 있고, 중요한 차이를 검토하기에 자료가 부족할 수도 있다.
정밀도·정확도·신뢰도·타당도
자료나 분석의 품질을 두고 ‘정확하다’, ‘신뢰할 만하다’, ‘타당하다’는 말을 섞어 쓰기 쉽다. 그러나 무엇이 좋은지를 나누어 보면 확인할 방법도 달라진다. 정밀도와 정확도는 측정값과 추정값의 성질을 설명할 때, 신뢰도와 타당도는 설문·검사 점수를 해석할 때 자주 쓰인다. 분야에 따라 용법이 조금씩 다르며 네 개념이 완전히 독립된 것은 아니다.[8](#ref-8)[9](#ref-9)[10](#ref-10)
개념무엇을 묻는가주로 살펴볼 것
| 정밀도(precision) | 정해진 조건에서 측정이나 추정을 반복할 때 결과가 얼마나 적게 흩어지는가 | 반복 측정의 산포, 추정량의 표준오차, 같은 신뢰수준에서의 신뢰구간 폭 |
| 정확도(accuracy) | 측정하거나 추정한 값이 알고자 하는 실제값에 얼마나 가까운가 | 실제값을 대신할 수 있는 적절한 기준값과의 차이, 편향과 우연한 오차 |
| 신뢰도(reliability) | 의도한 측정 조건에서 점수가 얼마나 일관되게 얻어지는가 | 재검사, 평가자 간 일치, 문항 간 일관성 등 해당 용도에 맞는 증거 |
| 타당도(validity) | 그 점수를 의도한 개념으로 해석하고 그 용도에 사용할 근거가 충분한가 | 측정 내용·응답 과정·내적 구조·다른 변수와의 관계 등 해석을 뒷받침하는 증거 |
정밀도는 소수점 이하를 몇 자리까지 표시했는지가 아니다. 국제측정용어집(VIM)은 정해진 조건의 반복 측정값들이 서로 얼마나 가까운지를 정밀도로 설명한다. 통계 추정에서는 표준오차가 작을수록 정밀하다고 말한다. 반면 정확도는 알고자 하는 실제값과의 가까움에 관한 개념이다. 실제값을 모르는 경우에는 적절한 기준과 오차에 관한 증거를 통해 판단해야 한다.[8](#ref-8)[9](#ref-9)
가상의 저울로 이를 구분해 보자. 기준 질량이 100g인 물체를 세 번 쟀는데 104.9g, 105.0g, 105.1g이 나왔다. 값들이 좁은 범위에 모여 있으므로 이 조건에서의 정밀도는 높다. 하지만 모두 기준에서 약 5g 벗어나 있다. 이 반복 결과가 일관된다는 이유로 정확하다고 할 수는 없다. 표시를 105.000g으로 바꾼다고 정밀도나 정확도가 좋아지는 것도 아니다.
설문·검사에서 신뢰도는 측정 조건과 함께 읽어야 한다. 안정된 특성을 같은 조건에서 다시 측정하는지, 평가자가 달라져도 같은 점수를 주는지, 문항들이 어떤 일관성을 보이는지는 서로 다른 질문이다. 내적 일관성 계수 하나로 이 모두를 확인했다고 말할 수 없다. 실제 특성이 변할 수 있는 기간의 점수 차이를 전부 측정 실패로 돌려서도 안 된다. 교육·심리검사 표준이 ‘신뢰도/정밀도’를 함께 다루듯이 두 개념에는 겹치는 부분이 있다.[10](#ref-10)
타당도에서는 점수의 해석과 용도가 중심이 된다. AERA·APA·NCME의 검사 표준도 검사를 통째로 ‘타당하다’고 부르기보다, 특정 용도로 점수를 해석하는 데 어떤 이론과 증거가 있는지를 묻는다.[10](#ref-10) 가령 서비스에 얼마나 자주 접속하는지는 정확하게 기록할 수 있다. 그 빈도가 계속 안정적으로 나타나더라도 이를 곧 서비스에 대한 신뢰로 해석할 수는 없다. 자주 접속한 이유가 신뢰인지, 불편해서 반복 방문한 것인지, 대안이 없어서인지 따로 검토해야 한다. 기록의 정확성과 개념 해석의 타당성은 다른 문제다.
조사에서는 이 차이가 중요하다. 표본설계와 추정 조건이 같다면 표본 수를 늘려 평균이나 비율의 표준오차를 줄일 수 있다. 그러나 같은 문항이 계속 다른 개념을 묻고 있거나 특정 집단이 조사틀에서 빠져 있다면, 표본 수를 늘리는 것만으로 그 문제는 없어지지 않는다. 큰 표본으로 엉뚱한 대상을 정밀하게 설명할 수도 있다. 표본 크기가 커진 것과 개별 측정도구의 신뢰도가 좋아진 것도 구분해야 한다.
정확도를 단지 ‘편향이 없는 정도’와 같다고 보아도 곤란하다. 평균적으로 맞는 방법이라도 결과가 크게 흔들리면 개별 추정은 실제값에서 멀 수 있다. 정확성에는 체계적인 어긋남과 우연한 변동이 모두 관련된다. 계측학에서는 평균적 치우침과 관련된 진도(trueness)를 정밀도 및 정확도와 구분한다.[8](#ref-8)
또한 ‘95% 신뢰구간’의 신뢰수준은 측정도구의 신뢰도가 95%라는 뜻이 아니다. 네 용어를 구분하는 목적은 이름을 엄격히 나누는 데 있지 않다. 결과가 좁게 모이는지, 실제값에 가까운지, 측정이 일관되는지, 그 결과를 의도한 의미로 쓸 수 있는지를 각각 확인하려는 것이다.
AI가 같은 답을 반복해 내놓는 것도 그 조건에서의 출력 일관성을 보여줄 뿐, 정확성과 타당성을 입증하지는 않는다. 답변을 다시 생성해 비교하는 일에 더해 원문·기준자료·별도 계산과 대조해야 한다. 앞 절의 비교 준거를 바꾸어 평가가 달라지는 것과, 오류를 바로잡아 측정값이 달라지는 것 역시 구별해야 한다.
7. 세 역할이 요구해야 할 최소한의 근거
학술연구자는 **질문–개념–측정–설계–추정–주장**의 연결을 확인해야 한다. 정책전문가는 여기에 **기준선–대안–효과–비용–형평성–실행 조건**을 더해야 한다. 데이터전문가는 이 연결을 실제 산출물에서 확인할 수 있도록 **표집·실사·처리·분석·검증·전달의 기록**을 제공해야 한다.
공통으로 요구할 것은 긴 기술보고서의 양이 아니라 다음 내용이다.
**무엇을 알고 싶었는가. 어떤 자료를 썼는가. 실제로 누구를 포함해 무엇을 계산했는가. 무엇을 확인했고 무엇은 가정하거나 확인하지 못했는가. 무엇을 주장할 수 있는가.**
모든 이용자가 모든 코드를 감사해야 한다는 뜻은 아니다. 전문적인 검토가 필요한 부분을 식별하고, 그 검토를 요청할 수 있어야 한다. 앱과 기관도 필요한 근거를 제공할 책임이 있다. AI 위험관리 역시 개발만이 아니라 이용·평가·관리 전반의 역할과 절차를 포함한다. [5](#ref-5)
9. 데이터가 많아질수록 근거의 경계를 더 분명히 한다
기록 수가 많다고 필요한 집단을 빠짐없이 포착한 것은 아니다. 예측이 잘 맞는다고 개입 효과를 알게 된 것도 아니다. 합성자료에서 새로운 패턴이 나왔다고 현실에서 그 패턴을 확인한 것도 아니다.
또한 **디지털 트윈은 단순한 데이터 유형이라기보다 특정 대상의 상태·구조·변화를 표현하는 모형과 연결 체계로 이해하는 편이 낫다.** 그 체계에 실측자료와 모의자료가 함께 들어갈 수 있다. ‘실리콘 표본’처럼 생성형 AI가 만든 응답을 이용할 때도 실제 응답, 모형 출력, 전문가 판단을 따로 표시해야 한다.
새로운 기술을 쓸수록 **무엇을 새로 할 수 있고 무엇이 여전히 확인되지 않는지를 정확하게 구분해야 한다*.
지표를 읽는 일과 지표를 목표로 만드는 일은 다르다
데이터의 한계는 표본과 계산에만 있지 않다. 수치로 표현하지 않은 가치를 평가에서 지우거나, 실적지표를 보상과 연결해 원래 의도와 다른 행동을 만들 수도 있다. 예컨대 취업률만 높이려다가 지원이 더 필요한 사람을 기피한다면 숫자상의 성과와 정책의 목적은 어긋난다. 이는 가상 사례다.
2편에서는 **맥나마라 오류(수치화한 것만 중시), 굿하트·캠벨 논의(지표 목표화에 따른 왜곡), 코브라 효과(유인 역효과)**를 구분한다. 이들을 제1·2종 통계적 검정 오류와 같은 층에 놓지 않는다. 문제가 생기는 경로가 달라 필요한 대응도 다르기 때문이다. [추가 설명과 근거: 2편](02_구조_메타데이터_자동화.html)
학술연구자는 주장과 측정의 거리를, 정책전문가는 지표와 실제 목표의 차이를, 데이터전문가는 자료 생성·처리와 보고의 근거를 함께 확인한다.
10. 결론: 도구 사용의 장벽이 낮아졌다고 판단의 기준도 낮아지는 것은 아니다
AI는 자료 탐색·코드 작성·분류·설명·문서화를 지원하며 이용자가 시도할 수 있는 작업을 넓힌다. 구체적인 성능과 한계는 과업·자료·도구·설정에 따라 확인해야 한다. AI 일반에 대한 낙관이나 불신이 개별 결과의 검토를 대신하지 않는다.
이용자의 공부는 없어지는 것이 아니라 중심이 이동한다. 코드 문법을 직접 만들어내는 숙련만이 아니라 **분야지식, 과학적·분석적 방법, 데이터의 생성과정, 자동화의 선택과 검증**을 함께 이해해야 한다.
**AI 시대의 데이터 리터러시는 데이터를 읽는 능력에, AI가 무엇을 근거로 어떻게 일했는지 확인하고 그 결과를 책임 있게 사용하는 능력이 더해진 것이다.**
2편에서는 이 판단의 기반인 데이터 구조·형식·메타데이터를, 3편에서는 역할별 도구 선택을, 4편에서는 이를 수행할 개인 역량을 다룬다.
참고자료
<a id="ref-1"></a>**[1]** Hernán, M. A., Hsu, J., & Healy, B. *Data science is science’s second chance to get causal inference right: A classification of data science tasks*. 기술·예측·인과 과업의 구분. https://arxiv.org/abs/1804.10846
<a id="ref-2"></a>**[2]** HM Treasury. *The Green Book*. 정책대안의 비용·편익·위험 평가. https://www.gov.uk/government/publications/the-green-book-appraisal-and-evaluation-in-central-government
<a id="ref-3"></a>**[3]** CDC/NCHS. *NHANES Tutorials: Variance Estimation*. 복합표본 설계와 분산 추정. https://wwwn.cdc.gov/nchs/nhanes/tutorials/varianceestimation.aspx
<a id="ref-4"></a>**[4]** W3C. *PROV-Overview*. 자료·활동·책임 주체의 출처 관계. https://www.w3.org/TR/prov-overview/
<a id="ref-5"></a>**[5]** NIST. *AI Risk Management Framework*. 맥락·역할·평가·관리. https://www.nist.gov/itl/ai-risk-management-framework
<a id="ref-6"></a>**[6]** Kahneman, D., & Tversky, A. (1979). *Prospect theory: An analysis of decision under risk*. Econometrica, 47(2), 263–291. 준거점에 대한 이득·손실 평가와 준거점의 이동. https://doi.org/10.2307/1914185 · 저자 공개 원문: https://kahneman.scholar.princeton.edu/document/11
<a id="ref-7"></a>**[7]** Tversky, A., & Kahneman, D. (1981). *The framing of decisions and the psychology of choice*. Science, 211(4481), 453–458. 동등한 선택 문제의 표현 방식과 판단. https://doi.org/10.1126/science.7455683
<a id="ref-8"></a>**[8]** JCGM. *International Vocabulary of Metrology (VIM), 3rd edition*, 2.13 Measurement accuracy; 2.14 Measurement trueness. 정확도·진도와 정밀도의 관계. https://jcgm.bipm.org/vim/en/2.13.html · https://jcgm.bipm.org/vim/en/2.14.html
<a id="ref-9"></a>**[9]** JCGM. *International Vocabulary of Metrology (VIM), 3rd edition*, 2.15 Measurement precision. 반복 측정 조건과 정밀도. https://jcgm.bipm.org/vim/en/2.15.html
<a id="ref-10"></a>**[10]** AERA, APA, & NCME. (2014). *Standards for Educational and Psychological Testing*. 제1장 Validity, 제2장 Reliability/Precision and Errors of Measurement, 제5장 Scores, Scales, Norms, Score Linking, and Cut Scores. 특정 해석·용도의 타당성, 측정 조건별 신뢰도와 정밀도. https://www.testingstandards.net/uploads/7/6/6/4/76643089/standards_2014edition.pdf
*작성·개정 성격: 필자가 제시한 개요와 논지를 토대로 생성형 AI가 구조화·문장 작성·자료 확인을 지원한 개정 초안이다. 본문에서 제안한 역할 구분과 점검표는 실무 설명용이며 검증된 평가척도가 아니다. 최종 공개 전 저자의 검토·승인이 필요하다. 수치 예시는 실제 조사 결과가 아니다.*
'데이터 리터러시' 카테고리의 다른 글
| 개인과 조직의 데이터 역량 (0) | 2026.09.14 |
|---|---|
| 데이터의 유형, 품질과 메타 데이터 (0) | 2026.09.14 |
| GPT 시대, 연구문제 설정과 분석 기법 선택 가이드 (0) | 2025.09.26 |
| ChatGPT용 데이터 설명서 (메타데이터) 만들기 (0) | 2025.09.26 |
| 데이터 분석의 자동 전 처리: 커스텀 ChatGPT 활용 (0) | 2025.09.26 |