AI좌표

발행된 글을 최신 순서로 보여드립니다.

AI 시스템 설계 순서: 문제 정의부터 평가·권한·복구까지

AI 시스템 설계 순서: 문제 정의부터 평가·권한·복구까지

운영되는 AI 시스템은 모델에서 시작하지 않고 업무 결정과 피해를 정의한 뒤 평가, 데이터 경계, 권한, 승인, 관찰, 복구를 하나의 통제 흐름으로 연결한다. 데모는 좋은 답 한 번으로 성공할 수 있지만 서비스는 모호한 입력, 데이터 변경, 도구 장애, 공격, 사람 실수를 반복해서 견뎌야 한다. 모델 품질은 중요한 구성 요소일 뿐이다. 시스템이 틀렸을 때 멈추고 설명하고 되돌릴 수 있어야 실…

판단 근거 읽기 →

AI 모델 선택 기준: 품질·비용·지연·크기를 한 표에서 비교하기

AI 모델 선택 기준: 품질·비용·지연·크기를 한 표에서 비교하기

모델 선택은 최고 점수 경쟁이 아니라 필요한 품질을 만족하는 후보 중 요청당 전체 비용과 꼬리 지연, 배포 제약을 가장 잘 맞추는 시스템을 찾는 일이다. 모델 크기는 능력과 같지 않고 가격표의 입력 단가도 총비용과 같지 않다. 긴 문맥, 재시도, 검색, 도구 호출, 검수 시간, GPU 유휴와 장애 대응까지 포함하면 선택이 달라진다. 먼저 품질 실패를 정의하고 같은 트래픽으로 후보를 비교해야 …

판단 근거 읽기 →

Model Card와 Datasheet: AI 모델과 데이터의 설명서를 쓰는 법

Model Card와 Datasheet: AI 모델과 데이터의 설명서를 쓰는 법

Model Card는 모델이 어디에 적합하고 어디에서 실패하는지 기록하고 Datasheet는 그 모델이 배운 데이터의 출처·구성·제약을 기록하는 서로 보완적인 문서다. 정확도 표 하나로는 모델이 어떤 사람과 환경에서 평가되었는지, 데이터가 왜 수집되었는지, 금지된 사용이 무엇인지 알 수 없다. 설명서는 홍보 문구가 아니라 다음 사용자와 검토자가 같은 경계를 재현하도록 돕는 운영 기록이어야 한…

판단 근거 읽기 →

AI 편향과 공정성: 평균 성능 뒤의 집단 격차를 찾는 법

AI 편향과 공정성: 평균 성능 뒤의 집단 격차를 찾는 법

공정성 평가는 하나의 편향 점수를 찾는 일이 아니라 누구에게 어떤 오류가 얼마나 발생하고 그 오류가 어떤 결정과 피해로 이어지는지 측정하는 과정이다. 데이터에 집단이 적게 포함되거나 라벨이 과거 관행을 반영하고, 목표 지표가 운영 피해를 놓치면 평균 성능이 높아도 격차가 생길 수 있다. 공정성의 정의는 과제와 가치에 따라 충돌할 수 있으므로 지표 선택 근거와 한계를 공개해야 한다. AI 핵심 …

판단 근거 읽기 →

AI 콘텐츠 저작권·라이선스·출처 증명: 세 질문을 분리하세요

AI 콘텐츠 저작권·라이선스·출처 증명: 세 질문을 분리하세요

AI 콘텐츠 검토에서는 결과물에 권리가 생기는지, 사용한 자료의 라이선스를 지켰는지, 파일의 출처와 편집 이력을 증명할 수 있는지를 따로 물어야 한다. 저작권, 라이선스, 출처 증명은 서로 연결되지만 같은 문제가 아니다. 사람이 창작적으로 선택·수정한 범위, 입력 자료와 폰트·음원의 허용 조건, 결과물이 기존 표현과 유사한지, 제작 이력을 어떻게 남길지를 나눠 검토해야 한다. AI 핵심 지식 …

판단 근거 읽기 →

AI 데이터 경계 설계: 학습·보관·로그·RAG를 따로 물어야 하는 이유

AI 데이터 경계 설계: 학습·보관·로그·RAG를 따로 물어야 하는 이유

AI 데이터 보호는 '학습에 쓰지 않는다' 한 문장으로 끝나지 않으며 입력·보관·로그·학습·RAG 복제본마다 목적과 수명, 접근자를 따로 확인해야 한다. 한 문서를 모델에 보내면 추론 요청 본문, 장애 분석 로그, 사용자 기록, 벡터 색인, 백업처럼 여러 위치에 파생본이 생길 수 있다. 학습 제외는 중요한 조건이지만 보관과 접근, 삭제 전파를 자동으로 해결하지 않는다. 실제 데…

판단 근거 읽기 →

프롬프트 인젝션이란: 외부 문서가 AI 지시를 바꾸는 공격

프롬프트 인젝션이란: 외부 문서가 AI 지시를 바꾸는 공격

프롬프트 인젝션은 모델 입력에 섞인 공격자 문구가 신뢰된 지시처럼 해석되는 문제이며 문구 필터 하나가 아니라 시스템 권한 경계로 방어해야 한다. 검색형 AI는 웹, 파일, 이메일을 읽는다. 그 콘텐츠 안에 '이전 지시를 무시하고 비밀을 보내라'는 문장이 있어도 사람에게는 단순 데이터지만 모델은 지시로 해석할 수 있다. 완벽한 탐지보다 공격이 성공해도 민감 정보와 외부 행동에 닿…

판단 근거 읽기 →

사람 평가와 LLM-as-a-Judge: 생성형 AI 답변을 공정하게 채점하는 법

사람 평가와 LLM-as-a-Judge: 생성형 AI 답변을 공정하게 채점하는 법

LLM 심사자는 대규모 반복 채점에 유용하지만 사람 판단의 대체물이 아니라 명시적 루브릭과 교정 표본 아래서 사용하는 측정 도구다. 요약·글쓰기·대화 답변은 문자열 일치만으로 품질을 재기 어렵다. 사람 평가는 맥락을 읽을 수 있지만 비용과 편향이 있고, 모델 심사자는 빠르지만 위치·말투·자기 선호 같은 편향을 보일 수 있다. 평가 목적에 맞는 역할 분담이 필요하다. AI 핵심 지식 52편 중 …

판단 근거 읽기 →

AI 벤치마크를 믿기 전에: 데이터 오염과 점수 해석의 함정

AI 벤치마크를 믿기 전에: 데이터 오염과 점수 해석의 함정

벤치마크 점수는 정해진 문항과 채점 조건에서의 측정값이며 문항 노출과 반복 최적화, 업무 분포 차이를 확인하지 않으면 선택 근거가 될 수 없다. 공개 시험은 같은 조건으로 후보를 비교하는 데 유용하지만 점수 한 줄은 과제 범위와 평가 시점을 압축한다. 문항이나 유사 표현이 학습 자료에 포함되었거나 개발자가 결과를 보며 반복 조정했다면 낯선 문제 해결 능력보다 시험 친숙도가 반영될 수 있다. A…

판단 근거 읽기 →

정확도·정밀도·재현율·F1: 어떤 지표를 언제 봐야 할까

정확도·정밀도·재현율·F1: 어떤 지표를 언제 봐야 할까

지표 선택은 숫자의 크기가 아니라 거짓 양성과 거짓 음성 중 어떤 오류가 더 중요한지를 정의하는 일이다. 양성 사례가 드문 데이터에서는 모두 음성이라고 예측해도 정확도가 높게 나올 수 있다. 정밀도는 양성이라고 한 것의 신뢰를, 재현율은 실제 양성을 얼마나 찾았는지를 본다. F1은 둘의 조화평균이지만 업무 비용을 대신 결정하지 않는다. AI 핵심 지식 52편 중 43편입니다. 제품 화면이 바뀌…

판단 근거 읽기 →

AI 평가 세트 만드는 법: 실제 업무 과제와 골든 세트의 기준

AI 평가 세트 만드는 법: 실제 업무 과제와 골든 세트의 기준

좋은 골든 세트는 어려운 질문 모음이 아니라 실제 업무 분포와 고비용 실패를 대표하고 누구나 같은 기준으로 다시 채점할 수 있는 테스트 자산이다. 임의의 열 문항으로 모델을 비교하면 결과가 담당자의 취향과 예시 선택에 흔들린다. 평가하려는 업무 결정, 입력 범위, 허용 가능한 답, 금지해야 할 오류를 먼저 정의해야 한다. 세트는 한 번 만들고 끝나는 문서가 아니라 실패가 발견될 때 버전으로 …

판단 근거 읽기 →

ASR과 TTS의 차이: 음성 AI 파이프라인을 평가하는 기준

ASR과 TTS의 차이: 음성 AI 파이프라인을 평가하는 기준

ASR은 음성을 문자 시퀀스로 해석하고 TTS는 문장을 발음·운율·음색을 가진 소리로 합성하므로 같은 음성 AI라도 실패 기준이 다르다. 마이크 입력과 스피커 출력 사이에는 음향 전처리, 언어 해석, 발음 생성, 파형 합성 같은 여러 단계가 있다. 회의실 소음에서 이름을 놓치는 문제와 안내 음성이 부자연스러운 문제는 같은 지표로 다룰 수 없다. 사용 환경에서 중요한 단위를 먼저 정해야 한다. …

판단 근거 읽기 →

VLM과 OCR은 무엇이 다른가: 문서 읽기에서 역할 나누는 법

VLM과 OCR은 무엇이 다른가: 문서 읽기에서 역할 나누는 법

OCR은 보이는 문자를 구조화하는 도구이고 VLM은 시각 요소와 언어 맥락의 관계를 해석하는 모델이므로 정밀 전사와 의미 판단을 분리해야 한다. 문서에서 '무슨 내용인가'를 묻는 것과 '세 번째 줄의 금액을 한 글자도 틀리지 않게 옮겨라'는 서로 다른 과제다. VLM이 문서를 설명할 수 있어도 모든 문자의 좌표와 정확성을 보장하지 않는다. 중요한 필드는 추출과 해…

판단 근거 읽기 →