검색과 ML 시스템의 품질은 모델 지표와 운영 결과를 함께 봐야 판단할 수 있습니다. 사용자 질문과 현업의 의사결정이 그 기준이 됩니다.

Writing

원문을 그대로 검색했는데 0건: Elasticsearch nori의 position hole

nori mixed decompounding과 품사 필터를 함께 사용하면 원문과 같은 match_phrase가 0건을 반환했습니다. 토큰 그래프의 position hole이 span query에서 사라진 두 경로를 수정하고 회귀 테스트를 추가했습니다.

Elasticsearch · Nori · Retrieval · 2026.07

거래금액 48개로 풀리는 FDS 데이터: AI-Hub 638만 건 감사

AI-Hub 금융 이상거래 데이터 638만 건을 감사했습니다. 전자금융공동망 443만 건은 거래금액 48개로 구성됐고, 전체의 98.97%를 차지하는 구간에 양성이 한 건도 없었습니다.

Fraud Detection · Data Validation · 2026.07

Transformers continuous batching에서 이미 받은 출력이 바뀌던 문제 (English)

이미 전달된 스트리밍 chunk가 뒤늦게 바뀌고, soft-reset 요청이 max_new_tokens에 도달하기 전에 멈췄습니다. 토큰마다 실행되는 출력 변환기를 snapshot으로 바꿔 해결했습니다.

Transformers · Serving · 2026.07

모바일 스크린샷 50장으로 비교한 OCR과 Vision LLM

Tesseract·EasyOCR·PaddleOCR과 Qwen2.5-VL 7B/32B/72B를 같은 스크린샷 50장으로 비교했습니다. PaddleOCR과 7B는 ROUGE-L과 처리 시간이 비슷했고, 32B에서 두 지표의 균형이 가장 좋았습니다.

OCR · VLM · 2026.05

보험 QA Agent의 자율성을 설계하는 법

보험 질문 하나에는 약관 검색, 사고 해석, 담보 연결이 함께 들어옵니다. 세 가지 Agent 구조를 같은 질문과 평가 기준으로 비교할 수 있도록 실험을 설계했습니다.

Agent · Evaluation · 2026.06

미조사 데이터를 세 번째 레이블로 관리하는 법

조사 대기 사례에 정상 레이블을 붙이면 과거 조사 정책이 모델의 정답이 됩니다. 미조사를 별도 레이블로 분리하고 선택 편향을 측정하는 방법을 정리했습니다.

Label Quality · PU Learning · 2026.02

양성 0.5%에서 모델을 선택하는 기준

조사팀이 처리할 수 있는 건 하루 100건입니다. 이 용량을 기준으로 모델 지표를 실제 조사 정책으로 바꾸는 방법을 설명합니다.

Model Evaluation · Precision@K · 2026.02