목록전체 글 (429)
susinlee 님의 블로그
결론부터D2a Dense는 여전히 가장 강한 단일 retriever.특히 @20에서 25/27 claim, 6/8 question으로 RRF의 23/27, 5/8보다 좋음. 반면 @3, @5에서 상당한 이득을 보여서 sparse/dense 상보성이 실제로 존재함.즉, "Hybrid가 실패했다"도 아니고 "Hybrid가 baseline을 대체했다"도 아님. Sparse와 Dense의 상보성은 확인됨 → 고정 1:1 RRF는 그 상보성을 완전히 보존하지 못함→ 현재 RRF 구현에도 tie 처리 문제가 하나 있음1. 요청했던 invariant 10개를 검토하면실험 invariant는 대부분 제대로 지켜졌음. Representation, query rewrite, reranker, parser, chunker..
1. D2b 문제는 제대로 바로 잡혔다D2b = row-atomic retrieval experiment 로만 참고하고,compact representation의 효과는 새 D2c로 판단할 수 있게 됐음.2. 이번 D2c는 우리가 원래 원했던 실험이 맞다이번에는 독립변수가 제대로 통제됨. D2a와 D2c 모두:Retrieval Units = 2,869RU ID 동일canonical mapping 동일source span 동일split topology 동일1:N canonical chunk = 5 바뀐 건 eligible table 745개의 embedding용 문자열뿐임. 이게 바로 우리가 원해던 실험.즉 이번 결과부터는 실제로 "compact table representation의 효과" 라고 해석해도..
이전 실험 결론D2a는 채택할 가치가 있고, D2b는 폐기한다. 다음에는 표 serialization을 더 만지지 말고, Q05-C3의 structural-context 문제를 딱 한 번 확인한 뒤Hybrid Retrieval로 넘어가는 게 좋다.1. 이번 작업에서 실제로 확정한 것먼저 아키텍처가 꽤 깔끔히 분리됨.Original Source→ Element→ Canonical Chunk→ Retrieval Unit→ Search Result→ Context Unit→ Generation 특히 중요한 변화는 이제 검색 모델에 들어가는 객체가 Canonical Chunk가 아니라 Retrieval Unit으로 명시됐다는 것.Gold evidence는 여전히 원본 source ref/span에 고정되고,Re..
결론부터12,711-token chunk는 packing bug가 아니라 "1x1 표 셀 하나가 문서 여러 소절을 통째로 담고 있어서" 생겼음따라서 parser보다는 chunking/retrieval-unit contract 문제에 가까움D1 structured serialization은 실패함. Dense 검색을 개선하지 못했고 오히려 잘 검색되던 E228을 악화시킴`Canonical Source → Rerieval Unit → Context Unit` 분리 방향은 맞지만, 현재 context budget 정책은 조금 수정해야 함headline 결과를 보면 분명한데, D0 Dense는 @5에서 `15/27 claim`, `2/8 question` 이었는데, D1은 `9/27, 1/8`로 떨어짐.@20에..
요약BM25 baseline을 잠근 뒤 BGE-M3 dense-only baseline까지 붙였고,Dense가 의미적 표현 차이에는 확실히 강했지만 표 표현 방식과 multi-evidence 결합에서는 아직 한계가 드러난 상태. 먼저 큰 그림부터현재 파이프라인은 아래와 같음고정 원본→ Parser→ Element / Cell lineage→ Gold evidence→ Structural Chunking→ BM25 baseline→ Q07 gold 재설계→ E186 conflict semantics 정리→ Dense Retrieval baseline(BGE-M3)→ [현재 위치] 다음 후보는 에이전트가 제안한 대로 structured table serialization인데, 결과를 보면 꽤 타당한 선택임...
중간 점검 1을 정리하며 궁금한 점들에 대한 답변.1·2 언제 "금융 공시 검색 Recall@5가 18%다"라고 할 수 있는가, 그리고 출시 후 에이전트 성능은 어떻게 평가하는가현재 `5/27 = 18.52%`는 정확한 계산이지만, 의미는 매우 작음.현재 인덱스는 이수페타시스FY2025 사업보고서 한 건2,803개 청크이고독립 양성 질문 8개에서필수 claim 27개를 평가함.따라서 현재 말할 수 있는 것은:"이수페타시스 FY2025 사업보고서 한 건에 대해 사람이 검수한 10문항 회귀셋에서, 독립 양성 문항의 필수 주장 27개를 기준으로 BM25 claim Recall@5는 5/27(18.52%)였다" 반대로"우리 금융 공시 검색기의 Recall@5는 18.5%다" 라고 일반화하려면 평가 데이터셋 자체..
지금 프로젝트는 고정 원본 → 파싱 → 골드 근거(Element/Cell) → 결정적 청킹 → 근거-청크 대응 평가 → BM25 baseline → baseline 감사 및 평가 버그 수정 까지 끝난 상태고, 이제 Dense Retrieval baseline을 붙여 BM25와 비교하는 단계 직전임. 더보기더보기1. 골드 근거 (Gold Evidence)정의: 특정 질문이나 작업에 대해 "사람이 직접 검증한 100% 확실한 정답 기준 문서/위치(Ground Truth)"를 뜻합니다.배경: 인공지능/데이터 분야에서는 정답 레이블(기준 데이터)을 흔히 골드 스탠다드(Gold Standard)라고 부릅니다.괄호 (Element/Cell)의 의미:문서 전체를 정답으로 두는 것이 아니라, 문서 내의 특정 문단/제목..
상태와 범위이 10개는 첫 컹킹과 검색·답변 경로를 점검하는 작은 회귀셋이다. 전체 기업에 대한 일반화 성능을 나타내지 않는다.공통 스냅샷 S25 ― 원본·manifest 대조 완료필드값기업이수페타시스, corp_code=00107613정보 기준시점2026-09-26T00:00:00:+09:00대상 문서FY2025 사업보고서, 접수번호 20260323000847원본 ZIP SHA-256ff2ee7ca28c18ac6487ea4349cfde9d8dca4d03771c2a8a1bd37c9d81cfd7bb6사용자가 기록한 파서·전처리 버전2 / 2사용자가 기록한 설정 해시2d75d2abcee582315a440b126806f22760c813a3f14cf4b16d563b517dc7f0e7검색 자격제공된 parse_m..
