Skip to content

Commit d1f1029

Browse files
committed
docs(eval): refresh presentation metrics and swap final report html
1 parent 18c7004 commit d1f1029

2 files changed

Lines changed: 199 additions & 179 deletions

File tree

eval_resources/ab_presentation_reordered_with_latency_track.md

Lines changed: 30 additions & 7 deletions
Original file line numberDiff line numberDiff line change
@@ -156,6 +156,29 @@
156156
- `eval_010`: 비CSV 질의에서 "문서 미검출" 상태를 벗어나 정확 답변으로 안정화(0->10).
157157
- `eval_016`: 2트랙 생성 붕괴를 추출우선에서 복구하며 최종 품질이 크게 상승(3->9).
158158

159+
### 3-4) 마지막 패치 묶음 기준 최종 레이턴시 절감
160+
목적: "최종 운영 시점에서 레이턴시가 얼마나 줄었는지"를 별도 확인.
161+
162+
마지막 패치 묶음(3/1):
163+
- `f12a15d`: row-scoped 수량 추출/기관 정규화
164+
- `6fbaa64`: 답변 잘림 방지 + 근거 문맥 보존
165+
- `18c7004`: 존댓말 통일 + 중복 후행 라인 제거
166+
167+
비교 기준:
168+
- A: `extractive_only_20260226` (실험 3-2의 개선 기준점)
169+
- B: `full20_chunk_synced_after_honorific_dedupe_fix_20260301` (최종)
170+
171+
| 레이턴시 지표 | A | B | 변화율 |
172+
|---|---:|---:|---:|
173+
| 총 latency (문항당 단계합 평균) | 10.886s | 6.55s | -39.85% |
174+
| 평균 generate | 8.31s | 3.68s | -55.68% |
175+
176+
가능해진 개선 포인트(최종 운영 관점):
177+
- 장문/복합 질의에서 답변 중간 절단을 줄이고, 근거 문맥을 유지한 상태로 완결형 응답 생성 가능
178+
- 단답형/수치형 질문도 존댓말 문장으로 일관되게 출력 가능
179+
- 후행 중복 문장(같은 의미 반복) 자동 억제로 가독성 개선
180+
- 표/행 기반 수량 추출에서 행 스코프를 고정해 값 혼입(옆 행 숫자 오인) 가능성 축소
181+
159182
---
160183

161184
## 4) 실험 4: chunk recall 개선(측정/개선 분리 보고)
@@ -280,14 +303,14 @@
280303
---
281304

282305
## 7) 최종 정리: 기준선 대비 최종 운영 지표
283-
핵심: "실험 1의 기준선(current_patch)에서 최종 운영(full20_chunk_synced_after_commit_rerun)까지의 순증."
306+
핵심: "실험 1의 기준선(current_patch)에서 최종 운영(full20_chunk_synced_after_honorific_dedupe_fix_20260301)까지의 순증."
284307

285-
| 지표 | A (current_patch) | B (full20_chunk_synced_after_commit_rerun) | 변화율 |
308+
| 지표 | A (current_patch) | B (full20_chunk_synced_after_honorific_dedupe_fix_20260301) | 변화율 |
286309
|---|---:|---:|---:|
287-
| Correctness | 3.75 | 4.25 | +13.33% |
288-
| Answer Coverage | 3.35 | 4.25 | +26.87% |
289-
| Faithfulness | 4.35 | 4.15 | -4.60% |
290-
| Context Relevance | 4.65 | 4.65 | +0.00% |
310+
| Correctness | 3.75 | 4.10 | +9.33% |
311+
| Answer Coverage | 3.35 | 4.00 | +19.40% |
312+
| Faithfulness | 4.35 | 4.35 | +0.00% |
313+
| Context Relevance | 4.65 | 4.75 | +2.15% |
291314
| Recall@5 (source) | 0.90 | 1.00 | +11.11% |
292315
| MRR (source) | 0.90 | 0.95 | +5.56% |
293-
| 매크로(C/AC/F/CR) | 4.0250 | 4.3250 | +7.45% |
316+
| 매크로(C/AC/F/CR) | 4.0250 | 4.3000 | +6.83% |

0 commit comments

Comments
 (0)