M3-4. 분석 — 데이터로 에이전트를 개선한다
한 줄 요약 — Analytics 페이지는 지표 나열이 아니라 4개 섹션 구조입니다 — 요약·커스텀 지표·Effectiveness(어떻게 끝났나)·Use(무엇을 얼마나 잘 답했나). 분석 → 토픽·지식 보강 → 재게시 사이클을 정기적으로 돌리세요.
1. 분석 페이지 열기
에이전트 상단 메뉴의 Analytics — 게시 후 실제 사용 데이터가 쌓이면 지표가 표시됩니다.
- 테스트 패널에서의 활동은 집계되지 않습니다 — 실사용 데이터만 잡힙니다
- 데이터 보존 — 분석 데이터 360일, 세션 상세·트랜스크립트는 28일
- 시간 표기는 모두 UTC 기준
- 분석만 열어주려면 공유 시 Analytics Viewer 역할, 트랜스크립트까지 보려면 Bot Transcript Viewer 역할이 필요합니다
2. Analytics의 4개 섹션
| 섹션 | 무엇을 보나 |
|---|---|
| Summary · Overview · Savings | AI가 뽑아준 요약 인사이트 · 핵심 KPI · 에이전트가 만든 시간·비용 절감 |
| Custom metrics (preview) | 우리 업무 기준으로 직접 정의한 지표 |
| Effectiveness | 대화가 어떻게 끝났고 사용자가 어떻게 느꼈나 |
| Use | 무엇을 얼마나 물었고, 답·도구·지식이 얼마나 잘 작동했나 |
화면 구성 예시 — 실제 화면·명칭은 버전에 따라 다를 수 있습니다
활성 사용자(DAU/MAU) 지표는 인증을 켠 에이전트에서만 제공됩니다 (M3-3).
3. Effectiveness — 대화 결과와 사용자 반응
| 하위 항목 | 내용 |
|---|---|
| Conversation outcomes | Resolved · Escalated · Abandoned · Unengaged 4가지 결과 |
| Reactions | 응답별 👍/👎 피드백과 사용자 코멘트 |
| Customer satisfaction | CSAT 설문 점수(5점) — Dissatisfied/Neutral/Satisfied 분포 |
| Sentiment (preview) | 세션 단위 AI 감정 분석 — Settings → Advanced에서 켜고 끔 |
| Agents | 자식·연결 에이전트의 호출량(Calls)·성공률(Success rate)·상태 |
대화 결과의 세부 사유 — 개선 지점을 찾는 핵심입니다:
- Resolved — Resolved confirmed(사용자가 성공을 확인) / Resolved implied(확인 없이 타임아웃·계획 종료)
- Escalated — System intended(설계된 업무 규칙에 따른 정상 이관) / System unintended(반복 실패로 막힌 사용자 — 조사 대상) / User requested(사용자가 직접 요청)
- Abandoned — 참여한 세션이 30분 무응답으로 타임아웃
- Unengaged — 시작만 하고 의미 있는 상호작용에 도달하지 못한 세션
차트의 See details 를 열면 결과별 비중과 함께 각 결과로 이어진 상위 토픽이 표시됩니다.
4. Use — 답변률·품질과 리소스 사용
| 하위 항목 | 내용 |
|---|---|
| Themes | 사용자 질문을 AI가 자동 군집화 — 어떤 주제가 몰리는지 |
| Generated answer rate and quality | 답한 질문/못 답한 질문 비율 + 답변 품질을 표본으로 Good/Poor 평가, Poor에는 사유 표시 |
| Tool use | 도구별 호출 횟수와 성공률 |
| Knowledge source use | 지식 소스별 사용량과 오류율 |
⚠️ “토픽별 성과” 독립 섹션은 현재 Analytics 구조에 없습니다. 대화 결과별 상위 토픽으로 대체됐습니다. 토픽 단위 분석은 클래식 모드 에이전트에 한해 Topics 페이지 → 토픽 선택 → … → Analytics 에서 볼 수 있고, 생성형 오케스트레이션이라면 대화 결과 + Themes 를 쓰라는 것이 공식 안내입니다.
5. Custom metrics (preview) — 우리 기준으로 재기
- 자연어로 “무엇을 재고 싶은지” 설명하면 AI가 계산용 프롬프트를 만들어 줍니다
- 에이전트당 최대 3개, 지표당 결과 카테고리 최대 10개(미분류는
Other) - 저장 시 최근 7일치를 1회 계산 → 이후 매일 야간에 재계산, 계산은 모두 세션 표본 기반
- 도넛 그래프로 표시되며, 세그먼트를 눌러 해당 세션 목록·AI의 판정 근거로 드릴다운
6. 개선 사이클
게시 → 사용 → 분석 확인
→ Escalated(System unintended)·Abandoned 세션의 실제 발화 검토
→ Poor 품질 답변의 사유 확인
→ 조치 선택:
· 반복되는 새 주제(Themes) → 토픽 신설
· 있는 토픽 미트리거 → 트리거 구문/설명 보강
· 지식 오답·오류율 → 소스 정비·추가
→ 재게시 → 다음 주기 확인
공식 워크플로도 같은 방향입니다 — 처음에는 지식 중심으로 빠르게 게시하고, 분석에서 발견한 자주 묻는 질문을 정형 토픽으로 만들어 갑니다 (M1-5).
7. 에이전트 플로우 모니터링
에이전트 플로우는 별도로 관찰합니다:
- 플로우 상세 화면에서 실행 기록(run history) — 성공·실패·소요 시간
- 실패 실행을 열어 어느 작업에서 실패했는지 입력·출력 확인
- 용량(Copilot Credits) 사용량은 Power Platform 관리센터에서 확인 (M3-5)
8. 환경 단위 관찰 — 관리자 시야
에이전트 한 대가 아니라 조직 전체를 봐야 할 때 쓰는 도구입니다.
| 도구 | 내용 |
|---|---|
| 환경 수준 텔레메트리 (preview) | Power Platform 관리센터에서 환경 단위로 한 번 설정 → OpenTelemetry GenAI 규격 스팬으로 Application Insights(dependencies 테이블)에 내보내기. 관리형 환경(Managed Environment) 한정이며 두 Harness 모두 지원 |
| 에이전트 수준 텔레메트리 | 메이커가 에이전트별로 설정하는 이벤트 기반 내보내기(customEvents) — Standard Harness 전용 |
| Agent inventory | 관리자가 테넌트 전역 에이전트 인벤토리(작성자·최근 게시일·연결 채널·인증 방식·커넥터 등)를 확인 |
분석 데이터 보존이 360일(트랜스크립트 28일)이므로, 장기 보관·상관 분석이 필요하면 텔레메트리 내보내기를 검토하세요.
9. 운영 루틴 제안
| 주기 | 할 일 |
|---|---|
| 주 1회 | 대화 결과(Escalated·Abandoned) 확인, 미해결 발화 10건 검토 |
| 격주 | 트리거 구문·지식 소스 보강, 재게시 |
| 월 1회 | Themes로 토픽 구조 재검토 — 볼륨 큰 주제의 정형화, 안 쓰는 토픽 정리 |
핵심 정리
- Analytics는 Summary·Overview·Savings / Custom metrics / Effectiveness / Use 4개 섹션 — 이 구조로 읽으세요
- 개선 대상 지정의 1순위는 Escalated(System unintended)·Abandoned 와 Poor 품질 답변의 사유입니다
- 실제 발화가 최고의 트리거 구문 소스입니다 — 상상으로 쓰지 마세요
- 보존 기간이 있습니다 — 분석 360일 · 트랜스크립트 28일. 더 길게 보려면 Application Insights로 내보내세요
M3 운영으로 · 다음: M3-5. 라이선스·용량
출처: Analyze conversational agents (MS Learn) · Analytics overview (MS Learn) · Analyze your agent with custom metrics (MS Learn) · Telemetry with Application Insights overview (MS Learn) · Agent inventory (MS Learn)