목록으로

콜센터 통화에서 겹쳐 말하는 구간의 화자 분리 개선

정하늘, 이수아, 문태경

기술 리포트 · GR-2026-042026.04.09

음성#가늠 NOTE

요약

상담 통화에서 고객과 상담원이 동시에 말하는 구간은 전체 통화의 일부지만, 불만이나 확인 요청처럼 중요한 발화가 몰려 있습니다. 본 리포트는 동시 발화 구간을 먼저 검출하고 해당 구간에서만 두 화자의 음성을 분리해 인식하는 방식으로 기록 누락을 줄인 결과를 정리합니다(예시 데이터).

그림 1. 동시 발화 구간을 화자별 트랙으로 나눈 예
그림 1. 동시 발화 구간을 화자별 트랙으로 나눈 예

겹치는 순간이 중요한 이유

상담 기록을 검토해 보면 고객이 상담원의 말을 끊고 들어오는 순간에 핵심 정보가 자주 나옵니다. "아니요, 그 주소 말고요" 같은 말입니다. 기존 음성 인식은 한 시점에 한 명만 말한다고 가정하기 때문에 이 구간에서 둘 중 한 사람의 말을 통째로 놓치곤 했습니다.

접근

모든 구간에서 음성 분리를 하면 계산량이 커지고 오히려 단독 발화 구간의 품질이 떨어집니다. 그래서 먼저 동시 발화가 일어난 구간만 찾아내고, 그 구간에서만 두 화자의 음성을 분리해 각각 인식하는 두 단계 구조를 만들었습니다.

데이터

상담 시나리오를 바탕으로 배우들이 녹음한 가상 통화 500건을 사용했습니다. 전화망을 거친 음질을 재현하기 위해 대역폭을 제한하고 잡음을 섞었습니다. 동시 발화 구간은 사람이 직접 표시했습니다.

결과

동시 발화 구간의 단어 누락이 기존 방식보다 줄었고, 전체 통화의 인식 품질은 그대로 유지되었습니다(예시 데이터). 특히 짧은 맞장구와 끼어들기 발화가 기록에 남기 시작했습니다.

남은 과제

세 사람 이상이 동시에 말하는 회의 녹음에서는 분리 성능이 아직 충분하지 않습니다. 또한 같은 성별, 비슷한 음색의 두 화자가 겹칠 때 화자 이름이 뒤바뀌는 사례가 있어 화자 특징을 통화 전체에서 누적하는 방법을 실험하고 있습니다.

이 연구가 적용된 솔루션가늠 NOTE