HereSay 음성 AI 분류 데이터셋
버전
2026-Q2-v2
· ODC-BY 1.0
54개의 익명화된 음성 AI 대화 54개 (2,334 turns)에서 계산한 10개 집계 분류 데이터셋입니다. OpenAI의 Asking/Doing/Expressing 3분류, 음성 전용 세부 항목, 턴별 감정(VADER), 질문 유형 및 대명사 분포, 대화 흐름 전환, 시간대 패턴을 포함합니다. 원본 대화 텍스트는 포함되지 않습니다.
라이선스: ODC-BY 1.0
무료로 사용하고, 자유롭게 재배포할 수 있지만, 출처 표기는 필요합니다. 이 데이터셋을 연구, 저널리즘, 또는 상업적 작업에 사용할 때는 다음을 포함해 주세요:
"Contains information from the HereSay Voice AI Classifications Dataset (2026-Q2-v2) by HereSay (heresay.live), which is made available under the ODC Attribution License (ODC-BY 1.0)."
다운로드하려면 무료 HereSay 계정이 필요해요. 다운로드할 때 라이선스를 확인하실 수 있도록 하기 위해서예요.
로그인하거나 무료 계정을 만드세요ZIP에 들어 있는 내용
-
01_conversation_stats.csv— workhorse table (turns, char counts, redactions) -
02_asking_doing_expressing.csv— OpenAI taxonomy label per conversation -
03_voice_facets.csv— mic_test / practice / casual / emotional / info_seeking -
04_turn_lengths.csv— char + word counts per turn -
05_voice_signals.csv— filler words, mic-check phrases, ASR garble -
06_question_types.csv— what / how / why / yes-no question counts -
07_pronoun_usage.csv— 1st / 2nd / 3rd person counts per role -
08_arc_transitions.csv— opening facet -> closing facet (Sankey input) -
09_sentiment.csv— VADER compound score per turn -
10_time_of_day.csv— UTC hour bucket counts - README, METHODOLOGY, DATASHEET, CODEBOOK, CITATION.cff, LICENSE, CHANGELOG 포함