HereSay 음성 AI 분류 데이터셋

버전 2026-Q2-v2 · ODC-BY 1.0

54개의 익명화된 음성 AI 대화 54개 (2,334 turns)에서 계산한 10개 집계 분류 데이터셋입니다. OpenAI의 Asking/Doing/Expressing 3분류, 음성 전용 세부 항목, 턴별 감정(VADER), 질문 유형 및 대명사 분포, 대화 흐름 전환, 시간대 패턴을 포함합니다. 원본 대화 텍스트는 포함되지 않습니다.

라이선스: ODC-BY 1.0

무료로 사용하고, 자유롭게 재배포할 수 있지만, 출처 표기는 필요합니다. 이 데이터셋을 연구, 저널리즘, 또는 상업적 작업에 사용할 때는 다음을 포함해 주세요:

"Contains information from the HereSay Voice AI Classifications Dataset (2026-Q2-v2) by HereSay (heresay.live), which is made available under the ODC Attribution License (ODC-BY 1.0)."

다운로드하려면 무료 HereSay 계정이 필요해요. 다운로드할 때 라이선스를 확인하실 수 있도록 하기 위해서예요.

로그인하거나 무료 계정을 만드세요

ZIP에 들어 있는 내용

  • 01_conversation_stats.csv — workhorse table (turns, char counts, redactions)
  • 02_asking_doing_expressing.csv — OpenAI taxonomy label per conversation
  • 03_voice_facets.csv — mic_test / practice / casual / emotional / info_seeking
  • 04_turn_lengths.csv — char + word counts per turn
  • 05_voice_signals.csv — filler words, mic-check phrases, ASR garble
  • 06_question_types.csv — what / how / why / yes-no question counts
  • 07_pronoun_usage.csv — 1st / 2nd / 3rd person counts per role
  • 08_arc_transitions.csv — opening facet -> closing facet (Sankey input)
  • 09_sentiment.csv — VADER compound score per turn
  • 10_time_of_day.csv — UTC hour bucket counts
  • README, METHODOLOGY, DATASHEET, CODEBOOK, CITATION.cff, LICENSE, CHANGELOG 포함

주요 결과를 담은 블로그 글 읽기 →