HereSay 語音 AI 分類資料集

版本 2026-Q2-v2 · ODC-BY 1.0

54 段匿名語音 AI 對話(2,334 個回合)計算出的 10 個彙總分類資料集。包含 OpenAI 的 Asking/Doing/Expressing 三分法、語音專屬面向、逐回合情緒(VADER)、問句類型與代名詞分布、對話軌跡轉換,以及一天中的時段模式。不包含原始對話文字。

授權:ODC-BY 1.0

可免費使用、可免費再散布,需註明出處。當你在研究、新聞報導或商業工作中使用這份資料集時,請包含:

"Contains information from the HereSay Voice AI Classifications Dataset (2026-Q2-v2) by HereSay (heresay.live), which is made available under the ODC Attribution License (ODC-BY 1.0)."

你需要免費的 HereSay 帳號才能下載。這樣你在下載時就能看到授權條款。

登入或建立免費帳號

ZIP 內容

  • 01_conversation_stats.csv — workhorse table (turns, char counts, redactions)
  • 02_asking_doing_expressing.csv — OpenAI taxonomy label per conversation
  • 03_voice_facets.csv — mic_test / practice / casual / emotional / info_seeking
  • 04_turn_lengths.csv — char + word counts per turn
  • 05_voice_signals.csv — filler words, mic-check phrases, ASR garble
  • 06_question_types.csv — what / how / why / yes-no question counts
  • 07_pronoun_usage.csv — 1st / 2nd / 3rd person counts per role
  • 08_arc_transitions.csv — opening facet -> closing facet (Sankey input)
  • 09_sentiment.csv — VADER compound score per turn
  • 10_time_of_day.csv — UTC hour bucket counts
  • 另含 README、METHODOLOGY、DATASHEET、CODEBOOK、CITATION.cff、LICENSE、CHANGELOG

閱讀包含重點發現的部落格文章 →