HereSay Voice AI Classifications Dataset

Bersyon 2026-Q2-v2 · ODC-BY 1.0

10 pinagsamang classification datasets na kinuha mula sa 54 anonymized voice AI conversations (2,334 turns). Kasama ang trichotomy ng OpenAI na Asking/Doing/Expressing, mga voice-specific facet, sentiment per turn (VADER), distribusyon ng question type at pronoun, transitions ng conversation arc, at mga pattern ayon sa oras ng araw. Hindi kasama ang raw conversation text.

Lisensya: ODC-BY 1.0

Libre gamitin, libre i-redistribute, kailangan ng attribution. Kapag ginamit mo ang dataset na ito sa research, journalism, o commercial work, isama:

"Contains information from the HereSay Voice AI Classifications Dataset (2026-Q2-v2) by HereSay (heresay.live), which is made available under the ODC Attribution License (ODC-BY 1.0)."

Kailangan mo ng free HereSay account para mag-download. Para makita mo ang license sa oras ng download.

Mag-sign in o gumawa ng free account

Ano ang nasa loob ng ZIP

  • 01_conversation_stats.csv — workhorse table (turns, char counts, redactions)
  • 02_asking_doing_expressing.csv — OpenAI taxonomy label per conversation
  • 03_voice_facets.csv — mic_test / practice / casual / emotional / info_seeking
  • 04_turn_lengths.csv — char + word counts per turn
  • 05_voice_signals.csv — filler words, mic-check phrases, ASR garble
  • 06_question_types.csv — what / how / why / yes-no question counts
  • 07_pronoun_usage.csv — 1st / 2nd / 3rd person counts per role
  • 08_arc_transitions.csv — opening facet -> closing facet (Sankey input)
  • 09_sentiment.csv — VADER compound score per turn
  • 10_time_of_day.csv — UTC hour bucket counts
  • Kasama rin ang README, METHODOLOGY, DATASHEET, CODEBOOK, CITATION.cff, LICENSE, CHANGELOG

Basahin ang blog post na may mga pangunahing findings →