Setul de date HereSay Voice AI Classifications

Versiune 2026-Q2-v2 · ODC-BY 1.0

10 seturi de date agregate pentru clasificare, calculate din 54 de conversații anonimizate cu AI vocal (2.334 de intervenții). Include triada Asking/Doing/Expressing a OpenAI, aspecte specifice vocii, sentimente per intervenție (VADER), distribuții pe tipuri de întrebări și pronume, tranziții în arcul conversației și tipare în funcție de ora din zi. Textul brut al conversațiilor nu este inclus.

Licență: ODC-BY 1.0

Gratuit de folosit, gratuit de redistribuit, cu atribuire obligatorie. Când folosești acest set de date în cercetare, jurnalism sau în proiecte comerciale, include:

"Contains information from the HereSay Voice AI Classifications Dataset (2026-Q2-v2) by HereSay (heresay.live), which is made available under the ODC Attribution License (ODC-BY 1.0)."

Ai nevoie de un cont HereSay gratuit ca să descarci. Așa vezi licența în momentul descărcării.

Autentifică-te sau creează un cont gratuit

Ce găsești în ZIP

  • 01_conversation_stats.csv — workhorse table (turns, char counts, redactions)
  • 02_asking_doing_expressing.csv — OpenAI taxonomy label per conversation
  • 03_voice_facets.csv — mic_test / practice / casual / emotional / info_seeking
  • 04_turn_lengths.csv — char + word counts per turn
  • 05_voice_signals.csv — filler words, mic-check phrases, ASR garble
  • 06_question_types.csv — what / how / why / yes-no question counts
  • 07_pronoun_usage.csv — 1st / 2nd / 3rd person counts per role
  • 08_arc_transitions.csv — opening facet -> closing facet (Sankey input)
  • 09_sentiment.csv — VADER compound score per turn
  • 10_time_of_day.csv — UTC hour bucket counts
  • Plus README, METHODOLOGY, DATASHEET, CODEBOOK, CITATION.cff, LICENSE, CHANGELOG

Citește articolul de blog cu concluziile principale →