Jeu de données de classifications HereSay Voice AI

Version 2026-Q2-v2 · ODC-BY 1.0

10 jeux de données de classification agrégés calculés à partir de 54 conversations anonymisées avec l’IA vocale (2 334 tours). Inclut la trichotomie Asking/Doing/Expressing d’OpenAI, des facettes spécifiques à la voix, le sentiment par tour (VADER), la distribution des types de questions et des pronoms, les transitions de l’arc de conversation et les tendances selon l’heure de la journée. Le texte brut des conversations n’est pas inclus.

Licence : ODC-BY 1.0

Libre à utiliser, libre à redistribuer, attribution requise. Quand tu utilises ce jeu de données dans des travaux de recherche, du journalisme ou un usage commercial, inclue :

"Contains information from the HereSay Voice AI Classifications Dataset (2026-Q2-v2) by HereSay (heresay.live), which is made available under the ODC Attribution License (ODC-BY 1.0)."

Tu as besoin d’un compte HereSay gratuit pour télécharger. Ça te permet de voir la licence au moment du téléchargement.

Connecte-toi ou crée un compte gratuit

Ce qu’il y a dans le ZIP

  • 01_conversation_stats.csv — workhorse table (turns, char counts, redactions)
  • 02_asking_doing_expressing.csv — OpenAI taxonomy label per conversation
  • 03_voice_facets.csv — mic_test / practice / casual / emotional / info_seeking
  • 04_turn_lengths.csv — char + word counts per turn
  • 05_voice_signals.csv — filler words, mic-check phrases, ASR garble
  • 06_question_types.csv — what / how / why / yes-no question counts
  • 07_pronoun_usage.csv — 1st / 2nd / 3rd person counts per role
  • 08_arc_transitions.csv — opening facet -> closing facet (Sankey input)
  • 09_sentiment.csv — VADER compound score per turn
  • 10_time_of_day.csv — UTC hour bucket counts
  • Plus README, METHODOLOGY, DATASHEET, CODEBOOK, CITATION.cff, LICENSE, CHANGELOG

Lire l’article de blog avec les principaux résultats →