Σύνολο δεδομένων ταξινομήσεων HereSay Voice AI

Έκδοση 2026-Q2-v2 · ODC-BY 1.0

10 συγκεντρωτικά σύνολα δεδομένων ταξινόμησης που υπολογίστηκαν από 54 ανωνυμοποιημένες συνομιλίες voice AI (2,334 γύροι). Περιλαμβάνει την τριχοτομία Ask/Do/Express της OpenAI, facets ειδικά για τη φωνή, συναίσθημα ανά γύρο (VADER), κατανομές τύπων ερωτήσεων και αντωνυμιών, μεταβάσεις στην πορεία της συνομιλίας και μοτίβα ανά ώρα της ημέρας. Το ακατέργαστο κείμενο των συνομιλιών δεν περιλαμβάνεται.

Άδεια: ODC-BY 1.0

Δωρεάν χρήση, δωρεάν αναδιανομή, με υποχρεωτική αναφορά. Όταν χρησιμοποιείς αυτό το σύνολο δεδομένων σε έρευνα, δημοσιογραφία ή εμπορική εργασία, βάλε:

"Contains information from the HereSay Voice AI Classifications Dataset (2026-Q2-v2) by HereSay (heresay.live), which is made available under the ODC Attribution License (ODC-BY 1.0)."

Χρειάζεσαι έναν δωρεάν λογαριασμό HereSay για να κατεβάσεις. Έτσι βλέπεις την άδεια τη στιγμή της λήψης.

Συνδέσου ή δημιούργησε έναν δωρεάν λογαριασμό

Τι περιέχει το ZIP

  • 01_conversation_stats.csv — workhorse table (turns, char counts, redactions)
  • 02_asking_doing_expressing.csv — OpenAI taxonomy label per conversation
  • 03_voice_facets.csv — mic_test / practice / casual / emotional / info_seeking
  • 04_turn_lengths.csv — char + word counts per turn
  • 05_voice_signals.csv — filler words, mic-check phrases, ASR garble
  • 06_question_types.csv — what / how / why / yes-no question counts
  • 07_pronoun_usage.csv — 1st / 2nd / 3rd person counts per role
  • 08_arc_transitions.csv — opening facet -> closing facet (Sankey input)
  • 09_sentiment.csv — VADER compound score per turn
  • 10_time_of_day.csv — UTC hour bucket counts
  • Επίσης README, METHODOLOGY, DATASHEET, CODEBOOK, CITATION.cff, LICENSE, CHANGELOG

Διάβασε το blog post με τα βασικά ευρήματα →