Set Data Klasifikasi AI Suara HereSay
Versi
2026-Q2-v2
· ODC-BY 1.0
10 set data klasifikasi agregat yang dikira daripada 54 perbualan AI suara yang dianonimkan (2,334 giliran). Termasuk trikotomi Asking/Doing/Expressing daripada OpenAI, ciri khusus suara, sentimen setiap giliran (VADER), pengagihan jenis soalan dan kata ganti nama diri, peralihan alur perbualan, dan corak masa dalam sehari. Teks perbualan mentah tidak disertakan.
Lesen: ODC-BY 1.0
Percuma untuk digunakan, percuma untuk diedarkan semula, perlu atribusi. Apabila anda menggunakan set data ini dalam penyelidikan, kewartawanan atau kerja komersial, sertakan:
"Contains information from the HereSay Voice AI Classifications Dataset (2026-Q2-v2) by HereSay (heresay.live), which is made available under the ODC Attribution License (ODC-BY 1.0)."
Anda perlukan akaun HereSay percuma untuk memuat turun. Ini supaya anda melihat lesen semasa muat turun.
Log masuk atau cipta akaun percumaApa yang ada dalam ZIP
-
01_conversation_stats.csv— workhorse table (turns, char counts, redactions) -
02_asking_doing_expressing.csv— OpenAI taxonomy label per conversation -
03_voice_facets.csv— mic_test / practice / casual / emotional / info_seeking -
04_turn_lengths.csv— char + word counts per turn -
05_voice_signals.csv— filler words, mic-check phrases, ASR garble -
06_question_types.csv— what / how / why / yes-no question counts -
07_pronoun_usage.csv— 1st / 2nd / 3rd person counts per role -
08_arc_transitions.csv— opening facet -> closing facet (Sankey input) -
09_sentiment.csv— VADER compound score per turn -
10_time_of_day.csv— UTC hour bucket counts - Serta README, METHODOLOGY, DATASHEET, CODEBOOK, CITATION.cff, LICENSE, CHANGELOG