HereSay குரல் AI வகைப்பாடு தரவுத்தொகுப்பு

பதிப்பு 2026-Q2-v2 · ODC-BY 1.0

54 பெயர் வெளியிடப்படாத குரல் AI உரையாடல்களில் (2,334 திருப்பங்கள்) இருந்து கணக்கிடப்பட்ட 10 தொகுப்பு வகைப்பாடு தரவுத்தொகுப்புகள். இதில் OpenAI-ன் Asking/Doing/Expressing முக்கோணம், குரல் சார்ந்த அம்சங்கள், ஒவ்வொரு திருப்பத்திற்குமான உணர்வுநிலை (VADER), கேள்வி வகை மற்றும் பிரதிப் பெயர் பகிர்வுகள், உரையாடல்-நடப்பு மாற்றங்கள், மற்றும் நாள் நேரப் பாங்குகள் அடங்கும். மூல உரையாடல் உரை சேர்க்கப்படவில்லை.

உரிமம்: ODC-BY 1.0

பயன்படுத்த இலவசம், மறுவிநியோகிக்க இலவசம், மேற்கோள் குறிப்பிட வேண்டும். இந்த தரவுத்தொகுப்பை ஆராய்ச்சி, செய்தியியல், அல்லது வணிகப் பணியில் பயன்படுத்தினால், இதைப் சேர்க்கவும்:

"Contains information from the HereSay Voice AI Classifications Dataset (2026-Q2-v2) by HereSay (heresay.live), which is made available under the ODC Attribution License (ODC-BY 1.0)."

பதிவிறக்க ஒரு இலவச HereSay கணக்கு வேண்டும். பதிவிறக்கும் நேரத்தில் உரிமத்தை நீங்கள் பார்க்க இதுதான் காரணம்.

உள்நுழையவும் அல்லது இலவச கணக்கை உருவாக்கவும்

ZIP-இல் என்ன உள்ளது

  • 01_conversation_stats.csv — workhorse table (turns, char counts, redactions)
  • 02_asking_doing_expressing.csv — OpenAI taxonomy label per conversation
  • 03_voice_facets.csv — mic_test / practice / casual / emotional / info_seeking
  • 04_turn_lengths.csv — char + word counts per turn
  • 05_voice_signals.csv — filler words, mic-check phrases, ASR garble
  • 06_question_types.csv — what / how / why / yes-no question counts
  • 07_pronoun_usage.csv — 1st / 2nd / 3rd person counts per role
  • 08_arc_transitions.csv — opening facet -> closing facet (Sankey input)
  • 09_sentiment.csv — VADER compound score per turn
  • 10_time_of_day.csv — UTC hour bucket counts
  • மேலும் README, METHODOLOGY, DATASHEET, CODEBOOK, CITATION.cff, LICENSE, CHANGELOG

முக்கிய கண்டுபிடிப்புகளுடன் உள்ள வலைப்பதிவு பதிவைப் படிக்கவும் →