ไฟล์ดีบัก — result.debug.vtt

result.debug.vtt เป็นไฟล์ผลลัพธ์เสริมที่ worker สร้างให้ ทุกงาน และ GET /status คืนลิงก์เป็น debug_vtt_url (presigned URL อายุจำกัด เหมือนไฟล์อื่น) ไฟล์นี้รวม cue แบบคาราโอเกะเข้ากับข้อมูลวิเคราะห์ของแต่ละ cue — ค่า VAD รายเฟรม และ speaker embedding เมื่อเปิด diarization — ไว้ในบล็อก NOTE ของ WebVTT มีไว้สำหรับ เครื่องมือวิเคราะห์และดีบัก ไม่ใช่ซับไตเติลสำหรับผู้ชม

ขั้นตอนสร้างไฟล์นี้ไม่ทำให้งานล้มเหลว: ถ้าสร้างหรืออัปโหลดไม่สำเร็จ งานยังเป็น READY ตามปกติ และ GET /status จะไม่มี debug_vtt_url

เปลี่ยนจากเดิม: ก่อนหน้านี้บล็อก NOTE loma-fastsrt-vad และ NOTE loma-fastsrt-embedding ซ่อนอยู่ใน result.vtt ตอนนี้ result.vtt และ result.karaoke.vtt เป็นซับไตเติลล้วนไม่มีบล็อก NOTE ใด ๆ โปรแกรมที่เคยอ่านบล็อกเหล่านี้ต้องเปลี่ยนมาอ่านจาก result.debug.vtt แทน รูปแบบของแต่ละบล็อกเหมือนเดิมทุกไบต์

โครงสร้าง

ไฟล์ขึ้นต้นด้วย WEBVTT และบล็อกหัวไฟล์ NOTE loma-fastsrt-debug v=1 จากนั้นแต่ละ cue มีบล็อกเรียงตามลำดับนี้ คั่นด้วยบรรทัดว่าง

  1. cue — ลำดับ, เวลา และข้อความ ข้อความมี timestamp ระดับคำ <hh:mm:ss.ttt> หน้าคำถัดไปเหมือน result.karaoke.vtt (เป็นข้อความล้วนเมื่อ forcealigner_level เป็น none) ป้ายชื่อผู้พูดคงอยู่ อักขระ &, <, > ถูก escape
  2. NOTE loma-fastsrt-vad — ค่า VAD ของช่วงเวลา cue นี้ มีทุก cue
  3. NOTE loma-fastsrt-embedding — speaker embedding ของ cue นี้ มีเฉพาะเมื่องานเปิด speaker_diarization
WEBVTT

NOTE loma-fastsrt-debug v=1

1
00:00:00.128 --> 00:00:03.910
A: สวัสดีครับ <00:00:00.640>วันนี้ <00:00:01.216>เรา <00:00:01.568>จะ <00:00:01.856>คุยกัน

NOTE loma-fastsrt-vad index=1 frame_size=512 frame_ms=32 start_frame=4 end_frame=122
values=01358999999999999989999999999999999999999999999999999999999999999999999999999999999999999999999999999999999999999998420

NOTE loma-fastsrt-embedding index=1 dim=192 bytes=768 data=3kR9…

2
00:00:03.910 --> 00:00:06.480
…

ความหมายของฟิลด์

NOTE loma-fastsrt-vad

ฟิลด์ ความหมาย
index ลำดับ cue ที่บล็อกนี้เป็นของ
frame_size จำนวนตัวอย่างเสียงต่อเฟรม (512 ที่ 16 kHz)
frame_ms ความยาวเฟรม (32 มิลลิวินาที)
start_frame, end_frame ช่วงเฟรมของ cue แบบครึ่งเปิด [start_frame, end_frame) นับจากต้นไฟล์
values ค่าความน่าจะเป็นเสียงพูดจาก Silero VAD หนึ่งหลัก (0–9) ต่อเฟรม (round(prob*9)) เรียงจาก start_frame — บรรทัดนี้ไม่มีเมื่อช่วงเฟรมว่าง

NOTE loma-fastsrt-embedding

ฟิลด์ ความหมาย
index ลำดับ cue ที่บล็อกนี้เป็นของ
dim จำนวนมิติของเวกเตอร์
bytes ขนาดเวกเตอร์เป็นไบต์ (dim × 4, float32)
data เวกเตอร์ float32 เข้ารหัส base62

เครื่องมือที่อ่านไฟล์นี้

  • runjob.py พิมพ์ Debug VTT URL: และเมื่อใช้ -osrt <path> จะบันทึกไฟล์เป็น <ชื่อ>.debug.vtt ข้าง SRT
  • worker/loma_worker/vtt.py parse_vtt อ่านไฟล์นี้ได้โดยตัด timestamp ระดับคำออกและคืน embedding ต่อ cue ส่วน karaoke.parse_karaoke_vtt ข้ามบล็อก NOTE และคืน tag
  • เครื่องมือจัดกลุ่มผู้พูดใน notes/ รับไฟล์นี้ได้โดยตรง เช่น PYTHONPATH=worker worker/.venv/bin/python notes/speaker_agglomerator.py <debug_vtt_url> --sweep --output result.srt

ดูข้อมูลระดับ token และค่า VAD ทั้งไฟล์ได้ที่ result.words.json

results matching ""

    No results matching ""