ไฟล์ดีบัก — result.debug.vtt
result.debug.vtt เป็นไฟล์ผลลัพธ์เสริมที่ worker สร้างให้ ทุกงาน และ GET /status คืนลิงก์เป็น debug_vtt_url (presigned URL อายุจำกัด เหมือนไฟล์อื่น) ไฟล์นี้รวม cue แบบคาราโอเกะเข้ากับข้อมูลวิเคราะห์ของแต่ละ cue — ค่า VAD รายเฟรม และ speaker embedding เมื่อเปิด diarization — ไว้ในบล็อก NOTE ของ WebVTT มีไว้สำหรับ เครื่องมือวิเคราะห์และดีบัก ไม่ใช่ซับไตเติลสำหรับผู้ชม
ขั้นตอนสร้างไฟล์นี้ไม่ทำให้งานล้มเหลว: ถ้าสร้างหรืออัปโหลดไม่สำเร็จ งานยังเป็น READY ตามปกติ และ GET /status จะไม่มี debug_vtt_url
เปลี่ยนจากเดิม: ก่อนหน้านี้บล็อก
NOTE loma-fastsrt-vadและNOTE loma-fastsrt-embeddingซ่อนอยู่ในresult.vttตอนนี้result.vttและresult.karaoke.vttเป็นซับไตเติลล้วนไม่มีบล็อกNOTEใด ๆ โปรแกรมที่เคยอ่านบล็อกเหล่านี้ต้องเปลี่ยนมาอ่านจากresult.debug.vttแทน รูปแบบของแต่ละบล็อกเหมือนเดิมทุกไบต์
โครงสร้าง
ไฟล์ขึ้นต้นด้วย WEBVTT และบล็อกหัวไฟล์ NOTE loma-fastsrt-debug v=1 จากนั้นแต่ละ cue มีบล็อกเรียงตามลำดับนี้ คั่นด้วยบรรทัดว่าง
- cue — ลำดับ, เวลา และข้อความ ข้อความมี timestamp ระดับคำ
<hh:mm:ss.ttt>หน้าคำถัดไปเหมือนresult.karaoke.vtt(เป็นข้อความล้วนเมื่อforcealigner_levelเป็นnone) ป้ายชื่อผู้พูดคงอยู่ อักขระ&,<,>ถูก escape NOTE loma-fastsrt-vad— ค่า VAD ของช่วงเวลา cue นี้ มีทุก cueNOTE loma-fastsrt-embedding— speaker embedding ของ cue นี้ มีเฉพาะเมื่องานเปิดspeaker_diarization
WEBVTT
NOTE loma-fastsrt-debug v=1
1
00:00:00.128 --> 00:00:03.910
A: สวัสดีครับ <00:00:00.640>วันนี้ <00:00:01.216>เรา <00:00:01.568>จะ <00:00:01.856>คุยกัน
NOTE loma-fastsrt-vad index=1 frame_size=512 frame_ms=32 start_frame=4 end_frame=122
values=01358999999999999989999999999999999999999999999999999999999999999999999999999999999999999999999999999999999999999998420
NOTE loma-fastsrt-embedding index=1 dim=192 bytes=768 data=3kR9…
2
00:00:03.910 --> 00:00:06.480
…
ความหมายของฟิลด์
NOTE loma-fastsrt-vad
| ฟิลด์ | ความหมาย |
|---|---|
index |
ลำดับ cue ที่บล็อกนี้เป็นของ |
frame_size |
จำนวนตัวอย่างเสียงต่อเฟรม (512 ที่ 16 kHz) |
frame_ms |
ความยาวเฟรม (32 มิลลิวินาที) |
start_frame, end_frame |
ช่วงเฟรมของ cue แบบครึ่งเปิด [start_frame, end_frame) นับจากต้นไฟล์ |
values |
ค่าความน่าจะเป็นเสียงพูดจาก Silero VAD หนึ่งหลัก (0–9) ต่อเฟรม (round(prob*9)) เรียงจาก start_frame — บรรทัดนี้ไม่มีเมื่อช่วงเฟรมว่าง |
NOTE loma-fastsrt-embedding
| ฟิลด์ | ความหมาย |
|---|---|
index |
ลำดับ cue ที่บล็อกนี้เป็นของ |
dim |
จำนวนมิติของเวกเตอร์ |
bytes |
ขนาดเวกเตอร์เป็นไบต์ (dim × 4, float32) |
data |
เวกเตอร์ float32 เข้ารหัส base62 |
เครื่องมือที่อ่านไฟล์นี้
runjob.pyพิมพ์Debug VTT URL:และเมื่อใช้-osrt <path>จะบันทึกไฟล์เป็น<ชื่อ>.debug.vttข้าง SRTworker/loma_worker/vtt.pyparse_vttอ่านไฟล์นี้ได้โดยตัด timestamp ระดับคำออกและคืน embedding ต่อ cue ส่วนkaraoke.parse_karaoke_vttข้ามบล็อกNOTEและคืน tag- เครื่องมือจัดกลุ่มผู้พูดใน
notes/รับไฟล์นี้ได้โดยตรง เช่นPYTHONPATH=worker worker/.venv/bin/python notes/speaker_agglomerator.py <debug_vtt_url> --sweep --output result.srt
ดูข้อมูลระดับ token และค่า VAD ทั้งไฟล์ได้ที่ result.words.json