Picture for Shiyu Zhou

Shiyu Zhou

MEGA-CL: A Molecular Foundation Model for Generalizable ADMET Prediction through Graph External Attention and Contrastive Learning

Add code
Jul 27, 2026
Viaarxiv icon

MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts

Add code
Jul 21, 2026
Viaarxiv icon

World Models for Policy Refinement in StarCraft II

Add code
Feb 16, 2026
Viaarxiv icon

Speech-Aware Long Context Pruning and Integration for Contextualized Automatic Speech Recognition

Add code
Nov 14, 2025
Viaarxiv icon

Token-level Speaker Change Detection Using Speaker Difference and Speech Content via Continuous Integrate-and-fire

Add code
Nov 17, 2022
Viaarxiv icon

Improving End-to-End Contextual Speech Recognition with Fine-grained Contextual Knowledge Selection

Add code
Jan 30, 2022
Figure 1 for Improving End-to-End Contextual Speech Recognition with Fine-grained Contextual Knowledge Selection
Figure 2 for Improving End-to-End Contextual Speech Recognition with Fine-grained Contextual Knowledge Selection
Figure 3 for Improving End-to-End Contextual Speech Recognition with Fine-grained Contextual Knowledge Selection
Figure 4 for Improving End-to-End Contextual Speech Recognition with Fine-grained Contextual Knowledge Selection
Viaarxiv icon

OPT: Omni-Perception Pre-Trainer for Cross-Modal Understanding and Generation

Add code
Jul 06, 2021
Figure 1 for OPT: Omni-Perception Pre-Trainer for Cross-Modal Understanding and Generation
Figure 2 for OPT: Omni-Perception Pre-Trainer for Cross-Modal Understanding and Generation
Figure 3 for OPT: Omni-Perception Pre-Trainer for Cross-Modal Understanding and Generation
Figure 4 for OPT: Omni-Perception Pre-Trainer for Cross-Modal Understanding and Generation
Viaarxiv icon

Long-Running Speech Recognizer:An End-to-End Multi-Task Learning Framework for Online ASR and VAD

Add code
Mar 02, 2021
Figure 1 for Long-Running Speech Recognizer:An End-to-End Multi-Task Learning Framework for Online ASR and VAD
Figure 2 for Long-Running Speech Recognizer:An End-to-End Multi-Task Learning Framework for Online ASR and VAD
Figure 3 for Long-Running Speech Recognizer:An End-to-End Multi-Task Learning Framework for Online ASR and VAD
Figure 4 for Long-Running Speech Recognizer:An End-to-End Multi-Task Learning Framework for Online ASR and VAD
Viaarxiv icon

Efficiently Fusing Pretrained Acoustic and Linguistic Encoders for Low-resource Speech Recognition

Add code
Jan 24, 2021
Figure 1 for Efficiently Fusing Pretrained Acoustic and Linguistic Encoders for Low-resource Speech Recognition
Figure 2 for Efficiently Fusing Pretrained Acoustic and Linguistic Encoders for Low-resource Speech Recognition
Figure 3 for Efficiently Fusing Pretrained Acoustic and Linguistic Encoders for Low-resource Speech Recognition
Figure 4 for Efficiently Fusing Pretrained Acoustic and Linguistic Encoders for Low-resource Speech Recognition
Viaarxiv icon

Applying Wav2vec2.0 to Speech Recognition in Various Low-resource Languages

Add code
Jan 17, 2021
Figure 1 for Applying Wav2vec2.0 to Speech Recognition in Various Low-resource Languages
Figure 2 for Applying Wav2vec2.0 to Speech Recognition in Various Low-resource Languages
Figure 3 for Applying Wav2vec2.0 to Speech Recognition in Various Low-resource Languages
Figure 4 for Applying Wav2vec2.0 to Speech Recognition in Various Low-resource Languages
Viaarxiv icon