👁️ 多模态与音视频
Computer vision, image generation, audio, text-to-speech.
当前分类已收录 922 个相关项目。
Audio & Speech (TTS/STT)
whisper
OpenAI推出的开源语音识别大模型,通过大规模弱监督学习实现高鲁棒性的多语言语音转文本。
- Stars: ⭐️ 106.4k
- Tags:
speech-recognitionwhisperopenaistt - 最后活动时间: 2026-07-28
GPT-SoVITS
少样本语音克隆TTS模型,仅需1分钟语音数据即可训练高质量语音合成模型。
- Stars: ⭐️ 60.3k
- Tags:
TTSVoice CloningFew-shot - 最后活动时间: 2026-07-22
Real-Time-Voice-Cloning
5秒实时语音克隆工具,可生成任意语音内容。
- Stars: ⭐️ 60.1k
- Tags:
Voice CloningTTSReal-time - 最后活动时间: 2026-03-09
whisper.cpp
OpenAI Whisper模型的C/C++高性能移植版本,支持本地CPU/GPU推理,适用于语音识别和语音转文字场景。
- Stars: ⭐️ 52.5k
- Tags:
speech-recognitionspeech-to-textwhisperinference - 最后活动时间: 2026-07-31
VibeVoice
开源的前沿语音AI项目,专注于语音识别与合成技术。
- Stars: ⭐️ 51.8k
- Tags:
voice-aispeech-synthesisspeech-recognition - 最后活动时间: 2026-07-24
voicebox
开源语音合成工作室,支持语音克隆和文本转语音,提供可视化界面操作。
- Stars: ⭐️ 47.9k
- Tags:
voice-aivoice-clonettswhisper - 最后活动时间: 2026-07-28
ChatTTS
专为日常对话优化的生成式语音合成模型,支持中英双语,适合对话场景。
- Stars: ⭐️ 39.7k
- Tags:
TTSSpeechDialogue - 最后活动时间: 2026-04-10
MockingBird
5秒内克隆任意声音并实时生成语音的AI语音合成工具,支持中文和多语言。
- Stars: ⭐️ 36.9k
- Tags:
TTSVoice CloningDeep Learning - 最后活动时间: 2026-03-03
VoxCPM
无分词器的文本转语音模型,支持上下文感知的语音生成和高保真声音克隆。
- Stars: ⭐️ 34.8k
- Tags:
TTS声音克隆语音合成 - 最后活动时间: 2026-07-08
fish-speech
开源SOTA级文本转语音项目,基于LLaMA和Transformer架构,支持高质量语音合成与克隆。
- Stars: ⭐️ 31.9k
- Tags:
TTS语音合成Transformer - 最后活动时间: 2026-07-26
Handy
免费开源的离线语音转文字应用,支持完全离线运行保护隐私,基于Tauri v2跨平台构建。
- Stars: ⭐️ 28.4k
- Tags:
语音识别离线无障碍 - 最后活动时间: 2026-08-01
spleeter
Deezer开源的音频源分离库,利用深度学习技术将音乐分离为人声、鼓点、贝斯等独立音轨。
- Stars: ⭐️ 28.4k
- Tags:
audio-processingsource-separationdeep-learningtensorflow - 最后活动时间: 2026-06-18
chatterbox
开源SoTA文本转语音模型,提供高质量语音合成能力。
- Stars: ⭐️ 25.8k
- Tags:
TTSSpeech Synthesis - 最后活动时间: 2026-07-21
MiniCPM-o
达到Gemini 2.5 Flash级别的多模态大语言模型,支持视觉、语音和全双工多模态实时流媒体,可在手机端运行。
- Stars: ⭐️ 24.5k
- Tags:
multimodalllmvisionspeechmobile - 最后活动时间: 2026-05-07
audiocraft
Meta推出的深度学习音频处理与生成库,包含业界领先的EnCodec音频压缩器和MusicGen音乐生成模型,支持文本和旋律条件控制。
- Stars: ⭐️ 23.5k
- Tags:
audio-generationmusic-generationdeep-learningmusicgenencodec - 最后活动时间: 2026-03-03
whisperX
基于Whisper的自动语音识别工具,支持词级时间戳和说话人分离,提供快速准确的语音转文字能力。
- Stars: ⭐️ 23.4k
- Tags:
ASRSpeech-to-TextWhisperDiarization - 最后活动时间: 2026-07-13
CosyVoice
多语言大模型语音生成系统,提供推理、训练和部署的全栈能力,支持高质量语音克隆。
- Stars: ⭐️ 22.5k
- Tags:
text-to-speechvoice-cloningaudio-generationmultilingual - 最后活动时间: 2026-05-25
index-tts
工业级可控高效零样本文本转语音系统,支持跨语言语音合成。
- Stars: ⭐️ 22.3k
- Tags:
TTSZero-shotIndustrial - 最后活动时间: 2026-07-14
CosyVoice
多语言大语音生成模型,提供推理、训练和部署全栈能力。
- Stars: ⭐️ 22.3k
- Tags:
TTSMulti-lingualVoice Cloning - 最后活动时间: 2026-05-25
buzz
基于OpenAI Whisper的离线音频转录与翻译工具,支持在本地电脑上运行,无需联网即可实现高质量的语音转文字。
- Stars: ⭐️ 20.7k
- Tags:
whisperspeech-to-texttranscriptionoffline-ai - 最后活动时间: 2026-07-31
FunASR
阿里达摩院开源的端到端语音识别工具包,提供SOTA预训练模型。
- Stars: ⭐️ 19.6k
- Tags:
speech-recognitionasrpytorchpretrained-modelvad - 最后活动时间: 2026-07-31
pyvideotrans
AI驱动的视频翻译工具,支持跨语言翻译并自动生成配音与字幕,集成语音识别与合成技术。
- Stars: ⭐️ 18.5k
- Tags:
video-translationspeech-to-texttext-to-speechsubtitle - 最后活动时间: 2026-08-01
VideoLingo
Netflix级AI视频字幕处理工具,支持一键自动切割、翻译、对齐和配音,实现全自动视频本地化。
- Stars: ⭐️ 18.0k
- Tags:
video-translationai-translationdubbingvoice-cloningsubtitle - 最后活动时间: 2026-07-02
Speech
一个可扩展的生成式AI框架,专为研究人员和开发者设计,支持大语言模型、多模态以及语音AI(自动语音识别和文本转语音)。
- Stars: ⭐️ 17.8k
- Tags:
asrdeeplearninggenerative-aittsspeech-synthesis - 最后活动时间: 2026-08-02
VideoCaptioner
基于LLM的智能字幕助手,支持视频字幕生成、断句、校正和翻译全流程处理,提升视频内容创作效率。
- Stars: ⭐️ 15.5k
- Tags:
字幕生成视频处理LLM应用翻译 - 最后活动时间: 2026-07-19
KittenTTS
体积小于25MB的SOTA文本转语音模型,适合边缘设备部署。
- Stars: ⭐️ 15.3k
- Tags:
text-to-speechttslightweightedge-deployment - 最后活动时间: 2026-06-11
F5-TTS
基于流匹配的高质量文本转语音模型,生成流畅自然的语音。
- Stars: ⭐️ 15.1k
- Tags:
TTSFlow MatchingResearch - 最后活动时间: 2026-07-23
vosk-api
离线语音识别API,支持Android、iOS、树莓派和服务器,提供Python、Java、C#和Node.js多语言SDK。
- Stars: ⭐️ 15.0k
- Tags:
Speech RecognitionOfflineDeep Learning - 最后活动时间: 2026-07-02
sherpa-onnx
离线语音处理神器,支持语音识别、语音合成、说话人分离、语音增强等功能,覆盖嵌入式设备到服务器的全平台部署。
- Stars: ⭐️ 13.9k
- Tags:
Speech-to-TextText-to-SpeechONNXEmbedded - 最后活动时间: 2026-07-31
supertonic
闪电般快速的设备端多语言TTS引擎,通过ONNX原生运行,支持跨平台离线语音合成。
- Stars: ⭐️ 13.6k
- Tags:
TTSONNXOn-Device - 最后活动时间: 2026-07-24
Qwen3-TTS
阿里云Qwen团队开源的文本转语音模型,支持稳定流式语音生成、自由语音设计和生动的语音克隆功能。
- Stars: ⭐️ 12.7k
- Tags:
TTSSpeech SynthesisVoice Cloning - 最后活动时间: 2026-03-17
PaddleSpeech
易用语音工具包,涵盖ASR、TTS、语音翻译、声纹识别等全栈能力,获NAACL2022最佳Demo奖。
- Stars: ⭐️ 12.7k
- Tags:
ASRTTSSpeech Toolkit - 最后活动时间: 2026-08-02
voice-pro
功能强大的Gradio WebUI音频处理工具,集成Edge-TTS、F5-TTS语音合成与克隆、Whisper语音识别及翻译功能。
- Stars: ⭐️ 11.9k
- Tags:
TTSVoice CloningWhisperGradio - 最后活动时间: 2026-07-13
ACE-Step-1.5
强大的本地音乐生成模型,性能超越多数商业替代品,支持Mac、AMD、Intel和CUDA设备。
- Stars: ⭐️ 11.8k
- Tags:
music-generationtext-to-musicgenerative-ailocal-inference - 最后活动时间: 2026-07-25
seamless_communication
Meta开源的先进语音和文本翻译基础模型,支持多语言无缝交流。提供高质量的语音识别、翻译和语音合成功能。
- Stars: ⭐️ 11.8k
- Tags:
speech-translationtext-translationmetaseamless - 最后活动时间: 2026-04-08
speechbrain
基于PyTorch的开源语音处理工具包,涵盖语音识别、说话人识别、语音增强等多种任务。
- Stars: ⭐️ 11.7k
- Tags:
SpeechPyTorchASRSpeaker-Recognition - 最后活动时间: 2026-06-15
edge-tts
无需Microsoft Edge或Windows即可使用Edge在线TTS服务的Python库,无需API密钥。
- Stars: ⭐️ 11.6k
- Tags:
text-to-speechttsspeech-synthesis - 最后活动时间: 2026-03-22
moshi
语音-文本基础模型和全双工口语对话框架,支持实时流式对话,采用Mimi编解码器实现高质量神经音频压缩。
- Stars: ⭐️ 10.7k
- Tags:
SpeechDialogueVoice AIReal-time - 最后活动时间: 2026-05-16
Whisper
OpenAI Whisper语音识别模型的高性能GPGPU推理实现,支持快速ASR处理。
- Stars: ⭐️ 10.6k
- Tags:
whisperspeech-recognitionasrgpgpuaudio-processing - 最后活动时间: 2026-05-24
KrillinAI
基于LLM的视频翻译配音工具,支持100种语言双向翻译和一键部署。
- Stars: ⭐️ 10.6k
- Tags:
VideoTranslationTTS - 最后活动时间: 2026-07-24
moonshine
专为边缘设备设计的快速精准自动语音识别(ASR)模型,适合资源受限环境下的实时语音转文字应用。
- Stars: ⭐️ 10.6k
- Tags:
ASRSpeech RecognitionEdge AI - 最后活动时间: 2026-08-02
WhisperLiveKit
提供实时同步的语音转文本模型工具包,适用于实时字幕和语音识别场景。
- Stars: ⭐️ 10.5k
- Tags:
speech-to-textwhisperreal-timetranscription - 最后活动时间: 2026-07-11
pyannote-audio
说话人分离神经网络工具包,支持语音活动检测、说话人识别与嵌入。
- Stars: ⭐️ 10.4k
- Tags:
speaker-diarizationspeech-processingpytorch - 最后活动时间: 2026-07-24
speech-to-speech
基于开源模型构建的本地语音代理工具,支持语音识别、合成和翻译全流程。
- Stars: ⭐️ 10.3k
- Tags:
语音识别语音合成本地部署 - 最后活动时间: 2026-07-31
RealtimeSTT
高性能实时语音转文本库,支持高级语音活动检测、唤醒词激活和即时转录。
- Stars: ⭐️ 10.0k
- Tags:
speech-to-textrealtimevoice-activity-detectiontranscription - 最后活动时间: 2026-06-12
Amphion
音频、音乐和语音生成工具包,支持TTS、语音转换、音乐生成等多种生成任务,助力可复现研究。
- Stars: ⭐️ 9.9k
- Tags:
Audio GenerationTTSMusic Generation - 最后活动时间: 2026-03-25
espnet
端到端语音处理工具包,支持语音识别、合成、翻译和说话人分离等多种任务,基于PyTorch构建并提供丰富的预训练模型。
- Stars: ⭐️ 9.9k
- Tags:
语音识别语音合成PyTorch - 最后活动时间: 2026-07-28
silero-vad
企业级预训练语音活动检测器,轻量高效,支持ONNX运行时,适用于语音识别前端处理。
- Stars: ⭐️ 9.8k
- Tags:
VADSpeech-ProcessingONNX - 最后活动时间: 2026-07-16
OmniVoice-Studio
开源的 ElevenLabs 替代方案,支持本地语音克隆、TTS/STT 和影视级配音功能。
- Stars: ⭐️ 9.4k
- Tags:
voice-cloningtext-to-speechspeech-recognitionvoice-ailocal-ai - 最后活动时间: 2026-07-31
so-vits-svc-fork
实时语音转换项目,支持歌声转换与变声功能。
- Stars: ⭐️ 9.3k
- Tags:
voice-conversionspeech-synthesispytorch - 最后活动时间: 2026-08-01
FluidVoice
macOS上最快的离线语音转文字应用,完全本地运行,无需联网即可实现高精度语音识别。
- Stars: ⭐️ 9.2k
- Tags:
speech-to-textdictationofflinemacosvoice-recognition - 最后活动时间: 2026-08-02
speech_recognition
Python语音识别模块,支持多种引擎和API,可在线或离线进行语音转文字。
- Stars: ⭐️ 9.0k
- Tags:
speech-recognitionspeech-to-textpython - 最后活动时间: 2026-07-31
SenseVoice
开源的多语言语音识别模型,支持中、粤、英、日、韩语ASR,并具备语种识别、情绪识别和音频事件检测功能。提供比Whisper更快的推理速度及丰富的语音理解能力。
- Stars: ⭐️ 9.0k
- Tags:
speech-recognitionASRmultilingualspeech-to-textemotion-recognitionaudio-event-detection - 最后活动时间: 2026-07-27
SenseVoice
多语言语音理解模型,支持语音识别、情感识别和音频事件分类等多种语音理解任务。
- Stars: ⭐️ 8.9k
- Tags:
ASRMultilingualSpeechEmotion-Recognition - 最后活动时间: 2026-07-14
Bert-VITS2
基于VITS2与多语言BERT的高质量语音合成项目,支持多语言文本转语音,生成自然流畅的语音效果。
- Stars: ⭐️ 8.8k
- Tags:
TTS语音合成BERT - 最后活动时间: 2026-07-27
OmniVoice
支持600多种语言的高质量语音克隆TTS系统,实现多语言语音合成与克隆功能。
- Stars: ⭐️ 8.7k
- Tags:
ttsvoice-cloningspeech-synthesismultilingual - 最后活动时间: 2026-07-30
librosa
Python音频与音乐分析核心库,提供丰富的音频特征提取和信号处理功能,广泛应用于AI音频领域。
- Stars: ⭐️ 8.5k
- Tags:
音频分析信号处理Python库 - 最后活动时间: 2026-07-31
VoiceCraft
零样本语音编辑与文本转语音模型,支持野外环境下的高质量语音合成与编辑。
- Stars: ⭐️ 8.5k
- Tags:
Zero-ShotSpeech EditingTTSVoice Clone - 最后活动时间: 2026-05-30
ASRT_SpeechRecognition
基于深度学习的中文语音识别系统,采用CNN和CTC架构实现语音转文字。
- Stars: ⭐️ 8.4k
- Tags:
Speech RecognitionChineseDeep Learning - 最后活动时间: 2026-04-10
higgs-audio
Boson AI开发的文本-音频基础模型,支持高质量音频生成与理解任务,在语音合成和多模态交互方面表现出色。
- Stars: ⭐️ 8.3k
- Tags:
Audio GenerationFoundation ModelMultimodal - 最后活动时间: 2026-06-05
audiblez
从电子书生成有声书的工具,支持EPUB格式转换为音频。
- Stars: ⭐️ 8.1k
- Tags:
audiobookstext-to-speechttsepub - 最后活动时间: 2026-02-27
pocket-tts
可在CPU上运行的轻量级TTS系统,适合资源受限环境。
- Stars: ⭐️ 8.0k
- Tags:
text-to-speechttslightweightcpu-inference - 最后活动时间: 2026-07-16
mlx-audio
基于Apple MLX框架的语音处理库,支持TTS、STT和STS全流程语音能力,专为Apple Silicon优化。
- Stars: ⭐️ 7.7k
- Tags:
TTSSTTApple SiliconMLX - 最后活动时间: 2026-07-31
ChatTTS-ui
ChatTTS的本地Web界面,支持文字转语音和对外API接口调用。
- Stars: ⭐️ 7.6k
- Tags:
chatttstext-to-speechttsweb-ui - 最后活动时间: 2026-06-14
vibe
基于 Whisper 的本地语音转录工具,支持跨平台桌面使用,让你完全掌控自己的语音识别流程。
- Stars: ⭐️ 7.0k
- Tags:
whispertranscribeaudiorustdesktop - 最后活动时间: 2026-07-26
mediabunny
纯TypeScript媒体处理工具包,支持在浏览器中直接读取、写入和转换音视频文件,适用于多模态AI应用的媒体预处理。
- Stars: ⭐️ 6.8k
- Tags:
audiovideowebcodecsmedia-processing - 最后活动时间: 2026-07-31
espeak-ng
开源语音合成引擎,支持超过100种语言和口音的文本转语音系统。
- Stars: ⭐️ 6.7k
- Tags:
text-to-speechspeech-synthesisopen-source - 最后活动时间: 2026-08-01
podcastfy
开源的NotebookLM播客功能替代方案,可将多种模态内容转换为引人入胜的多语言音频对话。
- Stars: ⭐️ 6.5k
- Tags:
Podcast GenerationText-to-SpeechGenAI - 最后活动时间: 2026-05-04
wav2letter
Meta AI Research开源的端到端自动语音识别工具包。
- Stars: ⭐️ 6.4k
- Tags:
speech-recognitionasrdeep-learningmeta - 最后活动时间: 2026-07-14
argmax-oss-swift
专为Apple Silicon设计的端侧语音AI工具包,支持语音识别、语音合成、说话人分离等功能。
- Stars: ⭐️ 6.3k
- Tags:
speech-recognitiontext-to-speechwhisperswifton-device - 最后活动时间: 2026-07-31
pedalboard
Spotify开源的Python音频处理库,支持VST3插件和音频增强,适用于机器学习音频数据预处理。
- Stars: ⭐️ 6.2k
- Tags:
audio-processingpythonmachine-learningvst3 - 最后活动时间: 2026-07-08
neutts
Neuphonic开发的设备端TTS模型,优化本地推理性能。
- Stars: ⭐️ 6.2k
- Tags:
text-to-speechttson-deviceedge-ai - 最后活动时间: 2026-07-30
tts-vue
基于微软语音服务的桌面端TTS工具,支持文本转语音合成,使用Electron+Vue构建。
- Stars: ⭐️ 6.1k
- Tags:
TTSSpeech SynthesisDesktop - 最后活动时间: 2026-04-24
FunClip
开源视频语音识别与剪辑工具,集成LLM智能剪辑功能。支持语音转文字、字幕生成,简化视频处理流程。
- Stars: ⭐️ 6.1k
- Tags:
语音识别视频剪辑AI字幕 - 最后活动时间: 2026-07-29
MegaTTS3
文本转语音合成项目,实现高质量语音生成。
- Stars: ⭐️ 6.1k
- Tags:
ttsspeech-synthesisaudio-generation - 最后活动时间: 2026-06-15
silero-models
预训练文本转语音模型库,支持俄语、乌克兰语等10多种语言,可通过PyTorch Hub快速集成。
- Stars: ⭐️ 6.0k
- Tags:
TTS预训练模型多语言 - 最后活动时间: 2026-07-31
WhisperKit
专为Apple Silicon优化的端侧语音识别框架,支持iOS、macOS等平台。
- Stars: ⭐️ 6.0k
- Tags:
speech-recognitionwhisperswifton-deviceapple-silicon - 最后活动时间: 2026-04-14
VoiceInk
macOS开源语音转文字应用,Superwhisper的免费替代方案,无需订阅。
- Stars: ⭐️ 5.7k
- Tags:
speech-to-textvoice-recognitionmacos - 最后活动时间: 2026-08-01
Recorder
功能强大的HTML5录音库,支持多格式音频录制并集成ASR语音识别,适用于语音交互和实时通话场景。
- Stars: ⭐️ 5.6k
- Tags:
音频录制ASRWebRTC - 最后活动时间: 2026-07-30
whisper-diarization
基于OpenAI Whisper的自动语音识别与说话人分离工具,支持多说话人场景下的语音转文字和身份识别。
- Stars: ⭐️ 5.6k
- Tags:
ASRSpeaker DiarizationWhisper - 最后活动时间: 2026-02-23
abogen
将EPUB、PDF和文本转换为有声书的开源工具,支持同步字幕和多种TTS引擎。
- Stars: ⭐️ 5.5k
- Tags:
TTSAudiobookKokoro - 最后活动时间: 2026-07-30
Kokoro-FastAPI
Kokoro-82M语音合成模型的FastAPI封装服务,支持CPU ONNX和GPU PyTorch推理,提供OpenAI兼容API。
- Stars: ⭐️ 5.3k
- Tags:
TTSFastAPIONNXDocker - 最后活动时间: 2026-08-02
wenet
生产级端到端语音识别工具包,支持Conformer和Transformer架构,专为工业部署优化。
- Stars: ⭐️ 5.2k
- Tags:
ASRE2EProduction Ready - 最后活动时间: 2026-06-15
porcupine
基于深度学习的端上唤醒词检测引擎,支持自定义唤醒词。
- Stars: ⭐️ 4.9k
- Tags:
wake-word-detectionkeyword-spottingvoice-activationon-device - 最后活动时间: 2026-08-01
LuxTTS
高质量快速TTS语音克隆模型,推理速度可达150倍实时。
- Stars: ⭐️ 4.9k
- Tags:
text-to-speechttsvoice-cloningfast-inference - 最后活动时间: 2026-06-05
DiffSinger
基于浅层扩散机制的歌声合成系统,AAAI 2022论文官方实现,支持SVS与TTS。
- Stars: ⭐️ 4.8k
- Tags:
Singing SynthesisDiffusion ModelTTSAAAI 2022 - 最后活动时间: 2026-07-24
piper1-gpl
快速且支持本地运行的神经文本转语音引擎,适合离线环境部署。
- Stars: ⭐️ 4.8k
- Tags:
text-to-speechneural-ttsoffline-ttsspeech-synthesis - 最后活动时间: 2026-07-14
ace-step-ui
开源AI音乐生成专业UI界面,作为ACE-Step 1.5的前端,支持本地免费无限生成音乐。
- Stars: ⭐️ 4.6k
- Tags:
aiai-musicmusic-generationlocal-firstopen-source - 最后活动时间: 2026-06-27
SmartSub
跨平台AI字幕生成工具,支持批量处理视频音频生成字幕并翻译,集成多家AI服务。
- Stars: ⭐️ 4.4k
- Tags:
字幕生成Whisper翻译 - 最后活动时间: 2026-07-30
pocketsphinx
轻量级语音识别引擎,适用于嵌入式设备和离线语音识别场景。
- Stars: ⭐️ 4.3k
- Tags:
speech-recognitionoffline-speechlightweight-stt - 最后活动时间: 2026-07-27
WhisperLive
OpenAI Whisper的近实时实现,支持语音识别、翻译和听写功能。
- Stars: ⭐️ 4.2k
- Tags:
语音识别Whisper实时转录 - 最后活动时间: 2026-07-31
OpenUtau
开源的歌声合成平台,是经典 UTAU 的现代继任者。支持跨平台操作,为虚拟人声和音乐创作提供强大的合成能力。
- Stars: ⭐️ 4.1k
- Tags:
musicsinging-synthesisspeech-synthesisvocal-synthesis - 最后活动时间: 2026-07-07
MOSS-TTS-Nano
开源多语言轻量级语音生成模型,仅0.1B参数即可实现实时语音合成,支持CPU运行。
- Stars: ⭐️ 4.0k
- Tags:
ttsspeech-synthesismultilingualrealtimevoice-clone - 最后活动时间: 2026-07-26
RealtimeTTS
实时文本转语音库,支持多种TTS引擎,可实现低延迟的语音合成输出。
- Stars: ⭐️ 4.0k
- Tags:
text-to-speechspeech-synthesisrealtimepython - 最后活动时间: 2026-05-31
auto-subs
本地 AI 字幕生成工具,支持 DaVinci Resolve 集成和说话人分离。
- Stars: ⭐️ 4.0k
- Tags:
subtitleswhisperspeech-to-texttranscriptiondavinci - 最后活动时间: 2026-08-01
MOSS-TTS
开源语音和声音生成模型家族,支持高保真长语音、多说话人对话、声音克隆和实时流式TTS。
- Stars: ⭐️ 3.9k
- Tags:
TTSVoice CloningMultimodal - 最后活动时间: 2026-07-26
Qwen3-Omni
阿里云Qwen团队开发的全模态端到端大模型,支持文本、音频、图像、视频理解及实时语音生成。
- Stars: ⭐️ 3.9k
- Tags:
Omni-ModalTTSQwen - 最后活动时间: 2026-04-23
heartlib
HeartMuLa 官方开源仓库,号称2026年最强大的开源音乐生成模型。能够高效生成高质量的音乐音频。
- Stars: ⭐️ 3.8k
- Tags:
music-generationaudio-synthesisgenerative-aiopen-source-models - 最后活动时间: 2026-04-10
OpenUtau
开源歌声合成平台,UTAU的现代化继任者。支持多种歌声合成引擎,提供直观的歌声编辑体验。
- Stars: ⭐️ 3.8k
- Tags:
singing-synthesisvoice-synthesisvocaloidutauopen-source - 最后活动时间: 2026-05-02
aubio
音频与音乐分析库,提供音符检测、音高追踪、节拍检测和MFCC特征提取功能,广泛应用于音频机器学习和音乐信息检索领域。
- Stars: ⭐️ 3.7k
- Tags:
audiomusic-analysismfccpitch-detectiononset-detection - 最后活动时间: 2026-04-10
stable-audio-tools
用于条件音频生成的生成模型工具集,支持高质量音频合成与处理。
- Stars: ⭐️ 3.7k
- Tags:
audio-generationgenerative-modelsdiffusion-models - 最后活动时间: 2026-02-14
essentia
专业的C++音频与音乐分析库,支持音乐信息检索、音频特征提取与合成,提供Python绑定接口。
- Stars: ⭐️ 3.7k
- Tags:
audio-analysismusic-information-retrievaldsppython - 最后活动时间: 2026-07-22
sam-audio
Meta官方音频分割模型SAM-Audio的推理代码和预训练权重,支持音频分割任务的完整示例和Jupyter笔记本。
- Stars: ⭐️ 3.6k
- Tags:
audio-processingsegment-anythingmeta-aiaudio-model - 最后活动时间: 2026-05-26
speaches
基于Whisper的语音转文字服务,支持Docker部署和OpenAI API兼容接口,提供高效的音频转录能力。
- Stars: ⭐️ 3.5k
- Tags:
WhisperSpeech-to-TextDockerTranscription - 最后活动时间: 2026-07-23
Applio
简单易用的高质量语音转换工具,专注于性能优化和用户体验。
- Stars: ⭐️ 3.5k
- Tags:
Voice ConversionRVCTTS - 最后活动时间: 2026-07-30
speakr
自托管的音频转录Web应用,支持将录音文件自动转换为文字,注重隐私保护。
- Stars: ⭐️ 3.5k
- Tags:
transcriptionspeech-to-textself-hostedaudio - 最后活动时间: 2026-07-15
LiveCaptions-Translator
基于Windows LiveCaptions的轻量级实时语音翻译工具,支持音频转文字和实时翻译。
- Stars: ⭐️ 3.4k
- Tags:
speech-to-textaudio-to-textreal-time-translationlivecaptions - 最后活动时间: 2026-07-22
Linly-Talker
数字人对话系统,融合大语言模型与视觉模型,集成语音识别、合成与说话人头像生成技术。
- Stars: ⭐️ 3.4k
- Tags:
Digital AvatarMultimodalTTS - 最后活动时间: 2026-02-10
audioFlux
音频与音乐分析特征提取库,支持深度学习和机器学习应用,涵盖频谱分析、MFCC、音高检测等功能。
- Stars: ⭐️ 3.3k
- Tags:
Audio AnalysisMachine LearningSignal Processing - 最后活动时间: 2026-03-06
Qwen3-ASR
Qwen团队开源的语音识别模型,支持多语言语音/音乐/歌曲识别及时间戳预测。
- Stars: ⭐️ 3.3k
- Tags:
ASRSpeech-RecognitionQwen - 最后活动时间: 2026-06-26
TTS-WebUI
集成多种TTS模型的统一WebUI,支持GPT-SoVITS、XTTS、Bark等20+语音合成引擎。
- Stars: ⭐️ 3.2k
- Tags:
TTSAudio GenerationGradio - 最后活动时间: 2026-07-27
MisoTTS
一个拥有80亿参数的高情感文本转语音模型。能够生成极具表现力和自然度的人类语音。
- Stars: ⭐️ 3.2k
- Tags:
ttstext-to-speechaudio-generationspeech-synthesis - 最后活动时间: 2026-06-09
stemroller
基于深度学习的音源分离工具,可从任意歌曲中提取人声、鼓点、贝斯等独立音轨。
- Stars: ⭐️ 3.1k
- Tags:
source-separationdeep-learningaudio-processingdemucs - 最后活动时间: 2026-06-30
suno-api
Suno AI 音乐生成 API 封装,支持轻松集成到 GPTs 等 AI 智能体中。
- Stars: ⭐️ 3.1k
- Tags:
musicsunoaiapitypescript - 最后活动时间: 2026-03-06
faust
一种用于信号处理和声音合成的函数式编程语言,支持多种平台和后端编译。
- Stars: ⭐️ 3.1k
- Tags:
audiodspcompilerfunctional-programming - 最后活动时间: 2026-07-31
willow
开源、本地自托管的智能语音助手,可作为 Amazon Echo/Google Home 的替代方案。支持 Whisper 语音识别,注重隐私保护。
- Stars: ⭐️ 3.1k
- Tags:
voice-assistantspeech-recognitionwhisperesp32home-automation - 最后活动时间: 2026-08-01
deepjazz
基于Keras和Theano的深度学习爵士乐生成项目。
- Stars: ⭐️ 2.9k
- Tags:
deep-learningmusic-generationlstmjazz - 最后活动时间: 2026-03-19
neural-amp-modeler
神经网络吉他放大器模拟器,使用深度学习精确还原放大器音色。
- Stars: ⭐️ 2.9k
- Tags:
neural-networkaudio-processingguitar-ampdeep-learning - 最后活动时间: 2026-07-20
openai-fm
OpenAI Speech API 的官方演示项目,展示语音合成与识别能力的交互式示例。
- Stars: ⭐️ 2.9k
- Tags:
openaispeech-apittsdemo - 最后活动时间: 2026-03-03
jarvis
离线语音助手,注重隐私保护,基于Rust和Tauri构建。无需联网即可运行,适合注重隐私的用户。
- Stars: ⭐️ 2.9k
- Tags:
voice-assistantrustofflineprivacy - 最后活动时间: 2026-02-18
lingvo
Google开源的序列建模框架,专注于语音识别、机器翻译和NLP任务,支持大规模分布式训练。
- Stars: ⭐️ 2.9k
- Tags:
Speech RecognitionMachine TranslationNLP - 最后活动时间: 2026-06-22
Scriberr
自托管的AI音频转录工具,支持本地部署以保护数据隐私,提供高质量的语音转文字服务。
- Stars: ⭐️ 2.9k
- Tags:
Audio TranscriptionSelf-hostedPrivacy - 最后活动时间: 2026-06-01
aeneas
Python/C库,用于自动同步音频与文本,支持生成SRT、SMIL等字幕格式,适合字幕制作场景。
- Stars: ⭐️ 2.9k
- Tags:
forced-alignmentaudiospeech - 最后活动时间: 2026-07-25
Hex
基于Whisper的macOS语音转文字应用,支持实时语音转录为文字,简洁高效的本地化语音识别工具。
- Stars: ⭐️ 2.7k
- Tags:
whisperspeech-to-texttranscriptionmacosswiftui - 最后活动时间: 2026-07-19
kokoro-onnx
基于Kokoro模型和ONNX Runtime的高效TTS推理实现。
- Stars: ⭐️ 2.7k
- Tags:
kokoroonnxruntimettstext-to-speech - 最后活动时间: 2026-07-05
DDSP-SVC
基于DDSP的实时端到端歌声转换系统,支持高质量声音克隆。
- Stars: ⭐️ 2.6k
- Tags:
Voice ConversionDDSPReal-time - 最后活动时间: 2026-07-31
NeuralAmpModelerPlugin
基于神经网络的吉他放大器建模插件,利用AI技术精准模拟真实放大器的音色特性。
- Stars: ⭐️ 2.6k
- Tags:
Neural NetworkAudioPlugin - 最后活动时间: 2026-04-20
opentalking
工业级开源 AI 数字人框架,支持实时对话、私有化部署及可插拔模型。
- Stars: ⭐️ 2.6k
- Tags:
digital-humanreal-time-conversationai-frameworkttsstt - 最后活动时间: 2026-07-31
AI-Video-Transcriber
开源AI视频转录与摘要工具,支持多语言视频和播客内容转录。跨平台支持,可处理YouTube、TikTok等平台视频。
- Stars: ⭐️ 2.6k
- Tags:
transcribeaivideospeech-to-textsummarization - 最后活动时间: 2026-04-30
ChatTTS_colab
基于ChatTTS的一键部署工具,支持流式输出、音色抽卡、长音频生成和分角色朗读。
- Stars: ⭐️ 2.6k
- Tags:
text-to-speechvoice-synthesiscolab - 最后活动时间: 2026-05-31
FluidAudio
基于CoreML的前沿音频模型库,支持TTS、STT、语音活动检测和说话人分离,专为iOS/macOS设计。
- Stars: ⭐️ 2.6k
- Tags:
CoreMLSpeech AIiOS - 最后活动时间: 2026-08-01
asteroid
PyTorch音频源分离工具包,提供预训练模型用于语音增强和分离研究。
- Stars: ⭐️ 2.6k
- Tags:
audio-separationspeech-enhancementpytorch - 最后活动时间: 2026-05-13
rhubarb-lip-sync
命令行工具,可从录音自动生成2D口型动画,适用于游戏角色和动画制作。
- Stars: ⭐️ 2.6k
- Tags:
lip-syncanimationaudio-processingcli - 最后活动时间: 2026-06-16
pyttsx3
离线文本转语音合成库,支持多种语音引擎,无需网络连接即可运行。适用于语音助手、无障碍应用等场景。
- Stars: ⭐️ 2.5k
- Tags:
text-to-speechttspythonofflinespeech-synthesis - 最后活动时间: 2026-07-22
awesome-digital-human-live2d
数字人技术资源合集,涵盖Live2D虚拟形象、语音合成、面部动画等AI驱动的数字人相关技术与工具。
- Stars: ⭐️ 2.4k
- Tags:
digital-humanlive2davatarttsanimation - 最后活动时间: 2026-05-18
awesome-whisper
OpenAI Whisper语音识别模型精选资源列表,汇集工具、模型、教程和应用案例。
- Stars: ⭐️ 2.4k
- Tags:
Whisper语音识别Speech-to-Text - 最后活动时间: 2026-03-17
stable-ts
基于Whisper的音频转录与强制对齐工具,提供稳定的语音识别能力。
- Stars: ⭐️ 2.3k
- Tags:
whispertranscriptionforced-alignmentspeech-recognition - 最后活动时间: 2026-05-30
VieNeu-TTS
越南语实时文本转语音系统,支持即时语音克隆和端侧CPU实时推理,输出24kHz高质量音频。
- Stars: ⭐️ 2.3k
- Tags:
TTS语音克隆端侧推理 - 最后活动时间: 2026-08-02
MMAudio
CVPR 2025接收的高质量视频到音频合成模型,通过多模态联合训练实现音视频同步生成,支持视频或文本生成音频。
- Stars: ⭐️ 2.3k
- Tags:
Video-to-AudioAudio SynthesisMultimodal - 最后活动时间: 2026-02-23
magenta-js
浏览器端机器学习音乐与艺术生成库,支持实时音频创作和视觉艺术生成。
- Stars: ⭐️ 2.1k
- Tags:
music-generationart-generationtensorflow-js - 最后活动时间: 2026-06-22
WhisperJAV
基于Qwen3-ASR和Whisper的日语语音识别字幕生成工具,集成TEN-VAD和本地LLM,抗噪能力强。
- Stars: ⭐️ 2.1k
- Tags:
ASRWhisper字幕生成语音识别 - 最后活动时间: 2026-05-10
epub_to_audiobook
EPUB电子书转有声书工具,支持Audiobookshelf,带WebUI界面。
- Stars: ⭐️ 2.0k
- Tags:
audiobookttsepubopenai - 最后活动时间: 2026-03-24
diart
基于AI的实时音频处理Python库,支持说话人分离、语音活动检测和转录功能。
- Stars: ⭐️ 2.0k
- Tags:
Speaker DiarizationStreaming AudioDeep Learning - 最后活动时间: 2026-06-19
stemdeck
面向音乐人、制作人和爱好者的现代音轨分离平台,可隔离人声、鼓点、贝斯、钢琴和吉他。适用于练习、转录、混音和创意音频工作流。
- Stars: ⭐️ 2.0k
- Tags:
audiostem-extractionmusicai-audio - 最后活动时间: 2026-07-28
FireRedASR
开源工业级语音识别模型,支持普通话、方言和英语,在公开中文ASR基准上达到SOTA水平,同时具备出色的歌词识别能力。
- Stars: ⭐️ 1.9k
- Tags:
ASRSpeech RecognitionLLMMultimodal - 最后活动时间: 2026-02-25
SongRec
开源的Shazam客户端,使用音频指纹识别技术识别歌曲,支持Linux平台。
- Stars: ⭐️ 1.9k
- Tags:
audio-fingerprintingshazammusic-recognitionrust - 最后活动时间: 2026-07-09
parlor
本地实时多模态AI助手,支持语音和视觉对话。基于Gemma 4 E2B和Kokoro,完全在设备端运行。
- Stars: ⭐️ 1.9k
- Tags:
multimodalvoice-assistantlocal-llmon-device-aitext-to-speech - 最后活动时间: 2026-07-31
GPA
通用音频模型,能够使用单一轻量级模型完成语音识别、文本转语音和语音转换任务。
- Stars: ⭐️ 1.9k
- Tags:
asrttsvoice-conversionaudio - 最后活动时间: 2026-05-25
audapolis
一款专为口语音频设计的编辑器,内置自动转录功能,支持音视频编辑。
- Stars: ⭐️ 1.9k
- Tags:
audio-editingspeech-to-texttranscriptionvideo-editing - 最后活动时间: 2026-06-24
descript-audio-codec
最先进音频编解码器,支持90倍压缩率,适用于高质量音频生成与传输。
- Stars: ⭐️ 1.8k
- Tags:
audio-codecdeep-learningaudio-compressionpytorchgan - 最后活动时间: 2026-07-16
Montreal-Forced-Aligner
基于Kaldi的强制对齐命令行工具,用于语音音频与文本的精确对齐。
- Stars: ⭐️ 1.8k
- Tags:
forced-alignmentkaldispeechacoustic-model - 最后活动时间: 2026-06-11
RHVoice
免费开源的多语言语音合成引擎,支持俄语、英语、乌克兰语等多种语言,跨平台运行于Windows、Linux和Android。
- Stars: ⭐️ 1.8k
- Tags:
TTS语音合成开源 - 最后活动时间: 2026-07-31
ComfyUI-Qwen-TTS
Qwen3-TTS的ComfyUI插件实现,方便在ComfyUI中使用语音合成功能。
- Stars: ⭐️ 1.8k
- Tags:
TTSComfyUIQwen - 最后活动时间: 2026-06-03
RAVE
实时音频变分自编码器,可实现高质量音频生成与风格迁移,支持实时处理。
- Stars: ⭐️ 1.8k
- Tags:
AudioDeep LearningGenerative Model - 最后活动时间: 2026-03-07
bailing
类似GPT-4o的低延迟语音对话机器人,集成DeepSeek R1等大模型,响应时延低至800ms,支持打断和低配置设备运行。
- Stars: ⭐️ 1.7k
- Tags:
语音助手TTSASRDeepSeek - 最后活动时间: 2026-04-06
read-aloud
一款优秀的浏览器扩展,一键朗读网页内容,支持多种语音引擎和语言,提升无障碍访问体验。
- Stars: ⭐️ 1.7k
- Tags:
text-to-speechbrowser-extensionaccessibilitytts - 最后活动时间: 2026-07-10
voxtral.c
纯C语言实现的Mistral Voxtral Realtime 4B语音转文字模型推理引擎,专注于高性能实时语音识别。
- Stars: ⭐️ 1.7k
- Tags:
speech-to-textinferencemistralc-language - 最后活动时间: 2026-02-15
magenta-realtime
Magenta RealTime 2 是一个开放权重的实时音乐生成模型。它基于 JAX 和 MLX 构建,支持实时音乐生成与处理。
- Stars: ⭐️ 1.7k
- Tags:
musicmachine-learningjaxmlxreal-time - 最后活动时间: 2026-07-30
awesome-python-scientific-audio
Python音频科学研究资源精选,涵盖音频分析、处理和机器学习相关工具包。
- Stars: ⭐️ 1.7k
- Tags:
audiopythonspeech-processingscientific-computing - 最后活动时间: 2026-06-11
madmom
Python音频与音乐信号处理库,支持音乐信息检索。
- Stars: ⭐️ 1.7k
- Tags:
audio-analysissignal-processingmusic-information-retrieval - 最后活动时间: 2026-03-20
subsai
基于 Whisper 的字幕生成工具,支持 Web-UI、命令行和 Python 包多种使用方式。
- Stars: ⭐️ 1.7k
- Tags:
whispersubtitlesspeech-to-textvideo - 最后活动时间: 2026-04-20
transcribe.cpp
基于 ggml 的语音转文本推理工具,支持 16 种以上的模型家族。提供高效的本地语音识别解决方案。
- Stars: ⭐️ 1.7k
- Tags:
asrggmlggufspeech-to-text - 最后活动时间: 2026-07-31
BirdNET-Analyzer
基于深度学习的鸟类声音识别与分析工具,可用于科学音频数据处理和生态监测。
- Stars: ⭐️ 1.7k
- Tags:
deep-learningaudio-classificationbioacousticsacoustic-monitoring - 最后活动时间: 2026-07-27
SongGeneration
LeVo高质量歌曲生成模型官方代码,采用多偏好对齐技术提升生成效果。
- Stars: ⭐️ 1.6k
- Tags:
song-generationmusic-generationaudio-synthesisdeep-learning - 最后活动时间: 2026-03-12
obs-localvocal
OBS Studio本地语音识别与字幕生成插件,基于Whisper AI实现实时语音转文字和翻译功能,支持离线运行。
- Stars: ⭐️ 1.6k
- Tags:
语音识别WhisperOBS插件 - 最后活动时间: 2026-05-20
yap
基于 macOS Speech.framework 的本地语音转录命令行工具,支持设备端离线语音识别转文字。
- Stars: ⭐️ 1.5k
- Tags:
speech-to-textmacosclitranscriptionspeech-recognition - 最后活动时间: 2026-07-20
video-analyzer
结合LLM、计算机视觉和语音识别的视频分析工具,支持多模态内容理解。
- Stars: ⭐️ 1.5k
- Tags:
视频分析ASR多模态 - 最后活动时间: 2026-04-19
birdnet-go
实时鸟类声音识别分析系统,支持树莓派等边缘设备部署。
- Stars: ⭐️ 1.5k
- Tags:
birdnetaudio-recognitionwildlifeedge-ai - 最后活动时间: 2026-08-01
VibeVoice-ComfyUI
微软VibeVoice TTS模型的ComfyUI集成节点,支持高质量单/多说话人语音合成。
- Stars: ⭐️ 1.5k
- Tags:
comfyuitext-to-speechttsvoice-cloningai-audio - 最后活动时间: 2026-02-18
CyberVerse
自托管的实时数字人智能体平台,支持通过 WebRTC 构建语音优先的 AI 智能体。具备角色记忆、RAG、工具调用及可选的数字人视频生成能力。
- Stars: ⭐️ 1.5k
- Tags:
ai-agentsdigital-humanvoice-assistantwebrtctalking-avatar - 最后活动时间: 2026-07-30
elevenlabs-mcp
ElevenLabs官方MCP服务器,为AI应用提供高质量的语音合成和语音克隆能力。
- Stars: ⭐️ 1.5k
- Tags:
elevenlabselevenlabs-apimcpttsvoice-ai - 最后活动时间: 2026-07-30
Step-Audio2
端到端多模态大语言模型,专为工业级音频理解与语音对话设计。
- Stars: ⭐️ 1.5k
- Tags:
audio-llmmultimodalspeech-conversation - 最后活动时间: 2026-03-16
SALMONN
字节跳动与清华联合开发的多模态大语言模型,支持音频、语音、音乐和视频理解,入选ICLR/ICML 2024。
- Stars: ⭐️ 1.5k
- Tags:
多模态音频处理视频理解 - 最后活动时间: 2026-07-16
pianotrans
ByteDance 钢琴转录工具的简洁 GUI,支持踏板检测。
- Stars: ⭐️ 1.5k
- Tags:
aipianotranscriptionaudio - 最后活动时间: 2026-06-07
voxbento
一个开源的AI驱动实时翻译与解释平台。致力于打破语言障碍,提供高效的语音翻译体验。
- Stars: ⭐️ 1.5k
- Tags:
ai-interpretationtranslationspeech-to-textopen-source - 最后活动时间: 2026-08-01
unmute
让文本大语言模型具备听和说的能力,实现语音交互功能。为LLM添加语音输入输出接口,使其能够进行自然对话。
- Stars: ⭐️ 1.5k
- Tags:
TTSSTTVoice AILLM - 最后活动时间: 2026-07-16
Fun-ASR
开源的基于大语言模型的语音识别模型家族,支持中文方言、口音及多语种语音转写。提供流式处理、说话人分离及端侧部署能力,是Whisper的优秀替代方案。
- Stars: ⭐️ 1.5k
- Tags:
asrspeech-to-textmultilingualreal-time-asrllm - 最后活动时间: 2026-07-24
TalkingHead
一个JavaScript类库,用于实现3D虚拟形象的实时口型同步和语音驱动动画。支持文本转语音和全身3D头像的唇形同步。
- Stars: ⭐️ 1.4k
- Tags:
3d-avatarlip-synctalking-avatartext-to-speechanimation - 最后活动时间: 2026-06-02
subgen
基于 OpenAI Whisper 模型的自动字幕生成工具,支持 Jellyfin、Plex、Emby 等媒体服务器集成。
- Stars: ⭐️ 1.4k
- Tags:
whispersubtitlespeech-to-textmedia-server - 最后活动时间: 2026-07-29
OuteTTS
OuteTTS 模型的推理接口,支持 GGUF 格式和 Transformers 框架。
- Stars: ⭐️ 1.4k
- Tags:
text-to-speechllamagguf - 最后活动时间: 2026-03-23
Speech-AI-Forge
一站式语音AI平台,集成ChatTTS、CosyVoice、Fish-Speech等多种模型,提供API服务器和Gradio WebUI界面。
- Stars: ⭐️ 1.4k
- Tags:
TTSASR语音合成WebUI - 最后活动时间: 2026-05-21
Fun-ASR
通义实验室推出的端到端语音识别大模型,支持说话人分离等功能。
- Stars: ⭐️ 1.4k
- Tags:
ASRSpeech RecognitionAudio - 最后活动时间: 2026-07-14
SoniTranslate
视频同步翻译与自动配音工具,结合ASR、TTS和翻译技术实现跨语言视频内容转换。
- Stars: ⭐️ 1.4k
- Tags:
视频配音翻译TTSASR - 最后活动时间: 2026-04-27
transcribe-anything
多后端Whisper语音转文字工具,支持本地文件和URL输入,Mac ARM优化,完全私密免费。
- Stars: ⭐️ 1.4k
- Tags:
whisperspeech-to-texttranscriptionaudio - 最后活动时间: 2026-07-11
Chatterbox-TTS-Server
强大的TTS语音合成服务器,支持Web UI、OpenAI兼容API、声音克隆,可在NVIDIA/AMD/CPU上运行。
- Stars: ⭐️ 1.4k
- Tags:
TTS语音合成声音克隆API服务 - 最后活动时间: 2026-05-26
MOSS-TTSD
支持长上下文建模、多说话人合成和零样本语音克隆的语音对话生成模型。
- Stars: ⭐️ 1.4k
- Tags:
text-to-speechspeech-synthesisvoice-cloningstreaming - 最后活动时间: 2026-07-26
ThinkSound
NeurIPS 2025论文实现,基于思维链推理的多模态音频生成框架,支持文本、视频等输入生成音频。
- Stars: ⭐️ 1.4k
- Tags:
text-to-audiovideo-to-audiomultimodalaudio-generationpytorch - 最后活动时间: 2026-04-03
wespeaker
面向研究和生产的说话人验证、识别和分割工具包。
- Stars: ⭐️ 1.4k
- Tags:
speaker-verificationspeaker-recognitionspeaker-diarizationpytorch - 最后活动时间: 2026-07-08
ThinkSound
NeurIPS 2025 论文实现,基于思维链(CoT)推理的统一多模态音频生成框架。支持从文本和视频等多种模态生成高质量音频。
- Stars: ⭐️ 1.4k
- Tags:
text-to-audiovideo-to-audiopytorchneuripsaudio-generation - 最后活动时间: 2026-04-03
k2
可微分的FSA/FST算法库,与PyTorch兼容,专为语音识别等序列建模任务设计。
- Stars: ⭐️ 1.3k
- Tags:
speech-recognitionfstdifferentiablepytorch - 最后活动时间: 2026-07-11
Matcha-TTS
ICASSP 2024发表的快速文本转语音架构,采用条件流匹配技术实现高质量语音合成。
- Stars: ⭐️ 1.3k
- Tags:
TTS流匹配语音合成 - 最后活动时间: 2026-07-13
dicio-android
开源Android离线语音助手,基于Vosk实现本地语音识别与唤醒词检测,支持多种技能扩展。
- Stars: ⭐️ 1.3k
- Tags:
语音助手离线STTAndroidVosk - 最后活动时间: 2026-04-23
whisper-ctranslate2
基于CTranslate2的Whisper语音识别命令行工具,兼容OpenAI官方客户端,提供高效的语音转文字能力。
- Stars: ⭐️ 1.3k
- Tags:
whisperspeech-recognitionspeech-to-textctranslate2openai - 最后活动时间: 2026-02-14
python-audio-separator
基于预训练模型的音频分离工具,支持从音乐中提取人声、伴奏等音轨,提供命令行和Python API两种使用方式。
- Stars: ⭐️ 1.3k
- Tags:
audio-separationstem-separationmusic-processingdeep-learning - 最后活动时间: 2026-07-20
faster-qwen3-tts
基于Qwen3-TTS的实时文本转语音工具,提供高效的语音合成能力。
- Stars: ⭐️ 1.3k
- Tags:
TTSQwen3Real-time - 最后活动时间: 2026-07-17
qwen-audio-agent
一个实时语音运行时环境,旨在让AI代理保持持续对话与工作状态。为AI智能体提供了强大的实时语音交互能力。
- Stars: ⭐️ 1.3k
- Tags:
voice-agentagentic-aivoice-aireal-time - 最后活动时间: 2026-08-01
ASR-LLM-TTS
基于开源模型构建的语音交互系统,串联集成ASR语音识别、LLM大语言模型和TTS语音合成,实现完整的语音对话功能。
- Stars: ⭐️ 1.3k
- Tags:
ASRLLMTTS语音交互Qwen - 最后活动时间: 2026-06-03
my-translator
实时语音翻译工具,支持macOS和Windows,本地运行无需服务器,使用用户自己的API密钥实现语音转文字和文字转语音。
- Stars: ⭐️ 1.3k
- Tags:
speech-translationsttttsreal-timetauri - 最后活动时间: 2026-07-11
speech-trident
精选语音/音频大语言模型、表示学习和编解码模型资源合集。
- Stars: ⭐️ 1.2k
- Tags:
speech-llmaudio-modelscodecrepresentation-learning - 最后活动时间: 2026-07-10
Mousai
开源歌曲识别应用,类似Shazam,可在数秒内识别正在播放的歌曲。基于GNOME/GTK的Linux桌面应用。
- Stars: ⭐️ 1.2k
- Tags:
music-recognitionshazam-likeaudio-fingerprintinglinuxgnome - 最后活动时间: 2026-07-29
quillman
基于无服务器架构的 AI 语音聊天应用,支持语音识别和自然对话。
- Stars: ⭐️ 1.2k
- Tags:
voice-chatspeech-recognitionserverlesspython - 最后活动时间: 2026-05-28
MusicRecognizer
开源Android音乐识别应用,集成AudD、ACRCloud和Shazam等多种识别服务,实现快速歌曲识别。
- Stars: ⭐️ 1.2k
- Tags:
music-recognitionshazamauddacrcloudandroidaudio-fingerprinting - 最后活动时间: 2026-07-20
ekho
开源中文文本转语音引擎,支持粤语、藏语等多种中文方言。
- Stars: ⭐️ 1.2k
- Tags:
chinesecantonesettstext-to-speech - 最后活动时间: 2026-07-14
AI-Song-Cover-RVC
AI歌曲翻唱全流程工具,集成YouTube下载、人声分离、音频分割、训练和推理功能。
- Stars: ⭐️ 1.2k
- Tags:
rvcvoice-conversionaudiomusic - 最后活动时间: 2026-05-31
AVA-AI-Voice-Agent-for-Asterisk
集成Asterisk/FreePBX的开源AI语音智能体,使用Audiosocket/RTP技术。
- Stars: ⭐️ 1.2k
- Tags:
voice-agentasteriskfreepbxvoip - 最后活动时间: 2026-08-01
lhotse
机器学习多模态数据处理工具集,专注于语音识别和音频数据处理。
- Stars: ⭐️ 1.1k
- Tags:
audiospeech-recognitionpytorchdeep-learning - 最后活动时间: 2026-07-31
aTrain
离线语音转录GUI工具,支持说话人分离,基于最新机器学习模型。
- Stars: ⭐️ 1.1k
- Tags:
speech-recognitiontranscriptionspeaker-diarization - 最后活动时间: 2026-05-28
conformer
INTERSPEECH 2020论文非官方实现,卷积增强的Transformer语音识别模型,结合CNN局部建模与Transformer全局建模优势。
- Stars: ⭐️ 1.1k
- Tags:
conformerspeech-recognitionasrtransformer - 最后活动时间: 2026-06-29
TTS-Audio-Suite
ComfyUI多引擎TTS集成节点,支持10+主流语音合成引擎,提供角色配音和时间轴功能。
- Stars: ⭐️ 1.1k
- Tags:
TTSComfyUIVoice CloningAudio Generation - 最后活动时间: 2026-07-31
nnAudio
基于PyTorch的音频处理库,使用1D卷积网络实现高效的频谱图转换。
- Stars: ⭐️ 1.1k
- Tags:
audio-processingspectrogrampytorchneural-network - 最后活动时间: 2026-05-21
speech-swift
专为 Apple Silicon 设计的 AI 语音工具包,支持语音识别、语音合成、语音增强和说话人分离等功能。
- Stars: ⭐️ 1.1k
- Tags:
speech-recognitiontext-to-speechapple-siliconmlxcoreml - 最后活动时间: 2026-08-02
Irodori-TTS
基于Flow Matching的文本转语音模型,支持Emoji表情驱动的风格控制,实现富有表现力的语音合成。
- Stars: ⭐️ 1.1k
- Tags:
text-to-speechttsflow-matchingvoice-cloningspeech-synthesis - 最后活动时间: 2026-08-01
MiMo-Audio
音频语言模型项目,展示音频模型在少样本学习场景下的强大能力。
- Stars: ⭐️ 1.1k
- Tags:
audio-language-modelmultimodalfew-shot-learning - 最后活动时间: 2026-06-17
vits-simple-api
一个简洁的VITS语音合成HTTP API,支持BERT-VITS2和GPT-SoVITS等多种模型,方便快速部署TTS服务。
- Stars: ⭐️ 1.1k
- Tags:
ttsvitstts-apibert-vits2 - 最后活动时间: 2026-05-18
GLM-TTS
可控情感表达的零样本TTS模型,支持多奖励强化学习优化。
- Stars: ⭐️ 1.0k
- Tags:
ttsspeech-synthesiszero-shotemotion - 最后活动时间: 2026-04-10
CrisperWhisper
基于Whisper改进的逐字语音识别模型,提供更精确的词级时间戳和填充词检测功能。
- Stars: ⭐️ 1.0k
- Tags:
ASR语音识别Whisper - 最后活动时间: 2026-07-31
sokuji
实时语音翻译工具,支持本地 AI 和多种云端服务商,提供 Chrome 扩展和桌面应用。
- Stars: ⭐️ 1.0k
- Tags:
TranslationSpeech-to-SpeechReal-time - 最后活动时间: 2026-08-02
voxtype
基于Whisper的Wayland语音转文字工具,支持按键说话和离线语音识别。
- Stars: ⭐️ 1.0k
- Tags:
speech-to-textwhisperwaylandrustoffline - 最后活动时间: 2026-07-16
violin
开源视频翻译技能,集成ASR语音识别与配音功能,支持多语言视频内容转换。
- Stars: ⭐️ 1.0k
- Tags:
video-translationasrdubbingagent-skills - 最后活动时间: 2026-05-19
Cognitive-Speech-TTS
微软认知服务TTS API的多语言示例代码,支持自定义神经语音。
- Stars: ⭐️ 1.0k
- Tags:
azure-ttstext-to-speechspeech-sdkneural-voice - 最后活动时间: 2026-06-22
TensorFlowASR
基于 TensorFlow 2 的端到端自动语音识别框架,支持多种先进模型如 Conformer、Jasper 等。
- Stars: ⭐️ 1.0k
- Tags:
speech-recognitiontensorflowasrdeep-learningconformer - 最后活动时间: 2026-08-02
tada
开源语音语言模型,将语音处理与大语言模型能力相结合。
- Stars: ⭐️ 1.0k
- Tags:
speech-language-modelaudiospeechllmopen-source - 最后活动时间: 2026-05-11
video-translator
一个实时视频翻译和配音技能项目,能够将视频内容快速转化为目标语言。
- Stars: ⭐️ 1.0k
- Tags:
video-translationdubbingreal-timemultimodal - 最后活动时间: 2026-06-17
voquill
开源的语音听写工具,WisprFlow的免费替代方案。支持本地AI语音转文字,基于Whisper技术构建。
- Stars: ⭐️ 995
- Tags:
speech-to-textwhisperlocal-aidictation - 最后活动时间: 2026-08-01
Fun-Audio-Chat
一个大型音频语言模型,专为自然、低延迟的语音交互而构建。能够实现高质量的实时音频对话体验。
- Stars: ⭐️ 986
- Tags:
Audio-Language-ModelVoice-InteractionLow-LatencySpeech - 最后活动时间: 2026-02-27
Fun-Audio-Chat
大型音频语言模型,专为自然、低延迟的语音交互而设计,支持流畅的实时对话体验。
- Stars: ⭐️ 983
- Tags:
audio-language-modelvoice-interactionspeech-ailow-latency - 最后活动时间: 2026-02-27
murmure
完全本地化、隐私优先的跨平台语音转文字工具,集成LLM后处理功能。
- Stars: ⭐️ 982
- Tags:
Speech-to-TextPrivacyLocal AI - 最后活动时间: 2026-07-30
Qwen3-ASR-Toolkit
Qwen3-ASR官方Python工具包,支持高吞吐并行转录与长音频处理。提供多采样率支持,适用于高效的语音转文本场景。
- Stars: ⭐️ 980
- Tags:
ASRSpeech-to-TextQwenAudio - 最后活动时间: 2026-02-05
parakeet-mlx
Nvidia Parakeet语音模型的Apple Silicon优化实现,基于MLX框架提供高效语音识别。
- Stars: ⭐️ 970
- Tags:
parakeetmlxspeech-recognitionapple-silicon - 最后活动时间: 2026-06-05
Step-Audio-EditX
30亿参数的LLM音频编辑模型,支持情感、风格编辑及零样本语音合成。
- Stars: ⭐️ 956
- Tags:
audio-editingttsvoice-cloningreinforcement-learning - 最后活动时间: 2026-04-09
kapre
Keras音频预处理库,提供可GPU加速的声谱图计算层。
- Stars: ⭐️ 947
- Tags:
audio-processingkerasspectrogram - 最后活动时间: 2026-05-17
botium-speech-processing
Botium语音处理工具,集成语音转文本与文本转语音功能。
- Stars: ⭐️ 943
- Tags:
speech-to-texttext-to-speechbotium - 最后活动时间: 2026-06-25
whisper.net
基于Whisper模型的.NET语音识别库,支持跨平台语音转文字和翻译功能,简单易用。
- Stars: ⭐️ 938
- Tags:
speech-recognitionspeech-to-textwhisperdotnet - 最后活动时间: 2026-07-26
jzsub
JZSub 是一款自动化视频处理工具,通过一条视频链接即可生成最高画质并附带 GPT 双语字幕的 MP4 文件。极大简化了视频字幕翻译与下载流程。
- Stars: ⭐️ 916
- Tags:
bilingualsubtitlesvideogptyt-dlp - 最后活动时间: 2026-07-29
inaSpeechSegmenter
基于CNN的音频分割工具包,可检测语音、音乐、噪声和说话人性别。
- Stars: ⭐️ 903
- Tags:
audio-segmentationspeech-detectiongender-classificationcnn - 最后活动时间: 2026-03-12
micro-wake-word
基于TensorFlow的唤醒词检测训练框架,支持合成样本生成,适用于微控制器部署。
- Stars: ⭐️ 902
- Tags:
wake-wordkeyword-spottingtensorflowembedded-aiaudio - 最后活动时间: 2026-07-06
ccextractor
强大的字幕提取工具,支持从视频流中提取隐藏字幕,集成OCR技术识别图像字幕。
- Stars: ⭐️ 896
- Tags:
字幕提取OCR视频处理 - 最后活动时间: 2026-07-26
TheWhisper
优化版Whisper模型,专为流式和端设备语音识别设计,支持多平台硬件加速。
- Stars: ⭐️ 894
- Tags:
whisperspeech-recognitionstreamingon-device-ai - 最后活动时间: 2026-06-15
whoBIRD
基于BirdNET的Android实时鸟类声音识别应用,支持全球6000+种鸟类的声音识别。
- Stars: ⭐️ 887
- Tags:
audio-recognitionbirdnetandroidreal-time - 最后活动时间: 2026-08-01
BS-RoFormer
Band Split Roformer实现,ByteDance AI Labs的SOTA音乐源分离注意力网络。
- Stars: ⭐️ 884
- Tags:
music-source-separationtransformersattentionpytorch - 最后活动时间: 2026-06-14
MidiTok
为深度学习模型设计的MIDI/符号音乐标记器,支持音乐生成与信息检索任务。
- Stars: ⭐️ 884
- Tags:
deep-learningmidimusic-generationtokenization - 最后活动时间: 2026-07-20
local-talking-llm
完全离线运行的语音对话LLM应用,集成语音识别与语音合成功能,无需联网即可使用。
- Stars: ⭐️ 883
- Tags:
speech-recognitionspeech-synthesislocal-llmchatbot - 最后活动时间: 2026-04-04
TypeNo
一款免费开源、隐私优先的macOS语音输入应用,支持本地语音转文字功能。
- Stars: ⭐️ 880
- Tags:
speech-to-textmacosprivacyvoice-inputswift - 最后活动时间: 2026-05-26
brain2qwerty
利用卷积编码器、Transformer和字符级语言模型,从非侵入式MEG和EEG脑电记录中解码打字句子。结合深度学习实现高精度的脑机接口文本生成。
- Stars: ⭐️ 880
- Tags:
brain-computer-interfaceeegmegtransformerneural-decoding - 最后活动时间: 2026-07-29
sopro
支持零样本语音克隆的轻量级文本转语音模型。
- Stars: ⭐️ 877
- Tags:
text-to-speechvoice-cloningzero-shottts - 最后活动时间: 2026-02-06
Easy-Voice-Toolkit
用户友好的音频工具包,支持语音识别、转录、转换等多种功能,简化音频处理流程。
- Stars: ⭐️ 874
- Tags:
语音识别TTS音频处理 - 最后活动时间: 2026-06-29
vocotype-cli
本地端侧隐私安全语音输入工具,支持语音实时转文字、MCP集成、AI文本优化及自定义词典功能。
- Stars: ⭐️ 872
- Tags:
asrspeech-to-textvoice-inputmcpfunasr - 最后活动时间: 2026-06-24
Qwen3-Audiobook-Converter
基于Qwen3 TTS语音模型的有声书转换工具,支持PDF、EPUB、DOCX等多种格式转换为高质量有声书。
- Stars: ⭐️ 871
- Tags:
ttsaudiobookqwen3voice-synthesisdocument-converter - 最后活动时间: 2026-04-07
subvert
视频字幕生成工具,秒级生成字幕、摘要和章节标记。结合ChatGPT和Whisper,自动化视频内容处理流程。
- Stars: ⭐️ 870
- Tags:
字幕生成视频处理Whisper - 最后活动时间: 2026-05-15
muesli
一款专为 macOS 设计的本地会议转录与听写工具,注重隐私保护。可作为 Granola 和 WisprFlow 的替代方案,提供高效的语音转文字体验。
- Stars: ⭐️ 865
- Tags:
macosspeech-to-texttranscriptionon-device-aiprivacy-first - 最后活动时间: 2026-08-01
pdf-to-podcast
将PDF文档转换为AI生成的播客音频,基于NVIDIA NIM构建,支持随时随地收听文档内容。
- Stars: ⭐️ 861
- Tags:
PDFTTS播客音频生成 - 最后活动时间: 2026-06-26
auditok
音频活动检测与分割工具,支持语音活动检测(VAD),是语音识别预处理的重要组件。
- Stars: ⭐️ 856
- Tags:
audiovadvoice-activity-detectionaudio-segmentation - 最后活动时间: 2026-07-28
offline-translator
基于Firefox翻译模型的Android离线翻译工具,支持设备端本地翻译,无需网络连接。
- Stars: ⭐️ 852
- Tags:
translationandroidofflinemachine-translation - 最后活动时间: 2026-05-28
alexandria-audiobook
AI驱动的多语音有声书生成器,支持LLM脚本标注、语音克隆、LoRA训练,基于Qwen3-TTS构建,可导出MP3、M4B等多格式。
- Stars: ⭐️ 849
- Tags:
audiobook-generatortext-to-speechvoice-cloningttsai - 最后活动时间: 2026-07-23
GLM-ASR
开源鲁棒性语音识别模型,15亿参数,支持边缘设备部署。
- Stars: ⭐️ 837
- Tags:
asrspeech-recognitionspeech-to-texton-device - 最后活动时间: 2026-03-06
whisper-flow
基于OpenAI Whisper的实时音频转录框架,支持流式音频处理和增量转录输出。
- Stars: ⭐️ 819
- Tags:
speech-to-textwhisperreal-timetranscription - 最后活动时间: 2026-08-01
voxtral-mini-realtime-rs
基于Rust和Burn ML框架实现的Mistral Voxtral Mini 4B实时语音识别模型,支持本地运行和浏览器WASM部署。
- Stars: ⭐️ 811
- Tags:
speech-recognitionrustmistralasrwasmrealtime - 最后活动时间: 2026-04-02
Kokoros
基于Kokoro模型的Rust高性能TTS实现,提供极速、高质量的实时语音合成能力。
- Stars: ⭐️ 806
- Tags:
TTSRust语音合成 - 最后活动时间: 2026-06-19
AlphaAvatar
基于LiveKit的实时交互式全能虚拟化身平台,支持无缝集成各类开源虚拟角色组件,包括实时模型、视觉、语音、记忆和搜索功能。
- Stars: ⭐️ 805
- Tags:
AvatarReal-timeLiveKit - 最后活动时间: 2026-07-25
SoulX-Singer
零样本歌唱语音合成项目,支持高质量歌声生成与推理。
- Stars: ⭐️ 800
- Tags:
singing-voice-synthesiszero-shotaudio-generationtts - 最后活动时间: 2026-05-29
lobe-tts
高质量文本转语音与语音识别库,同时支持服务端和浏览器端,提供统一 API 接口。
- Stars: ⭐️ 798
- Tags:
TTSSTTSpeech RecognitionReact - 最后活动时间: 2026-03-02
TTS-Voice-Wizard
强大的语音转换工具,支持语音识别、TTS和实时翻译,可集成VRChat虚拟形象显示,适合VTuber使用。
- Stars: ⭐️ 796
- Tags:
TTSSTTVRChatVTuber - 最后活动时间: 2026-05-28
lue
支持多种格式的终端电子书阅读器,内置高质量文本转语音(TTS)功能。为开发者在命令行中听书提供了极佳的体验。
- Stars: ⭐️ 793
- Tags:
cliebookreadertext-to-speechttstui - 最后活动时间: 2026-07-16
translate
实时手语翻译工具,利用计算机视觉技术实现无障碍沟通,支持Android、iOS和Web多平台。
- Stars: ⭐️ 783
- Tags:
sign-languagesign-language-recognitioncomputer-visiontranslation - 最后活动时间: 2026-06-16
MioSub
一站式全自动字幕生成软件,覆盖下载、转录、翻译到压制全流程,无需人工介入。
- Stars: ⭐️ 773
- Tags:
speech-to-textwhispersubtitle-generatortranscriptiondiarization - 最后活动时间: 2026-07-18
ZerolanLiveRobot
集成LLM、ASR、TTS、OCR、CV等技术的AI虚拟主播,支持直播和Minecraft互动。
- Stars: ⭐️ 772
- Tags:
ai-vtuberllmttsasrmultimodal - 最后活动时间: 2026-04-14
persona
一个致力于将实时语音技术带入现实生活的开源项目。它提供了流畅且低延迟的语音交互体验。
- Stars: ⭐️ 767
- Tags:
voicereal-timeaudiospeech - 最后活动时间: 2026-08-01
CloneTTS
轻量级离线Android TTS引擎,支持系统级语音克隆和高保真朗读。
- Stars: ⭐️ 760
- Tags:
text-to-speechvoice-cloningandroidoffline-tts - 最后活动时间: 2026-07-30
fish-diffusion
易于理解的 TTS/SVS/SVC 统一框架,基于扩散模型实现语音合成与转换。
- Stars: ⭐️ 751
- Tags:
diffusionttsvoice-conversionpytorch - 最后活动时间: 2026-06-01
mlx-audio-swift
基于Apple Silicon的模块化Swift音频处理SDK,支持语音识别、语音合成和端到端语音处理。
- Stars: ⭐️ 744
- Tags:
mlxspeech-to-texttext-to-speechswiftapple-silicon - 最后活动时间: 2026-07-29
vui
1亿参数轻量级对话式 TTS 模型,支持呼吸声、笑声、多说话人对话、声音克隆和流式推理。
- Stars: ⭐️ 737
- Tags:
lightweight-ttsllamavoice-cloningon-device - 最后活动时间: 2026-07-30
tts
Inworld TTS 语音合成引擎,提供高质量文本转语音服务。
- Stars: ⭐️ 736
- Tags:
ttstext-to-speechvoice-synthesis - 最后活动时间: 2026-07-13
ttsfm
镜像OpenAI TTS服务的开源实现,提供兼容的文本转语音接口,支持多种语音选项。
- Stars: ⭐️ 730
- Tags:
ttsopenai-apitext-to-speechself-hosted - 最后活动时间: 2026-06-30
Confucius4-TTS
支持多语言和跨语言的零样本文本转语音(TTS)引擎,能够实现高质量的语音克隆与合成。
- Stars: ⭐️ 730
- Tags:
ttszero-shot-ttsvoice-clonespeech-synthesispytorch - 最后活动时间: 2026-07-27
MASR
流式与非流式自动语音识别框架,支持Conformer、Squeezeformer等模型,兼容在线和离线识别场景。
- Stars: ⭐️ 729
- Tags:
asrspeech-recognitionconformerstreaming - 最后活动时间: 2026-07-06
ComfyUI-Index-TTS
ComfyUI 的 IndexTTS 自定义节点,支持中英文文本转语音和声音克隆。
- Stars: ⭐️ 727
- Tags:
comfyuiindex-ttsvoice-cloning - 最后活动时间: 2026-06-29
Thorsten-Voice
高质量德语 TTS 语音数据集,免费离线使用,无许可证限制。
- Stars: ⭐️ 726
- Tags:
german-ttsspeech-datasetopen-source - 最后活动时间: 2026-07-26
BiBi-Keyboard
基于Kotlin的Android语音输入法键盘,集成LLM与ASR语音识别,支持智能语音输入。
- Stars: ⭐️ 725
- Tags:
AndroidASRKeyboardSpeech-to-Text - 最后活动时间: 2026-08-02
GigaAM
强大的语音识别基础模型,支持语音识别、情感识别等任务,采用自监督学习方法训练。
- Stars: ⭐️ 720
- Tags:
speech-recognitionfoundation-modelsself-supervised-learningemotion-recognition - 最后活动时间: 2026-07-14
openspeech
基于PyTorch-Lightning和Hydra的端到端语音识别工具包,提供完整ASR解决方案。
- Stars: ⭐️ 716
- Tags:
ASRPyTorch端到端 - 最后活动时间: 2026-06-21
voice-ai
端到端语音AI编排平台,支持构建实时对话语音智能体,集成STT、TTS、VAD和多通道能力。
- Stars: ⭐️ 707
- Tags:
Voice AISTT/TTSVoice AgentsReal-time Audio - 最后活动时间: 2026-08-02
rhino
基于深度学习的端上语音意图识别引擎,用于语音助手和命令控制。
- Stars: ⭐️ 705
- Tags:
speech-recognitionnluvoice-assistantintent-recognitionon-device - 最后活动时间: 2026-07-27
whisper_android
基于OpenAI Whisper的Android离线语音识别方案,使用TensorFlow Lite实现本地化部署,无需网络即可运行。
- Stars: ⭐️ 679
- Tags:
语音识别Android离线推理 - 最后活动时间: 2026-03-18
MimikaStudio
macOS本地优先应用,集成MCP智能体支持、TTS语音合成与声音克隆功能。
- Stars: ⭐️ 673
- Tags:
ttsvoice-cloningmcpqwenagent - 最后活动时间: 2026-04-01
openlrc
使用Whisper和LLM进行语音转录与翻译,自动生成LRC字幕文件。
- Stars: ⭐️ 671
- Tags:
WhisperTranscriptionSubtitle - 最后活动时间: 2026-07-31
cheetah
基于深度学习的端上流式语音转文字引擎,支持实时转录。
- Stars: ⭐️ 670
- Tags:
speech-recognitionasrspeech-to-texton-devicestreaming - 最后活动时间: 2026-07-22
hear
undefined
- Stars: ⭐️ 670
- Tags:
speech-recognitiontranscriptionmacoscli - 最后活动时间: 2026-05-19
expo-speech-recognition
React Native Expo 语音识别库,支持语音转文字功能,适用于移动端语音交互应用开发。
- Stars: ⭐️ 658
- Tags:
speech-recognitionspeech-to-textreact-nativeexpovoice-recognition - 最后活动时间: 2026-07-28
aiavatarkit
快速构建 AI 驱动的对话虚拟形象工具包。
- Stars: ⭐️ 650
- Tags:
ai-avatarchatgptvoicevoxvrchat - 最后活动时间: 2026-07-31
tts
基于Go语言开发的文本转语音(TTS)服务,提供语音合成能力。
- Stars: ⭐️ 630
- Tags:
ttsgospeech-synthesis - 最后活动时间: 2026-04-28
voicetypr
基于 Whisper AI 的离线语音转文字工具,专为开发者和高级用户设计。支持 macOS 和 Windows,提供高效的本地语音听写体验。
- Stars: ⭐️ 627
- Tags:
voice-to-textwhisper-aitaurivoice-assistant - 最后活动时间: 2026-07-24
TranscriptionSuite
完全本地化且隐私安全的语音转文字应用,支持说话人分离、实时转录和LM Studio集成。提供跨平台的音频笔记本模式,兼容多种 Whisper 模型。
- Stars: ⭐️ 626
- Tags:
speech-to-textwhispertranscriptionlocaldiarization - 最后活动时间: 2026-08-01
FireRedASR2S
工业级全功能ASR语音识别系统,支持ASR、VAD、语言识别和标点预测,覆盖中文方言、英文及代码切换场景。
- Stars: ⭐️ 623
- Tags:
asrspeech-recognitionvadmultimodalllm - 最后活动时间: 2026-06-02
LookOnceToHear
一种用于耳机实时语音提取的新型人机交互方法,能够在嘈杂环境中提取目标语音。结合了深度学习和语音分离技术。
- Stars: ⭐️ 603
- Tags:
speech-extractionreal-timeaudio-processingdeep-learning - 最后活动时间: 2026-07-22
Pandrator
将PDF、EPUB转换为有声书,支持视频配音和翻译。使用本地模型XTTS实现语音克隆,提供友好的GUI界面。
- Stars: ⭐️ 599
- Tags:
text-to-speechvoice-cloningaudiobookxttsllm - 最后活动时间: 2026-08-02
room-impulse-responses
房间冲激响应数据集汇总,提供公开数据集列表及下载脚本,适用于语音识别、声学模拟等音频AI研究。
- Stars: ⭐️ 596
- Tags:
acousticsroom-impulse-responsespeechaudio-dataset - 最后活动时间: 2026-05-11
pindrop
一款原生 macOS 菜单栏听写应用,使用 WhisperKit 实现本地语音转文字,保护隐私的同时提供高质量的语音识别体验。
- Stars: ⭐️ 582
- Tags:
speech-to-textwhisperkitmacosdictationlocal-ai - 最后活动时间: 2026-07-22
qwen-asr
基于C语言实现的Qwen3-ASR语音识别模型推理引擎,支持0.6B和1.7B参数量的转录模型,提供高效轻量的本地部署方案。
- Stars: ⭐️ 579
- Tags:
asrspeech-recognitionqwenc-inferencetranscription - 最后活动时间: 2026-02-17
sag
类似 macOS say 命令的现代化语音合成工具,支持 ElevenLabs 等高质量 AI 语音生成。
- Stars: ⭐️ 574
- Tags:
elevenlabsttsgospeech-synthesis - 最后活动时间: 2026-07-12
offmute
利用LLM实现会议转录和说话人分离的实验性工具,探索纯LLM进行音频处理的可行性。
- Stars: ⭐️ 569
- Tags:
transcriptiondiarizationllmmeeting - 最后活动时间: 2026-04-08
auto-caption
一款跨平台的实时字幕显示软件,能够实时将音频转换为文字并展示。适用于会议、直播和日常交流等多种场景。
- Stars: ⭐️ 563
- Tags:
asrreal-timesubtitleselectron - 最后活动时间: 2026-02-10
Audar-ASR-V1
阿拉伯语优先的生成式语音识别模型,在Open Universal Arabic ASR排行榜上排名第一。提供模型卡片、基准测试和推理支持。
- Stars: ⭐️ 561
- Tags:
arabicasrspeech-recognitionspeech-to-texthuggingface - 最后活动时间: 2026-07-20
easy-whisper-ui
Whisper 语音识别模型的易用图形界面,针对各类 GPU 进行优化。
- Stars: ⭐️ 556
- Tags:
whisperspeech-recognitiontranscriptiongpu - 最后活动时间: 2026-02-15
spleeter-web
可自托管的Web应用,用于分离歌曲中的人声、伴奏、贝斯和鼓声。支持Spleeter、Demucs、BS-RoFormer等多种AI分离模型。
- Stars: ⭐️ 553
- Tags:
source-separationvocal-removerspleeterdemucsaudio-processing - 最后活动时间: 2026-07-26
FlashLabs-Chroma
首个开源的实时端到端语音对话模型,支持个性化声音克隆。
- Stars: ⭐️ 550
- Tags:
speech-to-speechvoice-cloningreal-time-audio - 最后活动时间: 2026-04-17
claude-watch
赋予Claude观看视频能力的工具,能提取场景变化帧、转录文本并生成结构化报告。
- Stars: ⭐️ 542
- Tags:
claudevideo-analysismultimodaltranscript - 最后活动时间: 2026-07-24
CleanS2S
单文件实现的流式全双工语音交互智能体,支持高质量实时语音对话。
- Stars: ⭐️ 537
- Tags:
speech-to-speechstreaminggpt-4o - 最后活动时间: 2026-04-07
macparakeet
一款专为 Apple Silicon Mac 设计的本地优先语音应用,支持听写、文件转录和会议录音。提供隐私保护的开源自动化语音转文本解决方案。
- Stars: ⭐️ 534
- Tags:
apple-silicondictationspeech-to-texttranscriptionlocal-first - 最后活动时间: 2026-07-31
UltraSinger
基于AI的工具,能从音乐中提取人声歌词和音高,自动生成Ultrastar Deluxe、Midi和笔记文件。可自动创建卡拉OK文件。
- Stars: ⭐️ 532
- Tags:
aiaudiokaraokelyricsmidimusicpitch-detectionvocal - 最后活动时间: 2026-06-30
ctc-forced-aligner
基于CTC强制对齐的文本到语音对齐工具,适用于语音合成与识别的数据处理。
- Stars: ⭐️ 529
- Tags:
forced-alignmentspeech-to-texttext-to-speechctc - 最后活动时间: 2026-07-12
ComfyUI-OmniVoice-TTS
ComfyUI的OmniVoice TTS节点,支持零样本多语言文本转语音、声音克隆及多说话人对话生成。
- Stars: ⭐️ 523
- Tags:
comfyuitext-to-speechvoice-cloningtts - 最后活动时间: 2026-06-11
muspy
符号音乐生成工具包,支持音乐信息检索和机器学习驱动的音乐创作。
- Stars: ⭐️ 522
- Tags:
Music GenerationSymbolic MusicPython - 最后活动时间: 2026-03-11
muesli
macOS本地会议转录与听写工具,可作为Granola和WisprFlow的替代方案。支持实时语音转文字,保护隐私的离线处理。
- Stars: ⭐️ 521
- Tags:
speech-to-texttranscriptionmacosdictationlocal-ai - 最后活动时间: 2026-05-27
neural-amp-modeler-lv2
基于机器学习的吉他放大器建模LV2插件,能够精准模拟真实硬件放大器的音色。
- Stars: ⭐️ 513
- Tags:
machine-learningaudioamplifierlv2-pluginguitar - 最后活动时间: 2026-07-26
subaligner
基于深度神经网络和Transformer的字幕自动同步、翻译与转录工具,支持多种字幕格式和语音活动检测。
- Stars: ⭐️ 510
- Tags:
subtitletranscriptiontransformersvoice-activity-detectiondnn - 最后活动时间: 2026-07-13
transcribee
开源的音视频转录软件,支持将音频和视频内容高效转换为文本。
- Stars: ⭐️ 509
- Tags:
speech-to-texttranscriptionaudiovideo - 最后活动时间: 2026-07-30
tiny-tts
最小的英语文本转语音(TTS)模型,仅包含100万参数。适合在资源受限的设备上进行轻量级语音合成。
- Stars: ⭐️ 508
- Tags:
ttstext-to-speechspeech-synthesislightweight-model - 最后活动时间: 2026-04-10
BeatNet
基于CRNN和粒子滤波的实时音乐节拍、速度和节拍线追踪系统。支持实时与离线的高精度音乐节奏分析。
- Stars: ⭐️ 507
- Tags:
beat-trackingcrnnpytorchreal-timemusic-analysis - 最后活动时间: 2026-04-13
ComfyUI-VoxCPM
ComfyUI节点插件,支持高表现力的语音合成与逼真的零样本声音克隆。为ComfyUI工作流提供强大的文本转语音能力。
- Stars: ⭐️ 501
- Tags:
comfyui-nodetext-to-speechvoice-cloningttsaudio - 最后活动时间: 2026-04-24
CrispASR
基于C++和ggml构建的多语言ASR与TTS运行时中心,支持Cohere Transcribe、Voxtral等多种语音模型及强制对齐功能。
- Stars: ⭐️ 501
- Tags:
ggmlspeech-recognitionspeech-to-textstttranscriptionwhisper-cpp - 最后活动时间: 2026-08-01
aspeak
Azure TTS API 的简洁命令行客户端,支持高质量语音合成。可快速将文本转换为自然流畅的语音输出。
- Stars: ⭐️ 500
- Tags:
text-to-speechttsazure-cognitive-servicescli - 最后活动时间: 2026-04-23
whisper
语音笔记应用,支持语音录制并利用AI进行智能转换和处理。
- Stars: ⭐️ 500
- Tags:
speech-to-textvoice-notesai-assistantproductivity - 最后活动时间: 2026-05-23
Image Generation
stable-diffusion-webui
最受欢迎的Stable Diffusion Web UI,提供完整的图像生成界面。支持文生图、图生图、图像放大等多种功能。
- Stars: ⭐️ 164.3k
- Tags:
stable-diffusionimage-generationgradioai-art - 最后活动时间: 2026-03-02
ComfyUI
最强大的模块化扩散模型GUI工具,基于节点的工作流界面,灵活构建复杂图像生成流程。
- Stars: ⭐️ 123.2k
- Tags:
Stable-DiffusionGUIImage-Generation - 最后活动时间: 2026-08-02
tesseract
开源OCR引擎,使用LSTM神经网络进行光学字符识别,支持多种语言。
- Stars: ⭐️ 75.7k
- Tags:
ocrmachine-learninglstmtesseract - 最后活动时间: 2026-07-29
face_recognition
最简单易用的人脸识别Python库,支持人脸检测与识别。
- Stars: ⭐️ 56.6k
- Tags:
face-recognitionface-detectionpythonmachine-learning - 最后活动时间: 2026-06-25
upscayl
免费开源的AI图像放大工具,基于ESRGAN模型实现高质量图像超分辨率重建,支持跨平台使用。
- Stars: ⭐️ 47.7k
- Tags:
AI图像放大ESRGAN开源工具 - 最后活动时间: 2026-07-30
diffusers
Hugging Face推出的扩散模型库,支持图像、视频和音频生成,是生成式AI领域的核心工具。
- Stars: ⭐️ 34.2k
- Tags:
DiffusionPyTorchHuggingFace - 最后活动时间: 2026-08-02
facefusion
业界领先的人脸处理平台,支持换脸、对口型等多种AI面部操作功能。
- Stars: ⭐️ 29.5k
- Tags:
人脸处理换脸深度学习 - 最后活动时间: 2026-08-01
insightface
业界领先的2D/3D人脸分析项目,支持人脸检测、识别、属性分析等任务。
- Stars: ⭐️ 29.4k
- Tags:
face-recognitionface-detectionpytorch - 最后活动时间: 2026-07-27
InvokeAI
领先的Stable Diffusion创意引擎,提供专业级WebUI界面。支持txt2img、img2img、inpainting等多种图像生成与编辑功能。
- Stars: ⭐️ 27.7k
- Tags:
Stable Diffusion图像生成AI艺术 - 最后活动时间: 2026-08-02
Open-Generative-AI
开源AI图像生成与视频创作工作室,支持Flux、SDXL、Midjourney等20+模型,可自托管部署。
- Stars: ⭐️ 25.4k
- Tags:
ai-image-generationai-video-generationgenerative-aiflux-1text-to-video - 最后活动时间: 2026-08-01
blender-mcp
MCP服务器,实现AI与Blender 3D建模软件的集成控制。
- Stars: ⭐️ 25.3k
- Tags:
mcpblender3dcreative-tools - 最后活动时间: 2026-07-29
rembg
基于深度学习的图像背景移除工具,支持多种AI模型快速精准去除图片背景。
- Stars: ⭐️ 24.1k
- Tags:
背景移除图像处理计算机视觉 - 最后活动时间: 2026-07-18
deepface
轻量级人脸分析库,支持年龄、性别、情绪等多属性识别。
- Stars: ⭐️ 23.2k
- Tags:
face-recognitiondeep-learningface-analysispython - 最后活动时间: 2026-06-29
surya
支持90+语言的OCR工具,提供版面分析、阅读顺序识别和表格识别功能。
- Stars: ⭐️ 21.1k
- Tags:
ocrlayout-analysistable-recognitionmultilingual - 最后活动时间: 2026-07-17
sam2
Meta第二代图像分割模型,支持图像和视频的实时分割,性能显著提升。
- Stars: ⭐️ 19.6k
- Tags:
segmentationvideo-segmentationcomputer-visionmeta - 最后活动时间: 2026-05-30
Waifu2x-Extension-GUI
强大的AI图像视频超分辨率工具,集成多种AI模型,支持图片/视频放大与帧插值。
- Stars: ⭐️ 16.8k
- Tags:
超分辨率图像放大视频处理 - 最后活动时间: 2026-07-19
awesome-gpt-image-2-API-and-Prompts
GPT-Image-2 API 和提示词资源合集,涵盖图像生成、图像到图像转换等功能,帮助开发者快速上手 OpenAI 图像生成技术。
- Stars: ⭐️ 16.6k
- Tags:
gpt-image-2image-generationopenaipromptstext-to-image - 最后活动时间: 2026-06-10
engine
强大的Web图形运行时,支持WebGL、WebGPU、WebXR和3D高斯泼溅神经渲染技术。
- Stars: ⭐️ 16.4k
- Tags:
3d-gaussian-splattingwebglwebgpugame-engine - 最后活动时间: 2026-08-01
lingbot-map
前馈式3D基础模型,用于从流数据中重建场景,支持实时3D场景理解与生成。
- Stars: ⭐️ 15.6k
- Tags:
3d-reconstructionfoundation-modelscene-understandingdeep-learning - 最后活动时间: 2026-07-23
openface
基于深度神经网络的人脸识别工具,支持人脸检测、对齐与特征提取。
- Stars: ⭐️ 15.4k
- Tags:
face-recognitiondeep-learningfacenetcomputer-vision - 最后活动时间: 2026-07-18
ddddocr
通用验证码识别OCR工具,支持多种验证码类型的自动识别。
- Stars: ⭐️ 14.5k
- Tags:
ocrcaptchapython - 最后活动时间: 2026-03-10
Unlimited-OCR
一款强大的 OCR 工具,旨在开启单次长序列解析的新时代。能够高效处理长文本和复杂版面的图像识别任务。
- Stars: ⭐️ 14.4k
- Tags:
ocrdocument-parsingmultimodal - 最后活动时间: 2026-07-03
vggt
CVPR 2025最佳论文奖获奖项目,视觉几何基础Transformer,在3D视觉理解与几何推理方面取得突破性进展。
- Stars: ⭐️ 14.1k
- Tags:
computer-visiontransformer3d-reconstructioncvpr2025 - 最后活动时间: 2026-05-19
open_clip
OpenAI CLIP模型的开源实现,支持多模态对比学习和零样本分类任务。
- Stars: ⭐️ 14.0k
- Tags:
clipmulti-modalzero-shotpytorch - 最后活动时间: 2026-07-31
ImageToolbox
功能强大的Android图像处理应用,集成AI背景移除、OCR文字识别、图像放大等智能功能。
- Stars: ⭐️ 14.0k
- Tags:
图像处理OCR背景移除 - 最后活动时间: 2026-07-31
Pillow
Python图像处理库,支持多种图像格式操作。是AI图像处理和计算机视觉任务的基础依赖库。
- Stars: ⭐️ 13.7k
- Tags:
image-processingpythonpil - 最后活动时间: 2026-08-02
TRELLIS
CVPR 2025 Spotlight论文,基于结构化3D潜变量的可扩展多功能3D生成模型。
- Stars: ⭐️ 13.3k
- Tags:
3d-generationimage-to-3dtext-to-3dcvpr - 最后活动时间: 2026-06-26
Meshroom
基于节点的视觉编程工具箱,用于3D重建和摄影测量,支持计算机视觉工作流自动化。
- Stars: ⭐️ 12.9k
- Tags:
Computer Vision3D ReconstructionPhotogrammetry - 最后活动时间: 2026-08-01
DiffSynth-Studio
一站式扩散模型创作工作室,支持图像生成、视频合成等多种AI生成任务,轻松体验扩散模型的魔力。
- Stars: ⭐️ 12.7k
- Tags:
扩散模型图像生成视频合成 - 最后活动时间: 2026-07-14
colmap
经典的运动恢复结构与多视图立体视觉系统,用于3D重建与视觉计算研究。
- Stars: ⭐️ 12.4k
- Tags:
structure-from-motionmulti-view-stereo3d-reconstructioncomputer-vision - 最后活动时间: 2026-08-01
chineseocr_lite
超轻量级中文OCR识别引擎,支持竖排文字,总模型仅4.7M,支持多种推理框架。
- Stars: ⭐️ 12.3k
- Tags:
ocrncnnpytorchchinese - 最后活动时间: 2026-05-18
chandra
强大的OCR模型,支持复杂表格、表单和手写内容的完整版面识别。
- Stars: ⭐️ 11.9k
- Tags:
ocrdocument-processinghandwriting-recognition - 最后活动时间: 2026-06-26
sam3
Meta Segment Anything Model 3 (SAM 3) 的官方仓库,提供模型推理、微调代码及预训练权重下载,支持图像分割任务。
- Stars: ⭐️ 11.1k
- Tags:
segment-anythingimage-segmentationcomputer-visionmeta-aisam - 最后活动时间: 2026-07-15
denoising-diffusion-pytorch
去噪扩散概率模型的PyTorch实现,生成模型领域核心算法库。简洁易用的扩散模型训练框架。
- Stars: ⭐️ 10.7k
- Tags:
diffusion-modelsgenerative-modelpytorch - 最后活动时间: 2026-08-01
easydiffusion
一键式AI艺术创作工具,无需技术背景即可在本地生成精美图像。提供简洁的浏览器界面,支持文本生成图像。
- Stars: ⭐️ 10.4k
- Tags:
Stable DiffusionImage GenerationGUI - 最后活动时间: 2026-07-24
krita-ai-diffusion
Krita图像编辑器的AI扩散插件,支持文生图、内补和外补功能。
- Stars: ⭐️ 10.4k
- Tags:
stable-diffusionkrita-pluginimage-generationgenerative-ai - 最后活动时间: 2026-06-30
openFrameworks
跨平台创意编程工具包,支持图形、音频、计算机视觉等多媒体应用开发。
- Stars: ⭐️ 10.4k
- Tags:
creative-codingcomputer-visionopencvcpp - 最后活动时间: 2026-06-13
manga-image-translator
基于深度学习的漫画/图片文字翻译工具,集成OCR文字检测、机器翻译和图像修复功能,支持一键翻译各类图片内文字。
- Stars: ⭐️ 10.3k
- Tags:
ocrmachine-translationimage-processinginpaintingneural-network - 最后活动时间: 2026-07-20
supersplat
基于浏览器的3D高斯泼溅编辑器,支持编辑AI生成的3D场景重建结果。
- Stars: ⭐️ 9.8k
- Tags:
gaussian-splatting3dwebgpueditor - 最后活动时间: 2026-07-31
moondream
轻量级视觉语言模型,专为边缘设备优化的多模态AI解决方案。
- Stars: ⭐️ 9.7k
- Tags:
vision-language-modeltiny-llmmultimodaledge-ai - 最后活动时间: 2026-04-20
dots.ocr
基于单一视觉语言模型的多语言文档版面解析工具。能够高效处理和解析复杂文档结构。
- Stars: ⭐️ 9.0k
- Tags:
document-layout-parsingvision-language-modelmultilingualocr - 最后活动时间: 2026-03-24
awesome-gpt-image-2
全球最大的 GPT Image 2 提示词库,包含 2000+ 精选提示词和预览图,支持 16 种语言,涵盖像素级文本渲染和商业级插画。
- Stars: ⭐️ 9.0k
- Tags:
gpt-image-2ai-image-generationprompt-engineeringopenai - 最后活动时间: 2026-08-02
TRELLIS.2
用于3D内容生成的原生紧凑结构化潜变量模型,支持高质量3D资产生成与编辑。
- Stars: ⭐️ 9.0k
- Tags:
3d-generationlatent-modelsimage-generationdeep-learning - 最后活动时间: 2026-07-10
img2threejs
将参考图像中的物体重建为纯代码、程序化且可直接用于动画的 Three.js 3D模型。提供了一种高效的图像到3D生成方案。
- Stars: ⭐️ 9.0k
- Tags:
image-to-3dthreejsgenerativeai-agentsprocedural-generation - 最后活动时间: 2026-08-01
ian-xiaohei-illustrations
一个用于生成中文小黑怪诞风格正文配图的Codex Skill。支持16:9白底手绘风格,并带有少量红橙蓝批注。
- Stars: ⭐️ 8.9k
- Tags:
ai-agentcodex-skillimage-generationillustrationchinese - 最后活动时间: 2026-06-03
awesome-3D-gaussian-splatting
3D高斯泼溅技术资源精选,涵盖神经渲染、NeRF相关的前沿论文与实现,是3D视觉与AI交叉领域的热门方向。
- Stars: ⭐️ 8.8k
- Tags:
3d-gaussian-splattingnerfneural-renderingcomputer-vision - 最后活动时间: 2026-07-25
nnUNet
医学图像分割领域的顶级深度学习框架,自动配置网络架构和预处理流程,在多个医学分割挑战中取得SOTA成绩。
- Stars: ⭐️ 8.7k
- Tags:
medical-imagingsegmentationdeep-learning - 最后活动时间: 2026-07-23
Sana
基于线性扩散Transformer的高效高分辨率图像合成模型,支持文本到图像生成。
- Stars: ⭐️ 8.6k
- Tags:
文生图扩散模型Transformer - 最后活动时间: 2026-08-02
MONAI
医疗影像AI工具包,基于PyTorch提供高性能GPU加速的医学图像计算框架。
- Stars: ⭐️ 8.6k
- Tags:
deep-learninghealthcare-imagingmedical-imagingpytorch - 最后活动时间: 2026-08-01
imaginAIry
Pythonic AI图像和视频生成工具,提供简洁的Python接口进行AI内容创作。
- Stars: ⭐️ 8.2k
- Tags:
ai-image-generationai-videopython - 最后活动时间: 2026-02-24
Qwen-Image
强大的图像生成基础模型,支持复杂的文本渲染和精确的图像编辑。能够根据文本指令生成高质量、细节丰富的图像。
- Stars: ⭐️ 8.1k
- Tags:
image-generationtext-to-imagefoundation-modelqwen - 最后活动时间: 2026-02-10
backgroundremover
基于AI的背景移除工具,支持图片和视频背景一键去除,提供简洁的命令行界面,免费开源。
- Stars: ⭐️ 8.0k
- Tags:
AIBackground RemovalImage ProcessingVideo Editing - 最后活动时间: 2026-07-10
sygil-webui
Stable Diffusion 网页界面,提供友好的AI图像生成用户体验,支持多种模型和插件扩展。
- Stars: ⭐️ 7.9k
- Tags:
stable-diffusionwebuiimage-generationai-art - 最后活动时间: 2026-07-17
face-alignment
基于PyTorch构建的2D和3D人脸对齐库,支持人脸检测与关键点定位,适用于人脸识别预处理。
- Stars: ⭐️ 7.5k
- Tags:
face-alignmentface-detectiondeep-learningpytorch - 最后活动时间: 2026-04-06
ccv
基于C语言的高性能计算机视觉库,提供现代化的CV功能实现,无外部依赖。
- Stars: ⭐️ 7.2k
- Tags:
computer-visionc-libraryimage-processing - 最后活动时间: 2026-07-31
civitai
AI 模型分享平台,汇集 Stable Diffusion 模型、文本反转等生成式 AI 资源。
- Stars: ⭐️ 7.2k
- Tags:
stable-diffusionmodelsimage-generationai - 最后活动时间: 2026-08-02
sdnext
全能型AI图像视频生成WebUI,支持Stable Diffusion、Flux等多种模型。集成图像生成、视频创作、字幕生成等功能。
- Stars: ⭐️ 7.2k
- Tags:
Stable DiffusionFluxWebUIVideo Generation - 最后活动时间: 2026-08-02
Open-Higgsfield-AI
开源免费的AI图像生成与电影工作室,支持Flux、SDXL等20+模型。可自托管部署,提供完整的图像与视频创作功能。
- Stars: ⭐️ 7.2k
- Tags:
AI图像生成视频创作开源替代 - 最后活动时间: 2026-04-24
sam-3d-objects
基于 Segment Anything Model (SAM) 的3D物体分割项目,将2D分割能力扩展到3D空间。
- Stars: ⭐️ 7.1k
- Tags:
segment-anything3d-segmentationcomputer-visionsam - 最后活动时间: 2026-06-02
TripoSR
从单张图像快速生成3D物体模型的高效重建模型,支持快速高质量3D内容创建。
- Stars: ⭐️ 6.8k
- Tags:
3d-reconstructionsingle-imagetext-to-3d - 最后活动时间: 2026-06-04
scikit-image
Python生态核心图像处理库,提供丰富的图像处理算法和科学计算工具。
- Stars: ⭐️ 6.6k
- Tags:
computer-visionimage-processingpythonscipy - 最后活动时间: 2026-08-01
VLM-R1
基于强化学习的视觉语言模型项目,将R1方法应用于多模态场景,实现视觉理解能力的突破性提升。
- Stars: ⭐️ 6.0k
- Tags:
VLMReinforcement LearningMultimodalDeepSeek-R1 - 最后活动时间: 2026-07-07
Chinese-CLIP
中文版CLIP模型,实现跨模态图文检索与表示生成。
- Stars: ⭐️ 6.0k
- Tags:
clipchinesemulti-modalcomputer-visionimage-text-retrieval - 最后活动时间: 2026-03-31
AR.js
轻量级Web增强现实框架,支持图像追踪、位置定位和标记追踪,完全在浏览器端运行。
- Stars: ⭐️ 6.0k
- Tags:
augmented-realitywebarthreejscomputer-vision - 最后活动时间: 2026-06-21
chaiNNer
基于节点的图像处理 GUI 工具,支持 AI 图像放大和处理任务的灵活编排。
- Stars: ⭐️ 5.9k
- Tags:
image-processingai-upscalingguinode-based - 最后活动时间: 2026-07-31
BLIP
Salesforce BLIP模型,统一视觉-语言理解与生成的预训练框架。
- Stars: ⭐️ 5.7k
- Tags:
vision-languageimage-captioningmultimodal - 最后活动时间: 2026-03-03
mmf
Meta AI开发的模块化多模态视觉-语言研究框架,支持VQA、图像描述、对话等多种任务,提供预训练模型。
- Stars: ⭐️ 5.6k
- Tags:
MultimodalVision-LanguageVQAPyTorch - 最后活动时间: 2026-07-07
neural-style
TensorFlow实现的经典神经风格迁移算法,将艺术风格应用到普通图像上。
- Stars: ⭐️ 5.5k
- Tags:
neural-stylestyle-transfertensorflowimage-generation - 最后活动时间: 2026-04-18
gsplat
CUDA加速的3D Gaussian Splatting光栅化库,支持高效神经渲染和3D重建。
- Stars: ⭐️ 5.5k
- Tags:
gaussian-splattingcuda3d-reconstructionneural-rendering - 最后活动时间: 2026-07-24
sapiens
高分辨率人体任务模型,支持人体姿态估计、分割等视觉任务。
- Stars: ⭐️ 5.4k
- Tags:
computer-visionhuman-centricpose-estimationdeep-learning - 最后活动时间: 2026-05-26
opencv-python
OpenCV 的 Python 预编译包,提供强大的计算机视觉和图像处理能力,是 AI 视觉应用开发的基础库。
- Stars: ⭐️ 5.3k
- Tags:
opencvcomputer-visionimage-processingpython - 最后活动时间: 2026-07-28
gemini-watermark-remover
高性能纯浏览器端Gemini AI水印去除工具,使用数学精确的反向Alpha混合算法实现无损去水印。
- Stars: ⭐️ 5.1k
- Tags:
watermark-removalgemini-aiimage-processingjavascript - 最后活动时间: 2026-07-30
watermark-removal
基于深度学习的图像水印去除工具,使用图像修复技术自动移除水印。
- Stars: ⭐️ 5.1k
- Tags:
image-inpaintingdeep-learningcomputer-vision - 最后活动时间: 2026-06-05
lottie
利用Claude Code或Codex生成可用于生产环境的Lottie动画。简化了动画创作流程,让开发者能通过AI快速生成高质量动画资源。
- Stars: ⭐️ 5.0k
- Tags:
lottieanimationclaude-codecodexai-generation - 最后活动时间: 2026-07-25
trace.moe
基于向量数据库的动漫场景反向图片搜索引擎,通过截图快速追溯动漫来源。
- Stars: ⭐️ 5.0k
- Tags:
animeimage-searchvector-databasereverse-search - 最后活动时间: 2026-07-14
unet
U-Net图像分割网络的Keras实现。经典的编码器-解码器架构,广泛应用于医学图像分割和语义分割任务。
- Stars: ⭐️ 4.9k
- Tags:
unetimage-segmentationkerasdeep-learning - 最后活动时间: 2026-03-27
pollinations
开源生成式AI平台,提供友好的AI创作体验,支持多种生成模型。
- Stars: ⭐️ 4.9k
- Tags:
Gen-AIOpen SourcePlatform - 最后活动时间: 2026-08-02
brush
基于高斯溅射技术的通用3D重建工具,支持快速高质量场景重建。
- Stars: ⭐️ 4.9k
- Tags:
gaussian-splatting3d-reconstructionnerf - 最后活动时间: 2026-07-01
modly
桌面应用程序,利用本地AI从图像生成3D模型,完全在GPU上运行,支持离线使用。
- Stars: ⭐️ 4.8k
- Tags:
3d-generationimage-to-3dlocal-aidesktop-appgpu - 最后活动时间: 2026-07-25
LLaVA-NeXT
LLaVA-NeXT 是新一代开源大型多模态模型,支持高分辨率图像理解和复杂的视觉推理任务。它在多模态对话和图像分析方面表现卓越。
- Stars: ⭐️ 4.7k
- Tags:
LLaVAMultimodalLarge-Language-ModelComputer-Vision - 最后活动时间: 2026-06-15
Depixelization_poc
从像素化截图中恢复原始文本的AI技术演示,展示了一种逆向图像处理方法。
- Stars: ⭐️ 4.5k
- Tags:
image-processingdepixelizationsecurityimage-recoverydeep-learning - 最后活动时间: 2026-04-14
SwarmUI
模块化的Stable Diffusion Web界面,支持ComfyUI后端,提供高性能图像生成和强大的扩展能力。
- Stars: ⭐️ 4.4k
- Tags:
stable-diffusionimage-generationaicomfyui - 最后活动时间: 2026-08-01
remove-ai-watermarks
用于移除AI生成图像水印的CLI工具,支持可见和不可见水印类型。
- Stars: ⭐️ 4.4k
- Tags:
aicomputer-visionimage-processingwatermark-removalsynthid - 最后活动时间: 2026-08-02
diffusion-models-class
Hugging Face扩散模型课程,深入讲解图像生成模型原理与实践。
- Stars: ⭐️ 4.3k
- Tags:
diffusion-modelsimage-generationhuggingfacegenerative-ai - 最后活动时间: 2026-04-17
OmniGen2
探索高级多模态生成的统一模型,支持多种生成任务的统一架构。
- Stars: ⭐️ 4.1k
- Tags:
multimodal-generationimage-generationunified-model - 最后活动时间: 2026-03-20
GPT-Image2-Skill
GPT Image 2 提示词库与智能体技能工具,提供图像生成/编辑的CLI工具和丰富的提示词模板。
- Stars: ⭐️ 4.1k
- Tags:
gpt-imageimage-generationopenaiagent-skillsprompt-library - 最后活动时间: 2026-07-20
photon
高性能的Rust/WebAssembly图像处理库,支持多种图像操作和滤镜效果,适用于Web端和AI图像处理管道。
- Stars: ⭐️ 3.9k
- Tags:
image-processingwebassemblyrustcomputer-vision - 最后活动时间: 2026-07-02
triangula
使用进化算法和遗传算法将图像转换为高质量三角剖分艺术作品,支持多边形艺术生成。
- Stars: ⭐️ 3.9k
- Tags:
generative-artgenetic-algorithmevolutionary-algorithmsimage-processing - 最后活动时间: 2026-03-21
map-anything
通用前馈度量3D重建模型,支持深度估计、多视角立体视觉和机器人应用场景。
- Stars: ⭐️ 3.6k
- Tags:
3d-reconstructiondepth-estimationimage-to-3drobotics - 最后活动时间: 2026-07-17
agent-sprite-forge
一个用于生成2D精灵图、透明PNG帧和动画GIF的智能体技能工具,支持从文本提示创建游戏像素艺术资源。
- Stars: ⭐️ 3.6k
- Tags:
agent-skillspixel-artsprite-generatorimage-generationgame-assets - 最后活动时间: 2026-07-12
roop
Stable Diffusion WebUI的人脸替换扩展插件,支持一键换脸功能。
- Stars: ⭐️ 3.6k
- Tags:
stable-diffusionface-swapimage-generation - 最后活动时间: 2026-03-13
sd-webui-roop
Stable Diffusion WebUI 的 Roop 换脸扩展插件。
- Stars: ⭐️ 3.5k
- Tags:
stable-diffusionface-swapwebui-plugin - 最后活动时间: 2026-03-13
LichtFeld-Studio
3D高斯泼溅场景的完整解决方案,支持训练、编辑、自动化处理与导出。
- Stars: ⭐️ 3.5k
- Tags:
gaussian-splatting3d-reconstructioncomputer-visioncuda - 最后活动时间: 2026-08-02
waifu2x-ncnn-vulkan
基于ncnn的waifu2x图像超分辨率工具,利用Vulkan实现跨平台GPU加速,适用于动漫图像放大降噪。
- Stars: ⭐️ 3.4k
- Tags:
Image UpscalingVulkanAnime - 最后活动时间: 2026-04-13
spark
基于THREE.js的高级3D高斯泼溅渲染器,支持神经辐射场风格的实时3D重建与渲染。
- Stars: ⭐️ 3.4k
- Tags:
3d-gaussian-splattingnerfthreejswebgl - 最后活动时间: 2026-07-15
sam-3d-body
SAM 3D人体模型推理代码,提供预训练模型和数据集,支持3D人体建模。
- Stars: ⭐️ 3.4k
- Tags:
3d-body-modelsegment-anythingcomputer-vision - 最后活动时间: 2026-02-19
nunif
waifu2x最新版本及2D视频转立体3D视频转换工具集。
- Stars: ⭐️ 3.4k
- Tags:
waifu2xsuper-resolutionstereo-3dvideo-processing - 最后活动时间: 2026-08-01
IQA-PyTorch
基于PyTorch的图像质量评估工具箱,支持PSNR、SSIM、LPIPS、FID等多种评估指标,涵盖全参考和无参考图像质量评估方法。
- Stars: ⭐️ 3.3k
- Tags:
image-quality-assessmentpytorchdeep-learningcomputer-vision - 最后活动时间: 2026-07-08
Eagle
前沿视觉语言模型项目,采用以数据为中心的策略训练,支持多种主流大模型架构。
- Stars: ⭐️ 3.3k
- Tags:
Vision-LanguageLMMLLaVA - 最后活动时间: 2026-06-24
gpt_image_playground
基于 OpenAI gpt-image-2 API 的图片生成与编辑工具,支持多种图像处理功能,提供直观的 Web 界面。
- Stars: ⭐️ 3.3k
- Tags:
gpt-imageimage-generationopenaireacttypescript - 最后活动时间: 2026-08-01
see-through
SIGGRAPH 2026 论文项目,专注于动漫角色的单图像层分解技术。能够将单一图像拆解为多个语义层,便于后续的AI图像编辑与生成。
- Stars: ⭐️ 3.2k
- Tags:
image-decompositionanimecomputer-visionsiggraph - 最后活动时间: 2026-07-04
HunyuanImage-3.0
腾讯混元图像生成模型3.0版本,强大的原生多模态图像生成模型,支持高质量图像创作。
- Stars: ⭐️ 3.2k
- Tags:
image-generationmultimodal-modeltext-to-imagediffusion-model - 最后活动时间: 2026-06-23
Saber-Translator
AI驱动的漫画翻译工具,智能检测气泡、识别日文文本并翻译成流畅中文。
- Stars: ⭐️ 3.2k
- Tags:
manga-translationocrai-translationimage-processing - 最后活动时间: 2026-05-22
Skywork-R1V
Skywork AI开发的高级多模态模型系列,专注于视觉语言推理任务。
- Stars: ⭐️ 3.2k
- Tags:
MultimodalVLMVision-Language - 最后活动时间: 2026-07-29
Pointcept
点云感知研究代码库,包含PTv3、Sonata等最新3D视觉研究成果。
- Stars: ⭐️ 3.1k
- Tags:
point-cloud3d-visionpytorch - 最后活动时间: 2026-08-01
awesome-virtual-try-on
虚拟试穿领域精选资源列表,汇集论文、代码、数据集,涵盖2D/3D试穿与多姿态引导技术。
- Stars: ⭐️ 3.1k
- Tags:
虚拟试穿图像生成计算机视觉 - 最后活动时间: 2026-07-27
QualityScaler
基于AI的图像和视频超分辨率放大应用,支持降噪和压缩伪影消除,可运行于NVIDIA/AMD/Intel GPU。
- Stars: ⭐️ 3.1k
- Tags:
Super ResolutionImage EnhancementVideo Upscaling - 最后活动时间: 2026-04-05
local-dream
在Android设备上运行Stable Diffusion,支持骁龙NPU加速及CPU/GPU推理。
- Stars: ⭐️ 3.1k
- Tags:
stable-diffusionandroidnpuimage-generation - 最后活动时间: 2026-07-12
tribev2
TRIBE v2多模态模型,用于脑响应预测的研究项目,结合神经科学与深度学习技术。
- Stars: ⭐️ 3.1k
- Tags:
multimodalbrain-responseneurosciencedeep-learning - 最后活动时间: 2026-06-23
swift-coreml-diffusers
基于Core ML的Stable Diffusion Swift实现,支持在Apple设备上本地运行图像生成。
- Stars: ⭐️ 3.0k
- Tags:
stable-diffusioncoremlswiftimage-generationapple - 最后活动时间: 2026-07-30
DeepDanbooru
基于TensorFlow的AI多标签图像分类系统,专注于动漫角色图像的自动标签识别。
- Stars: ⭐️ 2.9k
- Tags:
Image ClassificationTensorFlowAnime - 最后活动时间: 2026-07-04
SimpleTuner
面向图像、视频和音频扩散模型的通用微调工具包,支持Stable Diffusion、Flux等主流模型的高效训练。
- Stars: ⭐️ 2.9k
- Tags:
DiffusionFine-tuningStable Diffusion - 最后活动时间: 2026-07-28
ComfyUI-nunchaku
Nunchaku的ComfyUI插件,提供高效的扩散模型量化推理能力。
- Stars: ⭐️ 2.9k
- Tags:
ComfyUI扩散模型量化 - 最后活动时间: 2026-02-19
a1111-sd-webui-tagcomplete
Stable Diffusion WebUI标签自动补全扩展,提供Booru风格的智能提示词补全功能。
- Stars: ⭐️ 2.8k
- Tags:
stable-diffusionautocompletionprompt-engineeringwebui-extension - 最后活动时间: 2026-07-01
Stable-Diffusion
全面的Stable Diffusion学习资源库,涵盖FLUX、SDXL、SD3等模型的训练教程、WebUI工具指南及多模态AI应用实践。
- Stars: ⭐️ 2.8k
- Tags:
Stable DiffusionLoRAComfyUIImage Generation - 最后活动时间: 2026-07-31
voxelmorph
基于无监督学习的医学图像配准框架,支持变形场估计与图像对齐。
- Stars: ⭐️ 2.7k
- Tags:
image-registrationmedical-imagingunsupervised-learningdeep-learning - 最后活动时间: 2026-07-27
manga-ocr
面向日本漫画的日文光学字符识别工具,基于Transformer架构。
- Stars: ⭐️ 2.7k
- Tags:
ocrjapanesetransformersmanga - 最后活动时间: 2026-07-19
xDiT
可扩展的Diffusion Transformers推理引擎,支持大规模并行计算,显著提升DiT模型推理性能。
- Stars: ⭐️ 2.7k
- Tags:
DiffusionInferenceParallelism - 最后活动时间: 2026-07-14
stitching
Python图像拼接包,提供快速鲁棒的全景图像拼接功能。
- Stars: ⭐️ 2.6k
- Tags:
image-stitchingpanoramacomputer-visionpython - 最后活动时间: 2026-07-20
k-diffusion
Karras等人扩散模型PyTorch实现,高质量图像生成库。
- Stars: ⭐️ 2.6k
- Tags:
diffusion-modelsimage-generationpytorch - 最后活动时间: 2026-02-12
3DCellForge
AI驱动的交互式3D模型生成、检查和展示工作室,支持智能建模与可视化。
- Stars: ⭐️ 2.6k
- Tags:
3d-generationai-3dinteractivevisualization - 最后活动时间: 2026-05-22
OmniSVG
首个端到端多模态SVG生成器,基于预训练视觉语言模型,可生成从图标到动漫角色的复杂SVG。
- Stars: ⭐️ 2.6k
- Tags:
SVG GenerationVLMNeurIPS 2025 - 最后活动时间: 2026-03-01
conditional-flow-matching
条件流匹配库TorchCFM,用于生成模型训练。
- Stars: ⭐️ 2.6k
- Tags:
flow-matchinggenerative-modelsoptimal-transport - 最后活动时间: 2026-07-20
Infinite-Canvas
支持ComfyUI和ModelScope调用的无限画布工具,适用于AI图像生成工作流。
- Stars: ⭐️ 2.5k
- Tags:
comfyuiimage-generationcanvasmodelscope - 最后活动时间: 2026-08-01
ideogram4
Ideogram 4 是一款专注于设计领域的开源图像生成模型,处于行业前沿。它能够帮助用户高效地生成高质量的设计图像。
- Stars: ⭐️ 2.5k
- Tags:
image-generationopen-sourcedesigntext-to-image - 最后活动时间: 2026-06-30
Stable-Diffusion-Webui-Civitai-Helper
Civitai助手扩展,简化模型下载和管理流程,自动获取模型信息和预览图。
- Stars: ⭐️ 2.5k
- Tags:
stable-diffusioncivitaimodel-managementwebui-extension - 最后活动时间: 2026-06-09
flux2
FLUX.2图像生成模型的官方推理仓库。
- Stars: ⭐️ 2.5k
- Tags:
fluximage-generationdiffusion-modelinference - 最后活动时间: 2026-03-12
PartCrafter
NeurIPS 2025论文,通过组合潜变量扩散Transformer生成结构化3D网格。
- Stars: ⭐️ 2.5k
- Tags:
3d-generationmesh-generationimage-to-3dneurips - 最后活动时间: 2026-04-16
3dgrut
高斯粒子的光线追踪与混合光栅化渲染技术,用于3D场景重建。
- Stars: ⭐️ 2.4k
- Tags:
gaussian-splattingray-tracing3d-reconstructioncomputer-vision - 最后活动时间: 2026-07-08
gpupixel
基于GPU的实时图像滤镜引擎,支持人脸检测、美颜、瘦脸等AI图像处理功能。
- Stars: ⭐️ 2.3k
- Tags:
image-processinggpuface-detectionfilter - 最后活动时间: 2026-02-13
gowall
多功能图像处理工具,支持VLM视觉语言模型OCR识别、对抗网络图像超分辨率放大、色彩提取与主题转换等功能。
- Stars: ⭐️ 2.3k
- Tags:
image-processingocrupscalecolor-palettecli - 最后活动时间: 2026-06-10
cellpose
通用细胞分割算法,支持人机交互标注,广泛应用于生物医学图像分析领域。
- Stars: ⭐️ 2.3k
- Tags:
cell-segmentationbioimagedeep-learning - 最后活动时间: 2026-06-14
bgslibrary
C++背景减除库,提供多种背景建模算法,支持Python、MATLAB和Java绑定。
- Stars: ⭐️ 2.3k
- Tags:
background-subtractioncomputer-visionopencv - 最后活动时间: 2026-05-28
mflux
基于Apple MLX框架的原生生成图像模型实现,针对Apple Silicon优化。
- Stars: ⭐️ 2.3k
- Tags:
mlxfluxapple-siliconimage-generation - 最后活动时间: 2026-07-29
minimind-o
从零训练的0.1B全模态Omni模型,支持听、说、看多模态能力,适合学习多模态模型架构与训练。
- Stars: ⭐️ 2.3k
- Tags:
multimodalomni-modeltrainingaudiovision - 最后活动时间: 2026-06-28
JoyAI-Image
统一的多模态基础模型,支持图像理解、文本生成图像和指令引导的图像编辑功能。
- Stars: ⭐️ 2.2k
- Tags:
multimodalimage-generationimage-editingtext-to-image - 最后活动时间: 2026-07-17
Step1X-Edit
SOTA级开源图像编辑模型,性能媲美GPT-4o和Gemini 2 Flash等闭源模型。
- Stars: ⭐️ 2.2k
- Tags:
image-editingmultimodalvisual-reasoningopen-source - 最后活动时间: 2026-04-29
MambaVision
CVPR 2025论文,混合Mamba-Transformer视觉骨干网络,支持图像分类、检测和分割。
- Stars: ⭐️ 2.2k
- Tags:
mambavision-transformerimage-classificationobject-detection - 最后活动时间: 2026-03-11
Awesome-Image-Inpainting
图像修复与视频修复领域的精选论文和资源合集,涵盖人脸补全、图像修复等前沿研究方向。
- Stars: ⭐️ 2.2k
- Tags:
image-inpaintingvideo-inpaintingcomputer-visiondeep-learning - 最后活动时间: 2026-02-09
ComfyUI-Prompt-Assistant
ComfyUI提示词助手插件,支持多LLM服务的提示词翻译、扩写和图片反推功能。
- Stars: ⭐️ 2.2k
- Tags:
ComfyUIPromptImage Generation - 最后活动时间: 2026-04-25
OpenSplat
生产级3D高斯泼溅重建工具,支持CPU/GPU跨平台运行,适用于神经辐射场和3D场景重建。
- Stars: ⭐️ 2.1k
- Tags:
3dgaussian-splattingradiance-fieldneural-rendering - 最后活动时间: 2026-05-31
leptonica
开源图像处理与分析库,广泛应用于OCR和计算机视觉领域,提供图像增强、形态学运算、边缘检测等核心功能。
- Stars: ⭐️ 2.1k
- Tags:
image-processingcomputer-visionocrc - 最后活动时间: 2026-07-12
Pixal3D
SIGGRAPH 2026 论文项目,实现从图像生成像素对齐的3D模型,属于前沿的图像到3D生成技术。
- Stars: ⭐️ 2.1k
- Tags:
3d-generationimage-to-3dgenerative-aicomputer-vision - 最后活动时间: 2026-06-23
WorldGen
基于生成式AI的3D场景生成工具,支持文本和图像快速生成任意3D场景,实现秒级高质量三维内容创作。
- Stars: ⭐️ 2.0k
- Tags:
3D GenerationText-to-3DScene Generation - 最后活动时间: 2026-04-12
DreamOmni2
多模态指令驱动的图像编辑与生成统一模型,支持基于自然语言指令的图像处理任务。
- Stars: ⭐️ 2.0k
- Tags:
图像编辑图像生成多模态 - 最后活动时间: 2026-04-11
custom-diffusion
CVPR 2023论文实现,专注于文本到图像扩散模型的多概念定制化微调,支持少样本学习。
- Stars: ⭐️ 2.0k
- Tags:
diffusion-modelstext-to-imagefine-tuningcomputer-vision - 最后活动时间: 2026-05-24
mar
MAR+DiffLoss 的 PyTorch 实现,用于自回归图像生成的创新方法。
- Stars: ⭐️ 1.9k
- Tags:
autoregressive-modelimage-generationdiffusionpytorch - 最后活动时间: 2026-02-20
ComfyUI_frontend
ComfyUI官方前端实现,为节点式AI图像生成工作流提供现代化可视化界面,支持拖拽式构建复杂的Stable Diffusion处理流程。
- Stars: ⭐️ 1.9k
- Tags:
Stable DiffusionImage GenerationNode Editor - 最后活动时间: 2026-08-02
pymatting
Python图像Alpha抠图库,用于前景提取和图像处理任务。
- Stars: ⭐️ 1.9k
- Tags:
alpha-mattingimage-processingcomputer-vision - 最后活动时间: 2026-04-07
GlobalMLBuildingFootprints
从卫星图像提取的全球建筑物轮廓数据集,支持地理空间AI应用开发。
- Stars: ⭐️ 1.9k
- Tags:
satellite-imagerybuilding-detectiondatasetgeospatial - 最后活动时间: 2026-03-11
deepseek_ocr_app
基于DeepSeek模型构建的OCR文字识别应用,支持图像到文本的快速转换。
- Stars: ⭐️ 1.9k
- Tags:
ocrdeepseekimage-to-text - 最后活动时间: 2026-03-31
OnnxOCR
基于PaddleOCR重构的轻量级OCR系统,脱离PaddlePaddle框架,推理速度极快。
- Stars: ⭐️ 1.8k
- Tags:
ocronnxdeep-learningcomputer-vision - 最后活动时间: 2026-06-11
HunyuanOCR
腾讯混元 OCR 文字识别模型,提供高精度的光学字符识别能力。
- Stars: ⭐️ 1.8k
- Tags:
ocrtencenthunyuanchinese-ocr - 最后活动时间: 2026-07-13
pixel2motion
AI Logo动画生成技能,可将光栅Logo转换为平滑的SVG动画并生成HTML演示与视频预览。
- Stars: ⭐️ 1.8k
- Tags:
ai-design-toolslogo-animationsvg-animationclaude-skill - 最后活动时间: 2026-07-10
gpt_image_2_skill
GPT Image 2 提示词库与 CLI 工具,支持图像生成、编辑及智能体技能集成。
- Stars: ⭐️ 1.8k
- Tags:
gpt-image-2image-generationprompt-libraryopenaiagent-skills - 最后活动时间: 2026-05-08
pupil
开源眼动追踪项目,利用计算机视觉技术实现眼球检测与追踪,可应用于人机交互、心理学研究等领域。
- Stars: ⭐️ 1.7k
- Tags:
eye-trackingcomputer-visionopen-source - 最后活动时间: 2026-07-13
ComfyUI-Florence2
ComfyUI的Microsoft Florence2视觉语言模型推理节点。
- Stars: ⭐️ 1.7k
- Tags:
comfyuiflorence2vlmvision-language-model - 最后活动时间: 2026-05-06
lightweight-gan
ICLR 2021轻量级GAN实现,支持快速训练高分辨率图像生成模型。
- Stars: ⭐️ 1.7k
- Tags:
ganimage-generationdeep-learningpytorch - 最后活动时间: 2026-07-07
AI-Lossless-Zoomer
基于AI的图像无损放大工具,支持ESRGAN、waifu2x等多种超分辨率算法。
- Stars: ⭐️ 1.7k
- Tags:
super-resolutionesrganwaifu2ximage-upscaling - 最后活动时间: 2026-06-29
BrickGPT
基于文本提示生成物理稳定的积木模型,支持NeurIPS 2025论文实现。
- Stars: ⭐️ 1.7k
- Tags:
3d-generationtext-to-3dlego - 最后活动时间: 2026-05-21
ComfyUI-Easy-Install
跨平台便携式ComfyUI安装器,支持Nvidia GPU,简化Stable Diffusion工作流部署。
- Stars: ⭐️ 1.7k
- Tags:
comfyuistable-diffusionimage-generationinstaller - 最后活动时间: 2026-08-01
MMaDA
开源多模态大扩散语言模型,融合块扩散、混合思维链和统一强化学习技术。
- Stars: ⭐️ 1.7k
- Tags:
diffusion-modelsmultimodal-llmreasoning - 最后活动时间: 2026-02-14
Sa2VA
像素级大语言模型代码库,融合视觉与语言的多模态研究项目。
- Stars: ⭐️ 1.6k
- Tags:
MLLMcomputer-visionpixel-llm - 最后活动时间: 2026-07-29
logo-generator-skill
一个用于生成Logo的AI智能体技能模块。可帮助用户通过AI快速生成和设计个性化标志。
- Stars: ⭐️ 1.6k
- Tags:
logo-generatorimage-generationagent-skill - 最后活动时间: 2026-04-15
MeiGen-AI-Design-MCP
基于MCP协议的AI图像生成工具,集成ComfyUI与1400+提示词库,支持多方向并行生成。
- Stars: ⭐️ 1.6k
- Tags:
ai-image-generationmcpcomfyuiclaude-codeprompt-engineering - 最后活动时间: 2026-06-23
Magic123
ICLR24论文官方实现,单图生成高质量3D物体,结合2D和3D扩散先验实现精细转换。
- Stars: ⭐️ 1.6k
- Tags:
3D生成扩散模型图像转3D - 最后活动时间: 2026-07-06
ComfyUI-Docker
ComfyUI的Docker容器化部署方案,支持Stable Diffusion图像生成工作流,开箱即用。
- Stars: ⭐️ 1.6k
- Tags:
comfyuistable-diffusiondocker - 最后活动时间: 2026-07-31
ml-mobileclip
MobileCLIP官方实现,CVPR 2024发表的轻量级视觉-语言模型。
- Stars: ⭐️ 1.6k
- Tags:
mobileclipvision-languageclipefficient-ml - 最后活动时间: 2026-04-15
Infinity
CVPR 2025 Oral论文,用于高分辨率图像合成的自回归模型。
- Stars: ⭐️ 1.6k
- Tags:
text-to-imageautoregressiveimage-generationtransformers - 最后活动时间: 2026-04-16
3d-ken-burns
基于PyTorch的单图3D Ken Burns效果实现,从静态图像生成动态运镜视频。
- Stars: ⭐️ 1.6k
- Tags:
deep-learningcomputer-vision3DPyTorch - 最后活动时间: 2026-06-01
yomitoku
专为日语设计的 AI 文档图像分析 Python 包,集成深度学习 OCR 和版面分析功能,支持 PyTorch 框架。
- Stars: ⭐️ 1.6k
- Tags:
OCR文档分析日语PyTorch - 最后活动时间: 2026-07-31
SAM-Adapter-PyTorch
通过适配器和提示将Segment Anything模型迁移到下游分割任务的PyTorch实现。
- Stars: ⭐️ 1.5k
- Tags:
Segment AnythingAdapterFine-tuning - 最后活动时间: 2026-05-17
splatviz
基于3D Gaussian Splatting技术的实时交互式3D查看器,支持实时编辑和分析高斯溅射场景。
- Stars: ⭐️ 1.5k
- Tags:
3d-gaussian-splatting3dgsviewerpythonreal-time - 最后活动时间: 2026-05-20
ComfyUI_UltimateSDUpscale
ComfyUI的高质量图像放大节点扩展,支持多种放大算法,显著提升Stable Diffusion生成图像的分辨率和细节。
- Stars: ⭐️ 1.5k
- Tags:
ComfyUI图像放大Stable Diffusion - 最后活动时间: 2026-06-22
LucidDreamer
基于3D Gaussian Splatting技术的场景生成方法,无需特定域约束即可生成高质量3D场景。
- Stars: ⭐️ 1.5k
- Tags:
3d-gaussian-splattingscene-generationgenerative-ai - 最后活动时间: 2026-07-23
realesrgan-gui
跨平台AI图像超分辨率放大工具GUI,支持Real-ESRGAN和Real-CUGAN模型,提供美观易用的图形界面。
- Stars: ⭐️ 1.5k
- Tags:
real-esrgansuper-resolutionimage-upscalinggui - 最后活动时间: 2026-05-02
pyntcloud
3D点云处理Python库,支持点云可视化与深度学习应用。
- Stars: ⭐️ 1.5k
- Tags:
3d-point-cloudsdeep-learningpython3d-graphics - 最后活动时间: 2026-07-10
Ovis
一种新型多模态大语言模型架构,旨在从结构上对齐视觉和文本嵌入。支持Llama3和Qwen等模型,提升视觉语言学习与交互能力。
- Stars: ⭐️ 1.5k
- Tags:
multimodalllmvision-language-modelllama3qwen - 最后活动时间: 2026-07-15
DLSS
NVIDIA 深度学习超级采样技术,利用神经网络提升游戏帧率并生成高质量图像。
- Stars: ⭐️ 1.4k
- Tags:
dlssnvidiaimage-upscalinggaming - 最后活动时间: 2026-06-23
ComfyUI-Lora-Manager
ComfyUI 的 LoRA 模型管理扩展,支持模型组织、预览和元数据管理,提升工作流效率。
- Stars: ⭐️ 1.3k
- Tags:
ComfyUILoRA ManagerImage Generation - 最后活动时间: 2026-08-01
FireRed-Image-Edit
开源SOTA图像编辑基础模型,支持精确指令跟随、高保真生成和优异身份一致性。
- Stars: ⭐️ 1.3k
- Tags:
Image EditingDiffusionAIGC - 最后活动时间: 2026-04-03
TinyGPT-V
高效轻量级多模态大语言模型,采用小型骨干网络实现视觉语言理解与生成。
- Stars: ⭐️ 1.3k
- Tags:
multimodal-llmvision-languageefficient-model - 最后活动时间: 2026-02-05
LanPaint
高质量免训练图像修复工具,支持所有Stable Diffusion模型和ComfyUI。
- Stars: ⭐️ 1.3k
- Tags:
inpaintingstable-diffusioncomfyui - 最后活动时间: 2026-06-28
Lance
一个30亿活跃参数的原生统一多模态模型,支持图像和视频的理解、生成与编辑。
- Stars: ⭐️ 1.3k
- Tags:
multimodalimage-generationvideo-generationimage-understanding - 最后活动时间: 2026-07-14
image-matching-webui
基于Gradio的图像匹配Web界面,集成多种深度学习模型如SuperGlue、LightGlue、LoFTR等,支持特征匹配和位姿估计。
- Stars: ⭐️ 1.3k
- Tags:
image-matchingdeep-learningfeature-matchinggradio - 最后活动时间: 2026-07-14
ComfyUI-qwenmultiangle
ComfyUI 自定义节点,提供交互式 Three.js 视口控制相机角度,用于多角度 AI 图像生成。
- Stars: ⭐️ 1.3k
- Tags:
comfyuiimage-generation3d-camerastable-diffusion - 最后活动时间: 2026-07-06
ian-handdrawn-ppt
AI智能体技能,用于生成中文手绘风格的技术PPT图像,支持封面和正文配图。
- Stars: ⭐️ 1.3k
- Tags:
ai-agentimage-generationppthanddrawncodex-skill - 最后活动时间: 2026-04-25
ComfyUI-ReActor
ComfyUI的快速人脸替换扩展节点,支持SFW内容,简单易用的AI换脸工具。
- Stars: ⭐️ 1.3k
- Tags:
comfyuiface-swappingimage-generationai - 最后活动时间: 2026-05-12
mvsplat
ECCV'24 Oral论文,从稀疏多视角图像高效实现3D高斯泼溅重建。
- Stars: ⭐️ 1.3k
- Tags:
gaussian-splatting3d-reconstructionnovel-view-synthesisdeep-learning - 最后活动时间: 2026-05-06
LucidFlux
ICLR 2026论文,基于大规模扩散Transformer实现无需标注的高质量图像修复。
- Stars: ⭐️ 1.3k
- Tags:
diffusionimage-restorationtransformericlr - 最后活动时间: 2026-05-26
sceneview
跨平台3D与AR SDK,支持Android、iOS、Web、Desktop等多端部署,集成Filament和RealityKit渲染引擎。
- Stars: ⭐️ 1.3k
- Tags:
3dararcorearkitkotlinswiftwebxr - 最后活动时间: 2026-08-02
sprite-sheet-creator
基于fal.ai的2D角色和地图精灵图生成工具,支持创建可玩的像素风格游戏素材。
- Stars: ⭐️ 1.3k
- Tags:
sprite-sheetgame-assetsai-generationfal-ai - 最后活动时间: 2026-04-22
splat-transform
3D高斯泼溅格式转换与变换的CLI工具,支持多种格式互转和3D场景处理。
- Stars: ⭐️ 1.3k
- Tags:
3d-gaussian-splattinggaussian-splatting3dcli - 最后活动时间: 2026-07-31
CityGaussian
ECCV 2024 & ICLR 2025 系列,基于高斯泼溅的大规模场景高质量重建方法。
- Stars: ⭐️ 1.2k
- Tags:
gaussian-splattinglarge-scaleneural-renderingscene-reconstruction - 最后活动时间: 2026-02-07
joycaption
开源免费的图像描述视觉语言模型,专为训练扩散模型而设计。
- Stars: ⭐️ 1.2k
- Tags:
vlmimage-captioningmultimodaldiffusion - 最后活动时间: 2026-02-24
comfyui-inpaint-nodes
ComfyUI专业图像修复节点集合,支持Fooocus SDXL、LaMa、MAT等多种算法,提供强大的图像修复功能。
- Stars: ⭐️ 1.2k
- Tags:
ComfyUI图像修复Inpainting - 最后活动时间: 2026-05-31
flyimg
基于Docker的即时图像处理服务,支持AVIF、WebP等现代格式,内置人脸检测功能,可自动优化图像裁剪。
- Stars: ⭐️ 1.2k
- Tags:
image-processingface-detectiondockerimagemagick - 最后活动时间: 2026-07-27
cube
Roblox开源的3D智能基础模型,支持文本到3D生成和形状生成,为3D内容创作提供AI能力。
- Stars: ⭐️ 1.2k
- Tags:
3d-generationtext-to-3dfoundation-modelshape-generation - 最后活动时间: 2026-05-28
withoutbg-python
基于ONNX模型的开源背景移除Python SDK,支持本地与云端图像抠图处理。
- Stars: ⭐️ 1.2k
- Tags:
background-removalcomputer-visiononnximage-processing - 最后活动时间: 2026-07-23
Stable-Diffusion-Android
Android平台上的Stable Diffusion AI客户端应用,支持连接Automatic1111 WebUI进行AI图像生成。
- Stars: ⭐️ 1.2k
- Tags:
stable-diffusionandroidai-image-generationkotlin - 最后活动时间: 2026-06-12
comfyui-portrait-master
ComfyUI 节点插件,帮助 AI 图像创作者快速生成人物肖像的提示词,简化人像生成工作流。
- Stars: ⭐️ 1.2k
- Tags:
ComfyUI人像生成提示词 - 最后活动时间: 2026-02-09
PoseLib
提供用于校准相机姿态估计的最小求解器集合。广泛应用于计算机视觉和3D重建任务中。
- Stars: ⭐️ 1.2k
- Tags:
computer-visionpose-estimation3d-reconstructioncamera - 最后活动时间: 2026-06-23
gorest-2d-animation-spritesheet-generator
基于Codex辅助的本地2D动画精灵图生成器与场景合成工作台。可帮助开发者快速生成游戏动画资源。
- Stars: ⭐️ 1.2k
- Tags:
spritesheet2d-animationcodexgame-dev - 最后活动时间: 2026-07-17
MeanFlow
一步生成建模的PyTorch实现,探索流匹配和扩散模型的高效生成方法。
- Stars: ⭐️ 1.2k
- Tags:
DiffusionFlow MatchingGenerative Model - 最后活动时间: 2026-07-01
FastGS
CVPR 2026论文官方代码,将3D高斯泼溅训练时间缩短至100秒的革命性加速方法。
- Stars: ⭐️ 1.2k
- Tags:
3dgsgaussian-splattingcvpr2026acceleration - 最后活动时间: 2026-03-23
HunyuanWorld-Mirror
腾讯混元团队开发的快速通用3D重建模型,支持图像到3D、场景生成等多种任务。
- Stars: ⭐️ 1.2k
- Tags:
3d-reconstructionaigcimage-to-3dscene-generation - 最后活动时间: 2026-05-27
samila
基于数学算法的生成艺术工具,可创建独特的NFT艺术作品。支持多种参数配置,生成风格多样的视觉艺术。
- Stars: ⭐️ 1.2k
- Tags:
generative-artpython3nftmatplotlib - 最后活动时间: 2026-07-20
vertex-ai-creative-studio
Google Cloud Vertex AI生成媒体创意工作室,集成Imagen、Veo、Gemini TTS、Chirp等多模态AI能力。提供图像、视频、音频生成的完整解决方案。
- Stars: ⭐️ 1.2k
- Tags:
Vertex AIImagenVeoGeminiMultimodal - 最后活动时间: 2026-08-01
LLaVA-OneVision-2
完全开放的多模态训练框架,支持视觉语言模型的民主化训练与部署。
- Stars: ⭐️ 1.2k
- Tags:
llavallmmllmvision-language-modelmultimodal - 最后活动时间: 2026-07-27
biniou
一个自托管的生成式AI WebUI,支持30多种AI模型,包括Stable Diffusion、FLUX、AnimateDiff、Bark、Whisper等,覆盖图像、音频、视频多模态生成。
- Stars: ⭐️ 1.1k
- Tags:
Generative AIWebUIStable DiffusionMultimodal - 最后活动时间: 2026-08-01
ComfyUI-wiki
ComfyUI 综合知识库,包含工作流分享、资源分享、教程分享等内容,帮助用户快速上手 Stable Diffusion 图像生成。
- Stars: ⭐️ 1.1k
- Tags:
comfyuistable-diffusionimage-generationworkflow - 最后活动时间: 2026-07-12
3dgs-render-blender-addon
KIRI Engine 出品的 3D Gaussian Splatting 渲染器 Blender 插件,支持神经渲染技术在 3D 建模中的应用。
- Stars: ⭐️ 1.1k
- Tags:
3d-gaussian-splattingblenderneural-rendering3d-reconstruction - 最后活动时间: 2026-07-17
Awesome-Image-Composition
图像合成与物体插入领域的论文、代码和资源精选列表,涵盖图像融合、和谐化、阴影生成等生成式AI技术。
- Stars: ⭐️ 1.1k
- Tags:
image-compositionimage-harmonizationgenerative-aicomputer-vision - 最后活动时间: 2026-04-30
gaussian-splatting-lightning
基于PyTorch Lightning的3D高斯泼溅框架,集成多种衍生算法与交互式Web查看器。
- Stars: ⭐️ 1.1k
- Tags:
gaussian-splatting3d-reconstructionpytorch-lightningnerfdeep-learning - 最后活动时间: 2026-05-25
image-extender
基于 Gemini 和 OpenRouter 的开源 AI 图像扩展工具,支持任意方向延展图像。结合泊松融合算法和三选一变体挑选机制,实现无缝的图像外扩效果。
- Stars: ⭐️ 1.1k
- Tags:
aigeminiimage-generationoutpaintingnextjs - 最后活动时间: 2026-05-31
TripoSplat
由TripoAI开发的模型,能将单张2D图像转换为高质量且数量可变的3D高斯泼溅数据。
- Stars: ⭐️ 1.1k
- Tags:
3d-gaussian-splattingimage-to-3dgenerative-ai - 最后活动时间: 2026-06-02
TimeGAN
NeurIPS 2019论文代码,时间序列生成对抗网络,用于时序数据生成。
- Stars: ⭐️ 1.1k
- Tags:
time-seriesganneuripsdata-generation - 最后活动时间: 2026-02-05
InfiniDepth
利用神经隐式场实现任意分辨率和细粒度的深度估计模型。CVPR 2026 论文项目。
- Stars: ⭐️ 1.0k
- Tags:
Depth EstimationNeural Implicit FieldsComputer Vision - 最后活动时间: 2026-04-03
jimeng-api
逆向工程得到的即梦/Dreamina官方API,支持文本到图像及图像到图像的生成功能。为开发者提供便捷的接口调用方式,易于集成到各类AI创作应用中。
- Stars: ⭐️ 1.0k
- Tags:
apitext-to-imageimage-generationreverse-engineeringdreamina - 最后活动时间: 2026-03-02
CNNGestureRecognizer
基于CNN的手势识别项目,使用Keras和TensorFlow实现,支持实时手势检测。
- Stars: ⭐️ 1.0k
- Tags:
gesture-recognitioncnntensorflowkeras - 最后活动时间: 2026-05-21
GaussianAvatars
CVPR 2024 Highlight 论文,基于3D高斯泼溅的逼真头部头像生成技术,支持实时渲染与动画驱动。
- Stars: ⭐️ 1.0k
- Tags:
3d-gaussian-splattingavatar-generationcomputer-visionneural-rendering - 最后活动时间: 2026-02-11
muapi-cli
muapi.ai官方CLI工具,支持终端生成图像、视频和音频,集成MCP服务器。
- Stars: ⭐️ 1.0k
- Tags:
aicliimage-generationvideo-generationmcp - 最后活动时间: 2026-07-29
PRISM-VL
研究基于RAW测量的视觉语言模型(VLM)学习,支持相机条件定位和曝光包围监督转移。
- Stars: ⭐️ 1.0k
- Tags:
VLMComputer VisionMachine Learning - 最后活动时间: 2026-05-27
PatchFusion
CVPR 2024高分辨率单目度量深度估计的端到端分块框架。
- Stars: ⭐️ 1.0k
- Tags:
Depth EstimationComputer VisionCVPR 2024 - 最后活动时间: 2026-02-21
Lumina-DiMOO
开源多模态大扩散语言模型,支持统一的多模态理解与生成能力。
- Stars: ⭐️ 1.0k
- Tags:
diffusion-modelmultimodal-llmimage-generation - 最后活动时间: 2026-05-19
DiffusionToolkit
专为AI生成图像设计的元数据索引器和查看器,支持Stable Diffusion等生成工具的PNG信息管理。
- Stars: ⭐️ 1.0k
- Tags:
Stable Diffusion图像管理元数据 - 最后活动时间: 2026-02-27
GLM-Image
基于自回归的高保真图像生成模型,支持文本到图像和图像到图像的生成任务。
- Stars: ⭐️ 989
- Tags:
Text-to-ImageImage GenerationAuto-regressive - 最后活动时间: 2026-03-20
NoPoSplat
ICLR 2025 Oral论文,从稀疏无位姿图像生成3D高斯溅射的简单高效方法。
- Stars: ⭐️ 974
- Tags:
3d-gaussian-splatting3d-reconstructioncomputer-visionnerf - 最后活动时间: 2026-02-25
PillOCR-python
基于大模型API的OCR工具,提供智能文字识别能力。
- Stars: ⭐️ 970
- Tags:
ocrllmpython - 最后活动时间: 2026-05-01
Image-processing-algorithm
图像处理算法论文实现集合,包含Retinex、去雾等经典算法。
- Stars: ⭐️ 969
- Tags:
image-processingretinexdehazingopencv - 最后活动时间: 2026-05-20
story-iter
ICLR 2026论文项目,提供无需训练的迭代框架用于长故事可视化,基于扩散模型实现高质量图像生成。
- Stars: ⭐️ 958
- Tags:
diffusion-modelsimage-generationstorytellingvisual-storytelling - 最后活动时间: 2026-04-02
Awesome-diffusion-model-for-image-processing
基于扩散模型的图像处理资源汇总,涵盖图像修复、增强、编码和质量评估等方向。
- Stars: ⭐️ 956
- Tags:
diffusion-modelsimage-processingimage-restorationimage-enhancement - 最后活动时间: 2026-04-08
aholo-viewer
一款高性能的3D高斯泼溅(3DGS)渲染器,支持LOD多层级渲染。适合处理大规模3D场景的高效可视化。
- Stars: ⭐️ 956
- Tags:
3d3d-gaussian-splatting3dgs3dgs-lodrenderer - 最后活动时间: 2026-07-31
Skyfall-GS
从卫星图像合成沉浸式3D城市场景,结合3D高斯泼溅与扩散模型技术实现高质量三维重建。
- Stars: ⭐️ 941
- Tags:
3D重建卫星图像高斯泼溅 - 最后活动时间: 2026-06-20
OpenStereo
立体匹配领域的综合基准测试工具,用于评估和比较各种立体匹配算法的性能表现。
- Stars: ⭐️ 928
- Tags:
stereo-matchingcomputer-visionbenchmarkdepth-estimation - 最后活动时间: 2026-05-25
PixelDiT
CVPR 2026 Oral 论文项目,提出像素级扩散 Transformer 用于高质量图像生成,代表了图像生成领域的前沿研究进展。
- Stars: ⭐️ 912
- Tags:
diffusion-modelsimage-generationtransformercomputer-vision - 最后活动时间: 2026-07-08
PhysX-Anything
CVPR 2026论文,从单张图像生成具备物理仿真属性的3D资产。
- Stars: ⭐️ 911
- Tags:
image-to-3dphysical-modeling3d-generationcvpr - 最后活动时间: 2026-04-28
guizang-material-illustration
材质插画技能,用于生成带文字解释的图表、数据可视化和参考辅助配图。
- Stars: ⭐️ 902
- Tags:
illustrationdata-visualizationclaude-codeimage-generation - 最后活动时间: 2026-07-07
api-llm-ocr
基于视觉大模型的PDF转Markdown工具,支持表格、布局和结构保留,适用于文档AI处理场景。
- Stars: ⭐️ 899
- Tags:
OCRVision-LLMDocument-AIPDF - 最后活动时间: 2026-02-21
spz
Niantic开源的3D高斯泼溅文件格式,压缩率比PLY格式高约10倍,几乎无视觉质量损失。
- Stars: ⭐️ 896
- Tags:
gaussian-splatting3dgscompression3d-reconstruction - 最后活动时间: 2026-07-10
UpscalerJS
浏览器端AI图像增强库,支持超分辨率、去噪、修复等功能,无需后端服务。
- Stars: ⭐️ 894
- Tags:
image-enhancementsuper-resolutiontensorflow-jsesrgan - 最后活动时间: 2026-07-31
mesh2splat
快速将3D网格模型转换为高斯泼溅格式的工具,支持神经渲染和实时新视角合成。
- Stars: ⭐️ 888
- Tags:
3d-gaussian-splattingneural-rendering3d-reconstruction - 最后活动时间: 2026-04-22
sapiens2
ICLR 26论文实现,在10亿人类图像上预训练的1K分辨率视觉Transformer模型,专注于人体视觉理解任务。
- Stars: ⭐️ 888
- Tags:
vision-transformercomputer-visionhuman-centricpretrained-model - 最后活动时间: 2026-05-24
open-cd
变化检测工具箱,集成多种深度学习变化检测算法,支持BIT、Changer等模型。
- Stars: ⭐️ 882
- Tags:
change-detectiondeep-learningpytorchtransformer - 最后活动时间: 2026-06-15
Boogu-Image
Apache-2.0开源的图像生成与编辑模型家族,以极少数据实现接近闭源模型的性能。
- Stars: ⭐️ 880
- Tags:
image-generationimage-editingopen-sourceapache-2 - 最后活动时间: 2026-07-23
UniPic
开源SOTA多图像编辑模型,支持高质量图像理解与编辑生成。
- Stars: ⭐️ 871
- Tags:
Image EditingDiffusionVLM - 最后活动时间: 2026-07-13
Image-Generation-CoT
CVPR 2025 论文,首次探索图像生成中的 Chain-of-Thought 推理,涵盖强化学习与反思机制。
- Stars: ⭐️ 865
- Tags:
image-generationchain-of-thoughtdiffusionreasoning - 最后活动时间: 2026-03-19
StableGen
强大的Blender插件,集成Stable Diffusion、ControlNet和Flux1-dev,实现智能3D纹理生成。
- Stars: ⭐️ 861
- Tags:
BlenderStable Diffusion3D纹理 - 最后活动时间: 2026-07-07
stirling-image
类似Stirling-PDF的图像处理工具箱,集成30多种本地AI功能,包括调整大小、压缩、背景移除、图像放大、OCR等,完全离线运行,无云服务依赖。
- Stars: ⭐️ 860
- Tags:
aiimage-processingocrimage-upscaleself-hosted - 最后活动时间: 2026-04-24
PoinTr
ICCV 2021 Oral论文,基于几何感知Transformer的点云补全模型,从部分点云重建完整3D几何结构。
- Stars: ⭐️ 855
- Tags:
3D VisionPoint CloudTransformer - 最后活动时间: 2026-06-24
JarvisArt
NeurIPS 2025智能照片修图代理,基于多模态大语言模型释放人类艺术创造力。
- Stars: ⭐️ 855
- Tags:
multimodalimage-processingvision-language-modelsagent - 最后活动时间: 2026-04-04
FastGen
NVIDIA推出的扩散模型加速生成技术,通过蒸馏方法显著提升图像生成速度,提供高效推理优化方案。
- Stars: ⭐️ 853
- Tags:
DiffusionDistillationNVIDIA - 最后活动时间: 2026-07-16
ComfyUI_RyanOnTheInside
ComfyUI的扩展节点库,支持音频、MIDI和动作的全面反应性控制。可动画化和操作图像、视频和音频,提供原生ACEStep扩展。
- Stars: ⭐️ 847
- Tags:
comfyuiaudio-reactivityimage-manipulationvideo-generationacestep - 最后活动时间: 2026-03-20
jimeng-free-api-all
即梦AI免费API服务,支持文生图、图生图、视频生成等功能,兼容OpenAI接口格式,支持多账号接入与零配置Docker部署。
- Stars: ⭐️ 839
- Tags:
ai-image-generationvideo-generationopenai-compatibledocker - 最后活动时间: 2026-04-13
uniface
基于ONNX Runtime的统一人脸分析Python库,支持人脸检测、识别、表情分析、年龄性别估计等多种功能。
- Stars: ⭐️ 838
- Tags:
face-detectionface-recognitionface-analysisonnxcomputer-vision - 最后活动时间: 2026-07-30
HVI-CIDNet
CVPR2025低光照图像增强方法,提出新型HVI颜色空间实现高质量暗光图像恢复。
- Stars: ⭐️ 834
- Tags:
image-enhancementlow-lighttransformercvpr2025 - 最后活动时间: 2026-03-09
FlashWorld
ICLR 2026 Oral论文官方代码,实现秒级高质量3D场景生成的创新方法。
- Stars: ⭐️ 834
- Tags:
3d-generationscene-generationiclr2026 - 最后活动时间: 2026-03-24
ComfyUI-QwenVL
ComfyUI自定义节点,集成Qwen-VL系列视觉语言模型,支持GGUF格式,提供文本生成、图像理解和视频分析能力。
- Stars: ⭐️ 824
- Tags:
ComfyUIQwen-VLMultimodal - 最后活动时间: 2026-07-13
MonoScene
CVPR 2022论文,单目3D语义场景补全,从单张图像预测3D语义占用。
- Stars: ⭐️ 819
- Tags:
3d-scene-completionmonocularsemantic-segmentationpytorch - 最后活动时间: 2026-03-25
RoseTTAFold-All-Atom
基于深度学习的蛋白质全原子结构预测模型,能够预测蛋白质及其配体的三维结构。
- Stars: ⭐️ 814
- Tags:
protein-structuredeep-learningbioinformaticsstructural-biology - 最后活动时间: 2026-05-18
zotero-ocr
Zotero文献管理软件的OCR插件,基于Tesseract实现文档文字识别功能。
- Stars: ⭐️ 809
- Tags:
ocrzoterotesseract - 最后活动时间: 2026-06-04
SAX-NeRF
CVPR 2024 论文,结构感知的稀疏视角X射线3D重建,支持CT重建和新视角合成。
- Stars: ⭐️ 803
- Tags:
x-rayct-reconstructionnerfmedical-imaging - 最后活动时间: 2026-06-24
SSRS
遥感图像语义分割工具箱,支持Mamba、多模态融合、Segment Anything及无监督域适应等前沿方法。
- Stars: ⭐️ 803
- Tags:
semantic-segmentationremote-sensingtransformermamba - 最后活动时间: 2026-07-22
scribeocr
基于Web的OCR文档识别与校对工具,支持创建完整数字化文档。
- Stars: ⭐️ 803
- Tags:
ocrtesseractweb-interface - 最后活动时间: 2026-07-28
midjourney-proxy
全球最大的Midjourney绘图API。日生成超百万张图,支持Discord集成。
- Stars: ⭐️ 802
- Tags:
midjourneyimage-generationapi-proxydiscord-bot - 最后活动时间: 2026-07-07
awesome-nanobananapro-prompts
基于 Google Gemini 2.5 Flash 模型打造的精美 AI 图像生成与编辑 Web 应用。使用 Next.js 构建,提供直观的图像创作体验。
- Stars: ⭐️ 801
- Tags:
geminiimage-generationnextjsai-art - 最后活动时间: 2026-07-28
gemini-nanobanana-pro
基于 Google Gemini 2.5 Flash 模型构建的 AI 图像生成与编辑 Web 应用,使用 Next.js 开发。
- Stars: ⭐️ 794
- Tags:
geminiimage-generationimage-editingnextjsweb-app - 最后活动时间: 2026-07-04
CnSTD
基于PyTorch/MXNet的中文场景文字检测工具包,支持OCR、数学公式检测和版面分析。
- Stars: ⭐️ 793
- Tags:
ocrtext-detectiondeep-learningpytorchscene-text-detection - 最后活动时间: 2026-07-05
Awesome-AIGC-3D
精选的AI生成3D内容论文合集,涵盖最新的文本到3D、图像到3D等前沿研究方向。
- Stars: ⭐️ 787
- Tags:
aigc3d-generationtext-to-3dimage-to-3dneural-rendering - 最后活动时间: 2026-05-04
ocean
Meta开源的跨平台计算机视觉与增强现实框架,C++实现,支持CV和AR应用开发。
- Stars: ⭐️ 785
- Tags:
computer-visionaugmented-realitymetacpp - 最后活动时间: 2026-07-24
MHR
Meta开发的参数化全身数字人体模型,包含骨骼模型、3D网格、姿态校正和面部混合变形,专为计算机视觉和图形学社区设计。
- Stars: ⭐️ 778
- Tags:
human-model3d-bodycomputer-visionparametric-model - 最后活动时间: 2026-07-29
ImageJ
开源科学图像处理软件,广泛应用于生物医学图像分析和科研领域。
- Stars: ⭐️ 776
- Tags:
computer-visionimage-processingscientific-imaging - 最后活动时间: 2026-07-22
ecom-details-image
面向跨境电商和国内电商的通用视觉创作Skill,精选25个高质量案例并配完整提示词。支持一键生成电商主图、详情页及社媒推广图等全套视觉素材,具备Campaign Style Lock机制以保障转化效果。
- Stars: ⭐️ 773
- Tags:
E-commerceImage GenerationPrompt EngineeringClaude Code - 最后活动时间: 2026-05-15
FG-CLIP
新一代CLIP模型,具备强大的细粒度识别能力,支持跨模态检索和图文匹配任务。
- Stars: ⭐️ 763
- Tags:
clipcross-modal-retrievalfine-grained-classificationtext-image-retrieval - 最后活动时间: 2026-06-16
pexo-skills
开源Agent技能集合,专注于图像、音频和视频等多模态内容创作。
- Stars: ⭐️ 760
- Tags:
agent-skillsmultimodalcontent-creation - 最后活动时间: 2026-07-21
ComfyUI-Trellis2
Microsoft Trellis 3D生成模型的ComfyUI封装,支持从图像生成高质量3D模型。
- Stars: ⭐️ 745
- Tags:
3d-generationcomfyuitext-to-3dimage-to-3d - 最后活动时间: 2026-07-31
aitviewer
用于可视化和交互3D数据序列的工具集,支持SMPL人体模型、网格渲染和计算机视觉数据可视化。
- Stars: ⭐️ 744
- Tags:
3d-visualizationcomputer-visionsmplmeshesrendering - 最后活动时间: 2026-05-07
DreamLite
ECCV 2026官方实现,一个用于图像生成与编辑的轻量级端侧统一模型。
- Stars: ⭐️ 741
- Tags:
image-generationimage-editingon-devicelightweight-model - 最后活动时间: 2026-06-12
huobao-canvas
无限画布工具,支持文生图、图生图、图生视频及多模型切换,兼容OpenAI标准格式。
- Stars: ⭐️ 737
- Tags:
image-generationtext-to-imagevideo-generation - 最后活动时间: 2026-03-18
FCGF
全卷积几何特征提取网络,用于3D点云配准和对应关系建立。
- Stars: ⭐️ 733
- Tags:
3d-visionfeature-extractionpoint-cloudregistration - 最后活动时间: 2026-07-02
OmniLottie
CVPR 2026 论文项目,开源的多模态向量动画生成器,可通过指令生成 Lottie JSON 动画文件,支持 VLM 视觉语言模型驱动。
- Stars: ⭐️ 732
- Tags:
generative-aimulti-modalvlmlottie-animationvector-graphics - 最后活动时间: 2026-04-06
EDGS
3D高斯泼溅高效收敛方法PyTorch实现,消除密集化步骤。3D重建新方法。
- Stars: ⭐️ 729
- Tags:
3dgs3d-reconstructiongaussian-splatting - 最后活动时间: 2026-07-04
Point-Transformers
点云Transformer实现,用于3D点云处理和理解,是计算机视觉领域的重要研究方向。
- Stars: ⭐️ 729
- Tags:
point-cloudtransformer3d-visiondeep-learning - 最后活动时间: 2026-06-13
PaddleMIX
飞桨多模态开发工具箱,支持主流多模态任务及扩散模型,提供高性能实现。
- Stars: ⭐️ 724
- Tags:
multimodalpaddlepaddlediffusion - 最后活动时间: 2026-03-06
icons
利用AI技术自动生成macOS应用图标的实用工具。它简化了图标设计流程,让开发者能快速创建高质量的应用图标。
- Stars: ⭐️ 719
- Tags:
AImacOSiconsdesignimage-generation - 最后活动时间: 2026-07-23
immich-automated-selfie-timelapse
自动化人脸提取、调整和对齐工具,适合制作自拍延时视频。基于Immich平台实现的人脸识别与处理工作流。
- Stars: ⭐️ 717
- Tags:
immichface-detectiontimelapseself-hosted - 最后活动时间: 2026-07-08
SOMA-X
统一参数化人体模型的开源框架,支持姿态估计与数字人生成。基于PyTorch和CUDA实现高性能计算。
- Stars: ⭐️ 717
- Tags:
digital-humanpose-estimationpytorchcudaopen-usd - 最后活动时间: 2026-06-05
gpt-image-canvas
基于 tldraw 构建的本地专业 AI 画布工具,支持图像生成与编辑。
- Stars: ⭐️ 715
- Tags:
aiai-toolsimage-generationcanvas - 最后活动时间: 2026-07-04
Awesome-Sketch-Based-Applications
基于草图的应用论文合集,涵盖草图到图像生成、草图检索、草图建模等AI相关研究方向。
- Stars: ⭐️ 712
- Tags:
sketch-to-imagesketch-based-retrievalgenerative-aicomputer-vision - 最后活动时间: 2026-07-23
paz
Python层级感知库,支持姿态估计、目标检测、实例分割、人脸识别等多种计算机视觉任务。
- Stars: ⭐️ 709
- Tags:
pose-estimationobject-detectionface-recognitioninstance-segmentation - 最后活动时间: 2026-07-30
DiffusionDPO
Salesforce开源的扩散模型对齐方法,将DPO技术应用于图像生成模型,实现更符合人类偏好的生成效果。
- Stars: ⭐️ 707
- Tags:
Diffusion ModelsDPOModel Alignment - 最后活动时间: 2026-06-02
micro-sam
Segment Anything模型在显微图像领域的适配应用,支持细胞与细胞器分割。
- Stars: ⭐️ 706
- Tags:
segment-anythingmicroscopycell-segmentationbioimage - 最后活动时间: 2026-07-31
mpv-AnimeJaNai
利用轻量级超分辨率模型在mpv播放器中实现实时动漫4K画质放大。基于TensorRT和Vapoursynth提供高效的视频增强体验。
- Stars: ⭐️ 705
- Tags:
super-resolutionesrgananime-upscalingtensorrt - 最后活动时间: 2026-07-31
MetalSplatter
在Apple平台上使用Metal渲染高斯溅射的框架,支持iOS、macOS和visionOS,实现实时3D场景重建与渲染。
- Stars: ⭐️ 704
- Tags:
gaussian-splattingmetal3d-renderingcomputer-vision - 最后活动时间: 2026-05-28
NanoBananaEditor
基于Gemini 2.5 Flash的AI图像生成与编辑应用,支持参考图、蒙版编辑和版本历史。
- Stars: ⭐️ 702
- Tags:
image-generationimage-editinggemini-api - 最后活动时间: 2026-05-14
Fast-SRGAN
轻量级实时超分辨率模型,可在30fps下将低分辨率视频实时上采样为高分辨率。
- Stars: ⭐️ 696
- Tags:
real-timesrganvideo-super-resolutiontensorflow - 最后活动时间: 2026-02-11
ComfyScript
ComfyUI的Python前端库,支持将工作流编写为Python脚本,在Jupyter中实现自动化图像生成。
- Stars: ⭐️ 695
- Tags:
ComfyUIStable DiffusionPython - 最后活动时间: 2026-07-18
NextStep-1
StepFun团队开发的SOTA自回归图像生成模型,采用连续token技术实现高质量图像生成。
- Stars: ⭐️ 693
- Tags:
image-generationautoregressivemultimodaldiffusion - 最后活动时间: 2026-02-27
FLAME-Universe
FLAME 3D头部模型的公开资源汇总,包含代码、数据集和学术论文,适用于人脸生成和表情动画。
- Stars: ⭐️ 692
- Tags:
3d-faceface-modelcomputer-visiongenerative-ai - 最后活动时间: 2026-03-03
Comfyui-zhenzhen
ComfyUI的平价API调用节点集合,支持Seedance2.0等多种图像生成模型。
- Stars: ⭐️ 691
- Tags:
comfyuiimage-generationapi-nodes - 最后活动时间: 2026-07-31
ai_gallery
AI生成内容展示平台,汇集有趣的AI生成作品,基于Next.js 14和React构建。
- Stars: ⭐️ 688
- Tags:
ai-generatedshowcasenextjsvisualization - 最后活动时间: 2026-05-07
fast-plate-ocr
轻量级高速车牌OCR识别模型,支持PyTorch、TensorFlow、JAX和ONNX运行时。
- Stars: ⭐️ 687
- Tags:
ocrlicense-plate-recognitioncomputer-visiononnxdeep-learning - 最后活动时间: 2026-03-14
peinture
通用AI图像生成框架,支持Hugging Face、Model Scope等多个模型平台。
- Stars: ⭐️ 685
- Tags:
Image GenerationAI ArtFramework - 最后活动时间: 2026-06-18
syncity
无需训练的3D世界生成框架,支持快速创建复杂3D场景。
- Stars: ⭐️ 677
- Tags:
3d-generationtraining-free3d-worlds - 最后活动时间: 2026-07-07
tessera
剑桥大学开发的卫星时序图像基础模型,支持土地分类和树冠高度预测等遥感应用。
- Stars: ⭐️ 675
- Tags:
SatelliteRemote SensingFoundation Models - 最后活动时间: 2026-07-26
spectral
Python高光谱图像处理模块,支持异常检测、图像分类和目标检测等AI功能。
- Stars: ⭐️ 675
- Tags:
hyperspectralimage-processinganomaly-detectionpython - 最后活动时间: 2026-07-30
comfyui-tooling-nodes
ComfyUI工具节点集合,支持将其作为后端服务使用,实现外部工具与ComfyUI直接图像传输。
- Stars: ⭐️ 667
- Tags:
ComfyUIStable DiffusionAPI - 最后活动时间: 2026-06-28
Ming
基于Ling大模型构建的多模态理解与生成框架,支持高级多模态任务处理。
- Stars: ⭐️ 665
- Tags:
multimodalllmvision-language - 最后活动时间: 2026-07-27
workflow_templates
提供丰富的 ComfyUI 模板工作流集合。方便用户快速复用和构建各类图像生成任务。
- Stars: ⭐️ 662
- Tags:
comfyuiworkflowtemplatesimage-generation - 最后活动时间: 2026-08-02
ComfyUI-See-through
ComfyUI插件,利用AI系统将单张动漫插画分解为可操作的2.5D分层模型。支持深度排序,可直接用于Live2D工作流。
- Stars: ⭐️ 660
- Tags:
comfyuiimage-generationlive2dai-art - 最后活动时间: 2026-05-27
LHM-plusplus
高效的大型人体重建模型,可从任意姿态图像重建3D人体模型。
- Stars: ⭐️ 659
- Tags:
3d-reconstructionhuman-modelcomputer-visiondeep-learning - 最后活动时间: 2026-05-29
yolov7-object-tracking
基于YOLOv7的目标检测与跟踪项目,结合PyTorch、OpenCV和SORT算法实现实时多目标跟踪。
- Stars: ⭐️ 653
- Tags:
yoloobject-detectionobject-trackingpytorchopencv - 最后活动时间: 2026-07-20
Prism
开源的跨平台壁纸应用,支持社区上传、精选合集以及AI壁纸生成功能,让用户轻松创建个性化壁纸。
- Stars: ⭐️ 653
- Tags:
flutterwallpaperaiimage-generation - 最后活动时间: 2026-06-11
nnDetection
自配置3D医学目标检测框架,支持12个数据集,无需手动干预即可应用于新数据。
- Stars: ⭐️ 651
- Tags:
medical-imaging3d-object-detectiondeep-learning - 最后活动时间: 2026-06-08
SeeSR
CVPR 2024论文,实现语义感知的真实世界图像超分辨率重建。
- Stars: ⭐️ 650
- Tags:
super-resolutionstable-diffusionimage-enhancement - 最后活动时间: 2026-04-09
assets
Ultralytics官方资源库,包含YOLO系列模型权重和计算机视觉资源。
- Stars: ⭐️ 647
- Tags:
computer-visionyoloobject-detectionultralytics - 最后活动时间: 2026-08-01
Liquid
IJCV收录的多模态大语言模型,实现可扩展的统一文本到图像生成。
- Stars: ⭐️ 642
- Tags:
Multimodal LLMText-to-ImageGenerative AI - 最后活动时间: 2026-06-01
comfyui-lumi-batcher
ComfyUI 的批量处理扩展插件,通过批量调试参数显著提升工作流效率。解决了传统图像生成中需要逐一调整参数的痛点。
- Stars: ⭐️ 642
- Tags:
comfyuibatch-processingimage-generationworkflow - 最后活动时间: 2026-07-20
ima2-gen
OpenAI GPT Image 2 的极简 CLI 和 Web UI 工具。支持文本生成图像、图像生成图像及并行生成。
- Stars: ⭐️ 637
- Tags:
image-generationopenaiclinodejs - 最后活动时间: 2026-07-27
MMIF-CDDFuse
CVPR 2023 论文官方实现,提出相关性驱动的双分支特征分解方法,用于多模态图像融合任务。
- Stars: ⭐️ 633
- Tags:
image-fusiondeep-learningcvpr2023multi-modality - 最后活动时间: 2026-06-08
pHash
开源感知哈希库,用于图像相似度检测和内容识别。支持图片指纹生成与匹配,广泛应用于图像去重、版权检测等场景。
- Stars: ⭐️ 632
- Tags:
perceptual-hashingimage-similaritycomputer-vision - 最后活动时间: 2026-05-26
ReconViaGen
ICLR2026论文项目,通过生成式方法实现精确的多视角3D物体重建,支持图像到3D的转换和姿态估计。
- Stars: ⭐️ 627
- Tags:
3d-generation3d-reconstructionimage-to-3dpose-estimationgenerative-ai - 最后活动时间: 2026-04-04
FastSurfer
FastSurferCNN的PyTorch实现,用于脑部MRI图像快速分割。
- Stars: ⭐️ 624
- Tags:
pytorchmedical-imagingbrain-segmentationmricnn - 最后活动时间: 2026-07-28
3D-RE-GEN
基于生成式框架的室内场景3D重建项目,利用AI技术从视觉数据生成高质量的三维网格模型。
- Stars: ⭐️ 619
- Tags:
3d-reconstructiongenerative-aicomputer-visionmesh - 最后活动时间: 2026-02-09
FakeShield
ICLR 2025论文项目,基于多模态大语言模型的可解释图像伪造检测与定位系统。
- Stars: ⭐️ 616
- Tags:
image-forensicsmllmdeepfake-detectioniclr2025 - 最后活动时间: 2026-02-21
WiLoR
端到端的3D手部定位与重建模型,可在自然场景中实现高精度的手部姿态估计和3D重建。
- Stars: ⭐️ 613
- Tags:
hand-pose3d-reconstructioncomputer-visiondeep-learning - 最后活动时间: 2026-04-07
YOLO-Master
CVPR2026论文官方代码,基于MOE加速和专业Transformer增强的实时目标检测模型,支持分类、检测和分割任务。
- Stars: ⭐️ 611
- Tags:
yoloobject-detectionmoecomputer-visiontransformers - 最后活动时间: 2026-07-30
SAM3DBody-cpp
基于单摄像头的实时3D全身重建工具,支持多人BVH输出与70关节骨架。纯C++运行时结合ONNX与ggml,实现高性能动作捕捉。
- Stars: ⭐️ 610
- Tags:
3d-human-posepose-estimationonnxcppreal-time - 最后活动时间: 2026-07-28
LLMDet
CVPR 2025亮点论文,利用大语言模型监督学习强大的开放词汇目标检测器。
- Stars: ⭐️ 609
- Tags:
object-detectionllmcomputer-visioncvpr - 最后活动时间: 2026-02-04
Awesome-Face-Restoration
人脸修复方法综合资源列表,涵盖论文、代码库等计算机视觉前沿技术。
- Stars: ⭐️ 608
- Tags:
face-restorationcomputer-visionimage-enhancementdeep-learning - 最后活动时间: 2026-03-20
TRIDENT
大规模全切片图像处理工具包,支持病理学基础模型,用于组织病理学图像的深度学习分析和处理。
- Stars: ⭐️ 603
- Tags:
deep-learningpathologywhole-slide-imagefoundation-model - 最后活动时间: 2026-07-24
WildDet3D
Allen AI开源的可提示3D目标检测模型,支持在开放场景中进行可扩展的3D检测。
- Stars: ⭐️ 603
- Tags:
3d-detectioncomputer-visionobject-detectionpromptable - 最后活动时间: 2026-06-01
krea-2
Krea 2的官方推理代码,提供强大的图像生成能力。
- Stars: ⭐️ 602
- Tags:
image-generationai-artinference - 最后活动时间: 2026-06-24
ComfyUI_tinyterraNodes
ComfyUI自定义节点集合,为Stable Diffusion提供扩展功能和工作流增强。
- Stars: ⭐️ 600
- Tags:
comfyuistable-diffusionnodes - 最后活动时间: 2026-05-17
Awesome-Deep-Stereo-Matching
深度立体匹配资源精选合集,涵盖立体视觉、深度估计和相关深度学习算法。
- Stars: ⭐️ 596
- Tags:
stereo-visiondepth-estimationcomputer-visiondeep-learning - 最后活动时间: 2026-06-25
aot-benchmark
基于Transformer的视频目标分割高效模块化实现,支持多对象关联追踪。
- Stars: ⭐️ 595
- Tags:
video-segmentationtransformerobject-tracking - 最后活动时间: 2026-04-07
Visual-Tracking-Development
视觉目标跟踪相关的深度学习基准测试项目,涵盖多种跟踪算法和评估方法。
- Stars: ⭐️ 595
- Tags:
visual-trackingdeep-learningcomputer-visionbenchmark - 最后活动时间: 2026-06-15
character_select_stand_alone_app
角色选择独立应用,支持AI提示词和ComfyUI/WebUI API,用于AI图像生成工作流。
- Stars: ⭐️ 593
- Tags:
comfyuiimage-generationelectronstable-diffusion - 最后活动时间: 2026-08-01
3dgsconverter
3D Gaussian Splatting 模型转换工具,支持多种格式互转及 GPU 加速滤波处理。
- Stars: ⭐️ 585
- Tags:
gaussian-splatting3d-reconstructionneural-renderingconverter - 最后活动时间: 2026-08-01
deepgen
轻量级统一多模态模型,专注于图像生成与编辑任务,提供高效的视觉创作能力。
- Stars: ⭐️ 584
- Tags:
multimodalimage-generationimage-editingdeep-learning - 最后活动时间: 2026-07-31
Awesome-Sketch-Synthesis
草图生成与合成领域的论文合集,涵盖矢量草图生成、笔画级处理等研究方向。
- Stars: ⭐️ 576
- Tags:
sketch-generationsketch-synthesisvector-sketchgenerative-ai - 最后活动时间: 2026-07-23
EmbodiedGen
面向具身智能的生成式3D世界引擎,能够高效生成高质量的3D场景与资产。为机器人和AI智能体提供逼真的虚拟训练与交互环境。
- Stars: ⭐️ 568
- Tags:
3d-generationembodied-aiworld-modelsynthetic-data - 最后活动时间: 2026-07-17
Coherent-Line-Drawing
从照片自动生成连贯线条画的计算机图形学项目,基于非真实感渲染技术。
- Stars: ⭐️ 566
- Tags:
line-drawingnpropencvcomputer-graphics - 最后活动时间: 2026-07-11
RT-DETRv4
RT-DETRv4官方实现,结合视觉基础模型无痛推进实时目标检测。该框架在保持高精度的同时实现了卓越的实时检测性能。
- Stars: ⭐️ 564
- Tags:
object-detectionreal-timevision-transformercomputer-vision - 最后活动时间: 2026-07-06
FaceRecognition_ReactNative
为 Android 和 iOS 提供端侧人脸验证、活体检测和人脸录入功能的 React Native 库。
- Stars: ⭐️ 559
- Tags:
face-detectionfacerecognitionfaceverificationliveness-detectionreact-native - 最后活动时间: 2026-08-01
ComfyUI-OpenClaw
基于ComfyUI的个人AIGC工厂,支持多平台机器人集成,可生成任意图片和视频内容。
- Stars: ⭐️ 558
- Tags:
comfyuiimage-generationagentbotaigc - 最后活动时间: 2026-08-01
2txt
快速将图片转换为文本的AI工具,基于OpenAI技术实现高效图像识别与文字提取。
- Stars: ⭐️ 557
- Tags:
Image-to-TextOpenAINext.js - 最后活动时间: 2026-07-30
FaceLift
ICCV 2025论文,从单张图像学习可泛化的3D人脸重建方法,基于合成头部数据训练。
- Stars: ⭐️ 556
- Tags:
3d-face-reconstructioncomputer-visioniccv2025 - 最后活动时间: 2026-03-25
segmenteverygrain
基于SAM的颗粒图像实例分割模型,适用于地质和材料科学领域。
- Stars: ⭐️ 550
- Tags:
saminstance-segmentationgrain-analysisgeoscience - 最后活动时间: 2026-06-03
facefusion-docker
业界领先的人脸处理平台,支持人脸替换、唇形同步等多种AI视频处理功能。
- Stars: ⭐️ 550
- Tags:
aiface-swaplip-syncdockerdeepfake - 最后活动时间: 2026-07-31
ll3m
基于大语言模型的3D资产生成工具,可自动编写Python代码在Blender中创建3D模型。
- Stars: ⭐️ 546
- Tags:
llm3d-generationblendercode-generation - 最后活动时间: 2026-03-07
XCube
CVPR 2024 Highlight论文,使用稀疏体素层次结构实现大规模3D生成建模。
- Stars: ⭐️ 544
- Tags:
3d-generationgenerative-aivoxelcomputer-vision - 最后活动时间: 2026-06-18
Pix2Vox
ICCV 2019 论文官方实现,基于上下文感知的深度学习方法,从单张或多视角图像重建3D体素模型。
- Stars: ⭐️ 541
- Tags:
3d-reconstructiondeep-learningvoxelcomputer-vision - 最后活动时间: 2026-06-15
ptlflow
基于 PyTorch Lightning 的光流估计模型库,提供多种预训练模型和权重。
- Stars: ⭐️ 541
- Tags:
optical-flowpytorch-lightningpretrained-modelscomputer-vision - 最后活动时间: 2026-07-21
gemini-image-editing-nextjs-quickstart
基于Gemini 2.0和Next.js的图像生成与编辑快速入门项目,演示原生多模态能力。
- Stars: ⭐️ 539
- Tags:
geminigemini-apiimage-generationnextjs - 最后活动时间: 2026-06-24
VistaDream
ICCV 2025论文,从单视图重建多视角一致的场景图像。
- Stars: ⭐️ 538
- Tags:
diffusion-modelsnovel-view-synthesis3d-reconstruction - 最后活动时间: 2026-04-25
DrivAerNet
大规模多模态汽车数据集,包含计算流体动力学仿真和深度学习基准。支持图神经网络和生成式AI进行气动性能预测与设计优化。
- Stars: ⭐️ 537
- Tags:
deep-learninggenerative-aigraph-neural-networkscfdsurrogate-models - 最后活动时间: 2026-05-14
Awesome-Object-Insertion
图像合成与物体插入领域的精选资源合集,涵盖论文、代码和工具,帮助生成逼真的合成图像。
- Stars: ⭐️ 535
- Tags:
image-compositionobject-insertionimage-generationcomputer-vision - 最后活动时间: 2026-04-30
DiffSplat
ICLR 2025论文官方实现,将图像扩散模型应用于可扩展的3D高斯溅射生成,实现高质量3D内容创建。
- Stars: ⭐️ 534
- Tags:
diffusion-model3d-generationgaussian-splattingimage-to-3d - 最后活动时间: 2026-03-19
DeepMetricEye
利用UE MetaHuman生成数据进行VR近眼图像深度估计的研究代码。基于PyTorch和计算机视觉技术实现高精度度量。
- Stars: ⭐️ 534
- Tags:
computer-visiondepth-estimationmetahumanpytorchvr - 最后活动时间: 2026-06-19
FFHQ-UV
CVPR 2023 论文,提供归一化面部UV纹理数据集,用于高质量3D人脸重建。
- Stars: ⭐️ 533
- Tags:
face-textureuv-mapping3d-facecvpr2023 - 最后活动时间: 2026-04-16
Concerto
NeurIPS'25 论文官方仓库,提出联合2D-3D自监督学习方法,能够自主学习空间表征,适用于计算机视觉和3D理解任务。
- Stars: ⭐️ 531
- Tags:
self-supervised-learning3d-visionspatial-representationneurips - 最后活动时间: 2026-04-07
Awesome-Image-Harmonization
图像和谐化领域的论文与代码资源合集,专注于使合成图像前景与背景光照色彩协调一致。
- Stars: ⭐️ 528
- Tags:
image-harmonizationimage-compositioncomputer-visiongenerative-ai - 最后活动时间: 2026-02-24
anime-face-detector
基于mmdet和mmpose的动漫人脸检测器,支持人脸关键点检测。
- Stars: ⭐️ 527
- Tags:
anime-face-detectionface-landmarkpytorch - 最后活动时间: 2026-07-05
handwritten-text-recognition-for-apache-mxnet
基于Apache MXNet的端到端手写文本识别神经网络训练框架,支持IAM数据集上的全页面手写识别。
- Stars: ⭐️ 526
- Tags:
OCRHandwriting RecognitionMXNetDeep Learning - 最后活动时间: 2026-02-05
supersplat-viewer
用户友好且高性能的3D高斯泼溅查看器,基于PlayCanvas和WebXR技术构建。提供流畅的Web端3D模型浏览体验。
- Stars: ⭐️ 526
- Tags:
3d-gaussian-splattinggaussian-splattingplaycanvaswebglwebxrviewer - 最后活动时间: 2026-07-20
MiVOLO
基于神经网络的年龄和性别预测模型,专注于人脸图像分析。
- Stars: ⭐️ 525
- Tags:
neural-networkage-predictiongender-predictioncomputer-vision - 最后活动时间: 2026-06-04
Bonsai-Image-Demo
支持本地端侧部署的AI图像生成演示项目,主打1-bit与三值化小型模型。适合在设备上直接运行轻量级图像生成任务。
- Stars: ⭐️ 522
- Tags:
image-generationon-device-aismall-models1-bitternary - 最后活动时间: 2026-06-14
SOTS
单目标跟踪与分割项目,结合目标检测与语义分割技术,适用于视频分析场景。
- Stars: ⭐️ 519
- Tags:
object-trackingsegmentationcomputer-vision - 最后活动时间: 2026-04-14
SenseNova-Vision
一个将视觉作为统一多模态生成的先进模型。专注于多模态大语言模型(MLLM)在计算机视觉领域的统一应用与生成。
- Stars: ⭐️ 519
- Tags:
mllmmultimodalcomputer-visionimage-generation - 最后活动时间: 2026-07-22
DiffiT
ECCV 2024 论文官方实现,提出 Diffusion Vision Transformers 用于高质量图像生成,创新性地将扩散模型与视觉 Transformer 架构相结合。
- Stars: ⭐️ 517
- Tags:
diffusion-modelvision-transformerimage-generationdeep-learning - 最后活动时间: 2026-03-09
opentryon
用于构建虚拟试穿和时尚AI应用的开源API、SDK和模型。支持生成模特、编辑服装并创建个性化时尚体验。
- Stars: ⭐️ 516
- Tags:
fashion-aivirtual-try-onopen-sourcetoolkit - 最后活动时间: 2026-07-29
visionary
基于WebGPU的高斯泼溅平台,支持3D/4D高斯泼溅、神经渲染和扩散模型的世界模型载体。
- Stars: ⭐️ 515
- Tags:
gaussian-splattingwebgpuneural-renderingdiffusion-modelscomputer-vision - 最后活动时间: 2026-06-26
MV-SAM3D
基于多视图图像的 Segment Anything Model (SAM) 3D 物体分割项目。利用多视角图像处理技术实现高效的3D对象识别与分割。
- Stars: ⭐️ 512
- Tags:
3d-segmentationsammulti-viewcomputer-vision - 最后活动时间: 2026-05-30
XPretrain
多模态预训练框架,支持视觉与语言的联合表示学习。
- Stars: ⭐️ 511
- Tags:
multimodal-learningpre-trainingdeep-learning - 最后活动时间: 2026-03-27
visionworkbench
NASA开发的通用图像处理与计算机视觉库,用于自主系统和机器人研究。
- Stars: ⭐️ 504
- Tags:
computer-visionnasaimage-processingrobotics - 最后活动时间: 2026-07-28
photo2pixel
将照片转换为像素风格(8-bit)艺术的算法实现,支持在线工具 photo2pixel.co。
- Stars: ⭐️ 504
- Tags:
image-processingpixel-artpytorchstyle-transfer - 最后活动时间: 2026-05-07
VLMCSHFG
用于夜间目标检测的视觉语言模型代码库,结合了一致性采样器和幻觉特征生成器。该研究发表于TIP 2025期刊。
- Stars: ⭐️ 503
- Tags:
vision-language-modelobject-detectionnighttimecomputer-vision - 最后活动时间: 2026-07-08
Reall3dViewer
基于Three.js构建的3DGS高斯泼溅查看器,支持标记、测量及预设LOD渲染等功能。提供丰富的Web端3D场景交互体验。
- Stars: ⭐️ 502
- Tags:
3dgsgaussian-splattingthreejswebglviewertypescript - 最后活动时间: 2026-07-20
IMAGHarmony
可控图像编辑框架,在复杂多对象编辑中保持对象数量和布局一致性,实现高保真连贯的图像生成。
- Stars: ⭐️ 316
- Tags:
Image EditingDiffusionControllable - 最后活动时间: 2026-03-24
Video Generation
MoneyPrinterTurbo
利用AI大模型一键生成高清短视频的自动化工具,支持批量创作和多种视频风格。
- Stars: ⭐️ 101.1k
- Tags:
AI视频生成短视频自动化 - 最后活动时间: 2026-08-02
Deep-Live-Cam
实时AI换脸工具,仅需单张图片即可实现一键视频深度伪造和实时摄像头换脸。
- Stars: ⭐️ 95.5k
- Tags:
deepfakeface-swapreal-timevideo-generationgan - 最后活动时间: 2026-08-01
faceswap
开源深度学习换脸软件,支持多种模型和训练方式,适合学习和研究深度伪造技术。
- Stars: ⭐️ 57.2k
- Tags:
深度伪造人脸替换深度学习视频处理 - 最后活动时间: 2026-07-06
OpenMontage
全球首个开源智能体视频生产系统,包含11条流水线、49个工具和400+智能体技能,将AI编程助手转变为完整的视频制作工作室。
- Stars: ⭐️ 44.6k
- Tags:
agentic-aivideo-generationffmpegopen-sourcepython - 最后活动时间: 2026-07-24
Open-Sora
开源视频生成模型,致力于让高效视频创作技术普及化,类似Sora的视频生成方案。
- Stars: ⭐️ 28.9k
- Tags:
video-generationopen-sourceaisora - 最后活动时间: 2026-04-09
Pixelle-Video
AI全自动短视频生成引擎。结合图像生成、TTS等多种AI能力,实现从文本到视频的全流程自动化。
- Stars: ⭐️ 26.3k
- Tags:
aigccomfyuivideo-generationtts - 最后活动时间: 2026-06-14
Pixelle-Video
AI全自动短视频生成引擎,支持从文本到视频的端到端创作。
- Stars: ⭐️ 22.1k
- Tags:
video-generationaigccomfyuishort-video - 最后活动时间: 2026-06-08
video2x
基于机器学习的视频超分辨率与帧插值框架,提升视频画质。
- Stars: ⭐️ 20.7k
- Tags:
video-upscalingsuper-resolutionmachine-learningframe-interpolation - 最后活动时间: 2026-03-07
Wan2.1
阿里开源的大规模视频生成模型,支持高质量视频内容生成,是先进的AI视频生成解决方案。
- Stars: ⭐️ 15.9k
- Tags:
Video GenerationAIGCOpen Source - 最后活动时间: 2026-03-05
Wan2.2
开源的大规模视频生成模型,支持高质量视频内容创作与生成。
- Stars: ⭐️ 15.4k
- Tags:
Video GenerationAIGCOpen Source - 最后活动时间: 2026-03-17
Duix-Avatar
开源AI数字人工具包,支持离线视频生成与数字人克隆,适用于虚拟主播与内容创作场景。
- Stars: ⭐️ 14.3k
- Tags:
ai-avatardigital-humanvideo-generationopen-source - 最后活动时间: 2026-04-21
MoneyPrinter
使用MoviePy自动化创建YouTube短视频,结合AI生成内容。
- Stars: ⭐️ 13.8k
- Tags:
video-generationautomationyoutubemoviepyai-video - 最后活动时间: 2026-03-26
huobao-drama
基于AI的一站式短剧生成平台,一句话即可生成完整短剧,实现从剧本到成片的全自动化流程。
- Stars: ⭐️ 13.8k
- Tags:
video-generationai-videodrama-generatormultimodal-ai - 最后活动时间: 2026-07-31
waoowaoo
工业级全流程AI影视生产平台,支持从短剧到真人实拍的好莱坞标准工作流,实现可控的视频内容生成。
- Stars: ⭐️ 13.4k
- Tags:
ai-agentvideo-generationgenerative-aifilm-production - 最后活动时间: 2026-08-01
Toonflow-app
AI 短剧漫剧创作工具,自动将小说转化为剧本并生成图片和视频内容。
- Stars: ⭐️ 13.2k
- Tags:
ai-videostory-generationcontent-creationmultimodal - 最后活动时间: 2026-07-28
HunyuanVideo
腾讯开源的系统性大型视频生成模型框架,支持高质量视频内容的生成与处理。
- Stars: ⭐️ 12.3k
- Tags:
diffusion-modelsvideo-generationai - 最后活动时间: 2026-06-29
video-subtitle-remover
基于AI的视频/图片硬字幕和文本水印去除工具,本地运行无需第三方API,支持无损分辨率输出。
- Stars: ⭐️ 12.2k
- Tags:
aivideo-processingsubtitle-removaldeep-learning - 最后活动时间: 2026-06-30
Open-Sora-Plan
开源复现OpenAI Sora视频生成模型的项目,旨在通过社区协作实现文本到视频的生成能力。
- Stars: ⭐️ 12.2k
- Tags:
video-generationtext-to-videosoraopen-source - 最后活动时间: 2026-03-08
waoowaoo
工业级全流程 AI 影视生产平台,支持从短视频到长片的可控视频生成与好莱坞标准工作流。
- Stars: ⭐️ 12.0k
- Tags:
ai-agentvideo-generationgenerative-aifilm-production - 最后活动时间: 2026-05-04
ViMax
智能体驱动的视频生成平台,集成导演、编剧、制片和视频生成全流程。
- Stars: ⭐️ 11.6k
- Tags:
video-generationagentic-aigcai-video - 最后活动时间: 2026-07-29
cosmos
NVIDIA Cosmos 是一个开源的世界模型平台,提供数据集和工具来构建物理 AI。它专为机器人、自动驾驶汽车和智能基础设施等领域的开发者设计。
- Stars: ⭐️ 11.3k
- Tags:
world-modelsphysical-airoboticsautonomous-vehiclesnvidia - 最后活动时间: 2026-07-31
NarratoAI
AI驱动的视频解说与剪辑工具,一键生成视频解说并自动完成剪辑处理。
- Stars: ⭐️ 10.5k
- Tags:
VideoAI AgentLLMPython - 最后活动时间: 2026-07-23
AI4Animation
Unity中基于AI的角色动画系统,利用计算机大脑让角色栩栩如生。
- Stars: ⭐️ 8.8k
- Tags:
animationunityai-animationgame-developmentcharacter-ai - 最后活动时间: 2026-04-17
LiveTalking
实时交互流媒体数字人系统,支持唇形同步与高逼真度虚拟人生成。基于NeRF等技术实现高质量的数字人实时驱动。
- Stars: ⭐️ 8.6k
- Tags:
aigcdigital-humannerflip-syncrealtime - 最后活动时间: 2026-07-19
LTX-2
LTX-2音频-视频生成模型的官方推理和LoRA训练工具包。
- Stars: ⭐️ 8.5k
- Tags:
generative-aivideo-generationaudio-video - 最后活动时间: 2026-07-08
InfiniteTalk
支持图生视频和视频生视频的无限长度说话视频生成模型。能够生成高质量、连贯的数字人对话视频。
- Stars: ⭐️ 7.6k
- Tags:
video-generationtalking-headimage-to-videodeep-learning - 最后活动时间: 2026-05-22
autoclip
AI驱动的智能视频剪辑工具,自动识别并提取视频高光片段,助力二创内容快速生成。
- Stars: ⭐️ 6.3k
- Tags:
AI视频自动剪辑高光提取 - 最后活动时间: 2026-06-03
Jellyfish
一站式AI短剧生产工具,从剧本输入到AI视频生成、后期剪辑、一键导出成片全流程覆盖。
- Stars: ⭐️ 5.8k
- Tags:
ai-videoshort-dramavideo-generationai-production - 最后活动时间: 2026-07-30
seedance-2.0
基于Seedance 2.0的四模态AI电影制作综合生产管线。为创作者提供从脚本到视频的端到端自动化工作流。
- Stars: ⭐️ 5.8k
- Tags:
ai-filmmakingmultimodalvideo-generationpipeline - 最后活动时间: 2026-08-01
Awesome-Video-Diffusion
视频扩散模型的精选资源列表,涵盖视频生成、编辑及运动定制等前沿应用。
- Stars: ⭐️ 5.7k
- Tags:
video-diffusionvideo-generationdiffusion-modelsgenerative-ai - 最后活动时间: 2026-07-24
aigcpanel
一站式 AI 数字人系统,支持视频合成、声音克隆、本地模型管理。
- Stars: ⭐️ 5.4k
- Tags:
aigcdigital-humanvideo-synthesisvoice-cloning - 最后活动时间: 2026-07-16
YouDub-webui
开源AI视频本地化工具,支持自动下载、字幕翻译、语音克隆配音及音轨混合。
- Stars: ⭐️ 5.2k
- Tags:
ai-dubbingvoice-cloningvideo-translationspeech-to-texttext-to-speech - 最后活动时间: 2026-07-14
mmaction2
OpenMMLab新一代视频理解工具箱,支持动作识别、时序动作检测、视频分类等任务。
- Stars: ⭐️ 5.1k
- Tags:
action-recognitionvideo-understandingdeep-learningpytorchopenmmlab - 最后活动时间: 2026-03-18
short-video-factory
AI驱动的短视频批量生成工具,支持一键生成产品营销视频,跨平台桌面应用。
- Stars: ⭐️ 5.1k
- Tags:
AI视频短视频自动剪辑 - 最后活动时间: 2026-07-23
vjepa2
Meta发布的视频自监督学习模型VJEPA2的PyTorch官方实现。
- Stars: ⭐️ 4.4k
- Tags:
videoself-supervisedpytorchmeta - 最后活动时间: 2026-03-23
HunyuanVideo-1.5
腾讯开源的领先轻量级视频生成模型,支持文本到视频和图像到视频的高质量生成。
- Stars: ⭐️ 4.4k
- Tags:
text-to-videovideo-generationimage-to-videogenerative-ai - 最后活动时间: 2026-04-10
lingbot-world
推进开源世界模型发展的项目,专注于视频生成与AIGC。
- Stars: ⭐️ 4.3k
- Tags:
world-modelsvideo-generationaigc - 最后活动时间: 2026-07-09
moyin-creator
AI影视生产级工具,支持Seedance 2.0,实现从剧本到成片的全流程批量化生产。
- Stars: ⭐️ 4.3k
- Tags:
视频生成影视制作AI工具 - 最后活动时间: 2026-07-15
html-video
面向编程代理的程序化视频生成工具,可将HTML、CSS和数据转换为真实的MP4视频。内置21个模板和可插拔渲染引擎,支持AI生成原声带。
- Stars: ⭐️ 4.2k
- Tags:
video-generationhtml-to-videoai-agentffmpeg - 最后活动时间: 2026-06-21
WebGazer
WebGazer.js 是一个可扩展的网页端眼动追踪库,通过用户交互和摄像头数据实现实时视线预测。
- Stars: ⭐️ 3.9k
- Tags:
eye-trackingwebcamjavascriptmachine-learning - 最后活动时间: 2026-02-24
ArcReel
AI Agent 驱动的开源视频生成工作台,支持从小说到视频的全流程自动化,实现跨镜头角色与场景一致性。
- Stars: ⭐️ 3.8k
- Tags:
ai-video-generatorai-agentstoryboardvideo-generationveo - 最后活动时间: 2026-08-02
pytorchvideo
Meta开源的视频理解深度学习库,提供视频分类、检测等预训练模型。
- Stars: ⭐️ 3.6k
- Tags:
video-understandingpytorchdeep-learningcomputer-vision - 最后活动时间: 2026-05-05
Ask-Anything
CVPR2024 Highlight项目,实现ChatGPT视频理解能力,支持miniGPT4、StableLM、MOSS等多种大语言模型。
- Stars: ⭐️ 3.3k
- Tags:
video-understandingmultimodalvideo-qa - 最后活动时间: 2026-07-17
flownet2-pytorch
FlowNet 2.0 PyTorch实现,用于深度学习光流估计。
- Stars: ⭐️ 3.3k
- Tags:
optical-flowcomputer-visionflownet - 最后活动时间: 2026-03-30
FireRed-OpenStoryline
AI视频编辑智能体,通过自然语言交互和LLM驱动的规划,实现意图驱动的导演式创作体验。
- Stars: ⭐️ 3.2k
- Tags:
Video EditingLLMLangChain - 最后活动时间: 2026-07-31
SysMocap
面向3D虚拟角色的实时动作捕捉系统,支持AR应用和VTuber动画制作。
- Stars: ⭐️ 3.2k
- Tags:
motion-capturevtuberaugmented-reality3d-animation - 最后活动时间: 2026-06-10
video-shotcraft
专为Claude Code和Codex设计的AI视频生成技能,提供上百种镜头配方和动态预览,结合Remotion生成电影级产品视频。
- Stars: ⭐️ 3.2k
- Tags:
ai-videoclaude-coderemotionvideo-generationai-agents - 最后活动时间: 2026-07-28
seedance2-skill
专为 Seedance 2.0 视频生成模型设计的提示词技能库,帮助用户创建高质量的视频生成提示词。
- Stars: ⭐️ 3.1k
- Tags:
promptvideo-generationseedanceai-video - 最后活动时间: 2026-02-18
GeminiWatermarkTool
VEO和Gemini Nano视频生成模型的水印维护工具,支持CLI和GUI界面操作。
- Stars: ⭐️ 3.0k
- Tags:
geminiveo3watermarkvideo-generation - 最后活动时间: 2026-07-28
HunyuanWorld-1.0
混元3D世界模型,从文本或像素生成沉浸式、可探索的交互3D世界。
- Stars: ⭐️ 2.9k
- Tags:
world-modeltext-to-3dscene-generationhunyuan3d - 最后活动时间: 2026-04-15
VideoPipe
跨平台视频结构化分析框架,支持目标检测、人脸识别、行为分析等多种AI能力。
- Stars: ⭐️ 2.9k
- Tags:
Video AnalysisComputer VisionDeepStream - 最后活动时间: 2026-02-25
printfilm
一个工业级的AI短剧和动态漫画生成平台,提供强大的视频工作台功能。
- Stars: ⭐️ 2.9k
- Tags:
aivideo-generationmotion-comicshort-film - 最后活动时间: 2026-06-04
seedance-prompt-skill
Seedance 2.0视频生成提示词技能,帮助用户快速生成高质量AI视频提示词。
- Stars: ⭐️ 2.6k
- Tags:
video-generationprompt-engineeringseedanceai-video - 最后活动时间: 2026-02-12
LightX2V
轻量级图像到视频生成推理框架,支持自回归扩散模型和多种视频生成模型的高效推理部署。
- Stars: ⭐️ 2.6k
- Tags:
Video GenerationDiffusionInference Framework - 最后活动时间: 2026-07-31
LongLive
LongLive 2.0 是一个专注于长视频生成的基础设施项目。它支持实时视频生成与并行处理。
- Stars: ⭐️ 2.5k
- Tags:
video-generationinfrareal-timenvfp4 - 最后活动时间: 2026-07-31
HY-Motion-1.0
用于3D人体动作和角色动画生成的AI模型,支持高质量运动合成。
- Stars: ⭐️ 2.5k
- Tags:
3d-motioncharacter-animationhuman-motiondeep-learning - 最后活动时间: 2026-07-18
HY-World-2.0
多模态世界模型,能够重建、生成和模拟3D世界,支持场景理解和物理仿真。
- Stars: ⭐️ 2.5k
- Tags:
world-model3d-generationmultimodalsimulation - 最后活动时间: 2026-05-27
ttt-video-dit
测试时训练实现一分钟视频生成,官方PyTorch实现。
- Stars: ⭐️ 2.4k
- Tags:
video-generationtest-time-trainingdiffusion - 最后活动时间: 2026-02-25
InternVideo
视频基础模型与多模态理解研究项目,支持动作识别、视频检索、问答等任务。
- Stars: ⭐️ 2.3k
- Tags:
video-understandingmultimodalfoundation-modelsvideo-retrieval - 最后活动时间: 2026-07-02
Matrix-Game
开源的实时流式交互世界模型,支持长视频生成和交互式视频应用。
- Stars: ⭐️ 2.3k
- Tags:
World ModelVideo GenerationInteractive - 最后活动时间: 2026-03-30
LiveAvatar
一种实时音频驱动的虚拟人生成方案,支持无限长度的流式输出。能够实现超低延迟的音视频同步驱动与渲染。
- Stars: ⭐️ 2.3k
- Tags:
real-timeavataraudio-drivenstreamingvideo-generation - 最后活动时间: 2026-07-26
awesome-seedance
Seedance 2.0 AI视频生成资源的精选合集,包含高质量提示词、API指南和高级视频生成工作流程。
- Stars: ⭐️ 2.2k
- Tags:
aivideo-generationseedanceprompt-engineering - 最后活动时间: 2026-08-01
REAL-Video-Enhancer
基于AI的视频增强工具,支持插帧、超分辨率、去噪和压缩修复,使用Real-ESRGAN和RIFE等模型。
- Stars: ⭐️ 2.2k
- Tags:
video-enhancementupscalinginterpolationreal-esrganrife - 最后活动时间: 2026-07-13
lyra
ICLR 2026论文,通过视频扩散模型自蒸馏实现3D场景重建。
- Stars: ⭐️ 2.2k
- Tags:
3d-reconstructionvideo-diffusiongenerative-model - 最后活动时间: 2026-07-20
VideoX-Fun
灵活的视频生成框架,支持任意分辨率视频生成及图像到视频转换。
- Stars: ⭐️ 2.2k
- Tags:
Video GenerationImage-to-VideoAI Framework - 最后活动时间: 2026-07-24
videoeditor
AI驱动的视频编辑创意助手,基于React和Remotion构建的开源视频编辑器。
- Stars: ⭐️ 2.2k
- Tags:
video-editorvideo-editingaireactremotiontypescript - 最后活动时间: 2026-06-09
ai4animationpy
基于神经网络的AI驱动角色动画框架,支持智能生成角色动作与运动序列。
- Stars: ⭐️ 2.1k
- Tags:
animationneural-networkscharacter-animationdeep-learning - 最后活动时间: 2026-07-26
kimodo
NVIDIA官方运动扩散模型,专注于生成高质量的人形角色动作序列。
- Stars: ⭐️ 2.0k
- Tags:
运动生成扩散模型角色动画 - 最后活动时间: 2026-04-15
Anime4KCPP
基于CNN的高性能动漫视频超分辨率放大工具,支持GPU加速和多种视频处理框架插件。
- Stars: ⭐️ 2.0k
- Tags:
UpscalingCNNVideo Processing - 最后活动时间: 2026-07-04
Helios
北大团队开源的实时长视频生成模型,支持文本/图像/视频到视频生成,具备世界模拟能力。
- Stars: ⭐️ 2.0k
- Tags:
视频生成扩散模型世界模型 - 最后活动时间: 2026-07-28
Seedance2-Storyboard-Generator
基于Seedance 2.0的AI剧本生成工具,可将小说故事一键转化为多集视频剧本。帮助创作者快速制作短剧内容。
- Stars: ⭐️ 2.0k
- Tags:
video-generationstoryboardai-script - 最后活动时间: 2026-06-19
tapnet
任意点追踪(TAP)深度学习模型,用于计算机视觉中的视频点跟踪任务。
- Stars: ⭐️ 2.0k
- Tags:
point-trackingcomputer-visiondeep-learningvideo - 最后活动时间: 2026-07-22
OminiControl
ICCV2025 Highlight,为Diffusion Transformer提供极简通用的控制方案。
- Stars: ⭐️ 1.9k
- Tags:
diffusion-transformercontrollable-generationminimal-control - 最后活动时间: 2026-07-02
awesome-talking-head-generation
数字人说话头像生成技术资源合集,涵盖人脸重演、图像动画、运动迁移等前沿方向。
- Stars: ⭐️ 1.9k
- Tags:
talking-headface-reenactmentimage-animationmotion-transferdeep-learning - 最后活动时间: 2026-04-27
claude-real-video
让 Claude 或任何大语言模型真正“看懂”视频的工具。支持场景感知、去重帧提取与转录,可处理本地或 URL 视频文件。
- Stars: ⭐️ 1.9k
- Tags:
videollmmultimodalclaudelocal - 最后活动时间: 2026-07-31
WhatDreamsCost-ComfyUI
包含LTX Director及多种ComfyUI自定义节点与工作流。专注于视频生成与创意AI工作流扩展。
- Stars: ⭐️ 1.9k
- Tags:
comfyuicustom-nodesvideo-generation - 最后活动时间: 2026-07-30
claude-code-video-toolkit
AI原生视频生产工具包,集成Claude Code、ElevenLabs、Qwen-TTS等,支持程序化视频编辑与生成。
- Stars: ⭐️ 1.9k
- Tags:
ai-video-generatorclaude-codevideo-productiontext-to-speechremotion - 最后活动时间: 2026-07-06
Code2Video
通过代码自动生成视频的工具,结合多智能体技术实现视频内容的自动化创作。
- Stars: ⭐️ 1.9k
- Tags:
Video GenerationMulti-AgentEducation - 最后活动时间: 2026-05-31
LTX-Desktop
开源桌面应用,用于使用LTX模型生成视频,支持非线性编辑功能。
- Stars: ⭐️ 1.8k
- Tags:
video-generationgenerative-ailtxdesktop-app - 最后活动时间: 2026-07-23
HunyuanVideo-I2V
腾讯混元推出的可定制图像到视频生成模型,基于扩散模型实现高质量视频生成,支持将静态图像转换为动态视频。
- Stars: ⭐️ 1.8k
- Tags:
Image-to-VideoDiffusion ModelsTencent - 最后活动时间: 2026-04-07
video-search-and-summarization
大规模视频检索与摘要蓝图,支持实时或存档视频的智能分析、摘要生成和交互式问答,结合LLM、RAG和VLM技术。
- Stars: ⭐️ 1.8k
- Tags:
video-searchvideo-summarizationragvlmllm - 最后活动时间: 2026-08-02
Auto-Synced-Translated-Dubs
自动翻译视频字幕并利用AI语音服务生成同步配音的工具,结合翻译、TTS与字幕时间轴同步技术实现一键视频配音。
- Stars: ⭐️ 1.7k
- Tags:
视频配音TTS字幕翻译 - 最后活动时间: 2026-05-11
awesome-seedance-2-prompts
Seedance 2.0视频生成提示词精选合集,包含500+电影、动漫、UGC、广告等风格提示词及API使用指南。
- Stars: ⭐️ 1.7k
- Tags:
ai-videovideo-generationprompt-engineeringseedance - 最后活动时间: 2026-08-01
ComfyUI-VideoHelperSuite
为ComfyUI提供视频工作流相关的自定义节点扩展。简化视频生成与处理流程。
- Stars: ⭐️ 1.7k
- Tags:
comfyuivideo-workflowcustom-nodes - 最后活动时间: 2026-05-14
VideoClaw
AI 全自动化视频生成智能体,通过对话即可生成完整视频作品。
- Stars: ⭐️ 1.7k
- Tags:
video-generationaigcmulti-agentttsimage-generation - 最后活动时间: 2026-07-17
SystemAnimatorOnline
基于AI的全身动作捕捉和扩展现实(XR)解决方案,支持VTuber和WebXR应用。
- Stars: ⭐️ 1.7k
- Tags:
motion-capturemediapipetensorflowjsthreejsvtuberwebxr - 最后活动时间: 2026-04-13
stable-virtual-camera
基于扩散模型的新视角合成生成模型,实现高质量视角生成。
- Stars: ⭐️ 1.6k
- Tags:
diffusion-modelnovel-view-synthesisgenerative-ai - 最后活动时间: 2026-03-03
JoyAI-VL-Interaction
一个开源的实时视频-语言交互系统,能够处理动态视频输入并实现智能对话交互。
- Stars: ⭐️ 1.6k
- Tags:
video-languagereal-timemultimodal - 最后活动时间: 2026-07-29
HunyuanWorld-Voyager
交互式RGBD视频生成模型,支持相机输入条件下的实时3D重建。
- Stars: ⭐️ 1.6k
- Tags:
world-modelimage-to-video3d-generationhunyuan3d - 最后活动时间: 2026-04-15
Video-Materials-AutoGEN-Workstation
集成内容策划、AI文案生成、TTS配音、图片合成、ASR字幕提取于一体的短视频生成工作站。
- Stars: ⭐️ 1.6k
- Tags:
video-generationttsai-contentasr - 最后活动时间: 2026-06-02
HY-WorldPlay
交互式世界建模系统框架,支持实时延迟和几何一致性的3D世界生成。
- Stars: ⭐️ 1.6k
- Tags:
world-model3d-generationhunyuanimage-to-3d - 最后活动时间: 2026-06-10
narrator-ai-cli-skill
AI 视频解说技能封装,支持 Claude/Codex 等工具调用,可自动生成短视频解说内容。
- Stars: ⭐️ 1.6k
- Tags:
claude-code-skillai-videonarrationagent-skills - 最后活动时间: 2026-07-05
Awesome-Talking-Head-Synthesis
数字人说话头像生成领域的精选资源合集,涵盖音频驱动的人脸合成、论文及实现方法。
- Stars: ⭐️ 1.5k
- Tags:
talking-headaudio-drivenface-synthesisvideo-generation - 最后活动时间: 2026-05-20
video-podcast-maker
AI驱动的视频播客创作工具,支持Bilibili和YouTube平台,集成6种TTS引擎,支持中英双语及4K Remotion渲染。
- Stars: ⭐️ 1.5k
- Tags:
ai-videottsvideo-podcastremotionclaude-code-skill - 最后活动时间: 2026-08-01
capcut-mate
开源剪映自动化工具包,支持生成和下载草稿文件,可作为Coze插件使用。
- Stars: ⭐️ 1.5k
- Tags:
capcutvideo-automationcozejianying - 最后活动时间: 2026-08-02
py-motmetrics
多目标跟踪(MOT)评估工具,提供CLEAR-MOT等标准指标的Python实现。
- Stars: ⭐️ 1.5k
- Tags:
object-trackingmotbenchmarkcomputer-vision - 最后活动时间: 2026-07-17
DepthFlow
基于深度估计的图像转3D视差视频工具,可将静态图片转换为沉浸式动态效果。
- Stars: ⭐️ 1.5k
- Tags:
depth-estimationparallaximage-to-video3d-effect - 最后活动时间: 2026-07-19
deep-printfilm
AI驱动的短剧与动态漫画生成平台,提供工业级视频创作工作台。
- Stars: ⭐️ 1.5k
- Tags:
aivideo-generationmotion-comic - 最后活动时间: 2026-05-07
MotionBERT
ICCV 2023论文实现,用于学习人体运动表示的统一框架,支持3D姿态估计、骨骼动作识别等任务。
- Stars: ⭐️ 1.4k
- Tags:
motion-analysis3d-pose-estimationtransformercomputer-vision - 最后活动时间: 2026-03-14
GEN3C
CVPR 2025 Highlight论文,实现3D感知的世界一致性视频生成,支持精确相机控制,是视频生成领域的前沿研究。
- Stars: ⭐️ 1.4k
- Tags:
video-generation3d-awarecamera-controldiffusion-modelcvpr2025 - 最后活动时间: 2026-06-15
ai-moive-studio
AI电影生成工作流Agent,输入剧本即可自动完成分镜生成、画面与音频素材生成、视频合成全流程,让个人创作者也能制作电影级作品。
- Stars: ⭐️ 1.4k
- Tags:
AI视频电影生成工作流Agent - 最后活动时间: 2026-04-06
MagicTime
基于扩散模型的延时视频生成模型,能够模拟物体随时间变化的形态演变。
- Stars: ⭐️ 1.3k
- Tags:
text-to-videodiffusion-modelsvideo-generation - 最后活动时间: 2026-04-14
Fast-FoundationStereo
一种快速的基础立体匹配模型,可实现实时零样本立体匹配。该论文提出了高效的深度估计方案。
- Stars: ⭐️ 1.3k
- Tags:
stereo-matchingdepth-estimationcomputer-visionreal-time - 最后活动时间: 2026-05-26
Tora
CVPR2025论文,面向轨迹的视频生成Diffusion Transformer,实现精确运动控制。
- Stars: ⭐️ 1.2k
- Tags:
video-generationdiffusion-transformertrajectory-control - 最后活动时间: 2026-07-27
ai_story
AI视频、动漫、短剧自动化生成工具,支持AI漫剧内容创作。
- Stars: ⭐️ 1.2k
- Tags:
ai-videoai-animationvideo-generationai-storytelling - 最后活动时间: 2026-07-31
BigBanana-AI-Director
工业级 AI 短剧/漫剧导演平台,实现从剧本到成片的全自动化生产,精准控制角色一致性与镜头运动。
- Stars: ⭐️ 1.2k
- Tags:
ai-videoai-short-dramaai-comicvideo-generation - 最后活动时间: 2026-04-15
Bernini
统一视频生成与编辑框架,结合多模态大语言模型语义规划器和扩散变换器渲染器。
- Stars: ⭐️ 1.2k
- Tags:
video-generationvideo-editingmllmdit - 最后活动时间: 2026-07-13
EvTexture
ICML 2024 & TPAMI 2026 论文实现,利用事件相机驱动视频超分辨率纹理增强,显著提升视频质量。
- Stars: ⭐️ 1.2k
- Tags:
video-super-resolutionevent-camerapytorchcomputational-photography - 最后活动时间: 2026-06-11
SoulX-LiveAct
实时人体动画生成推理代码,支持小时级别动画生成。
- Stars: ⭐️ 1.2k
- Tags:
human-animationvideo-generationreal-time - 最后活动时间: 2026-06-15
handcrafted-persona-engine
AI 驱动的交互式虚拟形象引擎,集成 Live2D、LLM、ASR、TTS 和 RVC,适合 VTuber 和虚拟助手应用。
- Stars: ⭐️ 1.2k
- Tags:
ai-vtuberlive2davatarttsasr - 最后活动时间: 2026-04-23
torchcodec
PyTorch媒体编解码库,提供视频和音频的解码与编码功能。
- Stars: ⭐️ 1.2k
- Tags:
pytorchvideoaudiocodecmedia-processing - 最后活动时间: 2026-08-01
SoraWatermarkCleaner
基于深度学习的高质量Sora2视频水印清理工具。能够快速且无损地去除视频生成水印。
- Stars: ⭐️ 1.2k
- Tags:
deep-learningvideo-processingwatermark-removalsora - 最后活动时间: 2026-04-14
OC_SORT
CVPR2023多目标跟踪算法,对遮挡和非线性运动具有强鲁棒性,简单高效的在线跟踪方案。
- Stars: ⭐️ 1.1k
- Tags:
object-trackingcomputer-visiondeep-learningtracking - 最后活动时间: 2026-04-21
ai-fusion-video
基于Agent的全流程AI短剧/漫剧/视频创作平台,支持自动化视频内容生成。
- Stars: ⭐️ 1.1k
- Tags:
video-generationagentsautomationcreative - 最后活动时间: 2026-08-01
cosmos-predict2.5
NVIDIA Cosmos 世界基础模型,专注于通过视频形式模拟和预测世界未来状态。
- Stars: ⭐️ 1.1k
- Tags:
world-modelsvideo-generationfoundational-models - 最后活动时间: 2026-04-17
hamer
基于Transformer的3D手部重建模型,实现高精度手部姿态估计与重建。
- Stars: ⭐️ 1.1k
- Tags:
3d-reconstructionhand-posetransformercomputer-vision - 最后活动时间: 2026-02-07
MOVA
面向可扩展的同步视频-音频生成模型,基于扩散模型实现高质量多模态内容生成。
- Stars: ⭐️ 1.1k
- Tags:
Video GenerationAudio GenerationMultimodal - 最后活动时间: 2026-07-31
bmf
字节跳动开源的跨平台多媒体处理框架,支持GPU加速、AI推理、转码和直播视频流处理。
- Stars: ⭐️ 1.0k
- Tags:
视频处理AI推理跨平台 - 最后活动时间: 2026-03-19
SCAIL
CVPR 2026论文,通过上下文学习实现工作室级别的角色动画生成。
- Stars: ⭐️ 1.0k
- Tags:
character-animationvideo-generationin-context-learningpose-estimation - 最后活动时间: 2026-05-06
StoryToolkitAI
AI驱动的视频编辑工具,集成ChatGPT实现转录、内容理解和智能搜索功能。
- Stars: ⭐️ 1.0k
- Tags:
aichatgptvideo-processingspeech-recognitionediting - 最后活动时间: 2026-07-28
SpaTrackerV2
ICCV 2025论文,简化高效的3D点追踪方法,适用于视频理解和重建任务。
- Stars: ⭐️ 986
- Tags:
3d-trackingpoint-trackingcomputer-visionvideo-understanding - 最后活动时间: 2026-02-27
segment-anything-video
MetaSeg是Segment Anything的封装版本,支持视频目标分割,集成YOLO系列检测器。
- Stars: ⭐️ 984
- Tags:
segment-anythingvideo-segmentationobject-detectionyolo - 最后活动时间: 2026-07-27
brainrot.js
文本转视频生成器,可将任意主题转化为流行风格的短视频内容。支持多种个性化风格,适合快速创作教育或娱乐内容。
- Stars: ⭐️ 956
- Tags:
Text-to-VideoChatGPTContent Generation - 最后活动时间: 2026-04-25
EGVSR
高效通用的视频超分辨率框架,支持实时视频增强处理。
- Stars: ⭐️ 952
- Tags:
video-super-resolutionreal-timevideo-enhancement - 最后活动时间: 2026-03-25
SoulX-FlashHead
一个统一的13亿参数框架,专为高保真、无限长度和实时流媒体肖像视频生成而设计。支持高质量的实时流媒体人物视频生成。
- Stars: ⭐️ 933
- Tags:
Portrait-GenerationStreaming-VideoReal-timeGenerative-AI - 最后活动时间: 2026-05-28
gbro-collage-broll
利用Gemini大模型生成半调纸拼贴风格B-roll视频的智能体技能工具。支持三闸门审批机制和首尾帧动画组装。
- Stars: ⭐️ 919
- Tags:
agent-skillbrollgeminivideo-generationpaper-collage - 最后活动时间: 2026-07-15
generative-manim
基于GPT的视频生成工具,利用Manim将文本提示转换为动画视频,支持Streamlit界面。
- Stars: ⭐️ 901
- Tags:
gpt-4manimvideo-generationanimationstreamlit - 最后活动时间: 2026-07-26
Causal-Forcing
自回归扩散蒸馏方案,实现高质量实时交互式视频生成。
- Stars: ⭐️ 893
- Tags:
diffusion-modelsvideo-generationautoregressive - 最后活动时间: 2026-07-23
JoyVASA
基于扩散模型的人物与动物动画生成工具,支持音频驱动的说话头像生成。
- Stars: ⭐️ 876
- Tags:
audio-driventalking-headportrait-animationdiffusion - 最后活动时间: 2026-04-16
lumenx
LumenX Studio 是一个 AI 短漫剧一站式生产平台,能够将小说文本转化为动态视频。它打通了从剧本分析、角色定制、分镜绘制到视频合成的完整创作链路。
- Stars: ⭐️ 876
- Tags:
AIVideo GenerationText-to-VideoComicCreative Apps - 最后活动时间: 2026-07-13
pireel
开源的无后端 AI 视频编辑器,专为数字人视频设计,支持故事板、动态字幕及浏览器内导出。可通过 MCP 协议被任意 AI Agent 驱动。
- Stars: ⭐️ 873
- Tags:
ai-videovideo-editortalking-headmcpwebcodecs - 最后活动时间: 2026-08-01
VisoMaster-Fusion
强大易用的视频人脸替换与编辑软件,支持AI驱动的面部交换和视频处理功能。
- Stars: ⭐️ 863
- Tags:
face-swapcomputer-visionvideo-editingdeepfake - 最后活动时间: 2026-07-27
YumCut
免费AI视频生成器,可将文本提示转换为适合TikTok、Reels和YouTube Shorts的竖屏视频。支持自动脚本、场景、配音、字幕生成,本地优先且支持多语言输出。
- Stars: ⭐️ 839
- Tags:
ai-video-generatorshortstiktokffmpegnextjs - 最后活动时间: 2026-07-20
ConsisID
CVPR 2025 Highlight项目,通过频率分解实现身份保持的文本到视频生成。
- Stars: ⭐️ 837
- Tags:
Text-to-VideoIdentity PreservingDiffusion - 最后活动时间: 2026-04-14
DiT-Extrapolation
视频扩散Transformer的长度外推方法,支持长视频生成和位置嵌入优化。
- Stars: ⭐️ 820
- Tags:
diffusion-transformervideo-generationposition-embedding - 最后活动时间: 2026-06-06
kandinsky-5
Kandinsky 5.0 扩散模型,支持高质量的视频与图像生成。
- Stars: ⭐️ 802
- Tags:
diffusiontext-to-videoimage-generation - 最后活动时间: 2026-07-05
VideoWorld
CVPR 2025 论文项目,一种从无标注视频中学习的生成模型,模拟婴儿通过观察环境学习的方式。
- Stars: ⭐️ 793
- Tags:
video-generationgenerative-modelself-supervised-learningcvpr2025 - 最后活动时间: 2026-02-25
Text-To-Video-AI
利用AI技术实现文本到视频生成的工具集合。
- Stars: ⭐️ 791
- Tags:
text-to-videoai-video-generatorvideo-generation - 最后活动时间: 2026-07-21
rcm
用于双向/自回归视频扩散模型蒸馏的领先统一算法与基础设施,支持大规模实时流视频生成。
- Stars: ⭐️ 777
- Tags:
video-generationdiffusiondistillationautoregressiveworld-models - 最后活动时间: 2026-06-25
mamma
无标记多人动作捕捉与3D人体重建的官方代码库。基于深度学习与PyTorch实现高精度人体姿态估计。
- Stars: ⭐️ 751
- Tags:
computer-visiondeep-learninghuman-pose-estimationpytorchmotion-capture - 最后活动时间: 2026-07-10
pose2sim
基于任意摄像头的无标记运动捕捉系统,从2D姿态估计到3D OpenSim运动学分析。
- Stars: ⭐️ 747
- Tags:
pose-estimationmotion-capture3d-kinematicsbiomechanics - 最后活动时间: 2026-07-30
comfy_mtb
面向动画制作的ComfyUI节点扩展包,支持人脸替换和插值功能。
- Stars: ⭐️ 722
- Tags:
comfyuianimationfaceswapstable-diffusion - 最后活动时间: 2026-07-04
ComfyUI_Yvann-Nodes
ComfyUI音频响应节点插件,支持创建AI生成的音频驱动动画,让静态图像随音乐节奏律动。
- Stars: ⭐️ 704
- Tags:
comfyuiaudio-reactivevideo-generationanimation - 最后活动时间: 2026-02-21
AlayaRenderer
一款面向游戏和虚拟世界的AI原生生成式渲染器。结合扩散模型与神经渲染技术,实现高质量的虚拟世界视频生成。
- Stars: ⭐️ 704
- Tags:
diffusion-modelneural-renderinggame-renderingvideo-generation - 最后活动时间: 2026-05-05
MoCha
端到端视频角色替换系统,无需结构引导即可实现高质量视频人物替换。
- Stars: ⭐️ 701
- Tags:
VideoCharacter ReplacementEnd-to-End - 最后活动时间: 2026-03-02
Sparse-VideoGen
通过稀疏注意力机制加速视频扩散Transformer的创新方法,显著提升视频生成效率。ICML 2025和NeurIPS 2025 Spotlight论文。
- Stars: ⭐️ 698
- Tags:
Video GenerationDiffusion ModelSparse AttentionEfficient ML - 最后活动时间: 2026-07-04
SparkVSR
基于稀疏关键帧传播的交互式视频超分辨率工具,利用AI实现高质量视频增强和修复。
- Stars: ⭐️ 692
- Tags:
video-super-resolutiongenerative-aivideo-processingvlm - 最后活动时间: 2026-07-29
reveal.js
结合网络摄像头手势识别技术的 reveal.js 演示工具,允许用户通过手势控制幻灯片。
- Stars: ⭐️ 692
- Tags:
gesture-recognitionwebcampresentationreveal-js - 最后活动时间: 2026-02-03
infinite-zoom-automatic1111-webui
AUTOMATIC1111 WebUI的无限缩放效果扩展,支持文生视频创作。
- Stars: ⭐️ 670
- Tags:
stable-diffusionautomatic1111infinite-zoomanimation - 最后活动时间: 2026-02-08
DreamID-V
基于扩散Transformer的高保真视频换脸方法,实现图像到视频的跨模态生成。
- Stars: ⭐️ 668
- Tags:
face-swappingdiffusion-transformervideo-generation - 最后活动时间: 2026-05-22
mpv-upscale-2x_animejanai
基于 Real-ESRGAN 模型的实时动漫视频超分辨率工具,可在 mpv 播放器中将动漫视频实时放大至 4K。
- Stars: ⭐️ 652
- Tags:
real-esrgansuper-resolutionanime-upscalingtensorrtvideo - 最后活动时间: 2026-04-18
vidi
Vidi 大型多模态模型官方仓库,专注于视频理解与编辑任务。
- Stars: ⭐️ 646
- Tags:
video-understandingvideo-editingmultimodal-llm - 最后活动时间: 2026-03-04
forge-film
基于DAG驱动的多模型并行AI电影生成引擎,利用关键路径法(CPM)实现场景并行调度,大幅提升生成效率。
- Stars: ⭐️ 646
- Tags:
ai-video-generationtext-to-videodag-schedulingmulti-modal - 最后活动时间: 2026-03-26
MiKaPo
基于MediaPipe的实时网页端MMD动作捕捉系统。利用姿态估计技术实现流畅的3D模型驱动。
- Stars: ⭐️ 631
- Tags:
mediapipemmdmotion-capturepose-estimationnextjs - 最后活动时间: 2026-07-31
heartbeat
基于远程光电容积描记术(rPPG)的桌面应用,能够通过分析面部视频来非接触式测量心率。利用视频处理与计算机视觉技术实现生命体征的远程监测。
- Stars: ⭐️ 622
- Tags:
rppgheart-ratevideo-processingcomputer-visionremote-sensing - 最后活动时间: 2026-03-02
Ditto
基于高质量合成数据集的指令驱动视频编辑方法,利用扩散模型实现精准视频编辑。
- Stars: ⭐️ 617
- Tags:
Video EditingDiffusion ModelsSynthetic Data - 最后活动时间: 2026-06-01
Diffuman4D
ICCV 2025论文实现,利用时空扩散模型从稀疏视角视频生成4D一致性人体视图合成。
- Stars: ⭐️ 617
- Tags:
4d-synthesisdiffusionhuman-avatarnovel-view-synthesis - 最后活动时间: 2026-04-10
sleap
多动物姿态追踪深度学习框架,支持行为分析和姿态估计,广泛应用于神经科学和动物行为研究。
- Stars: ⭐️ 606
- Tags:
pose-estimationdeep-learninganimal-trackingcomputer-vision - 最后活动时间: 2026-07-31
UniScene-Unified-Occupancy-centric-Driving-Scene-Generation
UniScene 是一个统一的以占用为中心的驾驶场景生成框架,发表于 CVPR 2025 和 TPAMI。该项目在自动驾驶场景生成领域具有重要的研究价值。
- Stars: ⭐️ 603
- Tags:
autonomous-drivingscene-generationoccupancy-predictioncomputer-vision - 最后活动时间: 2026-05-24
DigiHuman
使用姿态估计和地标生成技术实现3D角色自动动画化。
- Stars: ⭐️ 579
- Tags:
3d-animationpose-estimationdigital-humanunity - 最后活动时间: 2026-05-05
MotionStream
支持交互式动作控制的实时视频生成框架。允许用户在生成过程中动态调整视频运动轨迹。
- Stars: ⭐️ 576
- Tags:
video-generationreal-timemotion-controlgenerative-ai - 最后活动时间: 2026-03-01
video-production-skills
可复用的AI视频制作技能库,涵盖视频创作、重现、动态设计及质量保证等功能。
- Stars: ⭐️ 573
- Tags:
aivideo-productionmotion-designskills - 最后活动时间: 2026-07-14
awesome-ltx2
汇集了所有可用的 LTX-2 模型、编码器、工作流和 LoRA,专为 ComfyUI 打造。提供高效的文本到视频生成解决方案。
- Stars: ⭐️ 569
- Tags:
aicomfyuiltx-2loravideo-ai - 最后活动时间: 2026-07-31
Magic-TryOn
基于大规模视频扩散Transformer的视频虚拟试穿框架,支持高质量服装替换与视频编辑。
- Stars: ⭐️ 568
- Tags:
virtual-tryonvideo-diffusiontransformervideo-editing - 最后活动时间: 2026-04-30
ai-shortVideo-pipeline
端到端AI短视频制作管线,集成多模型故障转移、断路器机制与AI质量门控。
- Stars: ⭐️ 566
- Tags:
ai-pipelinevideo-generationmulti-modelfastapi - 最后活动时间: 2026-06-15
ComfyUI-Wan22FMLF
一个用于 ComfyUI 的实验性自定义节点,旨在集成和扩展视频生成模型的工作流。
- Stars: ⭐️ 566
- Tags:
comfyuicustom-nodesvideo-generationai-workflow - 最后活动时间: 2026-02-09
flowkit
AI智能体驱动的视频内容创作工具,旨在自动化并优化手动视频制作流程。
- Stars: ⭐️ 560
- Tags:
ai-agentsvideo-generationcontent-creation - 最后活动时间: 2026-07-04
openclip
AI驱动的长视频精彩时刻自动提取工具,大幅提升视频剪辑效率。利用大语言模型智能识别并提取视频高光片段。
- Stars: ⭐️ 544
- Tags:
aivideo-processingllmauto-highlight - 最后活动时间: 2026-05-19
ffmpeg-sidecar
FFmpeg Rust封装库,提供直观的迭代器接口,简化视频音频处理流程,适用于多模态AI系统的媒体预处理与后处理。
- Stars: ⭐️ 529
- Tags:
ffmpegvideo-processingaudio-processingrust - 最后活动时间: 2026-05-02
genblaze
用于编排生成式AI媒体管道的开源Python SDK,支持跨视频、音频和图像提供商并内置输出溯源功能。
- Stars: ⭐️ 524
- Tags:
generative-aiai-pipelinepythonvideo-generationaudio-generation - 最后活动时间: 2026-08-02
twick
基于 React 构建的 AI 视频编辑器 SDK,支持画布时间轴、拖拽编辑、AI 字幕生成和无服务器 MP4 导出。
- Stars: ⭐️ 522
- Tags:
ai-video-editorreactsdkai-captionsvideo-editing - 最后活动时间: 2026-06-04
Orkas-VideoStudio
将编码智能体转化为视频工作室的开源工具。通过自然语言描述视频,由 AI 智能体自动编写时间线并生成最终视频文件。
- Stars: ⭐️ 518
- Tags:
ai-agentsai-videogenerative-aimcp-servertext-to-video - 最后活动时间: 2026-07-29
DVR-Scan
一款基于OpenCV的视频动态场景提取工具,能够智能识别并提取监控录像中的移动画面。适用于安防监控和DVR录像的自动化分析。
- Stars: ⭐️ 512
- Tags:
opencvvideo-processingmotion-detectionpython - 最后活动时间: 2026-07-22
StereoCrafter
一个强大的框架,能够将任何普通的2D视频转换为沉浸式的立体3D视频。
- Stars: ⭐️ 508
- Tags:
3d-videostereoscopicvideo-generationdepth-estimation - 最后活动时间: 2026-05-27
AlayaRenderer
面向游戏与虚拟世界的AI原生渲染引擎,基于扩散模型实现神经渲染和视频生成。
- Stars: ⭐️ 507
- Tags:
neural-renderingdiffusion-modelvideo-generationgame-renderingai-renderer - 最后活动时间: 2026-05-05
free-ai-video-upscaler
一款免费且开源的AI视频画质提升工具,利用WebGPU和WebCodecs技术实现高效的视频增强处理。
- Stars: ⭐️ 504
- Tags:
upscalingvideo-enhancementwebcodecswebglwebgpu - 最后活动时间: 2026-05-20
未分类 (Others)
mediapipe
Google开源的跨平台机器学习框架,提供人脸检测、手势识别、姿态估计等实时ML解决方案,支持多平台部署。
- Stars: ⭐️ 36.4k
- Tags:
计算机视觉机器学习跨平台 - 最后活动时间: 2026-07-31
sharp
高性能Node.js图像处理库,适用于多模态AI图像预处理
- Stars: ⭐️ 32.5k
- Tags:
image-processingnodejsperformance - 最后活动时间: 2026-07-21
moondream
轻量级视觉语言模型,专为边缘设备优化部署设计。
- Stars: ⭐️ 9.6k
- Tags:
VLMTiny ModelEdge AI - 最后活动时间: 2026-04-20
minimind-v
1小时从零训练26M参数视觉多模态VLM的轻量级框架,适合快速入门和学习VLM架构原理。
- Stars: ⭐️ 8.4k
- Tags:
VLM多模态训练框架 - 最后活动时间: 2026-06-28
GLM-OCR
基于GLM的高精度OCR模型,支持快速全面的文字识别能力。
- Stars: ⭐️ 7.2k
- Tags:
ocrglmimage-to-textdeep-learning - 最后活动时间: 2026-04-21
pytesseract
Google Tesseract OCR的Python封装库,提供强大的光学字符识别能力,支持多种语言和图片格式。
- Stars: ⭐️ 6.3k
- Tags:
ocrtesseractcomputer-visionpython - 最后活动时间: 2026-05-25
Bagel
开源统一多模态模型,支持多种模态的理解与生成任务。
- Stars: ⭐️ 6.1k
- Tags:
Multimodal ModelOpen SourceUnified Model - 最后活动时间: 2026-05-04
PySceneDetect
基于OpenCV的视频场景检测工具,自动识别视频中的转场与切割点。
- Stars: ⭐️ 5.1k
- Tags:
video-processingscene-detectionopencv - 最后活动时间: 2026-07-23
LightGlue
ICCV 2023论文实现,轻量级局部特征匹配模型,实现高速图像匹配与姿态估计。
- Stars: ⭐️ 4.7k
- Tags:
Image MatchingComputer VisionDeep Learning - 最后活动时间: 2026-02-18
SpatialLM
NeurIPS 2025论文,专注于训练大语言模型进行室内场景结构化建模,融合点云与空间智能技术。
- Stars: ⭐️ 4.7k
- Tags:
mllmpoint-cloudsscene-understandingspatial-intelligence - 最后活动时间: 2026-06-26
VILA
NVIDIA推出的前沿视觉语言模型家族,支持边缘设备、数据中心和云端的多模态AI任务。
- Stars: ⭐️ 3.8k
- Tags:
vision-language-modelmultimodalvlm - 最后活动时间: 2026-03-12
OpenSfM
开源的三维重建流水线库,用于从图像序列中恢复相机位姿和三维结构。
- Stars: ⭐️ 3.8k
- Tags:
sfm3d-reconstructionphotogrammetry - 最后活动时间: 2026-07-13
TransUNet
医学图像分割Transformer模型,将Transformer作为编码器用于医学影像分析。
- Stars: ⭐️ 3.2k
- Tags:
medical-imagingsegmentationtransformer - 最后活动时间: 2026-02-25
Pix2Text
开源Python工具,支持布局分析、表格、数学公式(LaTeX)和文字识别,输出Markdown格式。
- Stars: ⭐️ 3.2k
- Tags:
ocrmath-formulatable-recognitionmarkdown - 最后活动时间: 2026-02-07
Segment-and-Track-Anything
开源视频目标分割与跟踪工具,结合SAM和AOT实现交互式视频对象分割。
- Stars: ⭐️ 3.1k
- Tags:
segment-anythingvideo-segmentationobject-trackingsam - 最后活动时间: 2026-07-03
GLM-V
智谱GLM系列多模态推理模型,通过可扩展强化学习实现通用多模态推理能力。
- Stars: ⭐️ 2.4k
- Tags:
vlmmultimodalreasoningvideo-understanding - 最后活动时间: 2026-07-21
perception_models
最先进的图像与视频CLIP模型及多模态大语言模型集合。
- Stars: ⭐️ 2.3k
- Tags:
multimodalclipvision-languagellm - 最后活动时间: 2026-04-13
deepseek-ocr.rs
Rust多后端OCR/VLM引擎,支持DeepSeek-OCR、PaddleOCR-VL等模型,提供OpenAI兼容服务器和CLI,无需Python即可本地运行。
- Stars: ⭐️ 2.2k
- Tags:
ocrvlmdeepseekrustopenai-compatible - 最后活动时间: 2026-02-21
RAE
扩散Transformer与表示自编码器的官方PyTorch实现,用于高质量图像生成。
- Stars: ⭐️ 2.0k
- Tags:
diffusiontransformerautoencoder - 最后活动时间: 2026-02-25
4D-Humans
基于Transformer的4D人体重建与跟踪方法,用于动态人体运动捕捉。
- Stars: ⭐️ 1.7k
- Tags:
3d-reconstructionhuman-posetransformer - 最后活动时间: 2026-02-07
HealthGPT
ICML 2025 Spotlight医学视觉语言模型,统一理解与生成能力。
- Stars: ⭐️ 1.6k
- Tags:
Medical AIVLMHealthcare - 最后活动时间: 2026-07-31
Rex-Omni
CVPR2026论文项目,基于下一帧点预测实现通用目标检测,结合MLLM实现开放集检测能力。
- Stars: ⭐️ 1.5k
- Tags:
mllmobject-detectionopen-setcomputer-vision - 最后活动时间: 2026-02-22
Retinexformer
ICCV 2023论文,基于Retinex理论的单阶段Transformer低光照图像增强方法。
- Stars: ⭐️ 1.5k
- Tags:
low-light-enhancementtransformerimage-restoration - 最后活动时间: 2026-05-23
Awesome_Think_With_Images
大型视觉语言模型(LVLM)视觉思维资源与论文清单,涵盖如何利用视觉信息进行复杂推理、规划和生成的研究综述。
- Stars: ⭐️ 1.5k
- Tags:
large-vision-language-modelsmultimodal-reasoningvisual-reasoningLVLM - 最后活动时间: 2026-03-09
Ovis
新颖的多模态大语言模型架构,通过结构化设计实现视觉与文本嵌入对齐,支持Llama3和Qwen等主流模型。
- Stars: ⭐️ 1.5k
- Tags:
MultimodalVision-Language ModelMLLM - 最后活动时间: 2026-02-11
PointLLM
ECCV 2024最佳论文候选,赋能大语言模型理解3D点云数据的多模态模型。
- Stars: ⭐️ 1.0k
- Tags:
Point CloudMultimodalLLM3D - 最后活动时间: 2026-05-15
superpoint_transformer
ICCV'23和3DV'24 Oral论文官方实现,用于高效3D语义分割和全景分割的超点Transformer。
- Stars: ⭐️ 1.0k
- Tags:
3dpoint-cloudsemantic-segmentationtransformer - 最后活动时间: 2026-04-21
Hulu-Med
面向整体医学视觉语言理解的透明通用模型。
- Stars: ⭐️ 1.0k
- Tags:
medical-aivision-language-modelmultimodal - 最后活动时间: 2026-06-16
MocapNET
实时3D人体姿态估计系统,从单目RGB图像直接生成BVH格式的动作捕捉数据,支持显著遮挡情况下的姿态恢复。
- Stars: ⭐️ 947
- Tags:
Pose EstimationComputer Vision3D AnimationTensorFlow - 最后活动时间: 2026-04-23
MultimodalOCR
研究大型多模态模型中OCR能力的隐藏奥秘,提供OCRBench基准测试。
- Stars: ⭐️ 873
- Tags:
OCRMultimodalBenchmark - 最后活动时间: 2026-07-22
Face-X
面部识别算法与操作演示集合,涵盖人脸检测、识别、动画等多种技术。
- Stars: ⭐️ 851
- Tags:
face-recognitionopencvdeep-learning - 最后活动时间: 2026-02-15
molmo2
Molmo2是由Allen AI研究所开发的开源视觉-语言模型,支持图像理解、视觉问答等多模态任务,性能优异。
- Stars: ⭐️ 701
- Tags:
vision-language-modelmultimodalopen-sourcevlm - 最后活动时间: 2026-03-18
OmniVinci
全模态大语言模型,支持视觉、音频和语言的联合理解。
- Stars: ⭐️ 675
- Tags:
multimodalvision-language-modelaudio-language-model - 最后活动时间: 2026-02-26
VLM2Vec
ICLR 2025论文,训练视觉语言模型用于大规模多模态嵌入任务。
- Stars: ⭐️ 670
- Tags:
embeddingvision-language-modelmultimodal - 最后活动时间: 2026-07-24
Vision-DeepResearch
首个长周期多模态深度研究MLLM,支持数十轮推理和数百次搜索引擎交互。
- Stars: ⭐️ 659
- Tags:
multimodaldeep-researchreasoningbenchmark - 最后活动时间: 2026-06-08
Multimodal-Toolkit
基于HuggingFace Transformers的多模态工具包,支持文本和表格数据的联合建模。
- Stars: ⭐️ 619
- Tags:
multimodal-learningtransformerstabular-datahuggingface - 最后活动时间: 2026-05-04
Q-Align
ICML2024论文,视觉评分一体化基础模型,支持图像质量评估(IQA)、美学评估(IAA)和视频质量评估(VQA),可高效微调至下游数据集。
- Stars: ⭐️ 611
- Tags:
IQAVQAAestheticICML2024 - 最后活动时间: 2026-06-24
Emotion-LLaMA
基于指令微调的多模态情感识别与推理模型,能够理解和分析图像中的情感表达。
- Stars: ⭐️ 608
- Tags:
Emotion RecognitionMultimodal LLMInstruction Tuning - 最后活动时间: 2026-07-23
mvdust3r
Meta Reality Labs开源的MV-DUSt3R实现,可在2秒内从稀疏视图完成单阶段场景重建,支持3D视觉与深度学习应用。
- Stars: ⭐️ 587
- Tags:
3d-reconstructioncomputer-visiondeep-learningscene-understanding - 最后活动时间: 2026-04-20
cambrian-s
面向视频空间超感知的视觉语言模型,实现视频场景的深度空间理解。
- Stars: ⭐️ 564
- Tags:
视频理解空间感知多模态 - 最后活动时间: 2026-04-03
Senna
连接大型视觉语言模型与端到端自动驾驶的桥梁项目。
- Stars: ⭐️ 550
- Tags:
autonomous-drivingvision-language-modelend-to-end - 最后活动时间: 2026-03-15
Live-Video-Magnification
基于欧拉视频放大算法的实时应用,可放大视频中的微小运动与颜色变化。
- Stars: ⭐️ 538
- Tags:
video-magnificationeulerianopencv - 最后活动时间: 2026-08-01
GPT4Scene-and-VLN-R1
利用视觉语言模型从视频中理解3D场景的研究项目,结合VLN导航任务实现场景理解。
- Stars: ⭐️ 531
- Tags:
vision-language-models3d-scene-understandingvideo-understandingvln - 最后活动时间: 2026-03-02
opennsfw2
Yahoo Open-NSFW 模型的 Keras 实现,用于检测图像中的不雅内容,支持 TensorFlow2 和 JAX 后端。
- Stars: ⭐️ 524
- Tags:
image-classificationnsfw-detectionkerastensorflowcontent-moderation - 最后活动时间: 2026-05-05
