Skip to content

👁️ 多模态与音视频

Computer vision, image generation, audio, text-to-speech.

当前分类已收录 1098 个相关项目。

Audio & Speech (TTS/STT)

whisper

OpenAI推出的开源语音识别大模型,通过大规模弱监督学习实现高鲁棒性的多语言语音转文本。

  • Stars: ⭐️ 109.2k
  • Tags: speech-recognition whisper openai stt
  • 最后活动时间: 2026-08-31

GPT-SoVITS

少样本语音克隆TTS模型,仅需1分钟语音数据即可训练高质量语音合成模型。

  • Stars: ⭐️ 61.8k
  • Tags: TTS Voice Cloning Few-shot
  • 最后活动时间: 2026-08-18

voicebox

开源语音合成工作室,支持语音克隆和文本转语音,提供可视化界面操作。

  • Stars: ⭐️ 54.6k
  • Tags: voice-ai voice-clone tts whisper
  • 最后活动时间: 2026-08-09

VibeVoice

开源的前沿语音AI项目,专注于语音识别与合成技术。

  • Stars: ⭐️ 54.4k
  • Tags: voice-ai speech-synthesis speech-recognition
  • 最后活动时间: 2026-09-03

whisper.cpp

OpenAI Whisper模型的C/C++高性能移植版本,支持本地CPU/GPU推理,适用于语音识别和语音转文字场景。

  • Stars: ⭐️ 53.7k
  • Tags: speech-recognition speech-to-text whisper inference
  • 最后活动时间: 2026-09-15

ChatTTS

专为日常对话优化的生成式语音合成模型,支持中英双语,适合对话场景。

  • Stars: ⭐️ 39.8k
  • Tags: TTS Speech Dialogue
  • 最后活动时间: 2026-04-10

VoxCPM

无分词器的文本转语音模型,支持上下文感知的语音生成和高保真声音克隆。

  • Stars: ⭐️ 37.7k
  • Tags: TTS 声音克隆 语音合成
  • 最后活动时间: 2026-09-02

fish-speech

开源SOTA级文本转语音项目,基于LLaMA和Transformer架构,支持高质量语音合成与克隆。

  • Stars: ⭐️ 32.7k
  • Tags: TTS 语音合成 Transformer
  • 最后活动时间: 2026-09-16

VoiceStudio

开源的 ElevenLabs 替代方案,提供 AI 语音克隆、配音、听写、转录及有声书制作功能。集成了强大的语音工作流工作室,支持本地部署。

  • Stars: ⭐️ 32.3k
  • Tags: ai voice-cloning tts transcription dubbing mlx
  • 最后活动时间: 2026-09-17

Handy

免费开源的离线语音转文字应用,支持完全离线运行保护隐私,基于Tauri v2跨平台构建。

  • Stars: ⭐️ 31.8k
  • Tags: 语音识别 离线 无障碍
  • 最后活动时间: 2026-09-15

spleeter

Deezer开源的音频源分离库,利用深度学习技术将音乐分离为人声、鼓点、贝斯等独立音轨。

  • Stars: ⭐️ 28.5k
  • Tags: audio-processing source-separation deep-learning tensorflow
  • 最后活动时间: 2026-06-18

chatterbox

开源SoTA文本转语音模型,提供高质量语音合成能力。

  • Stars: ⭐️ 26.4k
  • Tags: TTS Speech Synthesis
  • 最后活动时间: 2026-07-21

MiniCPM-o

达到Gemini 2.5 Flash级别的多模态大语言模型,支持视觉、语音和全双工多模态实时流媒体,可在手机端运行。

  • Stars: ⭐️ 24.5k
  • Tags: multimodal llm vision speech mobile
  • 最后活动时间: 2026-05-07

whisperX

基于Whisper的自动语音识别工具,支持词级时间戳和说话人分离,提供快速准确的语音转文字能力。

  • Stars: ⭐️ 24.1k
  • Tags: ASR Speech-to-Text Whisper Diarization
  • 最后活动时间: 2026-08-30

index-tts

工业级可控高效零样本文本转语音系统,支持跨语言语音合成。

  • Stars: ⭐️ 24.0k
  • Tags: TTS Zero-shot Industrial
  • 最后活动时间: 2026-08-18

CosyVoice

多语言大模型语音生成系统,提供推理、训练和部署的全栈能力,支持高质量语音克隆。

  • Stars: ⭐️ 23.7k
  • Tags: text-to-speech voice-cloning audio-generation multilingual
  • 最后活动时间: 2026-05-25

CosyVoice

多语言大语音生成模型,提供推理、训练和部署全栈能力。

  • Stars: ⭐️ 22.3k
  • Tags: TTS Multi-lingual Voice Cloning
  • 最后活动时间: 2026-05-25

buzz

基于OpenAI Whisper的离线音频转录与翻译工具,支持在本地电脑上运行,无需联网即可实现高质量的语音转文字。

  • Stars: ⭐️ 21.5k
  • Tags: whisper speech-to-text transcription offline-ai
  • 最后活动时间: 2026-09-12

FunASR

阿里达摩院开源的端到端语音识别工具包,提供SOTA预训练模型。

  • Stars: ⭐️ 20.4k
  • Tags: speech-recognition asr pytorch pretrained-model vad
  • 最后活动时间: 2026-09-16

pyvideotrans

AI驱动的视频翻译工具,支持跨语言翻译并自动生成配音与字幕,集成语音识别与合成技术。

  • Stars: ⭐️ 19.0k
  • Tags: video-translation speech-to-text text-to-speech subtitle
  • 最后活动时间: 2026-09-16

Speech

一个可扩展的生成式AI框架,专为研究人员和开发者设计,支持大语言模型、多模态以及语音AI(自动语音识别和文本转语音)。

  • Stars: ⭐️ 18.5k
  • Tags: asr deeplearning generative-ai tts speech-synthesis
  • 最后活动时间: 2026-09-17

VideoLingo

Netflix级AI视频字幕处理工具,支持一键自动切割、翻译、对齐和配音,实现全自动视频本地化。

  • Stars: ⭐️ 18.5k
  • Tags: video-translation ai-translation dubbing voice-cloning subtitle
  • 最后活动时间: 2026-09-15

VideoCaptioner

基于LLM的智能字幕助手,支持视频字幕生成、断句、校正和翻译全流程处理,提升视频内容创作效率。

  • Stars: ⭐️ 16.0k
  • Tags: 字幕生成 视频处理 LLM应用 翻译
  • 最后活动时间: 2026-09-12

KittenTTS

体积小于25MB的SOTA文本转语音模型,适合边缘设备部署。

  • Stars: ⭐️ 15.5k
  • Tags: text-to-speech tts lightweight edge-deployment
  • 最后活动时间: 2026-08-19

F5-TTS

基于流匹配的高质量文本转语音模型,生成流畅自然的语音。

  • Stars: ⭐️ 15.2k
  • Tags: TTS Flow Matching Research
  • 最后活动时间: 2026-07-23

vosk-api

离线语音识别API,支持Android、iOS、树莓派和服务器,提供Python、Java、C#和Node.js多语言SDK。

  • Stars: ⭐️ 15.1k
  • Tags: Speech Recognition Offline Deep Learning
  • 最后活动时间: 2026-08-09

sherpa-onnx

离线语音处理神器,支持语音识别、语音合成、说话人分离、语音增强等功能,覆盖嵌入式设备到服务器的全平台部署。

  • Stars: ⭐️ 14.8k
  • Tags: Speech-to-Text Text-to-Speech ONNX Embedded
  • 最后活动时间: 2026-09-17

supertonic

轻量级设备端多语言文本转语音引擎,基于 ONNX 原生运行,速度快且可离线使用。

  • Stars: ⭐️ 13.8k
  • Tags: TTS ONNX Speech-Synthesis On-Device Multilingual
  • 最后活动时间: 2026-09-09

supertonic

闪电般快速的设备端多语言TTS引擎,通过ONNX原生运行,支持跨平台离线语音合成。

  • Stars: ⭐️ 13.8k
  • Tags: TTS ONNX On-Device
  • 最后活动时间: 2026-07-24

OmniVoice

支持600多种语言的高质量语音克隆TTS系统,实现多语言语音合成与克隆功能。

  • Stars: ⭐️ 13.3k
  • Tags: tts voice-cloning speech-synthesis multilingual
  • 最后活动时间: 2026-09-14

speech-to-speech

基于开源模型构建的本地语音代理工具,支持语音识别、合成和翻译全流程。

  • Stars: ⭐️ 13.3k
  • Tags: 语音识别 语音合成 本地部署
  • 最后活动时间: 2026-09-06

voice-pro

功能强大的Gradio WebUI音频处理工具,集成Edge-TTS、F5-TTS语音合成与克隆、Whisper语音识别及翻译功能。

  • Stars: ⭐️ 12.8k
  • Tags: TTS Voice Cloning Whisper Gradio
  • 最后活动时间: 2026-07-13

ACE-Step-1.5

强大的本地音乐生成模型,性能超越多数商业替代品,支持Mac、AMD、Intel和CUDA设备。

  • Stars: ⭐️ 12.8k
  • Tags: music-generation text-to-music generative-ai local-inference
  • 最后活动时间: 2026-09-03

PaddleSpeech

易用语音工具包,涵盖ASR、TTS、语音翻译、声纹识别等全栈能力,获NAACL2022最佳Demo奖。

  • Stars: ⭐️ 12.7k
  • Tags: ASR TTS Speech Toolkit
  • 最后活动时间: 2026-08-12

edge-tts

无需Microsoft Edge或Windows即可使用Edge在线TTS服务的Python库,无需API密钥。

  • Stars: ⭐️ 12.0k
  • Tags: text-to-speech tts speech-synthesis
  • 最后活动时间: 2026-03-22

seamless_communication

Meta开源的先进语音和文本翻译基础模型,支持多语言无缝交流。提供高质量的语音识别、翻译和语音合成功能。

  • Stars: ⭐️ 11.8k
  • Tags: speech-translation text-translation meta seamless
  • 最后活动时间: 2026-07-28

speechbrain

基于PyTorch的开源语音处理工具包,涵盖语音识别、说话人识别、语音增强等多种任务。

  • Stars: ⭐️ 11.8k
  • Tags: Speech PyTorch ASR Speaker-Recognition
  • 最后活动时间: 2026-08-27

FluidVoice

macOS上最快的离线语音转文字应用,完全本地运行,无需联网即可实现高精度语音识别。

  • Stars: ⭐️ 11.6k
  • Tags: speech-to-text dictation offline macos voice-recognition
  • 最后活动时间: 2026-09-17

KrillinAI

基于LLM的视频翻译配音工具,支持100种语言双向翻译和一键部署。

  • Stars: ⭐️ 11.3k
  • Tags: Video Translation TTS
  • 最后活动时间: 2026-09-05

moonshine

专为边缘设备设计的快速精准自动语音识别(ASR)模型,适合资源受限环境下的实时语音转文字应用。

  • Stars: ⭐️ 11.1k
  • Tags: ASR Speech Recognition Edge AI
  • 最后活动时间: 2026-08-31

moshi

语音-文本基础模型和全双工口语对话框架,支持实时流式对话,采用Mimi编解码器实现高质量神经音频压缩。

  • Stars: ⭐️ 11.1k
  • Tags: Speech Dialogue Voice AI Real-time
  • 最后活动时间: 2026-09-09

WhisperLiveKit

提供实时同步的语音转文本模型工具包,适用于实时字幕和语音识别场景。

  • Stars: ⭐️ 11.1k
  • Tags: speech-to-text whisper real-time transcription
  • 最后活动时间: 2026-09-14

Whisper

OpenAI Whisper语音识别模型的高性能GPGPU推理实现,支持快速ASR处理。

  • Stars: ⭐️ 10.7k
  • Tags: whisper speech-recognition asr gpgpu audio-processing
  • 最后活动时间: 2026-05-24

pyannote-audio

说话人分离神经网络工具包,支持语音活动检测、说话人识别与嵌入。

  • Stars: ⭐️ 10.6k
  • Tags: speaker-diarization speech-processing pytorch
  • 最后活动时间: 2026-09-15

Amphion

音频、音乐和语音生成工具包,支持TTS、语音转换、音乐生成等多种生成任务,助力可复现研究。

  • Stars: ⭐️ 10.3k
  • Tags: Audio Generation TTS Music Generation
  • 最后活动时间: 2026-03-25

silero-vad

企业级预训练语音活动检测器,轻量高效,支持ONNX运行时,适用于语音识别前端处理。

  • Stars: ⭐️ 10.2k
  • Tags: VAD Speech-Processing ONNX
  • 最后活动时间: 2026-09-15

RealtimeSTT

高性能实时语音转文本库,支持高级语音活动检测、唤醒词激活和即时转录。

  • Stars: ⭐️ 10.1k
  • Tags: speech-to-text realtime voice-activity-detection transcription
  • 最后活动时间: 2026-08-30

espnet

端到端语音处理工具包,支持语音识别、合成、翻译和说话人分离等多种任务,基于PyTorch构建并提供丰富的预训练模型。

  • Stars: ⭐️ 10.0k
  • Tags: 语音识别 语音合成 PyTorch
  • 最后活动时间: 2026-09-17

OmniVoice-Studio

开源的 ElevenLabs 替代方案,支持本地语音克隆、TTS/STT 和影视级配音功能。

  • Stars: ⭐️ 9.6k
  • Tags: voice-cloning text-to-speech speech-recognition voice-ai local-ai
  • 最后活动时间: 2026-08-05

pocket-tts

可在CPU上运行的轻量级TTS系统,适合资源受限环境。

  • Stars: ⭐️ 9.5k
  • Tags: text-to-speech tts lightweight cpu-inference
  • 最后活动时间: 2026-09-14

YuE

开源全曲音乐生成基础模型,类似Suno.ai的开源替代方案,支持完整的歌曲创作与风格迁移。

  • Stars: ⭐️ 9.5k
  • Tags: Music Generation Foundation Model Open Source
  • 最后活动时间: 2026-09-17

so-vits-svc-fork

实时语音转换项目,支持歌声转换与变声功能。

  • Stars: ⭐️ 9.3k
  • Tags: voice-conversion speech-synthesis pytorch
  • 最后活动时间: 2026-09-17

SenseVoice

开源的多语言语音识别模型,支持中、粤、英、日、韩语ASR,并具备语种识别、情绪识别和音频事件检测功能。提供比Whisper更快的推理速度及丰富的语音理解能力。

  • Stars: ⭐️ 9.3k
  • Tags: speech-recognition ASR multilingual speech-to-text emotion-recognition audio-event-detection
  • 最后活动时间: 2026-09-10

speech_recognition

Python语音识别模块,支持多种引擎和API,可在线或离线进行语音转文字。

  • Stars: ⭐️ 9.0k
  • Tags: speech-recognition speech-to-text python
  • 最后活动时间: 2026-09-02

SenseVoice

多语言语音理解模型,支持语音识别、情感识别和音频事件分类等多种语音理解任务。

  • Stars: ⭐️ 8.9k
  • Tags: ASR Multilingual Speech Emotion-Recognition
  • 最后活动时间: 2026-07-14

Bert-VITS2

基于VITS2与多语言BERT的高质量语音合成项目,支持多语言文本转语音,生成自然流畅的语音效果。

  • Stars: ⭐️ 8.8k
  • Tags: TTS 语音合成 BERT
  • 最后活动时间: 2026-09-14

librosa

Python音频与音乐分析核心库,提供丰富的音频特征提取和信号处理功能,广泛应用于AI音频领域。

  • Stars: ⭐️ 8.6k
  • Tags: 音频分析 信号处理 Python库
  • 最后活动时间: 2026-09-15

VoiceCraft

零样本语音编辑与文本转语音模型,支持野外环境下的高质量语音合成与编辑。

  • Stars: ⭐️ 8.6k
  • Tags: Zero-Shot Speech Editing TTS Voice Clone
  • 最后活动时间: 2026-05-30

EmotiVoice

一款支持多说话人和情感控制的文本转语音引擎,可通过提示词灵活调节语音风格。

  • Stars: ⭐️ 8.5k
  • Tags: TTS 情感语音 PyTorch
  • 最后活动时间: 2026-09-03

ASRT_SpeechRecognition

基于深度学习的中文语音识别系统,采用CNN和CTC架构实现语音转文字。

  • Stars: ⭐️ 8.4k
  • Tags: Speech Recognition Chinese Deep Learning
  • 最后活动时间: 2026-04-10

higgs-audio

Boson AI开发的文本-音频基础模型,支持高质量音频生成与理解任务,在语音合成和多模态交互方面表现出色。

  • Stars: ⭐️ 8.4k
  • Tags: Audio Generation Foundation Model Multimodal
  • 最后活动时间: 2026-06-05

mlx-audio

基于Apple MLX框架的语音处理库,支持TTS、STT和STS全流程语音能力,专为Apple Silicon优化。

  • Stars: ⭐️ 7.9k
  • Tags: TTS STT Apple Silicon MLX
  • 最后活动时间: 2026-09-15

ffsubsync

自动同步字幕与视频的工具,利用语音活动检测和FFT算法实现字幕时间轴的智能对齐。

  • Stars: ⭐️ 7.9k
  • Tags: Subtitle Speech Detection Video Processing
  • 最后活动时间: 2026-07-24

ChatTTS-ui

ChatTTS的本地Web界面,支持文字转语音和对外API接口调用。

  • Stars: ⭐️ 7.7k
  • Tags: chattts text-to-speech tts web-ui
  • 最后活动时间: 2026-06-14

vibe

基于 Whisper 的本地语音转录工具,支持跨平台桌面使用,让你完全掌控自己的语音识别流程。

  • Stars: ⭐️ 7.5k
  • Tags: whisper transcribe audio rust desktop
  • 最后活动时间: 2026-09-05

voice-over-translation

一款浏览器扩展和用户脚本,可在任何浏览器中为视频提供配音翻译和字幕功能。帮助用户轻松跨越语言障碍观看外语视频。

  • Stars: ⭐️ 7.3k
  • Tags: extension userscript translation video tts
  • 最后活动时间: 2026-08-03

mediabunny

纯TypeScript媒体处理工具包,支持在浏览器中直接读取、写入和转换音视频文件,适用于多模态AI应用的媒体预处理。

  • Stars: ⭐️ 7.2k
  • Tags: audio video webcodecs media-processing
  • 最后活动时间: 2026-09-16

espeak-ng

开源语音合成引擎,支持超过100种语言和口音的文本转语音系统。

  • Stars: ⭐️ 6.8k
  • Tags: text-to-speech speech-synthesis open-source
  • 最后活动时间: 2026-09-14

noise-suppression-for-voice

基于RNNoise神经网络的专业级语音降噪插件,支持VST/LV2等多种音频格式。

  • Stars: ⭐️ 6.7k
  • Tags: noise-suppression rnnoise voice audio-plugin
  • 最后活动时间: 2026-05-29

podcastfy

开源的NotebookLM播客功能替代方案,可将多种模态内容转换为引人入胜的多语言音频对话。

  • Stars: ⭐️ 6.6k
  • Tags: Podcast Generation Text-to-Speech GenAI
  • 最后活动时间: 2026-05-04

wav2letter

Meta AI Research开源的端到端自动语音识别工具包。

  • Stars: ⭐️ 6.4k
  • Tags: speech-recognition asr deep-learning meta
  • 最后活动时间: 2026-08-28

VoiceInk

macOS开源语音转文字应用,Superwhisper的免费替代方案,无需订阅。

  • Stars: ⭐️ 6.4k
  • Tags: speech-to-text voice-recognition macos
  • 最后活动时间: 2026-09-17

argmax-oss-swift

专为Apple Silicon设计的端侧语音AI工具包,支持语音识别、语音合成、说话人分离等功能。

  • Stars: ⭐️ 6.4k
  • Tags: speech-recognition text-to-speech whisper swift on-device
  • 最后活动时间: 2026-08-13

FunClip

开源视频语音识别与剪辑工具,集成LLM智能剪辑功能。支持语音转文字、字幕生成,简化视频处理流程。

  • Stars: ⭐️ 6.3k
  • Tags: 语音识别 视频剪辑 AI字幕
  • 最后活动时间: 2026-09-16

pedalboard

Spotify开源的Python音频处理库,支持VST3插件和音频增强,适用于机器学习音频数据预处理。

  • Stars: ⭐️ 6.3k
  • Tags: audio-processing python machine-learning vst3
  • 最后活动时间: 2026-09-09

neutts

Neuphonic开发的设备端TTS模型,优化本地推理性能。

  • Stars: ⭐️ 6.3k
  • Tags: text-to-speech tts on-device edge-ai
  • 最后活动时间: 2026-07-30

silero-models

预训练文本转语音模型库,支持俄语、乌克兰语等10多种语言,可通过PyTorch Hub快速集成。

  • Stars: ⭐️ 6.1k
  • Tags: TTS 预训练模型 多语言
  • 最后活动时间: 2026-07-31

MegaTTS3

文本转语音合成项目,实现高质量语音生成。

  • Stars: ⭐️ 6.1k
  • Tags: tts speech-synthesis audio-generation
  • 最后活动时间: 2026-06-15

tts-vue

基于微软语音服务的桌面端TTS工具,支持文本转语音合成,使用Electron+Vue构建。

  • Stars: ⭐️ 6.1k
  • Tags: TTS Speech Synthesis Desktop
  • 最后活动时间: 2026-04-24

WhisperKit

专为Apple Silicon优化的端侧语音识别框架,支持iOS、macOS等平台。

  • Stars: ⭐️ 6.0k
  • Tags: speech-recognition whisper swift on-device apple-silicon
  • 最后活动时间: 2026-04-14

abogen

将EPUB、PDF和文本转换为有声书的开源工具,支持同步字幕和多种TTS引擎。

  • Stars: ⭐️ 6.0k
  • Tags: TTS Audiobook Kokoro
  • 最后活动时间: 2026-09-07

whisper-diarization

基于OpenAI Whisper的自动语音识别与说话人分离工具,支持多说话人场景下的语音转文字和身份识别。

  • Stars: ⭐️ 5.7k
  • Tags: ASR Speaker Diarization Whisper
  • 最后活动时间: 2026-08-15

Recorder

功能强大的HTML5录音库,支持多格式音频录制并集成ASR语音识别,适用于语音交互和实时通话场景。

  • Stars: ⭐️ 5.6k
  • Tags: 音频录制 ASR WebRTC
  • 最后活动时间: 2026-07-30

piper1-gpl

快速且支持本地运行的神经文本转语音引擎,适合离线环境部署。

  • Stars: ⭐️ 5.6k
  • Tags: text-to-speech neural-tts offline-tts speech-synthesis
  • 最后活动时间: 2026-09-15

Kokoro-FastAPI

Kokoro-82M语音合成模型的FastAPI封装服务,支持CPU ONNX和GPU PyTorch推理,提供OpenAI兼容API。

  • Stars: ⭐️ 5.5k
  • Tags: TTS FastAPI ONNX Docker
  • 最后活动时间: 2026-09-10

LuxTTS

高质量快速TTS语音克隆模型,推理速度可达150倍实时。

  • Stars: ⭐️ 5.4k
  • Tags: text-to-speech tts voice-cloning fast-inference
  • 最后活动时间: 2026-06-05

wenet

生产级端到端语音识别工具包,支持Conformer和Transformer架构,专为工业部署优化。

  • Stars: ⭐️ 5.2k
  • Tags: ASR E2E Production Ready
  • 最后活动时间: 2026-09-07

SmartSub

跨平台AI字幕生成工具,支持批量处理视频音频生成字幕并翻译,集成多家AI服务。

  • Stars: ⭐️ 5.2k
  • Tags: 字幕生成 Whisper 翻译
  • 最后活动时间: 2026-09-16

muzic

微软开源的AI音乐理解与生成研究项目,支持音乐创作与分析。

  • Stars: ⭐️ 5.0k
  • Tags: ai-music music-generation deep-learning microsoft
  • 最后活动时间: 2026-08-05

porcupine

基于深度学习的端上唤醒词检测引擎,支持自定义唤醒词。

  • Stars: ⭐️ 4.9k
  • Tags: wake-word-detection keyword-spotting voice-activation on-device
  • 最后活动时间: 2026-09-10

ace-step-ui

开源AI音乐生成专业UI界面,作为ACE-Step 1.5的前端,支持本地免费无限生成音乐。

  • Stars: ⭐️ 4.9k
  • Tags: ai ai-music music-generation local-first open-source
  • 最后活动时间: 2026-06-27

DiffSinger

基于浅层扩散机制的歌声合成系统,AAAI 2022论文官方实现,支持SVS与TTS。

  • Stars: ⭐️ 4.9k
  • Tags: Singing Synthesis Diffusion Model TTS AAAI 2022
  • 最后活动时间: 2026-07-24

MOSS-TTS-Nano

开源多语言轻量级语音生成模型,仅0.1B参数即可实现实时语音合成,支持CPU运行。

  • Stars: ⭐️ 4.4k
  • Tags: tts speech-synthesis multilingual realtime voice-clone
  • 最后活动时间: 2026-09-06

pocketsphinx

轻量级语音识别引擎,适用于嵌入式设备和离线语音识别场景。

  • Stars: ⭐️ 4.3k
  • Tags: speech-recognition offline-speech lightweight-stt
  • 最后活动时间: 2026-09-14

WhisperLive

OpenAI Whisper的近实时实现,支持语音识别、翻译和听写功能。

  • Stars: ⭐️ 4.3k
  • Tags: 语音识别 Whisper 实时转录
  • 最后活动时间: 2026-09-10

OpenUtau

开源的歌声合成平台,是经典 UTAU 的现代继任者。支持跨平台操作,为虚拟人声和音乐创作提供强大的合成能力。

  • Stars: ⭐️ 4.3k
  • Tags: music singing-synthesis speech-synthesis vocal-synthesis
  • 最后活动时间: 2026-09-03

auto-subs

本地 AI 字幕生成工具,支持 DaVinci Resolve 集成和说话人分离。

  • Stars: ⭐️ 4.2k
  • Tags: subtitles whisper speech-to-text transcription davinci
  • 最后活动时间: 2026-09-17

MOSS-TTS

开源语音和声音生成模型家族,支持高保真长语音、多说话人对话、声音克隆和实时流式TTS。

  • Stars: ⭐️ 4.1k
  • Tags: TTS Voice Cloning Multimodal
  • 最后活动时间: 2026-09-06

RealtimeTTS

实时文本转语音库,支持多种TTS引擎,可实现低延迟的语音合成输出。

  • Stars: ⭐️ 4.0k
  • Tags: text-to-speech speech-synthesis realtime python
  • 最后活动时间: 2026-08-31

Qwen3-Omni

阿里云Qwen团队开发的全模态端到端大模型,支持文本、音频、图像、视频理解及实时语音生成。

  • Stars: ⭐️ 4.0k
  • Tags: Omni-Modal TTS Qwen
  • 最后活动时间: 2026-04-23

stable-audio-tools

用于条件音频生成的生成模型工具集,支持高质量音频合成与处理。

  • Stars: ⭐️ 3.8k
  • Tags: audio-generation generative-models diffusion-models
  • 最后活动时间: 2026-08-09

heartlib

HeartMuLa 官方开源仓库,号称2026年最强大的开源音乐生成模型。能够高效生成高质量的音乐音频。

  • Stars: ⭐️ 3.8k
  • Tags: music-generation audio-synthesis generative-ai open-source-models
  • 最后活动时间: 2026-09-17

OpenUtau

开源歌声合成平台,UTAU的现代化继任者。支持多种歌声合成引擎,提供直观的歌声编辑体验。

  • Stars: ⭐️ 3.8k
  • Tags: singing-synthesis voice-synthesis vocaloid utau open-source
  • 最后活动时间: 2026-05-02

speakr

自托管的音频转录Web应用,支持将录音文件自动转换为文字,注重隐私保护。

  • Stars: ⭐️ 3.8k
  • Tags: transcription speech-to-text self-hosted audio
  • 最后活动时间: 2026-09-01

aubio

音频与音乐分析库,提供音符检测、音高追踪、节拍检测和MFCC特征提取功能,广泛应用于音频机器学习和音乐信息检索领域。

  • Stars: ⭐️ 3.8k
  • Tags: audio music-analysis mfcc pitch-detection onset-detection
  • 最后活动时间: 2026-04-10

stemdeck

面向音乐人、制作人和爱好者的现代音轨分离平台,可隔离人声、鼓点、贝斯、钢琴和吉他。适用于练习、转录、混音和创意音频工作流。

  • Stars: ⭐️ 3.7k
  • Tags: audio stem-extraction music ai-audio
  • 最后活动时间: 2026-09-13

Applio

简单易用的高质量语音转换工具,专注于性能优化和用户体验。

  • Stars: ⭐️ 3.7k
  • Tags: Voice Conversion RVC TTS
  • 最后活动时间: 2026-09-16

essentia

专业的C++音频与音乐分析库,支持音乐信息检索、音频特征提取与合成,提供Python绑定接口。

  • Stars: ⭐️ 3.7k
  • Tags: audio-analysis music-information-retrieval dsp python
  • 最后活动时间: 2026-08-27

LiveCaptions-Translator

基于Windows LiveCaptions的轻量级实时语音翻译工具,支持音频转文字和实时翻译。

  • Stars: ⭐️ 3.7k
  • Tags: speech-to-text audio-to-text real-time-translation livecaptions
  • 最后活动时间: 2026-08-17

speaches

基于Whisper的语音转文字服务,支持Docker部署和OpenAI API兼容接口,提供高效的音频转录能力。

  • Stars: ⭐️ 3.7k
  • Tags: Whisper Speech-to-Text Docker Transcription
  • 最后活动时间: 2026-09-16

sam-audio

Meta官方音频分割模型SAM-Audio的推理代码和预训练权重,支持音频分割任务的完整示例和Jupyter笔记本。

  • Stars: ⭐️ 3.6k
  • Tags: audio-processing segment-anything meta-ai audio-model
  • 最后活动时间: 2026-05-26

Qwen3-ASR

Qwen团队开源的语音识别模型,支持多语言语音/音乐/歌曲识别及时间戳预测。

  • Stars: ⭐️ 3.5k
  • Tags: ASR Speech-Recognition Qwen
  • 最后活动时间: 2026-06-26

AI-Video-Transcriber

开源AI视频转录与摘要工具,支持多语言视频和播客内容转录。跨平台支持,可处理YouTube、TikTok等平台视频。

  • Stars: ⭐️ 3.3k
  • Tags: transcribe ai video speech-to-text summarization
  • 最后活动时间: 2026-09-15

TTS-WebUI

集成多种TTS模型的统一WebUI,支持GPT-SoVITS、XTTS、Bark等20+语音合成引擎。

  • Stars: ⭐️ 3.3k
  • Tags: TTS Audio Generation Gradio
  • 最后活动时间: 2026-09-07

MisoTTS

一个拥有80亿参数的高情感文本转语音模型。能够生成极具表现力和自然度的人类语音。

  • Stars: ⭐️ 3.2k
  • Tags: tts text-to-speech audio-generation speech-synthesis
  • 最后活动时间: 2026-06-09

stemroller

基于深度学习的音源分离工具,可从任意歌曲中提取人声、鼓点、贝斯等独立音轨。

  • Stars: ⭐️ 3.2k
  • Tags: source-separation deep-learning audio-processing demucs
  • 最后活动时间: 2026-06-30

faust

一种用于信号处理和声音合成的函数式编程语言,支持多种平台和后端编译。

  • Stars: ⭐️ 3.2k
  • Tags: audio dsp compiler functional-programming
  • 最后活动时间: 2026-09-16

GPA

通用音频模型,能够使用单一轻量级模型完成语音识别、文本转语音和语音转换任务。

  • Stars: ⭐️ 3.1k
  • Tags: asr tts voice-conversion audio
  • 最后活动时间: 2026-05-25

willow

开源、本地自托管的智能语音助手,可作为 Amazon Echo/Google Home 的替代方案。支持 Whisper 语音识别,注重隐私保护。

  • Stars: ⭐️ 3.1k
  • Tags: voice-assistant speech-recognition whisper esp32 home-automation
  • 最后活动时间: 2026-09-01

whishper

基于Whisper模型的本地音频转文字工具,支持翻译和字幕编辑,提供简洁的Web界面,100%本地运行保护隐私。

  • Stars: ⭐️ 3.1k
  • Tags: whisper speech-to-text transcription audio subtitle
  • 最后活动时间: 2026-07-31

Scriberr

自托管的AI音频转录工具,支持本地部署以保护数据隐私,提供高质量的语音转文字服务。

  • Stars: ⭐️ 3.1k
  • Tags: Audio Transcription Self-hosted Privacy
  • 最后活动时间: 2026-06-01

neural-amp-modeler

神经网络吉他放大器模拟器,使用深度学习精确还原放大器音色。

  • Stars: ⭐️ 3.0k
  • Tags: neural-network audio-processing guitar-amp deep-learning
  • 最后活动时间: 2026-08-23

opentalking

工业级开源 AI 数字人框架,支持实时对话、私有化部署及可插拔模型。

  • Stars: ⭐️ 3.0k
  • Tags: digital-human real-time-conversation ai-framework tts stt
  • 最后活动时间: 2026-09-04

openscreen

免费开源的GPU加速屏幕录制工具,内置Whisper语音转文字功能。支持跨平台且无水印,适合快速制作产品演示。

  • Stars: ⭐️ 3.0k
  • Tags: screen-recorder whisper speech-to-text gpu-acceleration cross-platform
  • 最后活动时间: 2026-09-17

faster-whisper-GUI

基于PySide6的faster-whisper图形界面工具,支持语音转文字、VAD检测,提供高效本地音频转录体验。

  • Stars: ⭐️ 3.0k
  • Tags: ASR Whisper 语音转录 GUI
  • 最后活动时间: 2026-08-25

Bark-Voice-Cloning

基于Bark的语音克隆项目,支持中文语音合成与声音克隆功能。

  • Stars: ⭐️ 2.9k
  • Tags: Voice Cloning TTS Bark Chinese Speech
  • 最后活动时间: 2026-05-31

NeuralNote

基于深度学习的音频转MIDI转录插件,支持实时音频识别并转换为MIDI音符,适用于音乐制作工作流。

  • Stars: ⭐️ 2.9k
  • Tags: Audio-to-MIDI Deep Learning Music Transcription
  • 最后活动时间: 2026-09-16

NeuralAmpModelerPlugin

基于神经网络的吉他放大器建模插件,利用AI技术精准模拟真实放大器的音色特性。

  • Stars: ⭐️ 2.9k
  • Tags: Neural Network Audio Plugin
  • 最后活动时间: 2026-06-12

Hex

基于Whisper的macOS语音转文字应用,支持实时语音转录为文字,简洁高效的本地化语音识别工具。

  • Stars: ⭐️ 2.9k
  • Tags: whisper speech-to-text transcription macos swiftui
  • 最后活动时间: 2026-08-27

deepjazz

基于Keras和Theano的深度学习爵士乐生成项目。

  • Stars: ⭐️ 2.9k
  • Tags: deep-learning music-generation lstm jazz
  • 最后活动时间: 2026-03-19

aeneas

Python/C库,用于自动同步音频与文本,支持生成SRT、SMIL等字幕格式,适合字幕制作场景。

  • Stars: ⭐️ 2.9k
  • Tags: forced-alignment audio speech
  • 最后活动时间: 2026-07-25

lingvo

Google开源的序列建模框架,专注于语音识别、机器翻译和NLP任务,支持大规模分布式训练。

  • Stars: ⭐️ 2.9k
  • Tags: Speech Recognition Machine Translation NLP
  • 最后活动时间: 2026-06-22

whisper-timestamped

支持词级时间戳和置信度的多语言语音识别工具,提供更精确的转录结果。

  • Stars: ⭐️ 2.8k
  • Tags: ASR Timestamps Multilingual
  • 最后活动时间: 2026-08-17

FluidAudio

基于CoreML的前沿音频模型库,支持TTS、STT、语音活动检测和说话人分离,专为iOS/macOS设计。

  • Stars: ⭐️ 2.8k
  • Tags: CoreML Speech AI iOS
  • 最后活动时间: 2026-09-14

TTS

一个先进的深度学习文本转语音(TTS)工具包,支持多语言和高质量语音合成。它提供了丰富的模型和训练接口,适合语音合成研究与开发。

  • Stars: ⭐️ 2.7k
  • Tags: tts text-to-speech speech-synthesis deep-learning pytorch
  • 最后活动时间: 2026-09-09

kokoro-onnx

基于Kokoro模型和ONNX Runtime的高效TTS推理实现。

  • Stars: ⭐️ 2.7k
  • Tags: kokoro onnxruntime tts text-to-speech
  • 最后活动时间: 2026-09-01

diff-svc

基于扩散模型的歌声转换项目,能够实现高质量的音频风格迁移。

  • Stars: ⭐️ 2.7k
  • Tags: diffusion-model singing-voice-conversion audio-generation deep-learning
  • 最后活动时间: 2026-06-06

qwen-audio-agent

一个实时语音运行时环境,旨在让AI代理保持持续对话与工作状态。为AI智能体提供了强大的实时语音交互能力。

  • Stars: ⭐️ 2.7k
  • Tags: voice-agent agentic-ai voice-ai real-time
  • 最后活动时间: 2026-09-17

DDSP-SVC

基于DDSP的实时端到端歌声转换系统,支持高质量声音克隆。

  • Stars: ⭐️ 2.7k
  • Tags: Voice Conversion DDSP Real-time
  • 最后活动时间: 2026-08-12

rhubarb-lip-sync

命令行工具,可从录音自动生成2D口型动画,适用于游戏角色和动画制作。

  • Stars: ⭐️ 2.6k
  • Tags: lip-sync animation audio-processing cli
  • 最后活动时间: 2026-06-16

ChatTTS_colab

基于ChatTTS的一键部署工具,支持流式输出、音色抽卡、长音频生成和分角色朗读。

  • Stars: ⭐️ 2.6k
  • Tags: text-to-speech voice-synthesis colab
  • 最后活动时间: 2026-05-31

VieNeu-TTS

越南语实时文本转语音系统,支持即时语音克隆和端侧CPU实时推理,输出24kHz高质量音频。

  • Stars: ⭐️ 2.6k
  • Tags: TTS 语音克隆 端侧推理
  • 最后活动时间: 2026-09-17

asteroid

PyTorch音频源分离工具包,提供预训练模型用于语音增强和分离研究。

  • Stars: ⭐️ 2.6k
  • Tags: audio-separation speech-enhancement pytorch
  • 最后活动时间: 2026-05-13

pyttsx3

离线文本转语音合成库,支持多种语音引擎,无需网络连接即可运行。适用于语音助手、无障碍应用等场景。

  • Stars: ⭐️ 2.5k
  • Tags: text-to-speech tts python offline speech-synthesis
  • 最后活动时间: 2026-07-22

awesome-digital-human-live2d

数字人技术资源合集,涵盖Live2D虚拟形象、语音合成、面部动画等AI驱动的数字人相关技术与工具。

  • Stars: ⭐️ 2.4k
  • Tags: digital-human live2d avatar tts animation
  • 最后活动时间: 2026-05-18

awesome-whisper

OpenAI Whisper语音识别模型精选资源列表,汇集工具、模型、教程和应用案例。

  • Stars: ⭐️ 2.4k
  • Tags: Whisper 语音识别 Speech-to-Text
  • 最后活动时间: 2026-09-17

stable-ts

基于Whisper的音频转录与强制对齐工具,提供稳定的语音识别能力。

  • Stars: ⭐️ 2.3k
  • Tags: whisper transcription forced-alignment speech-recognition
  • 最后活动时间: 2026-05-30

WhisperJAV

基于Qwen3-ASR和Whisper的日语语音识别字幕生成工具,集成TEN-VAD和本地LLM,抗噪能力强。

  • Stars: ⭐️ 2.2k
  • Tags: ASR Whisper 字幕生成 语音识别
  • 最后活动时间: 2026-09-17

magenta-js

浏览器端机器学习音乐与艺术生成库,支持实时音频创作和视觉艺术生成。

  • Stars: ⭐️ 2.1k
  • Tags: music-generation art-generation tensorflow-js
  • 最后活动时间: 2026-06-22

birdnet-go

实时鸟类声音识别分析系统,支持树莓派等边缘设备部署。

  • Stars: ⭐️ 2.1k
  • Tags: birdnet audio-recognition wildlife edge-ai
  • 最后活动时间: 2026-09-16

epub_to_audiobook

EPUB电子书转有声书工具,支持Audiobookshelf,带WebUI界面。

  • Stars: ⭐️ 2.1k
  • Tags: audiobook tts epub openai
  • 最后活动时间: 2026-03-24

parlor

本地实时多模态AI助手,支持语音和视觉对话。基于Gemma 4 E2B和Kokoro,完全在设备端运行。

  • Stars: ⭐️ 2.1k
  • Tags: multimodal voice-assistant local-llm on-device-ai text-to-speech
  • 最后活动时间: 2026-08-03

vad

基于ONNX Runtime的高精度浏览器端语音活动检测器,提供简洁API实现实时语音识别。

  • Stars: ⭐️ 2.1k
  • Tags: voice-activity-detection silero-vad onnxruntime web-audio
  • 最后活动时间: 2026-09-12

diart

基于AI的实时音频处理Python库,支持说话人分离、语音活动检测和转录功能。

  • Stars: ⭐️ 2.0k
  • Tags: Speaker Diarization Streaming Audio Deep Learning
  • 最后活动时间: 2026-06-19

MOSS-Transcribe-Diarize

开源的端到端音频理解模型,专为长音频多说话人转录、说话人分离和时间戳预测设计。

  • Stars: ⭐️ 2.0k
  • Tags: speech-to-text speaker-diarization audio-understanding open-source-models
  • 最后活动时间: 2026-09-15

SongRec

开源的Shazam客户端,使用音频指纹识别技术识别歌曲,支持Linux平台。

  • Stars: ⭐️ 2.0k
  • Tags: audio-fingerprinting shazam music-recognition rust
  • 最后活动时间: 2026-09-05

whisper-plus

WhisperPlus 提供更快、更智能的语音转文本体验。通过优化加速推理,大幅提升音频处理效率。

  • Stars: ⭐️ 2.0k
  • Tags: whisper speech-to-text audio-processing faster-whisper
  • 最后活动时间: 2026-08-03

omnizort

Omnizort 是一个音乐转录工具,能够识别并转录音乐中的各种元素,包括人声、鼓点、和弦、节拍及多种乐器。

  • Stars: ⭐️ 2.0k
  • Tags: music-transcription audio-processing music-information-retrieval beat-tracking chord-recognition
  • 最后活动时间: 2026-05-31

transcribe.cpp

基于 ggml 的语音转文本推理工具,支持 16 种以上的模型家族。提供高效的本地语音识别解决方案。

  • Stars: ⭐️ 1.9k
  • Tags: asr ggml gguf speech-to-text
  • 最后活动时间: 2026-09-17

ComfyUI-Qwen-TTS

Qwen3-TTS的ComfyUI插件实现,方便在ComfyUI中使用语音合成功能。

  • Stars: ⭐️ 1.9k
  • Tags: TTS ComfyUI Qwen
  • 最后活动时间: 2026-09-06

audapolis

一款专为口语音频设计的编辑器,内置自动转录功能,支持音视频编辑。

  • Stars: ⭐️ 1.9k
  • Tags: audio-editing speech-to-text transcription video-editing
  • 最后活动时间: 2026-06-24

descript-audio-codec

最先进音频编解码器,支持90倍压缩率,适用于高质量音频生成与传输。

  • Stars: ⭐️ 1.9k
  • Tags: audio-codec deep-learning audio-compression pytorch gan
  • 最后活动时间: 2026-07-16

RHVoice

免费开源的多语言语音合成引擎,支持俄语、英语、乌克兰语等多种语言,跨平台运行于Windows、Linux和Android。

  • Stars: ⭐️ 1.8k
  • Tags: TTS 语音合成 开源
  • 最后活动时间: 2026-08-27

Montreal-Forced-Aligner

基于Kaldi的强制对齐命令行工具,用于语音音频与文本的精确对齐。

  • Stars: ⭐️ 1.8k
  • Tags: forced-alignment kaldi speech acoustic-model
  • 最后活动时间: 2026-06-11

Real-time-translation-typing

实时语音打字与翻译工具,支持语音实时转文字、实时翻译,还可用于 LOL 游戏语音输入。基于语音识别技术,让打字与跨语言交流更高效。

  • Stars: ⭐️ 1.8k
  • Tags: speech-to-text real-time-translation voice-typing translation windows
  • 最后活动时间: 2026-09-06

magenta-realtime

Magenta RealTime 2 是一个开放权重的实时音乐生成模型。它基于 JAX 和 MLX 构建,支持实时音乐生成与处理。

  • Stars: ⭐️ 1.8k
  • Tags: music machine-learning jax mlx real-time
  • 最后活动时间: 2026-09-13

bailing

类似GPT-4o的低延迟语音对话机器人,集成DeepSeek R1等大模型,响应时延低至800ms,支持打断和低配置设备运行。

  • Stars: ⭐️ 1.8k
  • Tags: 语音助手 TTS ASR DeepSeek
  • 最后活动时间: 2026-04-06

vocal-remover

使用深度神经网络进行人声分离的工具,支持音频处理。

  • Stars: ⭐️ 1.8k
  • Tags: vocal-separation audio-processing deep-learning
  • 最后活动时间: 2026-09-10

read-aloud

一款优秀的浏览器扩展,一键朗读网页内容,支持多种语音引擎和语言,提升无障碍访问体验。

  • Stars: ⭐️ 1.7k
  • Tags: text-to-speech browser-extension accessibility tts
  • 最后活动时间: 2026-07-10

mt3

谷歌推出的多任务多轨道音乐转录模型,能将音频精准转换为MIDI格式。支持多乐器识别与分离,是音乐AI领域的经典研究项目。

  • Stars: ⭐️ 1.7k
  • Tags: music-transcription audio multimodal midi machine-learning
  • 最后活动时间: 2026-07-09

awesome-python-scientific-audio

Python音频科学研究资源精选,涵盖音频分析、处理和机器学习相关工具包。

  • Stars: ⭐️ 1.7k
  • Tags: audio python speech-processing scientific-computing
  • 最后活动时间: 2026-09-11

madmom

Python音频与音乐信号处理库,支持音乐信息检索。

  • Stars: ⭐️ 1.7k
  • Tags: audio-analysis signal-processing music-information-retrieval
  • 最后活动时间: 2026-03-20

BirdNET-Analyzer

基于深度学习的鸟类声音识别与分析工具,可用于科学音频数据处理和生态监测。

  • Stars: ⭐️ 1.7k
  • Tags: deep-learning audio-classification bioacoustics acoustic-monitoring
  • 最后活动时间: 2026-09-08

subsai

基于 Whisper 的字幕生成工具,支持 Web-UI、命令行和 Python 包多种使用方式。

  • Stars: ⭐️ 1.7k
  • Tags: whisper subtitles speech-to-text video
  • 最后活动时间: 2026-04-20

CyberVerse

自托管的实时数字人智能体平台,支持通过 WebRTC 构建语音优先的 AI 智能体。具备角色记忆、RAG、工具调用及可选的数字人视频生成能力。

  • Stars: ⭐️ 1.7k
  • Tags: ai-agents digital-human voice-assistant webrtc talking-avatar
  • 最后活动时间: 2026-09-11

obs-localvocal

OBS Studio本地语音识别与字幕生成插件,基于Whisper AI实现实时语音转文字和翻译功能,支持离线运行。

  • Stars: ⭐️ 1.6k
  • Tags: 语音识别 Whisper OBS插件
  • 最后活动时间: 2026-09-09

yap

基于 macOS Speech.framework 的本地语音转录命令行工具,支持设备端离线语音识别转文字。

  • Stars: ⭐️ 1.6k
  • Tags: speech-to-text macos cli transcription speech-recognition
  • 最后活动时间: 2026-07-20

video-analyzer

结合LLM、计算机视觉和语音识别的视频分析工具,支持多模态内容理解。

  • Stars: ⭐️ 1.6k
  • Tags: 视频分析 ASR 多模态
  • 最后活动时间: 2026-04-19

TalkingHead

一个JavaScript类库,用于实现3D虚拟形象的实时口型同步和语音驱动动画。支持文本转语音和全身3D头像的唇形同步。

  • Stars: ⭐️ 1.6k
  • Tags: 3d-avatar lip-sync talking-avatar text-to-speech animation
  • 最后活动时间: 2026-06-02

Fun-ASR

开源的基于大语言模型的语音识别模型家族,支持中文方言、口音及多语种语音转写。提供流式处理、说话人分离及端侧部署能力,是Whisper的优秀替代方案。

  • Stars: ⭐️ 1.5k
  • Tags: asr speech-to-text multilingual real-time-asr llm
  • 最后活动时间: 2026-09-10

elevenlabs-mcp

ElevenLabs官方MCP服务器,为AI应用提供高质量的语音合成和语音克隆能力。

  • Stars: ⭐️ 1.5k
  • Tags: elevenlabs elevenlabs-api mcp tts voice-ai
  • 最后活动时间: 2026-08-20

SALMONN

字节跳动与清华联合开发的多模态大语言模型,支持音频、语音、音乐和视频理解,入选ICLR/ICML 2024。

  • Stars: ⭐️ 1.5k
  • Tags: 多模态 音频处理 视频理解
  • 最后活动时间: 2026-08-24

writeout.ai

免费的音频转录与翻译工具,支持快速处理音频文件。帮助用户轻松实现语音转文本及多语言翻译。

  • Stars: ⭐️ 1.5k
  • Tags: transcription translation audio speech-to-text
  • 最后活动时间: 2026-06-30

hibiki

用于流式语音翻译的模型,能够实时进行同声传译,逐块生成正确的翻译结果。

  • Stars: ⭐️ 1.5k
  • Tags: speech-translation streaming real-time
  • 最后活动时间: 2026-09-09

pianotrans

ByteDance 钢琴转录工具的简洁 GUI,支持踏板检测。

  • Stars: ⭐️ 1.5k
  • Tags: ai piano transcription audio
  • 最后活动时间: 2026-09-14

unmute

让文本大语言模型具备听和说的能力,实现语音交互功能。为LLM添加语音输入输出接口,使其能够进行自然对话。

  • Stars: ⭐️ 1.5k
  • Tags: TTS STT Voice AI LLM
  • 最后活动时间: 2026-09-09

voxbento

一个开源的AI驱动实时翻译与解释平台。致力于打破语言障碍,提供高效的语音翻译体验。

  • Stars: ⭐️ 1.5k
  • Tags: ai-interpretation translation speech-to-text open-source
  • 最后活动时间: 2026-09-12

Audio8_TTS

以紧凑模型规模实现 SOTA 级别的文本转语音效果,兼顾高质量语音合成与轻量化部署。

  • Stars: ⭐️ 1.5k
  • Tags: TTS Text-to-Speech Speech-Synthesis
  • 最后活动时间: 2026-09-02

subgen

基于 OpenAI Whisper 模型的自动字幕生成工具,支持 Jellyfin、Plex、Emby 等媒体服务器集成。

  • Stars: ⭐️ 1.5k
  • Tags: whisper subtitle speech-to-text media-server
  • 最后活动时间: 2026-08-07

voxtype

基于Whisper的Wayland语音转文字工具,支持按键说话和离线语音识别。

  • Stars: ⭐️ 1.5k
  • Tags: speech-to-text whisper wayland rust offline
  • 最后活动时间: 2026-09-10

Chatterbox-TTS-Server

强大的TTS语音合成服务器,支持Web UI、OpenAI兼容API、声音克隆,可在NVIDIA/AMD/CPU上运行。

  • Stars: ⭐️ 1.4k
  • Tags: TTS 语音合成 声音克隆 API服务
  • 最后活动时间: 2026-05-26

OuteTTS

OuteTTS 模型的推理接口,支持 GGUF 格式和 Transformers 框架。

  • Stars: ⭐️ 1.4k
  • Tags: text-to-speech llama gguf
  • 最后活动时间: 2026-03-23

Speech-AI-Forge

一站式语音AI平台,集成ChatTTS、CosyVoice、Fish-Speech等多种模型,提供API服务器和Gradio WebUI界面。

  • Stars: ⭐️ 1.4k
  • Tags: TTS ASR 语音合成 WebUI
  • 最后活动时间: 2026-05-21

SoniTranslate

视频同步翻译与自动配音工具,结合ASR、TTS和翻译技术实现跨语言视频内容转换。

  • Stars: ⭐️ 1.4k
  • Tags: 视频配音 翻译 TTS ASR
  • 最后活动时间: 2026-08-29

wespeaker

面向研究和生产的说话人验证、识别和分割工具包。

  • Stars: ⭐️ 1.4k
  • Tags: speaker-verification speaker-recognition speaker-diarization pytorch
  • 最后活动时间: 2026-07-08

Fun-ASR

通义实验室推出的端到端语音识别大模型,支持说话人分离等功能。

  • Stars: ⭐️ 1.4k
  • Tags: ASR Speech Recognition Audio
  • 最后活动时间: 2026-07-14

CrisperWhisper

基于Whisper改进的逐字语音识别模型,提供更精确的词级时间戳和填充词检测功能。

  • Stars: ⭐️ 1.4k
  • Tags: ASR 语音识别 Whisper
  • 最后活动时间: 2026-09-14

transcribe-anything

多后端Whisper语音转文字工具,支持本地文件和URL输入,Mac ARM优化,完全私密免费。

  • Stars: ⭐️ 1.4k
  • Tags: whisper speech-to-text transcription audio
  • 最后活动时间: 2026-07-11

MOSS-TTSD

支持长上下文建模、多说话人合成和零样本语音克隆的语音对话生成模型。

  • Stars: ⭐️ 1.4k
  • Tags: text-to-speech speech-synthesis voice-cloning streaming
  • 最后活动时间: 2026-09-06

ThinkSound

NeurIPS 2025 论文实现,基于思维链(CoT)推理的统一多模态音频生成框架。支持从文本和视频等多种模态生成高质量音频。

  • Stars: ⭐️ 1.4k
  • Tags: text-to-audio video-to-audio pytorch neurips audio-generation
  • 最后活动时间: 2026-04-03

ThinkSound

NeurIPS 2025论文实现,基于思维链推理的多模态音频生成框架,支持文本、视频等输入生成音频。

  • Stars: ⭐️ 1.4k
  • Tags: text-to-audio video-to-audio multimodal audio-generation pytorch
  • 最后活动时间: 2026-04-03

python-audio-separator

基于预训练模型的音频分离工具,支持从音乐中提取人声、伴奏等音轨,提供命令行和Python API两种使用方式。

  • Stars: ⭐️ 1.4k
  • Tags: audio-separation stem-separation music-processing deep-learning
  • 最后活动时间: 2026-08-27

k2

可微分的FSA/FST算法库,与PyTorch兼容,专为语音识别等序列建模任务设计。

  • Stars: ⭐️ 1.4k
  • Tags: speech-recognition fst differentiable pytorch
  • 最后活动时间: 2026-07-11

Matcha-TTS

ICASSP 2024发表的快速文本转语音架构,采用条件流匹配技术实现高质量语音合成。

  • Stars: ⭐️ 1.4k
  • Tags: TTS 流匹配 语音合成
  • 最后活动时间: 2026-08-31

faster-qwen3-tts

基于Qwen3-TTS的实时文本转语音工具,提供高效的语音合成能力。

  • Stars: ⭐️ 1.4k
  • Tags: TTS Qwen3 Real-time
  • 最后活动时间: 2026-08-25

dicio-android

开源Android离线语音助手,基于Vosk实现本地语音识别与唤醒词检测,支持多种技能扩展。

  • Stars: ⭐️ 1.3k
  • Tags: 语音助手 离线STT Android Vosk
  • 最后活动时间: 2026-04-23

OBS-captions-plugin

利用 Google 语音识别技术为 OBS 提供实时字幕生成的插件。能够将语音快速准确地转换为屏幕显示文本。

  • Stars: ⭐️ 1.3k
  • Tags: speech-to-text obs captions google-speech
  • 最后活动时间: 2026-08-25

VoiceprintRecognition-Pytorch

声纹识别工具库,支持EcapaTdnn、ResNetSE、CAM++等先进模型,适用于说话人识别和验证场景。

  • Stars: ⭐️ 1.3k
  • Tags: voiceprint-recognition speaker-recognition arcface pytorch
  • 最后活动时间: 2026-09-15

sokuji

实时语音翻译工具,支持本地 AI 和多种云端服务商,提供 Chrome 扩展和桌面应用。

  • Stars: ⭐️ 1.3k
  • Tags: Translation Speech-to-Speech Real-time
  • 最后活动时间: 2026-09-17

Irodori-TTS

基于Flow Matching的文本转语音模型,支持Emoji表情驱动的风格控制,实现富有表现力的语音合成。

  • Stars: ⭐️ 1.3k
  • Tags: text-to-speech tts flow-matching voice-cloning speech-synthesis
  • 最后活动时间: 2026-09-12

Audio8_TTS

紧凑型规模的SOTA(当前最佳)文本转语音(TTS)模型。以极小的体量提供顶级的语音合成质量。

  • Stars: ⭐️ 1.3k
  • Tags: tts text-to-speech audio-synthesis voice-cloning
  • 最后活动时间: 2026-09-02

my-translator

实时语音翻译工具,支持macOS和Windows,本地运行无需服务器,使用用户自己的API密钥实现语音转文字和文字转语音。

  • Stars: ⭐️ 1.3k
  • Tags: speech-translation stt tts real-time tauri
  • 最后活动时间: 2026-07-11

ASR-LLM-TTS

基于开源模型构建的语音交互系统,串联集成ASR语音识别、LLM大语言模型和TTS语音合成,实现完整的语音对话功能。

  • Stars: ⭐️ 1.3k
  • Tags: ASR LLM TTS 语音交互 Qwen
  • 最后活动时间: 2026-06-03

muesli

一款专为 macOS 设计的本地会议转录与听写工具,注重隐私保护。可作为 Granola 和 WisprFlow 的替代方案,提供高效的语音转文字体验。

  • Stars: ⭐️ 1.3k
  • Tags: macos speech-to-text transcription on-device-ai privacy-first
  • 最后活动时间: 2026-09-16

FireRedTTS3

FireRedTTS3 是先进的多语言多方言语音克隆系统,支持指令引导的语音设计与精确语音编辑。

  • Stars: ⭐️ 1.3k
  • Tags: TTS VoiceCloning Multilingual SpeechEditing
  • 最后活动时间: 2026-09-08

MSST-WebUI

面向音乐源分离的 WebUI,集成 MSST 与 UVR,可用于人声/伴奏分离等音频 AI 处理。

  • Stars: ⭐️ 1.3k
  • Tags: music-source-separation audio webui uvr python
  • 最后活动时间: 2026-09-16

speech-trident

精选语音/音频大语言模型、表示学习和编解码模型资源合集。

  • Stars: ⭐️ 1.2k
  • Tags: speech-llm audio-models codec representation-learning
  • 最后活动时间: 2026-07-10

Mousai

开源歌曲识别应用,类似Shazam,可在数秒内识别正在播放的歌曲。基于GNOME/GTK的Linux桌面应用。

  • Stars: ⭐️ 1.2k
  • Tags: music-recognition shazam-like audio-fingerprinting linux gnome
  • 最后活动时间: 2026-09-07

AI-Song-Cover-RVC

AI歌曲翻唱全流程工具,集成YouTube下载、人声分离、音频分割、训练和推理功能。

  • Stars: ⭐️ 1.2k
  • Tags: rvc voice-conversion audio music
  • 最后活动时间: 2026-05-31

AVA-AI-Voice-Agent-for-Asterisk

集成Asterisk/FreePBX的开源AI语音智能体,使用Audiosocket/RTP技术。

  • Stars: ⭐️ 1.2k
  • Tags: voice-agent asterisk freepbx voip
  • 最后活动时间: 2026-09-14

ekho

开源中文文本转语音引擎,支持粤语、藏语等多种中文方言。

  • Stars: ⭐️ 1.2k
  • Tags: chinese cantonese tts text-to-speech
  • 最后活动时间: 2026-09-02

MusicRecognizer

开源Android音乐识别应用,集成AudD、ACRCloud和Shazam等多种识别服务,实现快速歌曲识别。

  • Stars: ⭐️ 1.2k
  • Tags: music-recognition shazam audd acrcloud android audio-fingerprinting
  • 最后活动时间: 2026-07-20

quillman

基于无服务器架构的 AI 语音聊天应用,支持语音识别和自然对话。

  • Stars: ⭐️ 1.2k
  • Tags: voice-chat speech-recognition serverless python
  • 最后活动时间: 2026-05-28

TTS-Audio-Suite

ComfyUI多引擎TTS集成节点,支持10+主流语音合成引擎,提供角色配音和时间轴功能。

  • Stars: ⭐️ 1.2k
  • Tags: TTS ComfyUI Voice Cloning Audio Generation
  • 最后活动时间: 2026-09-05

parrot

极简主义的 macOS 语音听写工具,通过语音识别将你说的话即时转为文字输入,大幅提升打字效率。

  • Stars: ⭐️ 1.2k
  • Tags: macOS dictation speech-to-text voice-input productivity
  • 最后活动时间: 2026-07-30

speech-swift

专为 Apple Silicon 设计的 AI 语音工具包,支持语音识别、语音合成、语音增强和说话人分离等功能。

  • Stars: ⭐️ 1.2k
  • Tags: speech-recognition text-to-speech apple-silicon mlx coreml
  • 最后活动时间: 2026-09-12

voxceleb_trainer

基于度量学习的说话人识别训练框架,面向 VoxCeleb 的说话人验证与声纹嵌入学习。

  • Stars: ⭐️ 1.2k
  • Tags: speaker-recognition metric-learning voxceleb speaker-verification
  • 最后活动时间: 2026-04-22

offline-translator

基于Firefox翻译模型的Android离线翻译工具,支持设备端本地翻译,无需网络连接。

  • Stars: ⭐️ 1.2k
  • Tags: translation android offline machine-translation
  • 最后活动时间: 2026-08-29

VibeVoice

一个专注于生成富有表现力的长篇对话语音的合成项目社区分支。它致力于提供更自然、连贯的语音合成体验。

  • Stars: ⭐️ 1.2k
  • Tags: TTS Speech Synthesis Voice Cloning Audio Generation
  • 最后活动时间: 2026-06-12

lhotse

机器学习多模态数据处理工具集,专注于语音识别和音频数据处理。

  • Stars: ⭐️ 1.2k
  • Tags: audio speech-recognition pytorch deep-learning
  • 最后活动时间: 2026-09-11

aTrain

离线语音转录GUI工具,支持说话人分离,基于最新机器学习模型。

  • Stars: ⭐️ 1.1k
  • Tags: speech-recognition transcription speaker-diarization
  • 最后活动时间: 2026-05-28

conformer

INTERSPEECH 2020论文非官方实现,卷积增强的Transformer语音识别模型,结合CNN局部建模与Transformer全局建模优势。

  • Stars: ⭐️ 1.1k
  • Tags: conformer speech-recognition asr transformer
  • 最后活动时间: 2026-06-29

voicevox_core

免费的中高质量文本转语音软件核心引擎。支持本地化部署,提供自然的日语语音合成能力。

  • Stars: ⭐️ 1.1k
  • Tags: tts speech-synthesis voice-synthesis
  • 最后活动时间: 2026-08-10

nnAudio

基于PyTorch的音频处理库,使用1D卷积网络实现高效的频谱图转换。

  • Stars: ⭐️ 1.1k
  • Tags: audio-processing spectrogram pytorch neural-network
  • 最后活动时间: 2026-05-21

Mega-ASR

专为真实复杂声学环境构建的基础自动语音识别(ASR)模型。在多种真实场景下表现显著优于现有SOTA模型。

  • Stars: ⭐️ 1.1k
  • Tags: asr speech-recognition audio robust
  • 最后活动时间: 2026-06-02

Qwen3-Audiobook-Converter

基于Qwen3 TTS语音模型的有声书转换工具,支持PDF、EPUB、DOCX等多种格式转换为高质量有声书。

  • Stars: ⭐️ 1.1k
  • Tags: tts audiobook qwen3 voice-synthesis document-converter
  • 最后活动时间: 2026-04-07

MiMo-Audio

音频语言模型项目,展示音频模型在少样本学习场景下的强大能力。

  • Stars: ⭐️ 1.1k
  • Tags: audio-language-model multimodal few-shot-learning
  • 最后活动时间: 2026-06-17

murmure

完全本地化、隐私优先的跨平台语音转文字工具,集成LLM后处理功能。

  • Stars: ⭐️ 1.1k
  • Tags: Speech-to-Text Privacy Local AI
  • 最后活动时间: 2026-09-16

GLM-TTS

可控情感表达的零样本TTS模型,支持多奖励强化学习优化。

  • Stars: ⭐️ 1.1k
  • Tags: tts speech-synthesis zero-shot emotion
  • 最后活动时间: 2026-04-10

violin

开源视频翻译技能,集成ASR语音识别与配音功能,支持多语言视频内容转换。

  • Stars: ⭐️ 1.1k
  • Tags: video-translation asr dubbing agent-skills
  • 最后活动时间: 2026-09-04

AuK

开源语音生成与编辑基础模型,支持零样本TTS、语音分离、说话人提取和语音增强。

  • Stars: ⭐️ 1.0k
  • Tags: speech tts foundation-models pytorch zero-shot-tts
  • 最后活动时间: 2026-09-16

vits-simple-api

一个简洁的VITS语音合成HTTP API,支持BERT-VITS2和GPT-SoVITS等多种模型,方便快速部署TTS服务。

  • Stars: ⭐️ 1.0k
  • Tags: tts vits tts-api bert-vits2
  • 最后活动时间: 2026-05-18

tada

开源语音语言模型,将语音处理与大语言模型能力相结合。

  • Stars: ⭐️ 1.0k
  • Tags: speech-language-model audio speech llm open-source
  • 最后活动时间: 2026-05-11

Cognitive-Speech-TTS

微软认知服务TTS API的多语言示例代码,支持自定义神经语音。

  • Stars: ⭐️ 1.0k
  • Tags: azure-tts text-to-speech speech-sdk neural-voice
  • 最后活动时间: 2026-09-17

TensorFlowASR

基于 TensorFlow 2 的端到端自动语音识别框架,支持多种先进模型如 Conformer、Jasper 等。

  • Stars: ⭐️ 1.0k
  • Tags: speech-recognition tensorflow asr deep-learning conformer
  • 最后活动时间: 2026-09-13

voquill

开源的语音听写工具,WisprFlow的免费替代方案。支持本地AI语音转文字,基于Whisper技术构建。

  • Stars: ⭐️ 1.0k
  • Tags: speech-to-text whisper local-ai dictation
  • 最后活动时间: 2026-08-01

alexandria-audiobook

AI驱动的多语音有声书生成器,支持LLM脚本标注、语音克隆、LoRA训练,基于Qwen3-TTS构建,可导出MP3、M4B等多格式。

  • Stars: ⭐️ 1.0k
  • Tags: audiobook-generator text-to-speech voice-cloning tts ai
  • 最后活动时间: 2026-08-02

jzsub

JZSub 是一款自动化视频处理工具,通过一条视频链接即可生成最高画质并附带 GPT 双语字幕的 MP4 文件。极大简化了视频字幕翻译与下载流程。

  • Stars: ⭐️ 989
  • Tags: bilingual subtitles video gpt yt-dlp
  • 最后活动时间: 2026-07-29

parakeet-mlx

Nvidia Parakeet语音模型的Apple Silicon优化实现,基于MLX框架提供高效语音识别。

  • Stars: ⭐️ 981
  • Tags: parakeet mlx speech-recognition apple-silicon
  • 最后活动时间: 2026-08-29

Step-Audio-EditX

30亿参数的LLM音频编辑模型,支持情感、风格编辑及零样本语音合成。

  • Stars: ⭐️ 978
  • Tags: audio-editing tts voice-cloning reinforcement-learning
  • 最后活动时间: 2026-04-09

whisper-flow

基于OpenAI Whisper的实时音频转录框架,支持流式音频处理和增量转录输出。

  • Stars: ⭐️ 969
  • Tags: speech-to-text whisper real-time transcription
  • 最后活动时间: 2026-08-16

SoulX-Singer

零样本歌唱语音合成项目,支持高质量歌声生成与推理。

  • Stars: ⭐️ 965
  • Tags: singing-voice-synthesis zero-shot audio-generation tts
  • 最后活动时间: 2026-05-29

VoiceStreamAI

近实时音频转写系统,使用自托管Whisper和WebSocket实现Python/JS端流式语音识别。

  • Stars: ⭐️ 960
  • Tags: speech-to-text whisper websocket realtime
  • 最后活动时间: 2026-08-13

sopro

支持零样本语音克隆的轻量级文本转语音模型。

  • Stars: ⭐️ 954
  • Tags: text-to-speech voice-cloning zero-shot tts
  • 最后活动时间: 2026-09-01

ShazamIO

异步Shazam API库,用于音乐识别和音频指纹识别,支持Python 3.10+。

  • Stars: ⭐️ 951
  • Tags: shazam music-identification asyncio aiohttp python3
  • 最后活动时间: 2026-09-16

kapre

Keras音频预处理库,提供可GPU加速的声谱图计算层。

  • Stars: ⭐️ 947
  • Tags: audio-processing keras spectrogram
  • 最后活动时间: 2026-05-17

BS-RoFormer

Band Split Roformer实现,ByteDance AI Labs的SOTA音乐源分离注意力网络。

  • Stars: ⭐️ 943
  • Tags: music-source-separation transformers attention pytorch
  • 最后活动时间: 2026-06-14

botium-speech-processing

Botium语音处理工具,集成语音转文本与文本转语音功能。

  • Stars: ⭐️ 943
  • Tags: speech-to-text text-to-speech botium
  • 最后活动时间: 2026-09-02

whisper.net

基于Whisper模型的.NET语音识别库,支持跨平台语音转文字和翻译功能,简单易用。

  • Stars: ⭐️ 942
  • Tags: speech-recognition speech-to-text whisper dotnet
  • 最后活动时间: 2026-09-14

persona

一个致力于将实时语音技术带入现实生活的开源项目。它提供了流畅且低延迟的语音交互体验。

  • Stars: ⭐️ 942
  • Tags: voice real-time audio speech
  • 最后活动时间: 2026-09-02

vocotype-cli

本地端侧隐私安全语音输入工具,支持语音实时转文字、MCP集成、AI文本优化及自定义词典功能。

  • Stars: ⭐️ 935
  • Tags: asr speech-to-text voice-input mcp funasr
  • 最后活动时间: 2026-09-14

brain2qwerty

利用卷积编码器、Transformer和字符级语言模型,从非侵入式MEG和EEG脑电记录中解码打字句子。结合深度学习实现高精度的脑机接口文本生成。

  • Stars: ⭐️ 933
  • Tags: brain-computer-interface eeg meg transformer neural-decoding
  • 最后活动时间: 2026-09-10

micro-wake-word

基于TensorFlow的唤醒词检测训练框架,支持合成样本生成,适用于微控制器部署。

  • Stars: ⭐️ 932
  • Tags: wake-word keyword-spotting tensorflow embedded-ai audio
  • 最后活动时间: 2026-07-06

video-translator

一个实时视频翻译和配音技能项目,能够将视频内容快速转化为目标语言。

  • Stars: ⭐️ 929
  • Tags: video-translation dubbing real-time multimodal
  • 最后活动时间: 2026-06-17

whoBIRD

基于BirdNET的Android实时鸟类声音识别应用,支持全球6000+种鸟类的声音识别。

  • Stars: ⭐️ 911
  • Tags: audio-recognition birdnet android real-time
  • 最后活动时间: 2026-08-02

ccextractor

强大的字幕提取工具,支持从视频流中提取隐藏字幕,集成OCR技术识别图像字幕。

  • Stars: ⭐️ 903
  • Tags: 字幕提取 OCR 视频处理
  • 最后活动时间: 2026-09-12

TypeNo

一款免费开源、隐私优先的macOS语音输入应用,支持本地语音转文字功能。

  • Stars: ⭐️ 898
  • Tags: speech-to-text macos privacy voice-input swift
  • 最后活动时间: 2026-08-28

TheWhisper

优化版Whisper模型,专为流式和端设备语音识别设计,支持多平台硬件加速。

  • Stars: ⭐️ 897
  • Tags: whisper speech-recognition streaming on-device-ai
  • 最后活动时间: 2026-06-15

MidiTok

为深度学习模型设计的MIDI/符号音乐标记器,支持音乐生成与信息检索任务。

  • Stars: ⭐️ 896
  • Tags: deep-learning midi music-generation tokenization
  • 最后活动时间: 2026-09-08

local-talking-llm

完全离线运行的语音对话LLM应用,集成语音识别与语音合成功能,无需联网即可使用。

  • Stars: ⭐️ 890
  • Tags: speech-recognition speech-synthesis local-llm chatbot
  • 最后活动时间: 2026-04-04

pdf-to-podcast

将PDF文档转换为AI生成的播客音频,基于NVIDIA NIM构建,支持随时随地收听文档内容。

  • Stars: ⭐️ 875
  • Tags: PDF TTS 播客 音频生成
  • 最后活动时间: 2026-06-26

Easy-Voice-Toolkit

用户友好的音频工具包,支持语音识别、转录、转换等多种功能,简化音频处理流程。

  • Stars: ⭐️ 873
  • Tags: 语音识别 TTS 音频处理
  • 最后活动时间: 2026-09-09

subvert

视频字幕生成工具,秒级生成字幕、摘要和章节标记。结合ChatGPT和Whisper,自动化视频内容处理流程。

  • Stars: ⭐️ 869
  • Tags: 字幕生成 视频处理 Whisper
  • 最后活动时间: 2026-05-15

auditok

音频活动检测与分割工具,支持语音活动检测(VAD),是语音识别预处理的重要组件。

  • Stars: ⭐️ 861
  • Tags: audio vad voice-activity-detection audio-segmentation
  • 最后活动时间: 2026-07-28

Caption-Trans

一站式视频字幕翻译工具,帮助创作者快速为视频生成并翻译多语言字幕。适合需要本地化视频内容的开发者和内容创作者。

  • Stars: ⭐️ 861
  • Tags: subtitle translation video speech-to-text localization
  • 最后活动时间: 2026-03-23

Kokoros

基于Kokoro模型的Rust高性能TTS实现,提供极速、高质量的实时语音合成能力。

  • Stars: ⭐️ 824
  • Tags: TTS Rust 语音合成
  • 最后活动时间: 2026-08-04

voxtral-mini-realtime-rs

基于Rust和Burn ML框架实现的Mistral Voxtral Mini 4B实时语音识别模型,支持本地运行和浏览器WASM部署。

  • Stars: ⭐️ 821
  • Tags: speech-recognition rust mistral asr wasm realtime
  • 最后活动时间: 2026-04-02

claude-watch

赋予Claude观看视频能力的工具,能提取场景变化帧、转录文本并生成结构化报告。

  • Stars: ⭐️ 821
  • Tags: claude video-analysis multimodal transcript
  • 最后活动时间: 2026-07-24

MioSub

一站式全自动字幕生成软件,覆盖下载、转录、翻译到压制全流程,无需人工介入。

  • Stars: ⭐️ 816
  • Tags: speech-to-text whisper subtitle-generator transcription diarization
  • 最后活动时间: 2026-07-18

AlphaAvatar

基于LiveKit的实时交互式全能虚拟化身平台,支持无缝集成各类开源虚拟角色组件,包括实时模型、视觉、语音、记忆和搜索功能。

  • Stars: ⭐️ 815
  • Tags: Avatar Real-time LiveKit
  • 最后活动时间: 2026-09-16

GigaAM

强大的语音识别基础模型,支持语音识别、情感识别等任务,采用自监督学习方法训练。

  • Stars: ⭐️ 815
  • Tags: speech-recognition foundation-models self-supervised-learning emotion-recognition
  • 最后活动时间: 2026-08-17

CloneTTS

轻量级离线Android TTS引擎,支持系统级语音克隆和高保真朗读。

  • Stars: ⭐️ 815
  • Tags: text-to-speech voice-cloning android offline-tts
  • 最后活动时间: 2026-07-30

lue

支持多种格式的终端电子书阅读器,内置高质量文本转语音(TTS)功能。为开发者在命令行中听书提供了极佳的体验。

  • Stars: ⭐️ 810
  • Tags: cli ebook reader text-to-speech tts tui
  • 最后活动时间: 2026-07-16

TTS-Voice-Wizard

强大的语音转换工具,支持语音识别、TTS和实时翻译,可集成VRChat虚拟形象显示,适合VTuber使用。

  • Stars: ⭐️ 807
  • Tags: TTS STT VRChat VTuber
  • 最后活动时间: 2026-08-19

ZerolanLiveRobot

集成LLM、ASR、TTS、OCR、CV等技术的AI虚拟主播,支持直播和Minecraft互动。

  • Stars: ⭐️ 804
  • Tags: ai-vtuber llm tts asr multimodal
  • 最后活动时间: 2026-04-14

Confucius4-TTS

支持多语言和跨语言的零样本文本转语音(TTS)引擎,能够实现高质量的语音克隆与合成。

  • Stars: ⭐️ 796
  • Tags: tts zero-shot-tts voice-clone speech-synthesis pytorch
  • 最后活动时间: 2026-09-03

audio-diffusion

使用扩散模型进行音乐合成,基于Hugging Face diffusers实现音频生成。

  • Stars: ⭐️ 794
  • Tags: music-generation diffusion-models audio-synthesis
  • 最后活动时间: 2026-09-06

BiBi-Keyboard

基于Kotlin的Android语音输入法键盘,集成LLM与ASR语音识别,支持智能语音输入。

  • Stars: ⭐️ 793
  • Tags: Android ASR Keyboard Speech-to-Text
  • 最后活动时间: 2026-09-15

translate

实时手语翻译工具,利用计算机视觉技术实现无障碍沟通,支持Android、iOS和Web多平台。

  • Stars: ⭐️ 791
  • Tags: sign-language sign-language-recognition computer-vision translation
  • 最后活动时间: 2026-08-11

parakeet.cpp

基于 ggml 的 Parakeet 模型 C++ 实现,专注于高效的语音识别与处理。提供轻量级的本地推理能力,适合在资源受限的环境下部署。

  • Stars: ⭐️ 786
  • Tags: parakeet cpp ggml stt speech-recognition
  • 最后活动时间: 2026-08-28

Dolphin

由数据海洋AI与清华大学联合训练的多语言、多任务自动语音识别(ASR)模型。

  • Stars: ⭐️ 778
  • Tags: asr speech-recognition multilingual ai
  • 最后活动时间: 2026-06-11

mlx-audio-swift

基于Apple Silicon的模块化Swift音频处理SDK,支持语音识别、语音合成和端到端语音处理。

  • Stars: ⭐️ 776
  • Tags: mlx speech-to-text text-to-speech swift apple-silicon
  • 最后活动时间: 2026-09-13

sgmse

基于扩散模型的语音增强与去混响工具,利用分数生成模型实现高质量语音处理。

  • Stars: ⭐️ 771
  • Tags: Diffusion 语音增强 音频处理
  • 最后活动时间: 2026-05-12

vui

1亿参数轻量级对话式 TTS 模型,支持呼吸声、笑声、多说话人对话、声音克隆和流式推理。

  • Stars: ⭐️ 765
  • Tags: lightweight-tts llama voice-cloning on-device
  • 最后活动时间: 2026-09-12

audioseal

专为AI生成语音设计的局部水印工具,在鲁棒性和检测速度上达到SOTA水平。

  • Stars: ⭐️ 763
  • Tags: audio-watermarking ai-generated-speech deepfake-detection audio-security
  • 最后活动时间: 2026-05-19

fish-diffusion

易于理解的 TTS/SVS/SVC 统一框架,基于扩散模型实现语音合成与转换。

  • Stars: ⭐️ 761
  • Tags: diffusion tts voice-conversion pytorch
  • 最后活动时间: 2026-09-07

tts

Inworld TTS 语音合成引擎,提供高质量文本转语音服务。

  • Stars: ⭐️ 758
  • Tags: tts text-to-speech voice-synthesis
  • 最后活动时间: 2026-09-14

ComfyUI-Index-TTS

ComfyUI 的 IndexTTS 自定义节点,支持中英文文本转语音和声音克隆。

  • Stars: ⭐️ 754
  • Tags: comfyui index-tts voice-cloning
  • 最后活动时间: 2026-09-02

MimikaStudio

macOS本地优先应用,集成MCP智能体支持、TTS语音合成与声音克隆功能。

  • Stars: ⭐️ 741
  • Tags: tts voice-cloning mcp qwen agent
  • 最后活动时间: 2026-04-01

ttsfm

镜像OpenAI TTS服务的开源实现,提供兼容的文本转语音接口,支持多种语音选项。

  • Stars: ⭐️ 737
  • Tags: tts openai-api text-to-speech self-hosted
  • 最后活动时间: 2026-06-30

TranscriptionSuite

完全本地化且隐私安全的语音转文字应用,支持说话人分离、实时转录和LM Studio集成。提供跨平台的音频笔记本模式,兼容多种 Whisper 模型。

  • Stars: ⭐️ 736
  • Tags: speech-to-text whisper transcription local diarization
  • 最后活动时间: 2026-09-15

Thorsten-Voice

高质量德语 TTS 语音数据集,免费离线使用,无许可证限制。

  • Stars: ⭐️ 732
  • Tags: german-tts speech-dataset open-source
  • 最后活动时间: 2026-08-04

voice-ai

端到端语音AI编排平台,支持构建实时对话语音智能体,集成STT、TTS、VAD和多通道能力。

  • Stars: ⭐️ 731
  • Tags: Voice AI STT/TTS Voice Agents Real-time Audio
  • 最后活动时间: 2026-09-14

MASR

流式与非流式自动语音识别框架,支持Conformer、Squeezeformer等模型,兼容在线和离线识别场景。

  • Stars: ⭐️ 727
  • Tags: asr speech-recognition conformer streaming
  • 最后活动时间: 2026-07-06

voicetypr

基于 Whisper 的离线语音转文字听写工具,面向 macOS 与 Windows,强调本地隐私与高效输入。

  • Stars: ⭐️ 719
  • Tags: whisper speech-to-text offline-ai voice-dictation tauri
  • 最后活动时间: 2026-09-14

voicetypr

基于 Whisper AI 的离线语音转文字工具,专为开发者和高级用户设计。支持 macOS 和 Windows,提供高效的本地语音听写体验。

  • Stars: ⭐️ 717
  • Tags: voice-to-text whisper-ai tauri voice-assistant
  • 最后活动时间: 2026-09-06

UVR5-UI

基于Gradio的人声分离工具,支持多种模型将音频分离为人声和伴奏轨道。

  • Stars: ⭐️ 716
  • Tags: audio-separation vocal-remover gradio
  • 最后活动时间: 2026-06-26

openspeech

基于PyTorch-Lightning和Hydra的端到端语音识别工具包,提供完整ASR解决方案。

  • Stars: ⭐️ 714
  • Tags: ASR PyTorch 端到端
  • 最后活动时间: 2026-06-21

WolfCut

一款免费开源的跨平台视频编辑器,旨在替代CapCut。它集成了Whisper-cpp实现自动字幕生成,支持离线优先的视频处理。

  • Stars: ⭐️ 714
  • Tags: video-editing whisper-cpp auto-caption tauri-app rust-lang
  • 最后活动时间: 2026-08-30

rhino

基于深度学习的端上语音意图识别引擎,用于语音助手和命令控制。

  • Stars: ⭐️ 711
  • Tags: speech-recognition nlu voice-assistant intent-recognition on-device
  • 最后活动时间: 2026-09-09

sanoTTS

sanoTTS 是仅约140万参数的超轻量神经TTS,可在廉价芯片或浏览器中运行,小型模型评测中表现领先。

  • Stars: ⭐️ 707
  • Tags: TTS Lightweight EdgeAI NeuralTTS
  • 最后活动时间: 2026-09-16

whisper_android

基于OpenAI Whisper的Android离线语音识别方案,使用TensorFlow Lite实现本地化部署,无需网络即可运行。

  • Stars: ⭐️ 689
  • Tags: 语音识别 Android 离线推理
  • 最后活动时间: 2026-03-18

FireRedASR2S

工业级全功能ASR语音识别系统,支持ASR、VAD、语言识别和标点预测,覆盖中文方言、英文及代码切换场景。

  • Stars: ⭐️ 684
  • Tags: asr speech-recognition vad multimodal llm
  • 最后活动时间: 2026-06-02

openlrc

使用Whisper和LLM进行语音转录与翻译,自动生成LRC字幕文件。

  • Stars: ⭐️ 679
  • Tags: Whisper Transcription Subtitle
  • 最后活动时间: 2026-08-10

expo-speech-recognition

React Native Expo 语音识别库,支持语音转文字功能,适用于移动端语音交互应用开发。

  • Stars: ⭐️ 679
  • Tags: speech-recognition speech-to-text react-native expo voice-recognition
  • 最后活动时间: 2026-09-16

aiavatarkit

快速构建 AI 驱动的对话虚拟形象工具包。

  • Stars: ⭐️ 672
  • Tags: ai-avatar chatgpt voicevox vrchat
  • 最后活动时间: 2026-09-15

cheetah

基于深度学习的端上流式语音转文字引擎,支持实时转录。

  • Stars: ⭐️ 671
  • Tags: speech-recognition asr speech-to-text on-device streaming
  • 最后活动时间: 2026-09-09

hear

undefined

  • Stars: ⭐️ 669
  • Tags: speech-recognition transcription macos cli
  • 最后活动时间: 2026-08-30

LiveTranslate

实时音频翻译工具,捕获系统音频与麦克风,运行 Whisper/SenseVoice 语音识别并通过 LLM 流式翻译显示,适合主播与外语内容观看。

  • Stars: ⭐️ 666
  • Tags: real-time-translation asr whisper speech-recognition subtitle
  • 最后活动时间: 2026-08-17

MOSS-Audio

开源的统一音频理解基础模型,支持语音、声音、音乐的识别、问答与推理。

  • Stars: ⭐️ 665
  • Tags: audio-understanding speech-recognition audio-reasoning open-source-models
  • 最后活动时间: 2026-09-06

FoleyCrafter

IJCV论文,为无声视频生成生动同步的音效,AI拟音大师。

  • Stars: ⭐️ 664
  • Tags: diffusion-models video-to-audio foley-sound-synthesis
  • 最后活动时间: 2026-06-15

macparakeet

一款专为 Apple Silicon Mac 设计的本地优先语音应用,支持听写、文件转录和会议录音。提供隐私保护的开源自动化语音转文本解决方案。

  • Stars: ⭐️ 651
  • Tags: apple-silicon dictation speech-to-text transcription local-first
  • 最后活动时间: 2026-09-17

xiaohu-video-translate

一句话即可为外语视频自动添加中文字幕的AI工具,集下载、语音转写、翻译、润色与字幕烧录于一体。全程本地运行,转写零API费用。

  • Stars: ⭐️ 647
  • Tags: video-translation speech-to-text subtitles whisper local-ai
  • 最后活动时间: 2026-06-08

CrispASR

基于C++和ggml构建的多语言ASR与TTS运行时中心,支持Cohere Transcribe、Voxtral等多种语音模型及强制对齐功能。

  • Stars: ⭐️ 640
  • Tags: ggml speech-recognition speech-to-text stt transcription whisper-cpp
  • 最后活动时间: 2026-09-16

tts

基于Go语言开发的文本转语音(TTS)服务,提供语音合成能力。

  • Stars: ⭐️ 637
  • Tags: tts go speech-synthesis
  • 最后活动时间: 2026-04-28

free-voice-clone

收录了所有可本地运行的免费开源声音克隆 TTS 模型与音乐生成模型清单,帮助你快速挑选合适的语音克隆方案。

  • Stars: ⭐️ 630
  • Tags: TTS voice-clone speech-synthesis open-source awesome-list
  • 最后活动时间: 2026-04-09

Pandrator

将PDF、EPUB转换为有声书,支持视频配音和翻译。使用本地模型XTTS实现语音克隆,提供友好的GUI界面。

  • Stars: ⭐️ 625
  • Tags: text-to-speech voice-cloning audiobook xtts llm
  • 最后活动时间: 2026-09-16

pindrop

一款原生 macOS 菜单栏听写应用,使用 WhisperKit 实现本地语音转文字,保护隐私的同时提供高质量的语音识别体验。

  • Stars: ⭐️ 621
  • Tags: speech-to-text whisperkit macos dictation local-ai
  • 最后活动时间: 2026-09-05

audio-separation-nodes-comfyui

ComfyUI 的音频分离节点插件,支持从音频中提取人声、鼓点、贝斯等音轨。提供音频重组、节拍匹配与切片裁剪功能。

  • Stars: ⭐️ 613
  • Tags: comfyui audio-separation stems audio-processing
  • 最后活动时间: 2026-08-17

haoone-app

新一代AI专业字幕软件,基于先进开源ASR模型实现97%+转录准确率,支持说话人识别、AI校正、智能热词、翻译与双语字幕,并提供100+字幕动画及达芬奇/PR插件。

  • Stars: ⭐️ 612
  • Tags: ASR SpeechRecognition Subtitles Transcription AI
  • 最后活动时间: 2026-09-16

room-impulse-responses

房间冲激响应数据集汇总,提供公开数据集列表及下载脚本,适用于语音识别、声学模拟等音频AI研究。

  • Stars: ⭐️ 611
  • Tags: acoustics room-impulse-response speech audio-dataset
  • 最后活动时间: 2026-08-21

LookOnceToHear

一种用于耳机实时语音提取的新型人机交互方法,能够在嘈杂环境中提取目标语音。结合了深度学习和语音分离技术。

  • Stars: ⭐️ 610
  • Tags: speech-extraction real-time audio-processing deep-learning
  • 最后活动时间: 2026-07-22

tiny-tts

最小的英语文本转语音(TTS)模型,仅包含100万参数。适合在资源受限的设备上进行轻量级语音合成。

  • Stars: ⭐️ 598
  • Tags: tts text-to-speech speech-synthesis lightweight-model
  • 最后活动时间: 2026-04-10

auto-caption

一款跨平台的实时字幕显示软件,能够实时将音频转换为文字并展示。适用于会议、直播和日常交流等多种场景。

  • Stars: ⭐️ 580
  • Tags: asr real-time subtitles electron
  • 最后活动时间: 2026-09-07

sag

类似 macOS say 命令的现代化语音合成工具,支持 ElevenLabs 等高质量 AI 语音生成。

  • Stars: ⭐️ 579
  • Tags: elevenlabs tts go speech-synthesis
  • 最后活动时间: 2026-09-14

offmute

利用LLM实现会议转录和说话人分离的实验性工具,探索纯LLM进行音频处理的可行性。

  • Stars: ⭐️ 568
  • Tags: transcription diarization llm meeting
  • 最后活动时间: 2026-04-08

ctc-forced-aligner

基于CTC强制对齐的文本到语音对齐工具,适用于语音合成与识别的数据处理。

  • Stars: ⭐️ 563
  • Tags: forced-alignment speech-to-text text-to-speech ctc
  • 最后活动时间: 2026-09-07

spleeter-web

可自托管的Web应用,用于分离歌曲中的人声、伴奏、贝斯和鼓声。支持Spleeter、Demucs、BS-RoFormer等多种AI分离模型。

  • Stars: ⭐️ 555
  • Tags: source-separation vocal-remover spleeter demucs audio-processing
  • 最后活动时间: 2026-09-02

ComfyUI-OmniVoice-TTS

ComfyUI的OmniVoice TTS节点,支持零样本多语言文本转语音、声音克隆及多说话人对话生成。

  • Stars: ⭐️ 553
  • Tags: comfyui text-to-speech voice-cloning tts
  • 最后活动时间: 2026-06-11

Talkify

一款适用于macOS的极速本地语音听写工具,支持设备端转录。利用Apple Silicon和Metal实现高性能语音识别与合成。

  • Stars: ⭐️ 551
  • Tags: speech-to-text dictation macos apple-silicon local-first
  • 最后活动时间: 2026-09-08

FlashLabs-Chroma

首个开源的实时端到端语音对话模型,支持个性化声音克隆。

  • Stars: ⭐️ 550
  • Tags: speech-to-speech voice-cloning real-time-audio
  • 最后活动时间: 2026-09-04

scenema-audio

零样本情感语音克隆与语音生成工具。仅需10秒参考音频即可克隆声音,并生成带有真实情感和呼吸控制的短音频或长篇有声书。

  • Stars: ⭐️ 544
  • Tags: voice-cloning text-to-speech audio-generation zero-shot
  • 最后活动时间: 2026-07-07

CleanS2S

单文件实现的流式全双工语音交互智能体,支持高质量实时语音对话。

  • Stars: ⭐️ 541
  • Tags: speech-to-speech streaming gpt-4o
  • 最后活动时间: 2026-04-07

UltraSinger

基于AI的工具,能从音乐中提取人声歌词和音高,自动生成Ultrastar Deluxe、Midi和笔记文件。可自动创建卡拉OK文件。

  • Stars: ⭐️ 540
  • Tags: ai audio karaoke lyrics midi music pitch-detection vocal
  • 最后活动时间: 2026-06-30

opentypeless

这是一个开源的AI语音输入工具,支持macOS、Windows和Linux。按下热键说话,自然地获得任何应用中的 polished text。使用Whisper实现语音转文本。

  • Stars: ⭐️ 539
  • Tags: AI Voice Typing Whisper Speech-to-Text Productivity
  • 最后活动时间: 2026-09-09

neural-amp-modeler-lv2

基于机器学习的吉他放大器建模LV2插件,能够精准模拟真实硬件放大器的音色。

  • Stars: ⭐️ 536
  • Tags: machine-learning audio amplifier lv2-plugin guitar
  • 最后活动时间: 2026-09-04

muesli

macOS本地会议转录与听写工具,可作为Granola和WisprFlow的替代方案。支持实时语音转文字,保护隐私的离线处理。

  • Stars: ⭐️ 521
  • Tags: speech-to-text transcription macos dictation local-ai
  • 最后活动时间: 2026-05-27

transcribee

开源的音视频转录软件,支持将音频和视频内容高效转换为文本。

  • Stars: ⭐️ 516
  • Tags: speech-to-text transcription audio video
  • 最后活动时间: 2026-08-24

BeatNet

基于CRNN和粒子滤波的实时音乐节拍、速度和节拍线追踪系统。支持实时与离线的高精度音乐节奏分析。

  • Stars: ⭐️ 516
  • Tags: beat-tracking crnn pytorch real-time music-analysis
  • 最后活动时间: 2026-04-13

subaligner

基于深度神经网络和Transformer的字幕自动同步、翻译与转录工具,支持多种字幕格式和语音活动检测。

  • Stars: ⭐️ 510
  • Tags: subtitle transcription transformers voice-activity-detection dnn
  • 最后活动时间: 2026-09-02

ComfyUI-VoxCPM

ComfyUI节点插件,支持高表现力的语音合成与逼真的零样本声音克隆。为ComfyUI工作流提供强大的文本转语音能力。

  • Stars: ⭐️ 510
  • Tags: comfyui-node text-to-speech voice-cloning tts audio
  • 最后活动时间: 2026-08-06

openreader

开源的伴读文档阅读服务器,集成Kokoro、OpenAI TTS等多种高质量语音合成引擎,支持同步高亮与有声书导出。兼容EPUB、PDF、DOCX、TXT、MD等多种文档格式。

  • Stars: ⭐️ 509
  • Tags: tts text-to-speech epub-reader pdf audiobook document-reader openai
  • 最后活动时间: 2026-09-17

Mediapipe4u-plugin

Unreal Engine的MediaPipe插件,支持面部、手部、姿态追踪及TTS功能。

  • Stars: ⭐️ 508
  • Tags: mediapipe motion-capture tts unreal-engine
  • 最后活动时间: 2026-09-04

FireRedVAD

工业级语音活动检测与音频事件检测模型,支持100+语言,性能超越Silero-VAD、WebRTC-VAD等主流方案。

  • Stars: ⭐️ 508
  • Tags: vad voice-activity-detection audio-event-detection speech
  • 最后活动时间: 2026-05-06

whisper

语音笔记应用,支持语音录制并利用AI进行智能转换和处理。

  • Stars: ⭐️ 504
  • Tags: speech-to-text voice-notes ai-assistant productivity
  • 最后活动时间: 2026-05-25

Audar-ASR-V1

阿拉伯语优先的生成式语音识别模型,在Open Universal Arabic ASR排行榜上排名第一。提供模型卡片、基准测试和推理支持。

  • Stars: ⭐️ 503
  • Tags: arabic asr speech-recognition speech-to-text huggingface
  • 最后活动时间: 2026-08-22

NeMo-text-processing

NVIDIA NeMo 文本处理库,为 ASR 和 TTS 提供专业的文本归一化与逆文本归一化能力。

  • Stars: ⭐️ 502
  • Tags: TextNormalization ASR TTS NeMo
  • 最后活动时间: 2026-09-12

aspeak

Azure TTS API 的简洁命令行客户端,支持高质量语音合成。可快速将文本转换为自然流畅的语音输出。

  • Stars: ⭐️ 500
  • Tags: text-to-speech tts azure-cognitive-services cli
  • 最后活动时间: 2026-04-23

Image Generation

ComfyUI

最强大的模块化扩散模型GUI工具,基于节点的工作流界面,灵活构建复杂图像生成流程。

  • Stars: ⭐️ 133.6k
  • Tags: Stable-Diffusion GUI Image-Generation
  • 最后活动时间: 2026-09-17

tesseract

开源OCR引擎,使用LSTM神经网络进行光学字符识别,支持多种语言。

  • Stars: ⭐️ 76.5k
  • Tags: ocr machine-learning lstm tesseract
  • 最后活动时间: 2026-09-11

face_recognition

最简单易用的人脸识别Python库,支持人脸检测与识别。

  • Stars: ⭐️ 56.8k
  • Tags: face-recognition face-detection python machine-learning
  • 最后活动时间: 2026-06-25

upscayl

免费开源的AI图像放大工具,基于ESRGAN模型实现高质量图像超分辨率重建,支持跨平台使用。

  • Stars: ⭐️ 49.3k
  • Tags: AI图像放大 ESRGAN 开源工具
  • 最后活动时间: 2026-09-15

diffusers

Hugging Face推出的扩散模型库,支持图像、视频和音频生成,是生成式AI领域的核心工具。

  • Stars: ⭐️ 34.5k
  • Tags: Diffusion PyTorch HuggingFace
  • 最后活动时间: 2026-09-17

facefusion

业界领先的人脸处理平台,支持换脸、对口型等多种AI面部操作功能。

  • Stars: ⭐️ 29.9k
  • Tags: 人脸处理 换脸 深度学习
  • 最后活动时间: 2026-09-14

insightface

业界领先的2D/3D人脸分析项目,支持人脸检测、识别、属性分析等任务。

  • Stars: ⭐️ 29.8k
  • Tags: face-recognition face-detection pytorch
  • 最后活动时间: 2026-09-09

blender-mcp

MCP服务器,实现AI与Blender 3D建模软件的集成控制。

  • Stars: ⭐️ 28.7k
  • Tags: mcp blender 3d creative-tools
  • 最后活动时间: 2026-09-15

Open-Generative-AI

开源AI图像生成与视频创作工作室,支持Flux、SDXL、Midjourney等20+模型,可自托管部署。

  • Stars: ⭐️ 28.6k
  • Tags: ai-image-generation ai-video-generation generative-ai flux-1 text-to-video
  • 最后活动时间: 2026-09-15

InvokeAI

领先的Stable Diffusion创意引擎,提供专业级WebUI界面。支持txt2img、img2img、inpainting等多种图像生成与编辑功能。

  • Stars: ⭐️ 28.2k
  • Tags: Stable Diffusion 图像生成 AI艺术
  • 最后活动时间: 2026-09-15

Unlimited-OCR

一款强大的 OCR 工具,旨在开启单次长序列解析的新时代。能够高效处理长文本和复杂版面的图像识别任务。

  • Stars: ⭐️ 25.6k
  • Tags: ocr document-parsing multimodal
  • 最后活动时间: 2026-07-29

rembg

基于深度学习的图像背景移除工具,支持多种AI模型快速精准去除图片背景。

  • Stars: ⭐️ 24.8k
  • Tags: 背景移除 图像处理 计算机视觉
  • 最后活动时间: 2026-09-08

Awesome-Nano-Banana-images

基于Gemini-2.5-flash-image模型的图像生成示例集合,展示Nano Banana系列模型的创意生成能力,并开源Nano-consistent-150K数据集支持社区开发。

  • Stars: ⭐️ 23.7k
  • Tags: image-generation gemini multimodal generative-art
  • 最后活动时间: 2026-09-03

deepface

轻量级人脸分析库,支持年龄、性别、情绪等多属性识别。

  • Stars: ⭐️ 23.5k
  • Tags: face-recognition deep-learning face-analysis python
  • 最后活动时间: 2026-09-16

surya

支持90+语言的OCR工具,提供版面分析、阅读顺序识别和表格识别功能。

  • Stars: ⭐️ 21.4k
  • Tags: ocr layout-analysis table-recognition multilingual
  • 最后活动时间: 2026-09-11

sam2

Meta第二代图像分割模型,支持图像和视频的实时分割,性能显著提升。

  • Stars: ⭐️ 19.9k
  • Tags: segmentation video-segmentation computer-vision meta
  • 最后活动时间: 2026-05-30

ml-stable-diffusion

苹果官方 Core ML 版 Stable Diffusion,可在 Apple Silicon 上高效本地生成图像。

  • Stars: ⭐️ 18.0k
  • Tags: Stable-Diffusion CoreML Apple-Silicon Image-Generation
  • 最后活动时间: 2026-09-11

awesome-gpt-image-2-API-and-Prompts

GPT-Image-2 API 和提示词资源合集,涵盖图像生成、图像到图像转换等功能,帮助开发者快速上手 OpenAI 图像生成技术。

  • Stars: ⭐️ 17.2k
  • Tags: gpt-image-2 image-generation openai prompts text-to-image
  • 最后活动时间: 2026-07-18

lingbot-map

前馈式3D基础模型,用于从流数据中重建场景,支持实时3D场景理解与生成。

  • Stars: ⭐️ 17.1k
  • Tags: 3d-reconstruction foundation-model scene-understanding deep-learning
  • 最后活动时间: 2026-09-08

Waifu2x-Extension-GUI

强大的AI图像视频超分辨率工具,集成多种AI模型,支持图片/视频放大与帧插值。

  • Stars: ⭐️ 17.0k
  • Tags: 超分辨率 图像放大 视频处理
  • 最后活动时间: 2026-09-05

engine

强大的Web图形运行时,支持WebGL、WebGPU、WebXR和3D高斯泼溅神经渲染技术。

  • Stars: ⭐️ 16.9k
  • Tags: 3d-gaussian-splatting webgl webgpu game-engine
  • 最后活动时间: 2026-09-17

img2threejs

将参考图像中的物体重建为纯代码、程序化且可直接用于动画的 Three.js 3D模型。提供了一种高效的图像到3D生成方案。

  • Stars: ⭐️ 16.3k
  • Tags: image-to-3d threejs generative ai-agents procedural-generation
  • 最后活动时间: 2026-09-13

openface

基于深度神经网络的人脸识别工具,支持人脸检测、对齐与特征提取。

  • Stars: ⭐️ 15.4k
  • Tags: face-recognition deep-learning facenet computer-vision
  • 最后活动时间: 2026-07-18

ImageToolbox

功能强大的Android图像处理应用,集成AI背景移除、OCR文字识别、图像放大等智能功能。

  • Stars: ⭐️ 14.7k
  • Tags: 图像处理 OCR 背景移除
  • 最后活动时间: 2026-09-15

vggt

CVPR 2025最佳论文奖获奖项目,视觉几何基础Transformer,在3D视觉理解与几何推理方面取得突破性进展。

  • Stars: ⭐️ 14.4k
  • Tags: computer-vision transformer 3d-reconstruction cvpr2025
  • 最后活动时间: 2026-05-19

open_clip

OpenAI CLIP模型的开源实现,支持多模态对比学习和零样本分类任务。

  • Stars: ⭐️ 14.1k
  • Tags: clip multi-modal zero-shot pytorch
  • 最后活动时间: 2026-09-08

Pillow

Python图像处理库,支持多种图像格式操作。是AI图像处理和计算机视觉任务的基础依赖库。

  • Stars: ⭐️ 13.8k
  • Tags: image-processing python pil
  • 最后活动时间: 2026-09-17

TRELLIS

CVPR 2025 Spotlight论文,基于结构化3D潜变量的可扩展多功能3D生成模型。

  • Stars: ⭐️ 13.7k
  • Tags: 3d-generation image-to-3d text-to-3d cvpr
  • 最后活动时间: 2026-06-26

DiffSynth-Studio

一站式扩散模型创作工作室,支持图像生成、视频合成等多种AI生成任务,轻松体验扩散模型的魔力。

  • Stars: ⭐️ 13.1k
  • Tags: 扩散模型 图像生成 视频合成
  • 最后活动时间: 2026-09-14

Meshroom

基于节点的视觉编程工具箱,用于3D重建和摄影测量,支持计算机视觉工作流自动化。

  • Stars: ⭐️ 13.0k
  • Tags: Computer Vision 3D Reconstruction Photogrammetry
  • 最后活动时间: 2026-09-16

colmap

经典的运动恢复结构与多视图立体视觉系统,用于3D重建与视觉计算研究。

  • Stars: ⭐️ 12.7k
  • Tags: structure-from-motion multi-view-stereo 3d-reconstruction computer-vision
  • 最后活动时间: 2026-09-16

chineseocr_lite

超轻量级中文OCR识别引擎,支持竖排文字,总模型仅4.7M,支持多种推理框架。

  • Stars: ⭐️ 12.3k
  • Tags: ocr ncnn pytorch chinese
  • 最后活动时间: 2026-05-18

chandra

强大的OCR模型,支持复杂表格、表单和手写内容的完整版面识别。

  • Stars: ⭐️ 12.3k
  • Tags: ocr document-processing handwriting-recognition
  • 最后活动时间: 2026-06-26

ian-xiaohei-illustrations

一个用于生成中文小黑怪诞风格正文配图的Codex Skill。支持16:9白底手绘风格,并带有少量红橙蓝批注。

  • Stars: ⭐️ 11.8k
  • Tags: ai-agent codex-skill image-generation illustration chinese
  • 最后活动时间: 2026-06-03

sam3

Meta Segment Anything Model 3 (SAM 3) 的官方仓库,提供模型推理、微调代码及预训练权重下载,支持图像分割任务。

  • Stars: ⭐️ 11.7k
  • Tags: segment-anything image-segmentation computer-vision meta-ai sam
  • 最后活动时间: 2026-08-26

TRELLIS.2

用于3D内容生成的原生紧凑结构化潜变量模型,支持高质量3D资产生成与编辑。

  • Stars: ⭐️ 11.2k
  • Tags: 3d-generation latent-models image-generation deep-learning
  • 最后活动时间: 2026-07-10

denoising-diffusion-pytorch

去噪扩散概率模型的PyTorch实现,生成模型领域核心算法库。简洁易用的扩散模型训练框架。

  • Stars: ⭐️ 10.7k
  • Tags: diffusion-models generative-model pytorch
  • 最后活动时间: 2026-09-01

krita-ai-diffusion

Krita图像编辑器的AI扩散插件,支持文生图、内补和外补功能。

  • Stars: ⭐️ 10.6k
  • Tags: stable-diffusion krita-plugin image-generation generative-ai
  • 最后活动时间: 2026-08-28

easydiffusion

一键式AI艺术创作工具,无需技术背景即可在本地生成精美图像。提供简洁的浏览器界面,支持文本生成图像。

  • Stars: ⭐️ 10.5k
  • Tags: Stable Diffusion Image Generation GUI
  • 最后活动时间: 2026-09-11

openFrameworks

跨平台创意编程工具包,支持图形、音频、计算机视觉等多媒体应用开发。

  • Stars: ⭐️ 10.4k
  • Tags: creative-coding computer-vision opencv cpp
  • 最后活动时间: 2026-09-15

manga-image-translator

基于深度学习的漫画/图片文字翻译工具,集成OCR文字检测、机器翻译和图像修复功能,支持一键翻译各类图片内文字。

  • Stars: ⭐️ 10.4k
  • Tags: ocr machine-translation image-processing inpainting neural-network
  • 最后活动时间: 2026-07-20

supersplat

基于浏览器的3D高斯泼溅编辑器,支持编辑AI生成的3D场景重建结果。

  • Stars: ⭐️ 10.2k
  • Tags: gaussian-splatting 3d webgpu editor
  • 最后活动时间: 2026-09-16

moondream

轻量级视觉语言模型,专为边缘设备优化的多模态AI解决方案。

  • Stars: ⭐️ 10.0k
  • Tags: vision-language-model tiny-llm multimodal edge-ai
  • 最后活动时间: 2026-04-20

awesome-gpt-image-2

全球最大的 GPT Image 2 提示词库,包含 2000+ 精选提示词和预览图,支持 16 种语言,涵盖像素级文本渲染和商业级插画。

  • Stars: ⭐️ 9.9k
  • Tags: gpt-image-2 ai-image-generation prompt-engineering openai
  • 最后活动时间: 2026-09-17

dots.ocr

基于单一视觉语言模型的多语言文档版面解析工具。能够高效处理和解析复杂文档结构。

  • Stars: ⭐️ 9.1k
  • Tags: document-layout-parsing vision-language-model multilingual ocr
  • 最后活动时间: 2026-03-24

Sana

基于线性扩散Transformer的高效高分辨率图像合成模型,支持文本到图像生成。

  • Stars: ⭐️ 9.1k
  • Tags: 文生图 扩散模型 Transformer
  • 最后活动时间: 2026-09-16

ml-sharp

不到一秒即可完成锐利的单目新视角合成,实现快速高质量视图生成。

  • Stars: ⭐️ 8.9k
  • Tags: View-Synthesis Neural-Rendering Computer-Vision 3D
  • 最后活动时间: 2026-09-11

nnUNet

医学图像分割领域的顶级深度学习框架,自动配置网络架构和预处理流程,在多个医学分割挑战中取得SOTA成绩。

  • Stars: ⭐️ 8.9k
  • Tags: medical-imaging segmentation deep-learning
  • 最后活动时间: 2026-09-14

awesome-3D-gaussian-splatting

3D高斯泼溅技术资源精选,涵盖神经渲染、NeRF相关的前沿论文与实现,是3D视觉与AI交叉领域的热门方向。

  • Stars: ⭐️ 8.9k
  • Tags: 3d-gaussian-splatting nerf neural-rendering computer-vision
  • 最后活动时间: 2026-09-12

MONAI

医疗影像AI工具包,基于PyTorch提供高性能GPU加速的医学图像计算框架。

  • Stars: ⭐️ 8.7k
  • Tags: deep-learning healthcare-imaging medical-imaging pytorch
  • 最后活动时间: 2026-09-16

Depth-Anything-V2

NeurIPS 2024 提出的更强大的单目深度估计基础模型。能够从单张图像中生成高质量的深度信息,适用于多种视觉任务。

  • Stars: ⭐️ 8.6k
  • Tags: monocular-depth-estimation computer-vision foundation-model depth-estimation
  • 最后活动时间: 2026-03-24

dream-textures

将 Stable Diffusion 集成到 Blender 中的插件,支持在 3D 工作流中直接生成纹理和图像。

  • Stars: ⭐️ 8.2k
  • Tags: ai blender stable-diffusion image-generation
  • 最后活动时间: 2026-09-15

backgroundremover

基于AI的背景移除工具,支持图片和视频背景一键去除,提供简洁的命令行界面,免费开源。

  • Stars: ⭐️ 8.1k
  • Tags: AI Background Removal Image Processing Video Editing
  • 最后活动时间: 2026-07-10

sygil-webui

Stable Diffusion 网页界面,提供友好的AI图像生成用户体验,支持多种模型和插件扩展。

  • Stars: ⭐️ 7.9k
  • Tags: stable-diffusion webui image-generation ai-art
  • 最后活动时间: 2026-07-17

Inpaint-Anything

结合Segment Anything (SAM)与图像修复模型,实现智能去除或替换图像中的任意对象。

  • Stars: ⭐️ 7.7k
  • Tags: inpainting segment-anything image-processing computer-vision
  • 最后活动时间: 2026-07-29

modly

桌面应用程序,利用本地AI从图像生成3D模型,完全在GPU上运行,支持离线使用。

  • Stars: ⭐️ 7.6k
  • Tags: 3d-generation image-to-3d local-ai desktop-app gpu
  • 最后活动时间: 2026-09-13

face-alignment

基于PyTorch构建的2D和3D人脸对齐库,支持人脸检测与关键点定位,适用于人脸识别预处理。

  • Stars: ⭐️ 7.5k
  • Tags: face-alignment face-detection deep-learning pytorch
  • 最后活动时间: 2026-04-06

sam-3d-objects

基于 Segment Anything Model (SAM) 的3D物体分割项目,将2D分割能力扩展到3D空间。

  • Stars: ⭐️ 7.4k
  • Tags: segment-anything 3d-segmentation computer-vision sam
  • 最后活动时间: 2026-06-02

sdnext

全能型AI图像视频生成WebUI,支持Stable Diffusion、Flux等多种模型。集成图像生成、视频创作、字幕生成等功能。

  • Stars: ⭐️ 7.3k
  • Tags: Stable Diffusion Flux WebUI Video Generation
  • 最后活动时间: 2026-09-17

civitai

AI 模型分享平台,汇集 Stable Diffusion 模型、文本反转等生成式 AI 资源。

  • Stars: ⭐️ 7.2k
  • Tags: stable-diffusion models image-generation ai
  • 最后活动时间: 2026-09-17

ccv

基于C语言的高性能计算机视觉库,提供现代化的CV功能实现,无外部依赖。

  • Stars: ⭐️ 7.2k
  • Tags: computer-vision c-library image-processing
  • 最后活动时间: 2026-09-16

Open-Higgsfield-AI

开源免费的AI图像生成与电影工作室,支持Flux、SDXL等20+模型。可自托管部署,提供完整的图像与视频创作功能。

  • Stars: ⭐️ 7.2k
  • Tags: AI图像生成 视频创作 开源替代
  • 最后活动时间: 2026-04-24

TripoSR

从单张图像快速生成3D物体模型的高效重建模型,支持快速高质量3D内容创建。

  • Stars: ⭐️ 7.0k
  • Tags: 3d-reconstruction single-image text-to-3d
  • 最后活动时间: 2026-06-04

scikit-image

Python生态核心图像处理库,提供丰富的图像处理算法和科学计算工具。

  • Stars: ⭐️ 6.6k
  • Tags: computer-vision image-processing python scipy
  • 最后活动时间: 2026-09-16

VLM-R1

基于强化学习的视觉语言模型项目,将R1方法应用于多模态场景,实现视觉理解能力的突破性提升。

  • Stars: ⭐️ 6.0k
  • Tags: VLM Reinforcement Learning Multimodal DeepSeek-R1
  • 最后活动时间: 2026-07-07

chaiNNer

基于节点的图像处理 GUI 工具,支持 AI 图像放大和处理任务的灵活编排。

  • Stars: ⭐️ 6.0k
  • Tags: image-processing ai-upscaling gui node-based
  • 最后活动时间: 2026-09-09

Chinese-CLIP

中文版CLIP模型,实现跨模态图文检索与表示生成。

  • Stars: ⭐️ 6.0k
  • Tags: clip chinese multi-modal computer-vision image-text-retrieval
  • 最后活动时间: 2026-03-31

AR.js

轻量级Web增强现实框架,支持图像追踪、位置定位和标记追踪,完全在浏览器端运行。

  • Stars: ⭐️ 6.0k
  • Tags: augmented-reality webar threejs computer-vision
  • 最后活动时间: 2026-06-21

PaddleClas

基于飞桨构建的图像分类与识别工具箱,提供丰富的预训练模型和多种数据增强策略。支持图像检索、产品识别等多种视觉任务的高效部署。

  • Stars: ⭐️ 5.8k
  • Tags: image-classification image-recognition paddlepaddle pretrained-models knowledge-distillation
  • 最后活动时间: 2026-08-10

gsplat

CUDA加速的3D Gaussian Splatting光栅化库,支持高效神经渲染和3D重建。

  • Stars: ⭐️ 5.7k
  • Tags: gaussian-splatting cuda 3d-reconstruction neural-rendering
  • 最后活动时间: 2026-09-03

mmf

Meta AI开发的模块化多模态视觉-语言研究框架,支持VQA、图像描述、对话等多种任务,提供预训练模型。

  • Stars: ⭐️ 5.6k
  • Tags: Multimodal Vision-Language VQA PyTorch
  • 最后活动时间: 2026-07-07

remove-ai-watermarks

用于移除AI生成图像水印的CLI工具,支持可见和不可见水印类型。

  • Stars: ⭐️ 5.6k
  • Tags: ai computer-vision image-processing watermark-removal synthid
  • 最后活动时间: 2026-09-16

koharu

基于AI的漫画翻译工具,使用Rust编写。结合计算机视觉与深度学习技术,支持GPU加速的日文漫画文本识别与翻译。

  • Stars: ⭐️ 5.6k
  • Tags: computer-vision deep-learning manga translation rust
  • 最后活动时间: 2026-09-16

gemini-watermark-remover

高性能纯浏览器端Gemini AI水印去除工具,使用数学精确的反向Alpha混合算法实现无损去水印。

  • Stars: ⭐️ 5.6k
  • Tags: watermark-removal gemini-ai image-processing javascript
  • 最后活动时间: 2026-09-10

neural-style

TensorFlow实现的经典神经风格迁移算法,将艺术风格应用到普通图像上。

  • Stars: ⭐️ 5.5k
  • Tags: neural-style style-transfer tensorflow image-generation
  • 最后活动时间: 2026-04-18

lottie

利用Claude Code或Codex生成可用于生产环境的Lottie动画。简化了动画创作流程,让开发者能通过AI快速生成高质量动画资源。

  • Stars: ⭐️ 5.5k
  • Tags: lottie animation claude-code codex ai-generation
  • 最后活动时间: 2026-07-25

GPT-Image2-Skill

GPT Image 2 提示词库与智能体技能工具,提供图像生成/编辑的CLI工具和丰富的提示词模板。

  • Stars: ⭐️ 5.4k
  • Tags: gpt-image image-generation openai agent-skills prompt-library
  • 最后活动时间: 2026-09-09

sapiens

高分辨率人体任务模型,支持人体姿态估计、分割等视觉任务。

  • Stars: ⭐️ 5.4k
  • Tags: computer-vision human-centric pose-estimation deep-learning
  • 最后活动时间: 2026-05-26

opencv-python

OpenCV 的 Python 预编译包,提供强大的计算机视觉和图像处理能力,是 AI 视觉应用开发的基础库。

  • Stars: ⭐️ 5.4k
  • Tags: opencv computer-vision image-processing python
  • 最后活动时间: 2026-09-04

watermark-removal

基于深度学习的图像水印去除工具,使用图像修复技术自动移除水印。

  • Stars: ⭐️ 5.2k
  • Tags: image-inpainting deep-learning computer-vision
  • 最后活动时间: 2026-08-14

brush

基于高斯溅射技术的通用3D重建工具,支持快速高质量场景重建。

  • Stars: ⭐️ 5.1k
  • Tags: gaussian-splatting 3d-reconstruction nerf
  • 最后活动时间: 2026-09-16

pollinations

开源生成式AI平台,提供友好的AI创作体验,支持多种生成模型。

  • Stars: ⭐️ 5.1k
  • Tags: Gen-AI Open Source Platform
  • 最后活动时间: 2026-09-17

trace.moe

基于向量数据库的动漫场景反向图片搜索引擎,通过截图快速追溯动漫来源。

  • Stars: ⭐️ 5.0k
  • Tags: anime image-search vector-database reverse-search
  • 最后活动时间: 2026-08-09

unet

U-Net图像分割网络的Keras实现。经典的编码器-解码器架构,广泛应用于医学图像分割和语义分割任务。

  • Stars: ⭐️ 4.9k
  • Tags: unet image-segmentation keras deep-learning
  • 最后活动时间: 2026-03-27

adetailer

基于检测模型的自动识别、遮罩与图像修复工具,适用于Stable Diffusion WebUI。能够有效提升局部重绘的精度与效率。

  • Stars: ⭐️ 4.8k
  • Tags: stable-diffusion image-inpainting object-detection sd-webui
  • 最后活动时间: 2026-08-03

LLaVA-NeXT

LLaVA-NeXT 是新一代开源大型多模态模型,支持高分辨率图像理解和复杂的视觉推理任务。它在多模态对话和图像分析方面表现卓越。

  • Stars: ⭐️ 4.7k
  • Tags: LLaVA Multimodal Large-Language-Model Computer-Vision
  • 最后活动时间: 2026-06-15

SwarmUI

模块化的Stable Diffusion Web界面,支持ComfyUI后端,提供高性能图像生成和强大的扩展能力。

  • Stars: ⭐️ 4.6k
  • Tags: stable-diffusion image-generation ai comfyui
  • 最后活动时间: 2026-09-17

Depixelization_poc

从像素化截图中恢复原始文本的AI技术演示,展示了一种逆向图像处理方法。

  • Stars: ⭐️ 4.5k
  • Tags: image-processing depixelization security image-recovery deep-learning
  • 最后活动时间: 2026-04-14

diffusion-models-class

Hugging Face扩散模型课程,深入讲解图像生成模型原理与实践。

  • Stars: ⭐️ 4.4k
  • Tags: diffusion-models image-generation huggingface generative-ai
  • 最后活动时间: 2026-05-26

comfyui_controlnet_aux

为ComfyUI提供ControlNet辅助预处理器节点的扩展插件。极大丰富了图像生成过程中的条件控制能力。

  • Stars: ⭐️ 4.2k
  • Tags: comfyui controlnet stable-diffusion image-generation
  • 最后活动时间: 2026-08-27

agent-sprite-forge

一个用于生成2D精灵图、透明PNG帧和动画GIF的智能体技能工具,支持从文本提示创建游戏像素艺术资源。

  • Stars: ⭐️ 4.1k
  • Tags: agent-skills pixel-art sprite-generator image-generation game-assets
  • 最后活动时间: 2026-07-12

OmniGen2

探索高级多模态生成的统一模型,支持多种生成任务的统一架构。

  • Stars: ⭐️ 4.1k
  • Tags: multimodal-generation image-generation unified-model
  • 最后活动时间: 2026-03-20

photon

高性能的Rust/WebAssembly图像处理库,支持多种图像操作和滤镜效果,适用于Web端和AI图像处理管道。

  • Stars: ⭐️ 3.9k
  • Tags: image-processing webassembly rust computer-vision
  • 最后活动时间: 2026-09-12

triangula

使用进化算法和遗传算法将图像转换为高质量三角剖分艺术作品,支持多边形艺术生成。

  • Stars: ⭐️ 3.9k
  • Tags: generative-art genetic-algorithm evolutionary-algorithms image-processing
  • 最后活动时间: 2026-03-21

ml-mgie

MGIE 借助多模态大模型按自然语言指令进行图像编辑,是视觉-语言模型应用的代表实现。

  • Stars: ⭐️ 3.9k
  • Tags: multimodal image-editing mllm
  • 最后活动时间: 2026-09-11

map-anything

通用前馈度量3D重建模型,支持深度估计、多视角立体视觉和机器人应用场景。

  • Stars: ⭐️ 3.7k
  • Tags: 3d-reconstruction depth-estimation image-to-3d robotics
  • 最后活动时间: 2026-08-07

gpt_image_playground

基于 OpenAI gpt-image-2 API 的图片生成与编辑工具,支持多种图像处理功能,提供直观的 Web 界面。

  • Stars: ⭐️ 3.7k
  • Tags: gpt-image image-generation openai react typescript
  • 最后活动时间: 2026-09-09

LichtFeld-Studio

3D高斯泼溅场景的完整解决方案,支持训练、编辑、自动化处理与导出。

  • Stars: ⭐️ 3.7k
  • Tags: gaussian-splatting 3d-reconstruction computer-vision cuda
  • 最后活动时间: 2026-09-16

spark

基于THREE.js的高级3D高斯泼溅渲染器,支持神经辐射场风格的实时3D重建与渲染。

  • Stars: ⭐️ 3.6k
  • Tags: 3d-gaussian-splatting nerf threejs webgl
  • 最后活动时间: 2026-09-14

Eagle

前沿视觉语言模型项目,采用以数据为中心的策略训练,支持多种主流大模型架构。

  • Stars: ⭐️ 3.6k
  • Tags: Vision-Language LMM LLaVA
  • 最后活动时间: 2026-06-24

Saber-Translator

AI驱动的漫画翻译工具,智能检测气泡、识别日文文本并翻译成流畅中文。

  • Stars: ⭐️ 3.5k
  • Tags: manga-translation ocr ai-translation image-processing
  • 最后活动时间: 2026-09-01

local-dream

在Android设备上运行Stable Diffusion,支持骁龙NPU加速及CPU/GPU推理。

  • Stars: ⭐️ 3.5k
  • Tags: stable-diffusion android npu image-generation
  • 最后活动时间: 2026-09-11

waifu2x-ncnn-vulkan

基于ncnn的waifu2x图像超分辨率工具,利用Vulkan实现跨平台GPU加速,适用于动漫图像放大降噪。

  • Stars: ⭐️ 3.5k
  • Tags: Image Upscaling Vulkan Anime
  • 最后活动时间: 2026-04-13

FoundationPose

CVPR 2024 提出的统一6D姿态估计与追踪框架,支持新物体的快速适配。基于深度学习实现高精度的三维空间物体定位。

  • Stars: ⭐️ 3.5k
  • Tags: pose-estimation computer-vision 6d-tracking cvpr-2024
  • 最后活动时间: 2026-04-29

nunif

waifu2x最新版本及2D视频转立体3D视频转换工具集。

  • Stars: ⭐️ 3.4k
  • Tags: waifu2x super-resolution stereo-3d video-processing
  • 最后活动时间: 2026-08-22

see-through

SIGGRAPH 2026 论文项目,专注于动漫角色的单图像层分解技术。能够将单一图像拆解为多个语义层,便于后续的AI图像编辑与生成。

  • Stars: ⭐️ 3.4k
  • Tags: image-decomposition anime computer-vision siggraph
  • 最后活动时间: 2026-07-20

IQA-PyTorch

基于PyTorch的图像质量评估工具箱,支持PSNR、SSIM、LPIPS、FID等多种评估指标,涵盖全参考和无参考图像质量评估方法。

  • Stars: ⭐️ 3.4k
  • Tags: image-quality-assessment pytorch deep-learning computer-vision
  • 最后活动时间: 2026-08-31

ComfyUI-Impact-Pack

广受欢迎的ComfyUI自定义节点包,集成检测器、细节修复、放大和管道等工具,便捷提升图像质量。

  • Stars: ⭐️ 3.3k
  • Tags: ComfyUI CustomNodes ImageEnhancement Detector Upscaler
  • 最后活动时间: 2026-04-19

ComfyUI-KJNodes

广受欢迎的 ComfyUI 自定义节点合集,提供图像处理、遮罩操作与批处理等大量实用能力,是搭建生成工作流的常用扩展。

  • Stars: ⭐️ 3.3k
  • Tags: ComfyUI Custom-Nodes Image-Generation Stable-Diffusion
  • 最后活动时间: 2026-09-13

HunyuanImage-3.0

腾讯混元图像生成模型3.0版本,强大的原生多模态图像生成模型,支持高质量图像创作。

  • Stars: ⭐️ 3.3k
  • Tags: image-generation multimodal-model text-to-image diffusion-model
  • 最后活动时间: 2026-06-23

tribev2

TRIBE v2多模态模型,用于脑响应预测的研究项目,结合神经科学与深度学习技术。

  • Stars: ⭐️ 3.2k
  • Tags: multimodal brain-response neuroscience deep-learning
  • 最后活动时间: 2026-06-23

Pointcept

点云感知研究代码库,包含PTv3、Sonata等最新3D视觉研究成果。

  • Stars: ⭐️ 3.2k
  • Tags: point-cloud 3d-vision pytorch
  • 最后活动时间: 2026-09-11

QualityScaler

基于AI的图像和视频超分辨率放大应用,支持降噪和压缩伪影消除,可运行于NVIDIA/AMD/Intel GPU。

  • Stars: ⭐️ 3.2k
  • Tags: Super Resolution Image Enhancement Video Upscaling
  • 最后活动时间: 2026-08-27

awesome-virtual-try-on

虚拟试穿领域精选资源列表,汇集论文、代码、数据集,涵盖2D/3D试穿与多姿态引导技术。

  • Stars: ⭐️ 3.2k
  • Tags: 虚拟试穿 图像生成 计算机视觉
  • 最后活动时间: 2026-09-11

Skywork-R1V

Skywork AI开发的高级多模态模型系列,专注于视觉语言推理任务。

  • Stars: ⭐️ 3.2k
  • Tags: Multimodal VLM Vision-Language
  • 最后活动时间: 2026-07-29

ComfyUI_LayerStyle

在 ComfyUI 中实现类似 Photoshop 的图层合成与蒙版功能,让图像叠加、混合与精修更加直观高效。

  • Stars: ⭐️ 3.2k
  • Tags: ComfyUI Image-Compositing Layer-Style Photoshop
  • 最后活动时间: 2026-09-03

swift-coreml-diffusers

基于Core ML的Stable Diffusion Swift实现,支持在Apple设备上本地运行图像生成。

  • Stars: ⭐️ 3.1k
  • Tags: stable-diffusion coreml swift image-generation apple
  • 最后活动时间: 2026-09-16

Infinite-Canvas

支持ComfyUI和ModelScope调用的无限画布工具,适用于AI图像生成工作流。

  • Stars: ⭐️ 3.1k
  • Tags: comfyui image-generation canvas modelscope
  • 最后活动时间: 2026-08-28

CHINESE-OCR

中文场景文字检测与识别系统,基于CTPN+CRNN+CTC实现不定长文字OCR识别。

  • Stars: ⭐️ 3.0k
  • Tags: ocr tensorflow pytorch
  • 最后活动时间: 2026-08-21

DeepDanbooru

基于TensorFlow的AI多标签图像分类系统,专注于动漫角色图像的自动标签识别。

  • Stars: ⭐️ 2.9k
  • Tags: Image Classification TensorFlow Anime
  • 最后活动时间: 2026-07-04

ComfyUI-nunchaku

Nunchaku 的 ComfyUI 插件,为 Flux 等扩散模型提供量化推理,降低显存并加速图像生成。

  • Stars: ⭐️ 2.9k
  • Tags: comfyui diffusion flux quantization genai
  • 最后活动时间: 2026-09-06

SimpleTuner

面向图像、视频和音频扩散模型的通用微调工具包,支持Stable Diffusion、Flux等主流模型的高效训练。

  • Stars: ⭐️ 2.9k
  • Tags: Diffusion Fine-tuning Stable Diffusion
  • 最后活动时间: 2026-09-07

Qwen-MM-Plugins

使任何智能体框架具备原生多模态能力的插件集合。助力大模型轻松处理图像与文本的联合理解。

  • Stars: ⭐️ 2.8k
  • Tags: multimodal llm agents plugins
  • 最后活动时间: 2026-09-16

a1111-sd-webui-tagcomplete

Stable Diffusion WebUI标签自动补全扩展,提供Booru风格的智能提示词补全功能。

  • Stars: ⭐️ 2.8k
  • Tags: stable-diffusion autocompletion prompt-engineering webui-extension
  • 最后活动时间: 2026-07-01

manga-ocr

面向日本漫画的日文光学字符识别工具,基于Transformer架构。

  • Stars: ⭐️ 2.8k
  • Tags: ocr japanese transformers manga
  • 最后活动时间: 2026-07-19

Stable-Diffusion

全面的Stable Diffusion学习资源库,涵盖FLUX、SDXL、SD3等模型的训练教程、WebUI工具指南及多模态AI应用实践。

  • Stars: ⭐️ 2.8k
  • Tags: Stable Diffusion LoRA ComfyUI Image Generation
  • 最后活动时间: 2026-09-16

voxelmorph

基于无监督学习的医学图像配准框架,支持变形场估计与图像对齐。

  • Stars: ⭐️ 2.8k
  • Tags: image-registration medical-imaging unsupervised-learning deep-learning
  • 最后活动时间: 2026-09-11

mediapipe-touchdesigner

GPU加速的MediaPipe TouchDesigner插件,用于实时计算机视觉和手势识别应用。

  • Stars: ⭐️ 2.8k
  • Tags: mediapipe touchdesigner computer-vision gpu
  • 最后活动时间: 2026-08-19

xDiT

可扩展的Diffusion Transformers推理引擎,支持大规模并行计算,显著提升DiT模型推理性能。

  • Stars: ⭐️ 2.7k
  • Tags: Diffusion Inference Parallelism
  • 最后活动时间: 2026-09-15

UNetPlusPlus

UNet++官方实现,IEEE TMI发表,通过嵌套密集跳跃连接改进医学图像分割性能。

  • Stars: ⭐️ 2.7k
  • Tags: medical-imaging segmentation unet
  • 最后活动时间: 2026-08-25

3DCellForge

AI驱动的交互式3D模型生成、检查和展示工作室,支持智能建模与可视化。

  • Stars: ⭐️ 2.6k
  • Tags: 3d-generation ai-3d interactive visualization
  • 最后活动时间: 2026-08-27

stitching

Python图像拼接包,提供快速鲁棒的全景图像拼接功能。

  • Stars: ⭐️ 2.6k
  • Tags: image-stitching panorama computer-vision python
  • 最后活动时间: 2026-09-05

conditional-flow-matching

条件流匹配库TorchCFM,用于生成模型训练。

  • Stars: ⭐️ 2.6k
  • Tags: flow-matching generative-models optimal-transport
  • 最后活动时间: 2026-07-20

ideogram4

Ideogram 4 是一款专注于设计领域的开源图像生成模型,处于行业前沿。它能够帮助用户高效地生成高质量的设计图像。

  • Stars: ⭐️ 2.5k
  • Tags: image-generation open-source design text-to-image
  • 最后活动时间: 2026-06-30

minimind-o

从零训练的0.1B全模态Omni模型,支持听、说、看多模态能力,适合学习多模态模型架构与训练。

  • Stars: ⭐️ 2.5k
  • Tags: multimodal omni-model training audio vision
  • 最后活动时间: 2026-08-06

Stable-Diffusion-Webui-Civitai-Helper

Civitai助手扩展,简化模型下载和管理流程,自动获取模型信息和预览图。

  • Stars: ⭐️ 2.5k
  • Tags: stable-diffusion civitai model-management webui-extension
  • 最后活动时间: 2026-06-09

PartCrafter

NeurIPS 2025论文,通过组合潜变量扩散Transformer生成结构化3D网格。

  • Stars: ⭐️ 2.5k
  • Tags: 3d-generation mesh-generation image-to-3d neurips
  • 最后活动时间: 2026-04-16

3dgrut

高斯粒子的光线追踪与混合光栅化渲染技术,用于3D场景重建。

  • Stars: ⭐️ 2.4k
  • Tags: gaussian-splatting ray-tracing 3d-reconstruction computer-vision
  • 最后活动时间: 2026-09-16

gpupixel

基于GPU的实时图像滤镜引擎,支持人脸检测、美颜、瘦脸等AI图像处理功能。

  • Stars: ⭐️ 2.4k
  • Tags: image-processing gpu face-detection filter
  • 最后活动时间: 2026-08-29

cellpose

通用细胞分割算法,支持人机交互标注,广泛应用于生物医学图像分析领域。

  • Stars: ⭐️ 2.4k
  • Tags: cell-segmentation bioimage deep-learning
  • 最后活动时间: 2026-06-14

ComfyUI-Prompt-Assistant

ComfyUI提示词助手插件,支持多LLM服务的提示词翻译、扩写和图片反推功能。

  • Stars: ⭐️ 2.3k
  • Tags: ComfyUI Prompt Image Generation
  • 最后活动时间: 2026-04-25

ComfyUI-SUPIR

将先进的SUPIR超分辨率模型封装为ComfyUI节点,实现高质量图像放大与细节增强。

  • Stars: ⭐️ 2.3k
  • Tags: ComfyUI SUPIR Upscaling ImageEnhancement
  • 最后活动时间: 2026-04-29

gowall

多功能图像处理工具,支持VLM视觉语言模型OCR识别、对抗网络图像超分辨率放大、色彩提取与主题转换等功能。

  • Stars: ⭐️ 2.3k
  • Tags: image-processing ocr upscale color-palette cli
  • 最后活动时间: 2026-06-10

Pixal3D

SIGGRAPH 2026 论文项目,实现从图像生成像素对齐的3D模型,属于前沿的图像到3D生成技术。

  • Stars: ⭐️ 2.3k
  • Tags: 3d-generation image-to-3d generative-ai computer-vision
  • 最后活动时间: 2026-09-01

nvdiffrec

CVPR 2022口头论文,从图像提取3D模型、材质和光照。

  • Stars: ⭐️ 2.3k
  • Tags: 3d-reconstruction differentiable-rendering nerf
  • 最后活动时间: 2026-08-12

pixel2motion

AI Logo动画生成技能,可将光栅Logo转换为平滑的SVG动画并生成HTML演示与视频预览。

  • Stars: ⭐️ 2.3k
  • Tags: ai-design-tools logo-animation svg-animation claude-skill
  • 最后活动时间: 2026-08-21

bgslibrary

C++背景减除库,提供多种背景建模算法,支持Python、MATLAB和Java绑定。

  • Stars: ⭐️ 2.3k
  • Tags: background-subtraction computer-vision opencv
  • 最后活动时间: 2026-05-28

mflux

基于Apple MLX框架的原生生成图像模型实现,针对Apple Silicon优化。

  • Stars: ⭐️ 2.3k
  • Tags: mlx flux apple-silicon image-generation
  • 最后活动时间: 2026-07-29

Step1X-Edit

SOTA级开源图像编辑模型,性能媲美GPT-4o和Gemini 2 Flash等闭源模型。

  • Stars: ⭐️ 2.3k
  • Tags: image-editing multimodal visual-reasoning open-source
  • 最后活动时间: 2026-04-29

HeliosGen

一款自托管的生成式AI桌面应用,支持本地运行AI图像生成等创作功能。作为 Higgsfield、OpenArt、Freepik 等平台的免费开源替代方案,让用户掌控自己的AI创作流程。

  • Stars: ⭐️ 2.3k
  • Tags: GenAI Self-Hosted Image Generation Desktop App AI Art
  • 最后活动时间: 2026-09-10

OpenSplat

生产级3D高斯溅射(3D Gaussian Splatting)工具,支持CPU/GPU跨平台运行。可用于从图像或无人机数据快速重建和渲染高质量的3D辐射场。

  • Stars: ⭐️ 2.2k
  • Tags: 3d gaussian-splatting radiance-field computer-vision
  • 最后活动时间: 2026-09-16

JoyAI-Image

统一的多模态基础模型,支持图像理解、文本生成图像和指令引导的图像编辑功能。

  • Stars: ⭐️ 2.2k
  • Tags: multimodal image-generation image-editing text-to-image
  • 最后活动时间: 2026-08-05

WorldGen

基于生成式AI的3D场景生成工具,支持文本和图像快速生成任意3D场景,实现秒级高质量三维内容创作。

  • Stars: ⭐️ 2.1k
  • Tags: 3D Generation Text-to-3D Scene Generation
  • 最后活动时间: 2026-04-12

OpenSplat

生产级3D高斯泼溅重建工具,支持CPU/GPU跨平台运行,适用于神经辐射场和3D场景重建。

  • Stars: ⭐️ 2.1k
  • Tags: 3d gaussian-splatting radiance-field neural-rendering
  • 最后活动时间: 2026-08-10

Anime2Sketch

动漫/插画风格草图提取器,基于GAN技术将动漫图像转换为线稿。

  • Stars: ⭐️ 2.1k
  • Tags: sketch-extraction anime gan image-processing
  • 最后活动时间: 2026-09-08

logo-generator-skill

一个用于生成Logo的AI智能体技能模块。可帮助用户通过AI快速生成和设计个性化标志。

  • Stars: ⭐️ 2.1k
  • Tags: logo-generator image-generation agent-skill
  • 最后活动时间: 2026-04-15

leptonica

开源图像处理与分析库,广泛应用于OCR和计算机视觉领域,提供图像增强、形态学运算、边缘检测等核心功能。

  • Stars: ⭐️ 2.1k
  • Tags: image-processing computer-vision ocr c
  • 最后活动时间: 2026-09-02

OpenSeeFace

实时人脸与面部关键点追踪库,支持CPU运行并提供Unity集成,适用于虚拟主播等应用场景。

  • Stars: ⭐️ 2.1k
  • Tags: face-tracking face-detection onnx pytorch unity
  • 最后活动时间: 2026-09-14

ComfyUI_frontend

ComfyUI官方前端实现,为节点式AI图像生成工作流提供现代化可视化界面,支持拖拽式构建复杂的Stable Diffusion处理流程。

  • Stars: ⭐️ 2.0k
  • Tags: Stable Diffusion Image Generation Node Editor
  • 最后活动时间: 2026-09-17

HunyuanOCR

腾讯混元 OCR 文字识别模型,提供高精度的光学字符识别能力。

  • Stars: ⭐️ 2.0k
  • Tags: ocr tencent hunyuan chinese-ocr
  • 最后活动时间: 2026-09-13

DreamOmni2

多模态指令驱动的图像编辑与生成统一模型,支持基于自然语言指令的图像处理任务。

  • Stars: ⭐️ 2.0k
  • Tags: 图像编辑 图像生成 多模态
  • 最后活动时间: 2026-04-11

custom-diffusion

CVPR 2023论文实现,专注于文本到图像扩散模型的多概念定制化微调,支持少样本学习。

  • Stars: ⭐️ 2.0k
  • Tags: diffusion-models text-to-image fine-tuning computer-vision
  • 最后活动时间: 2026-05-24

GlobalMLBuildingFootprints

从卫星图像提取的全球建筑物轮廓数据集,支持地理空间AI应用开发。

  • Stars: ⭐️ 2.0k
  • Tags: satellite-imagery building-detection dataset geospatial
  • 最后活动时间: 2026-08-14

pymatting

Python图像Alpha抠图库,用于前景提取和图像处理任务。

  • Stars: ⭐️ 1.9k
  • Tags: alpha-matting image-processing computer-vision
  • 最后活动时间: 2026-09-08

ComfyUI-Easy-Install

跨平台便携式ComfyUI安装器,支持Nvidia GPU,简化Stable Diffusion工作流部署。

  • Stars: ⭐️ 1.9k
  • Tags: comfyui stable-diffusion image-generation installer
  • 最后活动时间: 2026-09-14

deepseek_ocr_app

基于DeepSeek模型构建的OCR文字识别应用,支持图像到文本的快速转换。

  • Stars: ⭐️ 1.9k
  • Tags: ocr deepseek image-to-text
  • 最后活动时间: 2026-03-31

midjourney-api

非官方的 MidJourney Node.js 客户端,方便开发者将 MidJourney 的 AI 图像生成能力集成到自己的应用中。

  • Stars: ⭐️ 1.9k
  • Tags: midjourney image-generation nodejs api-client ai-art
  • 最后活动时间: 2026-08-26

OnnxOCR

基于PaddleOCR重构的轻量级OCR系统,脱离PaddlePaddle框架,推理速度极快。

  • Stars: ⭐️ 1.9k
  • Tags: ocr onnx deep-learning computer-vision
  • 最后活动时间: 2026-06-11

gpt_image_2_skill

GPT Image 2 提示词库与 CLI 工具,支持图像生成、编辑及智能体技能集成。

  • Stars: ⭐️ 1.8k
  • Tags: gpt-image-2 image-generation prompt-library openai agent-skills
  • 最后活动时间: 2026-05-08

MeiGen-AI-Design-MCP

基于MCP协议的AI图像生成工具,集成ComfyUI与1400+提示词库,支持多方向并行生成。

  • Stars: ⭐️ 1.8k
  • Tags: ai-image-generation mcp comfyui claude-code prompt-engineering
  • 最后活动时间: 2026-09-15

ComfyUI-Florence2

ComfyUI的Microsoft Florence2视觉语言模型推理节点。

  • Stars: ⭐️ 1.7k
  • Tags: comfyui florence2 vlm vision-language-model
  • 最后活动时间: 2026-05-06

pupil

开源眼动追踪项目,利用计算机视觉技术实现眼球检测与追踪,可应用于人机交互、心理学研究等领域。

  • Stars: ⭐️ 1.7k
  • Tags: eye-tracking computer-vision open-source
  • 最后活动时间: 2026-08-31

lightweight-gan

ICLR 2021轻量级GAN实现,支持快速训练高分辨率图像生成模型。

  • Stars: ⭐️ 1.7k
  • Tags: gan image-generation deep-learning pytorch
  • 最后活动时间: 2026-09-09

uniface

基于ONNX Runtime的统一人脸分析Python库,支持人脸检测、识别、表情分析、年龄性别估计等多种功能。

  • Stars: ⭐️ 1.7k
  • Tags: face-detection face-recognition face-analysis onnx computer-vision
  • 最后活动时间: 2026-09-09

BrickGPT

基于文本提示生成物理稳定的积木模型,支持NeurIPS 2025论文实现。

  • Stars: ⭐️ 1.7k
  • Tags: 3d-generation text-to-3d lego
  • 最后活动时间: 2026-05-21

AI-Lossless-Zoomer

基于AI的图像无损放大工具,支持ESRGAN、waifu2x等多种超分辨率算法。

  • Stars: ⭐️ 1.7k
  • Tags: super-resolution esrgan waifu2x image-upscaling
  • 最后活动时间: 2026-07-21

UniRig

基于自回归模型的通用自动骨骼绑定系统,能够处理多样化的骨架结构。该项目为SIGGRAPH 2025官方实现,大幅提升了3D动画绑定的自动化程度。

  • Stars: ⭐️ 1.7k
  • Tags: auto-rigging autoregressive computer-graphics 3d-animation
  • 最后活动时间: 2026-06-04

Sa2VA

像素级大语言模型代码库,融合视觉与语言的多模态研究项目。

  • Stars: ⭐️ 1.7k
  • Tags: MLLM computer-vision pixel-llm
  • 最后活动时间: 2026-09-08

gsplat.js

JavaScript 高斯泼溅(Gaussian Splatting)渲染库,可在浏览器中实现高质量的 3D 场景重建与可视化。适合 Web 端 3D 视觉与神经渲染应用开发。

  • Stars: ⭐️ 1.7k
  • Tags: gaussian-splatting 3d-reconstruction javascript webgl neural-rendering
  • 最后活动时间: 2026-05-26

ComfyUI-Docker

ComfyUI的Docker容器化部署方案,支持Stable Diffusion图像生成工作流,开箱即用。

  • Stars: ⭐️ 1.6k
  • Tags: comfyui stable-diffusion docker
  • 最后活动时间: 2026-09-16

ml-mobileclip

MobileCLIP官方实现,CVPR 2024发表的轻量级视觉-语言模型。

  • Stars: ⭐️ 1.6k
  • Tags: mobileclip vision-language clip efficient-ml
  • 最后活动时间: 2026-04-15

Magic123

ICLR24论文官方实现,单图生成高质量3D物体,结合2D和3D扩散先验实现精细转换。

  • Stars: ⭐️ 1.6k
  • Tags: 3D生成 扩散模型 图像转3D
  • 最后活动时间: 2026-07-06

WeMM-Embedding

由腾讯微信视觉团队开发的通用多模态嵌入模型家族,支持多模态理解与检索。

  • Stars: ⭐️ 1.6k
  • Tags: embedding-models multimodal multimodal-llm
  • 最后活动时间: 2026-09-16

yomitoku

专为日语设计的 AI 文档图像分析 Python 包,集成深度学习 OCR 和版面分析功能,支持 PyTorch 框架。

  • Stars: ⭐️ 1.6k
  • Tags: OCR 文档分析 日语 PyTorch
  • 最后活动时间: 2026-09-14

Infinity

CVPR 2025 Oral论文,用于高分辨率图像合成的自回归模型。

  • Stars: ⭐️ 1.6k
  • Tags: text-to-image autoregressive image-generation transformers
  • 最后活动时间: 2026-04-16

open-higgsfield

一个集图像与视频生成于一体的 AI 创作工作室,通过统一的提示词输入栏即可调用多种生成模型并保留每次运行结果。适合创作者进行多模型对比、参数调优与作品集中管理。

  • Stars: ⭐️ 1.6k
  • Tags: AI-Image-Generation AI-Video-Generation Text-to-Image Text-to-Video Generative-AI
  • 最后活动时间: 2026-09-02

3d-ken-burns

基于PyTorch的单图3D Ken Burns效果实现,从静态图像生成动态运镜视频。

  • Stars: ⭐️ 1.6k
  • Tags: deep-learning computer-vision 3D PyTorch
  • 最后活动时间: 2026-06-01

node-banana

免费开源的节点式生成式AI工作流工具,可通过可视化节点编排构建生成流程。适合想要灵活搭建生成式AI管线的创作者和开发者。

  • Stars: ⭐️ 1.6k
  • Tags: generative-ai node-editor workflow open-source
  • 最后活动时间: 2026-09-15

ComfyUI_UltimateSDUpscale

ComfyUI的高质量图像放大节点扩展,支持多种放大算法,显著提升Stable Diffusion生成图像的分辨率和细节。

  • Stars: ⭐️ 1.6k
  • Tags: ComfyUI 图像放大 Stable Diffusion
  • 最后活动时间: 2026-06-22

SAM-Adapter-PyTorch

通过适配器和提示将Segment Anything模型迁移到下游分割任务的PyTorch实现。

  • Stars: ⭐️ 1.6k
  • Tags: Segment Anything Adapter Fine-tuning
  • 最后活动时间: 2026-05-17

VRT

视频复原Transformer官方仓库,支持视频超分辨率、去噪、去模糊等多种任务。

  • Stars: ⭐️ 1.5k
  • Tags: video-restoration transformer super-resolution video-enhancement
  • 最后活动时间: 2026-09-08

splatviz

基于3D Gaussian Splatting技术的实时交互式3D查看器,支持实时编辑和分析高斯溅射场景。

  • Stars: ⭐️ 1.5k
  • Tags: 3d-gaussian-splatting 3dgs viewer python real-time
  • 最后活动时间: 2026-05-20

realesrgan-gui

跨平台AI图像超分辨率放大工具GUI,支持Real-ESRGAN和Real-CUGAN模型,提供美观易用的图形界面。

  • Stars: ⭐️ 1.5k
  • Tags: real-esrgan super-resolution image-upscaling gui
  • 最后活动时间: 2026-05-02

LucidDreamer

基于3D Gaussian Splatting技术的场景生成方法,无需特定域约束即可生成高质量3D场景。

  • Stars: ⭐️ 1.5k
  • Tags: 3d-gaussian-splatting scene-generation generative-ai
  • 最后活动时间: 2026-07-23

Ovis

一种新型多模态大语言模型架构,旨在从结构上对齐视觉和文本嵌入。支持Llama3和Qwen等模型,提升视觉语言学习与交互能力。

  • Stars: ⭐️ 1.5k
  • Tags: multimodal llm vision-language-model llama3 qwen
  • 最后活动时间: 2026-07-15

DLSS

NVIDIA 深度学习超级采样技术,利用神经网络提升游戏帧率并生成高质量图像。

  • Stars: ⭐️ 1.5k
  • Tags: dlss nvidia image-upscaling gaming
  • 最后活动时间: 2026-09-08

pyntcloud

3D点云处理Python库,支持点云可视化与深度学习应用。

  • Stars: ⭐️ 1.5k
  • Tags: 3d-point-clouds deep-learning python 3d-graphics
  • 最后活动时间: 2026-07-10

ComfyUI-Lora-Manager

ComfyUI 的 LoRA 模型管理扩展,支持模型组织、预览和元数据管理,提升工作流效率。

  • Stars: ⭐️ 1.5k
  • Tags: ComfyUI LoRA Manager Image Generation
  • 最后活动时间: 2026-09-15

gorest-2d-animation-spritesheet-generator

基于Codex辅助的本地2D动画精灵图生成器与场景合成工作台。可帮助开发者快速生成游戏动画资源。

  • Stars: ⭐️ 1.5k
  • Tags: spritesheet 2d-animation codex game-dev
  • 最后活动时间: 2026-08-09

ResShift

NeurIPS 2023 Spotlight论文,高效图像超分辨率扩散模型,通过残差偏移机制实现快速高质量图像重建。

  • Stars: ⭐️ 1.4k
  • Tags: 超分辨率 扩散模型 计算机视觉
  • 最后活动时间: 2026-07-08

ian-handdrawn-ppt

AI智能体技能,用于生成中文手绘风格的技术PPT图像,支持封面和正文配图。

  • Stars: ⭐️ 1.4k
  • Tags: ai-agent image-generation ppt handdrawn codex-skill
  • 最后活动时间: 2026-04-25

LanPaint

高质量免训练图像修复工具,支持所有Stable Diffusion模型和ComfyUI。

  • Stars: ⭐️ 1.4k
  • Tags: inpainting stable-diffusion comfyui
  • 最后活动时间: 2026-08-12

MonkeyOCRv2

MonkeyOCRv2 视觉编码器,一个专为文档处理设计的原生视觉骨干网络模型。适用于文档图像分析与识别任务。

  • Stars: ⭐️ 1.4k
  • Tags: OCR Vision-Encoder Document-AI Multimodal
  • 最后活动时间: 2026-09-15

terrain-diffusion

基于扩散模型的地形程序化生成项目,展示了SIGGRAPH会议的前沿研究成果。利用AI技术实现高质量的地形自动生成与设计。

  • Stars: ⭐️ 1.4k
  • Tags: diffusion-models procedural-generation terrain computer-graphics
  • 最后活动时间: 2026-08-12

FireRed-Image-Edit

开源SOTA图像编辑基础模型,支持精确指令跟随、高保真生成和优异身份一致性。

  • Stars: ⭐️ 1.4k
  • Tags: Image Editing Diffusion AIGC
  • 最后活动时间: 2026-04-03

ComfyUI-qwenmultiangle

ComfyUI 自定义节点,提供交互式 Three.js 视口控制相机角度,用于多角度 AI 图像生成。

  • Stars: ⭐️ 1.4k
  • Tags: comfyui image-generation 3d-camera stable-diffusion
  • 最后活动时间: 2026-09-13

ComfyUI-ReActor

ComfyUI的快速人脸替换扩展节点,支持SFW内容,简单易用的AI换脸工具。

  • Stars: ⭐️ 1.4k
  • Tags: comfyui face-swapping image-generation ai
  • 最后活动时间: 2026-09-17

Lance

一个30亿活跃参数的原生统一多模态模型,支持图像和视频的理解、生成与编辑。

  • Stars: ⭐️ 1.3k
  • Tags: multimodal image-generation video-generation image-understanding
  • 最后活动时间: 2026-07-14

splat-transform

3D高斯泼溅格式转换与变换的CLI工具,支持多种格式互转和3D场景处理。

  • Stars: ⭐️ 1.3k
  • Tags: 3d-gaussian-splatting gaussian-splatting 3d cli
  • 最后活动时间: 2026-09-15

sceneview

跨平台3D与AR SDK,支持Android、iOS、Web、Desktop等多端部署,集成Filament和RealityKit渲染引擎。

  • Stars: ⭐️ 1.3k
  • Tags: 3d ar arcore arkit kotlin swift webxr
  • 最后活动时间: 2026-09-16

image-matching-webui

基于Gradio的图像匹配Web界面,集成多种深度学习模型如SuperGlue、LightGlue、LoFTR等,支持特征匹配和位姿估计。

  • Stars: ⭐️ 1.3k
  • Tags: image-matching deep-learning feature-matching gradio
  • 最后活动时间: 2026-07-14

mvsplat

ECCV'24 Oral论文,从稀疏多视角图像高效实现3D高斯泼溅重建。

  • Stars: ⭐️ 1.3k
  • Tags: gaussian-splatting 3d-reconstruction novel-view-synthesis deep-learning
  • 最后活动时间: 2026-05-06

TripoSplat

由TripoAI开发的模型,能将单张2D图像转换为高质量且数量可变的3D高斯泼溅数据。

  • Stars: ⭐️ 1.3k
  • Tags: 3d-gaussian-splatting image-to-3d generative-ai
  • 最后活动时间: 2026-08-13

LucidFlux

ICLR 2026论文,基于大规模扩散Transformer实现无需标注的高质量图像修复。

  • Stars: ⭐️ 1.3k
  • Tags: diffusion image-restoration transformer iclr
  • 最后活动时间: 2026-05-26

Hunyuan3D-WorldClaw

腾讯混元推出的 WorldClaw,可大规模智能体式生成 3D 开放世界场景。

  • Stars: ⭐️ 1.3k
  • Tags: 3d-generation text-to-3d world-model generative-ai
  • 最后活动时间: 2026-08-13

sprite-sheet-creator

基于fal.ai的2D角色和地图精灵图生成工具,支持创建可玩的像素风格游戏素材。

  • Stars: ⭐️ 1.3k
  • Tags: sprite-sheet game-assets ai-generation fal-ai
  • 最后活动时间: 2026-04-22

MatchAnything

一种基于大规模预训练的通用跨模态图像匹配模型,发表于TPAMI 2026。能够实现不同模态间的精准图像特征对齐与匹配。

  • Stars: ⭐️ 1.3k
  • Tags: image-matching cross-modality feature-extraction computer-vision
  • 最后活动时间: 2026-08-06

withoutbg-python

基于ONNX模型的开源背景移除Python SDK,支持本地与云端图像抠图处理。

  • Stars: ⭐️ 1.3k
  • Tags: background-removal computer-vision onnx image-processing
  • 最后活动时间: 2026-07-23

CityGaussian

ECCV 2024 & ICLR 2025 系列,基于高斯泼溅的大规模场景高质量重建方法。

  • Stars: ⭐️ 1.3k
  • Tags: gaussian-splatting large-scale neural-rendering scene-reconstruction
  • 最后活动时间: 2026-08-16

cube

Roblox开源的3D智能基础模型,支持文本到3D生成和形状生成,为3D内容创作提供AI能力。

  • Stars: ⭐️ 1.3k
  • Tags: 3d-generation text-to-3d foundation-model shape-generation
  • 最后活动时间: 2026-05-28

comfyui-inpaint-nodes

ComfyUI专业图像修复节点集合,支持Fooocus SDXL、LaMa、MAT等多种算法,提供强大的图像修复功能。

  • Stars: ⭐️ 1.2k
  • Tags: ComfyUI 图像修复 Inpainting
  • 最后活动时间: 2026-05-31

FastGS

CVPR 2026论文官方代码,将3D高斯泼溅训练时间缩短至100秒的革命性加速方法。

  • Stars: ⭐️ 1.2k
  • Tags: 3dgs gaussian-splatting cvpr2026 acceleration
  • 最后活动时间: 2026-03-23

flyimg

基于Docker的即时图像处理服务,支持AVIF、WebP等现代格式,内置人脸检测功能,可自动优化图像裁剪。

  • Stars: ⭐️ 1.2k
  • Tags: image-processing face-detection docker imagemagick
  • 最后活动时间: 2026-09-02

vertex-ai-creative-studio

Google Cloud Vertex AI生成媒体创意工作室,集成Imagen、Veo、Gemini TTS、Chirp等多模态AI能力。提供图像、视频、音频生成的完整解决方案。

  • Stars: ⭐️ 1.2k
  • Tags: Vertex AI Imagen Veo Gemini Multimodal
  • 最后活动时间: 2026-09-17

agent-vision-toolkit

为纯文本大模型设计的视觉工具箱,支持多图理解、UI还原和GUI自动化。可无缝接入Codex、Claude Code等主流智能体,赋予其强大的图像处理与视觉交互能力。

  • Stars: ⭐️ 1.2k
  • Tags: agent-skills multimodal vision-language-model computer-use gui-automation
  • 最后活动时间: 2026-08-27

Stable-Diffusion-Android

Android平台上的Stable Diffusion AI客户端应用,支持连接Automatic1111 WebUI进行AI图像生成。

  • Stars: ⭐️ 1.2k
  • Tags: stable-diffusion android ai-image-generation kotlin
  • 最后活动时间: 2026-06-12

HunyuanWorld-Mirror

腾讯混元团队开发的快速通用3D重建模型,支持图像到3D、场景生成等多种任务。

  • Stars: ⭐️ 1.2k
  • Tags: 3d-reconstruction aigc image-to-3d scene-generation
  • 最后活动时间: 2026-05-27

MeanFlow

一步生成建模的PyTorch实现,探索流匹配和扩散模型的高效生成方法。

  • Stars: ⭐️ 1.2k
  • Tags: Diffusion Flow Matching Generative Model
  • 最后活动时间: 2026-07-01

LLaVA-OneVision-2

完全开放的多模态训练框架,支持视觉语言模型的民主化训练与部署。

  • Stars: ⭐️ 1.2k
  • Tags: llava llm mllm vision-language-model multimodal
  • 最后活动时间: 2026-09-16

3dgs-render-blender-addon

KIRI Engine 出品的 3D Gaussian Splatting 渲染器 Blender 插件,支持神经渲染技术在 3D 建模中的应用。

  • Stars: ⭐️ 1.2k
  • Tags: 3d-gaussian-splatting blender neural-rendering 3d-reconstruction
  • 最后活动时间: 2026-08-30

PoseLib

提供用于校准相机姿态估计的最小求解器集合。广泛应用于计算机视觉和3D重建任务中。

  • Stars: ⭐️ 1.2k
  • Tags: computer-vision pose-estimation 3d-reconstruction camera
  • 最后活动时间: 2026-06-23

samila

基于数学算法的生成艺术工具,可创建独特的NFT艺术作品。支持多种参数配置,生成风格多样的视觉艺术。

  • Stars: ⭐️ 1.2k
  • Tags: generative-art python3 nft matplotlib
  • 最后活动时间: 2026-09-07

ecom-details-image

面向跨境电商和国内电商的通用视觉创作Skill,精选25个高质量案例并配完整提示词。支持一键生成电商主图、详情页及社媒推广图等全套视觉素材,具备Campaign Style Lock机制以保障转化效果。

  • Stars: ⭐️ 1.2k
  • Tags: E-commerce Image Generation Prompt Engineering Claude Code
  • 最后活动时间: 2026-05-15

ComfyUI-wiki

ComfyUI 综合知识库,包含工作流分享、资源分享、教程分享等内容,帮助用户快速上手 Stable Diffusion 图像生成。

  • Stars: ⭐️ 1.2k
  • Tags: comfyui stable-diffusion image-generation workflow
  • 最后活动时间: 2026-09-14

deepsvg

NeurIPS 2020论文官方代码,用于矢量图形动画的分层生成网络,包含PyTorch深度学习库。

  • Stars: ⭐️ 1.2k
  • Tags: SVG Generative Model PyTorch NeurIPS
  • 最后活动时间: 2026-09-04

MambaIR

基于Mamba架构的低级视觉图像恢复模型,涵盖ECCV2024与CVPR2025版本。在图像超分辨率和去噪等任务中实现了高效的感受野与性能平衡。

  • Stars: ⭐️ 1.2k
  • Tags: Image-Restoration Mamba Low-Level-Vision Super-Resolution
  • 最后活动时间: 2026-06-03

ComfyUI-Inpaint-CropAndStitch

通过采样前裁剪、采样后缝合优化 ComfyUI 局部重绘,显著加快 inpainting 速度并降低显存占用。

  • Stars: ⭐️ 1.2k
  • Tags: ComfyUI Inpainting Image-Generation Optimization
  • 最后活动时间: 2026-09-07

biniou

一个自托管的生成式AI WebUI,支持30多种AI模型,包括Stable Diffusion、FLUX、AnimateDiff、Bark、Whisper等,覆盖图像、音频、视频多模态生成。

  • Stars: ⭐️ 1.1k
  • Tags: Generative AI WebUI Stable Diffusion Multimodal
  • 最后活动时间: 2026-09-16

guizang-material-illustration

材质插画技能,用于生成带文字解释的图表、数据可视化和参考辅助配图。

  • Stars: ⭐️ 1.1k
  • Tags: illustration data-visualization claude-code image-generation
  • 最后活动时间: 2026-07-07

Awesome-Image-Composition

图像合成与物体插入领域的论文、代码和资源精选列表,涵盖图像融合、和谐化、阴影生成等生成式AI技术。

  • Stars: ⭐️ 1.1k
  • Tags: image-composition image-harmonization generative-ai computer-vision
  • 最后活动时间: 2026-08-20

Uni-MoE

大规模多模态模型家族,基于混合专家架构实现多模态理解与生成能力。

  • Stars: ⭐️ 1.1k
  • Tags: multimodal moe large-language-model image-generation
  • 最后活动时间: 2026-08-06

PowerPaint

ECCV 2024多功能图像修复模型,支持物体插入、移除、扩展等多种功能。

  • Stars: ⭐️ 1.1k
  • Tags: inpainting image-editing stable-diffusion
  • 最后活动时间: 2026-08-15

image-extender

基于 Gemini 和 OpenRouter 的开源 AI 图像扩展工具,支持任意方向延展图像。结合泊松融合算法和三选一变体挑选机制,实现无缝的图像外扩效果。

  • Stars: ⭐️ 1.1k
  • Tags: ai gemini image-generation outpainting nextjs
  • 最后活动时间: 2026-05-31

gaussian-splatting-lightning

基于PyTorch Lightning的3D高斯泼溅框架,集成多种衍生算法与交互式Web查看器。

  • Stars: ⭐️ 1.1k
  • Tags: gaussian-splatting 3d-reconstruction pytorch-lightning nerf deep-learning
  • 最后活动时间: 2026-05-25

dsh-vision-router

为纯文本Deepseek智能体提供视觉能力的工具箱,支持图像问答、OCR、像素差异分析等功能。无需Python环境,一键安装即可让文本模型拥有多模态视觉理解能力。

  • Stars: ⭐️ 1.1k
  • Tags: deepseek-harness multimodal vision ocr agent-skills
  • 最后活动时间: 2026-09-16

aholo-viewer

一款高性能的3D高斯泼溅(3DGS)渲染器,支持LOD多层级渲染。适合处理大规模3D场景的高效可视化。

  • Stars: ⭐️ 1.1k
  • Tags: 3d 3d-gaussian-splatting 3dgs 3dgs-lod renderer
  • 最后活动时间: 2026-09-16

EmotiEffLib

高效的图像与视频人脸情绪识别库,支持多种表情分析。能够轻松集成到各类视觉应用中。

  • Stars: ⭐️ 1.1k
  • Tags: emotion-recognition facial-expression computer-vision face-detection
  • 最后活动时间: 2026-06-23

InfiniDepth

利用神经隐式场实现任意分辨率和细粒度的深度估计模型。CVPR 2026 论文项目。

  • Stars: ⭐️ 1.0k
  • Tags: Depth Estimation Neural Implicit Fields Computer Vision
  • 最后活动时间: 2026-04-03

muapi-cli

muapi.ai官方CLI工具,支持终端生成图像、视频和音频,集成MCP服务器。

  • Stars: ⭐️ 1.0k
  • Tags: ai cli image-generation video-generation mcp
  • 最后活动时间: 2026-08-27

CNNGestureRecognizer

基于CNN的手势识别项目,使用Keras和TensorFlow实现,支持实时手势检测。

  • Stars: ⭐️ 1.0k
  • Tags: gesture-recognition cnn tensorflow keras
  • 最后活动时间: 2026-05-21

Comfyui_TTP_Toolset

用于将图像分块以便进行高级控制与修改的 ComfyUI 工具集,适合高分辨率与精细编辑工作流。

  • Stars: ⭐️ 1.0k
  • Tags: ComfyUI ImageGeneration Tiling CustomNodes
  • 最后活动时间: 2026-09-14

GLM-Image

基于自回归的高保真图像生成模型,支持文本到图像和图像到图像的生成任务。

  • Stars: ⭐️ 1.0k
  • Tags: Text-to-Image Image Generation Auto-regressive
  • 最后活动时间: 2026-03-20

LAM

大型虚拟人模型,支持通过单张图像一键生成可动画化的3D高斯人头。该项目是SIGGRAPH 2025的前沿研究实现,专注于高质量的头部重建与驱动。

  • Stars: ⭐️ 1.0k
  • Tags: 3d-gaussian-splatting head-avatar one-shot-animation computer-graphics
  • 最后活动时间: 2026-06-10

Lumina-DiMOO

开源多模态大扩散语言模型,支持统一的多模态理解与生成能力。

  • Stars: ⭐️ 1.0k
  • Tags: diffusion-model multimodal-llm image-generation
  • 最后活动时间: 2026-05-19

PRISM-VL

研究基于RAW测量的视觉语言模型(VLM)学习,支持相机条件定位和曝光包围监督转移。

  • Stars: ⭐️ 1.0k
  • Tags: VLM Computer Vision Machine Learning
  • 最后活动时间: 2026-05-27

image-multiple-angles-3d-camera

基于 Three.js 与 Gradio 的多视角图像生成工具,用户可在 3D 空间中拖拽相机或通过滑块设置方位角、仰角和距离,利用 Qwen 图像编辑模型从任意视角生成图像。支持中英双语界面。

  • Stars: ⭐️ 1.0k
  • Tags: image-generation qwen gradio three-js multi-angle computer-vision
  • 最后活动时间: 2026-08-28

FlowEdit

基于预训练Flow模型的无反演文本引导图像编辑官方实现。无需反演即可通过文本指令对图像进行高质量编辑。

  • Stars: ⭐️ 1.0k
  • Tags: diffusion-models image-editing generative-model rectified-flow
  • 最后活动时间: 2026-08-16

PiD

PiD是一种基于像素扩散的快速高分辨率潜变量解码模型,能够高效生成高质量图像。

  • Stars: ⭐️ 1.0k
  • Tags: diffusion-decoder pixel-diffusion image-generation
  • 最后活动时间: 2026-07-22

ComfyUI-Advanced-ControlNet

为 ComfyUI 提供高级 ControlNet 调度和遮罩节点,支持滑动上下文功能。

  • Stars: ⭐️ 1.0k
  • Tags: ComfyUI ControlNet StableDiffusion ImageGeneration
  • 最后活动时间: 2026-07-28

FastGen

NVIDIA推出的扩散模型加速生成技术,通过蒸馏方法显著提升图像生成速度,提供高效推理优化方案。

  • Stars: ⭐️ 1.0k
  • Tags: Diffusion Distillation NVIDIA
  • 最后活动时间: 2026-08-21

SegAnyGAussians

AAAI-25论文官方实现,实现3D高斯场景的任意分割技术。

  • Stars: ⭐️ 998
  • Tags: 3d-segmentation gaussian-splatting computer-vision
  • 最后活动时间: 2026-08-02

Skyfall-GS

从卫星图像合成沉浸式3D城市场景,结合3D高斯泼溅与扩散模型技术实现高质量三维重建。

  • Stars: ⭐️ 986
  • Tags: 3D重建 卫星图像 高斯泼溅
  • 最后活动时间: 2026-06-20

Boogu-Image

Apache-2.0开源的图像生成与编辑模型家族,以极少数据实现接近闭源模型的性能。

  • Stars: ⭐️ 984
  • Tags: image-generation image-editing open-source apache-2
  • 最后活动时间: 2026-07-23

visual_anagrams

基于扩散模型的多视角光学错觉生成工具,可创建从不同角度观看呈现不同图像的创意视觉作品。

  • Stars: ⭐️ 971
  • Tags: Diffusion Models Optical Illusion Generative AI
  • 最后活动时间: 2026-07-17

Image-processing-algorithm

图像处理算法论文实现集合,包含Retinex、去雾等经典算法。

  • Stars: ⭐️ 969
  • Tags: image-processing retinex dehazing opencv
  • 最后活动时间: 2026-05-20

GLaMM

CVPR 2024 论文,首个能生成自然语言响应并无缝集成目标分割掩码的大规模多模态模型。

  • Stars: ⭐️ 968
  • Tags: Multimodal Segmentation Grounding CVPR 2024
  • 最后活动时间: 2026-09-05

PillOCR-python

基于大模型API的OCR工具,提供智能文字识别能力。

  • Stars: ⭐️ 964
  • Tags: ocr llm python
  • 最后活动时间: 2026-05-01

ComfyUI-Detail-Daemon

将知名的 Detail Daemon 细节控制方法移植为 ComfyUI 节点,通过调整 sigmas 精细掌控图像生成的细节强度。

  • Stars: ⭐️ 964
  • Tags: ComfyUI ImageGeneration StableDiffusion CustomNodes
  • 最后活动时间: 2026-08-18

story-iter

ICLR 2026论文项目,提供无需训练的迭代框架用于长故事可视化,基于扩散模型实现高质量图像生成。

  • Stars: ⭐️ 959
  • Tags: diffusion-models image-generation storytelling visual-storytelling
  • 最后活动时间: 2026-04-02

PixelDiT

CVPR 2026 Oral 论文项目,提出像素级扩散 Transformer 用于高质量图像生成,代表了图像生成领域的前沿研究进展。

  • Stars: ⭐️ 959
  • Tags: diffusion-models image-generation transformer computer-vision
  • 最后活动时间: 2026-07-08

Awesome-diffusion-model-for-image-processing

基于扩散模型的图像处理资源汇总,涵盖图像修复、增强、编码和质量评估等方向。

  • Stars: ⭐️ 956
  • Tags: diffusion-models image-processing image-restoration image-enhancement
  • 最后活动时间: 2026-04-08

sapiens2

ICLR 26论文实现,在10亿人类图像上预训练的1K分辨率视觉Transformer模型,专注于人体视觉理解任务。

  • Stars: ⭐️ 947
  • Tags: vision-transformer computer-vision human-centric pretrained-model
  • 最后活动时间: 2026-05-24

PhysX-Anything

CVPR 2026论文,从单张图像生成具备物理仿真属性的3D资产。

  • Stars: ⭐️ 942
  • Tags: image-to-3d physical-modeling 3d-generation cvpr
  • 最后活动时间: 2026-04-28

OpenStereo

立体匹配领域的综合基准测试工具,用于评估和比较各种立体匹配算法的性能表现。

  • Stars: ⭐️ 941
  • Tags: stereo-matching computer-vision benchmark depth-estimation
  • 最后活动时间: 2026-08-13

mesh2splat

快速将3D网格模型转换为高斯泼溅格式的工具,支持神经渲染和实时新视角合成。

  • Stars: ⭐️ 937
  • Tags: 3d-gaussian-splatting neural-rendering 3d-reconstruction
  • 最后活动时间: 2026-04-22

spz

Niantic开源的3D高斯泼溅文件格式,压缩率比PLY格式高约10倍,几乎无视觉质量损失。

  • Stars: ⭐️ 925
  • Tags: gaussian-splatting 3dgs compression 3d-reconstruction
  • 最后活动时间: 2026-09-01

StableGen

强大的Blender插件,集成Stable Diffusion、ControlNet和Flux1-dev,实现智能3D纹理生成。

  • Stars: ⭐️ 916
  • Tags: Blender Stable Diffusion 3D纹理
  • 最后活动时间: 2026-07-07

workflow_templates

提供丰富的 ComfyUI 模板工作流集合。方便用户快速复用和构建各类图像生成任务。

  • Stars: ⭐️ 912
  • Tags: comfyui workflow templates image-generation
  • 最后活动时间: 2026-09-16

UpscalerJS

浏览器端AI图像增强库,支持超分辨率、去噪、修复等功能,无需后端服务。

  • Stars: ⭐️ 899
  • Tags: image-enhancement super-resolution tensorflow-js esrgan
  • 最后活动时间: 2026-09-15

farmvibes-ai

农业与可持续发展领域的多模态地理空间机器学习模型平台。

  • Stars: ⭐️ 897
  • Tags: geospatial agriculture multi-modal
  • 最后活动时间: 2026-09-09

ComfyUI-QwenVL

ComfyUI自定义节点,集成Qwen-VL系列视觉语言模型,支持GGUF格式,提供文本生成、图像理解和视频分析能力。

  • Stars: ⭐️ 890
  • Tags: ComfyUI Qwen-VL Multimodal
  • 最后活动时间: 2026-09-14

open-cd

变化检测工具箱,集成多种深度学习变化检测算法,支持BIT、Changer等模型。

  • Stars: ⭐️ 890
  • Tags: change-detection deep-learning pytorch transformer
  • 最后活动时间: 2026-06-15

dsh-vision-toolkit

为纯文本大模型设计的强大视觉工具箱,支持图片识别、多图问答及UI还原等功能。通过插件化增强Agent的视觉交互能力。

  • Stars: ⭐️ 883
  • Tags: computer-vision ocr agent-skills ui-restoration vision-language-model
  • 最后活动时间: 2026-09-16

UniPic

开源SOTA多图像编辑模型,支持高质量图像理解与编辑生成。

  • Stars: ⭐️ 875
  • Tags: Image Editing Diffusion VLM
  • 最后活动时间: 2026-07-13

Open-DiffusionGS

ICCV 2025论文,融合高斯泼溅与扩散模型,实现快速单阶段图像到3D生成与重建。

  • Stars: ⭐️ 864
  • Tags: 3D生成 高斯泼溅 扩散模型
  • 最后活动时间: 2026-08-30

JarvisArt

NeurIPS 2025智能照片修图代理,基于多模态大语言模型释放人类艺术创造力。

  • Stars: ⭐️ 864
  • Tags: multimodal image-processing vision-language-models agent
  • 最后活动时间: 2026-04-04

Image-Generation-CoT

CVPR 2025 论文,首次探索图像生成中的 Chain-of-Thought 推理,涵盖强化学习与反思机制。

  • Stars: ⭐️ 864
  • Tags: image-generation chain-of-thought diffusion reasoning
  • 最后活动时间: 2026-03-19

ComfyUI_RyanOnTheInside

ComfyUI的扩展节点库,支持音频、MIDI和动作的全面反应性控制。可动画化和操作图像、视频和音频,提供原生ACEStep扩展。

  • Stars: ⭐️ 863
  • Tags: comfyui audio-reactivity image-manipulation video-generation acestep
  • 最后活动时间: 2026-03-20

PoinTr

ICCV 2021 Oral论文,基于几何感知Transformer的点云补全模型,从部分点云重建完整3D几何结构。

  • Stars: ⭐️ 862
  • Tags: 3D Vision Point Cloud Transformer
  • 最后活动时间: 2026-06-24

stirling-image

类似Stirling-PDF的图像处理工具箱,集成30多种本地AI功能,包括调整大小、压缩、背景移除、图像放大、OCR等,完全离线运行,无云服务依赖。

  • Stars: ⭐️ 860
  • Tags: ai image-processing ocr image-upscale self-hosted
  • 最后活动时间: 2026-04-24

FlashWorld

ICLR 2026 Oral论文官方代码,实现秒级高质量3D场景生成的创新方法。

  • Stars: ⭐️ 856
  • Tags: 3d-generation scene-generation iclr2026
  • 最后活动时间: 2026-03-24

MHR

Meta开发的参数化全身数字人体模型,包含骨骼模型、3D网格、姿态校正和面部混合变形,专为计算机视觉和图形学社区设计。

  • Stars: ⭐️ 850
  • Tags: human-model 3d-body computer-vision parametric-model
  • 最后活动时间: 2026-09-11

LxgwZhenKai

基于「霞鹜文楷」衍生的开源中文字体,后期利用AI生成字形辅助补字。结合了手动调整与AI生成技术,展现了AI在字体设计领域的应用。

  • Stars: ⭐️ 845
  • Tags: Font AI Typography Chinese
  • 最后活动时间: 2026-06-29

krea-2

Krea 2的官方推理代码,提供强大的图像生成能力。

  • Stars: ⭐️ 840
  • Tags: image-generation ai-art inference
  • 最后活动时间: 2026-07-24

jimeng-free-api-all

即梦AI免费API服务,支持文生图、图生图、视频生成等功能,兼容OpenAI接口格式,支持多账号接入与零配置Docker部署。

  • Stars: ⭐️ 839
  • Tags: ai-image-generation video-generation openai-compatible docker
  • 最后活动时间: 2026-04-13

ComfyUI-Trellis2

Microsoft Trellis 3D生成模型的ComfyUI封装,支持从图像生成高质量3D模型。

  • Stars: ⭐️ 831
  • Tags: 3d-generation comfyui text-to-3d image-to-3d
  • 最后活动时间: 2026-09-08

zotero-ocr

Zotero文献管理软件的OCR插件,基于Tesseract实现文档文字识别功能。

  • Stars: ⭐️ 826
  • Tags: ocr zotero tesseract
  • 最后活动时间: 2026-09-09

MonoScene

CVPR 2022论文,单目3D语义场景补全,从单张图像预测3D语义占用。

  • Stars: ⭐️ 821
  • Tags: 3d-scene-completion monocular semantic-segmentation pytorch
  • 最后活动时间: 2026-03-25

RoseTTAFold-All-Atom

基于深度学习的蛋白质全原子结构预测模型,能够预测蛋白质及其配体的三维结构。

  • Stars: ⭐️ 821
  • Tags: protein-structure deep-learning bioinformatics structural-biology
  • 最后活动时间: 2026-05-18

huobao-canvas

无限画布工具,支持文生图、图生图、图生视频及多模型切换,兼容OpenAI标准格式。

  • Stars: ⭐️ 817
  • Tags: image-generation text-to-image video-generation
  • 最后活动时间: 2026-09-11

midjourney-proxy

全球最大的Midjourney绘图API。日生成超百万张图,支持Discord集成。

  • Stars: ⭐️ 813
  • Tags: midjourney image-generation api-proxy discord-bot
  • 最后活动时间: 2026-09-16

scribeocr

基于Web的OCR文档识别与校对工具,支持创建完整数字化文档。

  • Stars: ⭐️ 811
  • Tags: ocr tesseract web-interface
  • 最后活动时间: 2026-08-28

SSRS

遥感图像语义分割工具箱,支持Mamba、多模态融合、Segment Anything及无监督域适应等前沿方法。

  • Stars: ⭐️ 808
  • Tags: semantic-segmentation remote-sensing transformer mamba
  • 最后活动时间: 2026-07-22

SAX-NeRF

CVPR 2024 论文,结构感知的稀疏视角X射线3D重建,支持CT重建和新视角合成。

  • Stars: ⭐️ 807
  • Tags: x-ray ct-reconstruction nerf medical-imaging
  • 最后活动时间: 2026-06-24

awesome-nanobananapro-prompts

基于 Google Gemini 2.5 Flash 模型打造的精美 AI 图像生成与编辑 Web 应用。使用 Next.js 构建,提供直观的图像创作体验。

  • Stars: ⭐️ 807
  • Tags: gemini image-generation nextjs ai-art
  • 最后活动时间: 2026-09-10

HY-WU

HY-WU是一个可扩展的功能性神经记忆框架,并在文本引导图像编辑场景中进行了实例化验证。该项目为AI记忆机制与多模态生成研究提供了新颖的探索方向。

  • Stars: ⭐️ 799
  • Tags: Neural Memory Image Editing Text-Guided Research
  • 最后活动时间: 2026-03-18

immich-automated-selfie-timelapse

自动化人脸提取、调整和对齐工具,适合制作自拍延时视频。基于Immich平台实现的人脸识别与处理工作流。

  • Stars: ⭐️ 797
  • Tags: immich face-detection timelapse self-hosted
  • 最后活动时间: 2026-07-08

CnSTD

基于PyTorch/MXNet的中文场景文字检测工具包,支持OCR、数学公式检测和版面分析。

  • Stars: ⭐️ 794
  • Tags: ocr text-detection deep-learning pytorch scene-text-detection
  • 最后活动时间: 2026-07-05

gemini-nanobanana-pro

基于 Google Gemini 2.5 Flash 模型构建的 AI 图像生成与编辑 Web 应用,使用 Next.js 开发。

  • Stars: ⭐️ 794
  • Tags: gemini image-generation image-editing nextjs web-app
  • 最后活动时间: 2026-07-04

ocean

Meta开源的跨平台计算机视觉与增强现实框架,C++实现,支持CV和AR应用开发。

  • Stars: ⭐️ 791
  • Tags: computer-vision augmented-reality meta cpp
  • 最后活动时间: 2026-09-15

Awesome-AIGC-3D

精选的AI生成3D内容论文合集,涵盖最新的文本到3D、图像到3D等前沿研究方向。

  • Stars: ⭐️ 787
  • Tags: aigc 3d-generation text-to-3d image-to-3d neural-rendering
  • 最后活动时间: 2026-05-04

ComfyUI-See-through

ComfyUI插件,利用AI系统将单张动漫插画分解为可操作的2.5D分层模型。支持深度排序,可直接用于Live2D工作流。

  • Stars: ⭐️ 787
  • Tags: comfyui image-generation live2d ai-art
  • 最后活动时间: 2026-08-20

ImageJ

开源科学图像处理软件,广泛应用于生物医学图像分析和科研领域。

  • Stars: ⭐️ 785
  • Tags: computer-vision image-processing scientific-imaging
  • 最后活动时间: 2026-07-22

OmniLottie

CVPR 2026 论文项目,开源的多模态向量动画生成器,可通过指令生成 Lottie JSON 动画文件,支持 VLM 视觉语言模型驱动。

  • Stars: ⭐️ 784
  • Tags: generative-ai multi-modal vlm lottie-animation vector-graphics
  • 最后活动时间: 2026-04-06

easyedit

一款通过简单的自然语言提示词即可轻松编辑图像的AI工具。大幅降低了图像编辑的门槛,实现高效的内容创作。

  • Stars: ⭐️ 781
  • Tags: image-editing prompt-based generative-ai
  • 最后活动时间: 2026-07-31

SOMA-X

统一参数化人体模型的开源框架,支持姿态估计与数字人生成。基于PyTorch和CUDA实现高性能计算。

  • Stars: ⭐️ 780
  • Tags: digital-human pose-estimation pytorch cuda open-usd
  • 最后活动时间: 2026-09-02

pexo-skills

开源Agent技能集合,专注于图像、音频和视频等多模态内容创作。

  • Stars: ⭐️ 776
  • Tags: agent-skills multimodal content-creation
  • 最后活动时间: 2026-08-20

LoG

Level of Gaussians - 基于高斯泼溅的神经渲染技术,实现高质量新视角合成与3D重建。

  • Stars: ⭐️ 771
  • Tags: gaussian-splatting 3d-reconstruction novel-view-synthesis neural-rendering
  • 最后活动时间: 2026-09-15

DreamLite

ECCV 2026官方实现,一个用于图像生成与编辑的轻量级端侧统一模型。

  • Stars: ⭐️ 770
  • Tags: image-generation image-editing on-device lightweight-model
  • 最后活动时间: 2026-08-08

ima2-gen

OpenAI GPT Image 2 的极简 CLI 和 Web UI 工具。支持文本生成图像、图像生成图像及并行生成。

  • Stars: ⭐️ 769
  • Tags: image-generation openai cli nodejs
  • 最后活动时间: 2026-09-17

FG-CLIP

新一代CLIP模型,具备强大的细粒度识别能力,支持跨模态检索和图文匹配任务。

  • Stars: ⭐️ 763
  • Tags: clip cross-modal-retrieval fine-grained-classification text-image-retrieval
  • 最后活动时间: 2026-06-16

HiVG

一种层次化SVG标记化方法,通过学习紧凑的视觉程序来实现可缩放矢量图形的生成与建模。支持文本到SVG和图像到SVG的智能转换。

  • Stars: ⭐️ 760
  • Tags: svg-generation visual-programs image-to-svg text-to-svg
  • 最后活动时间: 2026-04-17

aitviewer

用于可视化和交互3D数据序列的工具集,支持SMPL人体模型、网格渲染和计算机视觉数据可视化。

  • Stars: ⭐️ 749
  • Tags: 3d-visualization computer-vision smpl meshes rendering
  • 最后活动时间: 2026-05-07

DART

实时目标检测系统,利用前沿目标检测模型实现快速准确的识别。适用于需要低延迟响应的计算机视觉应用场景。

  • Stars: ⭐️ 747
  • Tags: object-detection real-time computer-vision ai
  • 最后活动时间: 2026-08-30

tessera

剑桥大学开发的卫星时序图像基础模型,支持土地分类和树冠高度预测等遥感应用。

  • Stars: ⭐️ 744
  • Tags: Satellite Remote Sensing Foundation Models
  • 最后活动时间: 2026-08-17

tuna-2

Tuna-2模型的官方实现,证明了像素嵌入在统一理解与生成任务中优于视觉编码器。

  • Stars: ⭐️ 744
  • Tags: multimodal pixel-embeddings vision-encoder unified-model
  • 最后活动时间: 2026-07-22

Comfyui-zhenzhen

ComfyUI的平价API调用节点集合,支持Seedance2.0等多种图像生成模型。

  • Stars: ⭐️ 741
  • Tags: comfyui image-generation api-nodes
  • 最后活动时间: 2026-09-13

EDGS

3D高斯泼溅高效收敛方法PyTorch实现,消除密集化步骤。3D重建新方法。

  • Stars: ⭐️ 740
  • Tags: 3dgs 3d-reconstruction gaussian-splatting
  • 最后活动时间: 2026-07-04

mpv-AnimeJaNai

利用轻量级超分辨率模型在mpv播放器中实现实时动漫4K画质放大。基于TensorRT和Vapoursynth提供高效的视频增强体验。

  • Stars: ⭐️ 739
  • Tags: super-resolution esrgan anime-upscaling tensorrt
  • 最后活动时间: 2026-09-16

marigold-v2

Marigold V2使用扩散Transformer实现高精度单目深度估计,改进深度图生成质量与效率。

  • Stars: ⭐️ 736
  • Tags: depth-estimation diffusion-transformer monocular-depth computer-vision
  • 最后活动时间: 2026-09-13

libcom

一个全面的图像合成工具箱,涵盖图像融合、物体插入、阴影生成和光照协调等功能。非常适合需要高质量图像编辑与合成的研究者和开发者。

  • Stars: ⭐️ 733
  • Tags: image-composition image-blending image-harmonization object-insertion computer-vision
  • 最后活动时间: 2026-04-26

FCGF

全卷积几何特征提取网络,用于3D点云配准和对应关系建立。

  • Stars: ⭐️ 732
  • Tags: 3d-vision feature-extraction point-cloud registration
  • 最后活动时间: 2026-07-02

gpt-image-canvas

基于 tldraw 构建的本地专业 AI 画布工具,支持图像生成与编辑。

  • Stars: ⭐️ 729
  • Tags: ai ai-tools image-generation canvas
  • 最后活动时间: 2026-08-27

Point-Transformers

点云Transformer实现,用于3D点云处理和理解,是计算机视觉领域的重要研究方向。

  • Stars: ⭐️ 728
  • Tags: point-cloud transformer 3d-vision deep-learning
  • 最后活动时间: 2026-06-13

YOLO-Master

CVPR2026论文官方代码,基于MOE加速和专业Transformer增强的实时目标检测模型,支持分类、检测和分割任务。

  • Stars: ⭐️ 725
  • Tags: yolo object-detection moe computer-vision transformers
  • 最后活动时间: 2026-09-17

native-subtitle-quote-image

这个 Agent Skill 保留视频内嵌字幕,精确取帧并生成 3:4 社交长图。结合 AI 技术,实现视频处理与社交媒体内容生成的自动化。

  • Stars: ⭐️ 724
  • Tags: Video Processing Image Generation Agent Skills Subtitles Social Media
  • 最后活动时间: 2026-08-24

micro-sam

Segment Anything模型在显微图像领域的适配应用,支持细胞与细胞器分割。

  • Stars: ⭐️ 721
  • Tags: segment-anything microscopy cell-segmentation bioimage
  • 最后活动时间: 2026-09-16

AI生成内容展示平台,汇集有趣的AI生成作品,基于Next.js 14和React构建。

  • Stars: ⭐️ 719
  • Tags: ai-generated showcase nextjs visualization
  • 最后活动时间: 2026-06-18

icons

利用AI技术自动生成macOS应用图标的实用工具。它简化了图标设计流程,让开发者能快速创建高质量的应用图标。

  • Stars: ⭐️ 719
  • Tags: AI macOS icons design image-generation
  • 最后活动时间: 2026-07-23

Awesome-Sketch-Based-Applications

基于草图的应用论文合集,涵盖草图到图像生成、草图检索、草图建模等AI相关研究方向。

  • Stars: ⭐️ 716
  • Tags: sketch-to-image sketch-based-retrieval generative-ai computer-vision
  • 最后活动时间: 2026-08-21

DiffusionDPO

Salesforce开源的扩散模型对齐方法,将DPO技术应用于图像生成模型,实现更符合人类偏好的生成效果。

  • Stars: ⭐️ 714
  • Tags: Diffusion Models DPO Model Alignment
  • 最后活动时间: 2026-06-02

MetalSplatter

在Apple平台上使用Metal渲染高斯溅射的框架,支持iOS、macOS和visionOS,实现实时3D场景重建与渲染。

  • Stars: ⭐️ 714
  • Tags: gaussian-splatting metal 3d-rendering computer-vision
  • 最后活动时间: 2026-09-02

Nova3D

支持通过文本或参考图像生成可编辑、部件感知的3D模型。结合大语言模型与生成式AI,为3D创作提供强大支持。

  • Stars: ⭐️ 714
  • Tags: 3d-generation generative-ai text-to-3d
  • 最后活动时间: 2026-08-12

NanoBananaEditor

基于Gemini 2.5 Flash的AI图像生成与编辑应用,支持参考图、蒙版编辑和版本历史。

  • Stars: ⭐️ 711
  • Tags: image-generation image-editing gemini-api
  • 最后活动时间: 2026-09-10

paz

Python层级感知库,支持姿态估计、目标检测、实例分割、人脸识别等多种计算机视觉任务。

  • Stars: ⭐️ 710
  • Tags: pose-estimation object-detection face-recognition instance-segmentation
  • 最后活动时间: 2026-09-13

Self-Flow

一种用于可扩展多模态合成的自监督流匹配方法。该项目提供了相关代码与论文资料。

  • Stars: ⭐️ 709
  • Tags: machine-learning flow-matching multimodal-synthesis self-supervised
  • 最后活动时间: 2026-05-23

FMA-Net

CVPR 2024 Oral论文,高效的视频去模糊与超分辨率网络。

  • Stars: ⭐️ 705
  • Tags: deblurring super-resolution video-enhancement cvpr2024
  • 最后活动时间: 2026-07-03

BiomedParse

生物医学图像基础模型,支持九种模态的联合分割、检测和识别任务。

  • Stars: ⭐️ 705
  • Tags: biomedical-imaging segmentation object-detection foundation-model
  • 最后活动时间: 2026-09-09

ComfyScript

ComfyUI的Python前端库,支持将工作流编写为Python脚本,在Jupyter中实现自动化图像生成。

  • Stars: ⭐️ 704
  • Tags: ComfyUI Stable Diffusion Python
  • 最后活动时间: 2026-07-18

NeuralRecon-W

SIGGRAPH 2022论文代码,实现野外场景的神经三维重建,支持复杂环境下的场景恢复。

  • Stars: ⭐️ 703
  • Tags: 3d-reconstruction neural-rendering siggraph
  • 最后活动时间: 2026-09-15

Fast-SRGAN

轻量级实时超分辨率模型,可在30fps下将低分辨率视频实时上采样为高分辨率。

  • Stars: ⭐️ 695
  • Tags: real-time srgan video-super-resolution tensorflow
  • 最后活动时间: 2026-09-01

peinture

通用AI图像生成框架,支持Hugging Face、Model Scope等多个模型平台。

  • Stars: ⭐️ 694
  • Tags: Image Generation AI Art Framework
  • 最后活动时间: 2026-06-18

MI-GAN

ICCV 2023 论文实现,专为移动设备设计的图像修复模型。通过知识蒸馏和重参数化技术实现高效移动端推理。

  • Stars: ⭐️ 690
  • Tags: image-inpainting knowledge-distillation mobile-inpainting gan
  • 最后活动时间: 2026-09-14

SenseNova-Vision

一个将视觉作为统一多模态生成的先进模型。专注于多模态大语言模型(MLLM)在计算机视觉领域的统一应用与生成。

  • Stars: ⭐️ 689
  • Tags: mllm multimodal computer-vision image-generation
  • 最后活动时间: 2026-09-01

LHM-plusplus

高效的大型人体重建模型,可从任意姿态图像重建3D人体模型。

  • Stars: ⭐️ 688
  • Tags: 3d-reconstruction human-model computer-vision deep-learning
  • 最后活动时间: 2026-05-29

spectral

Python高光谱图像处理模块,支持异常检测、图像分类和目标检测等AI功能。

  • Stars: ⭐️ 682
  • Tags: hyperspectral image-processing anomaly-detection python
  • 最后活动时间: 2026-09-04

syncity

无需训练的3D世界生成框架,支持快速创建复杂3D场景。

  • Stars: ⭐️ 681
  • Tags: 3d-generation training-free 3d-worlds
  • 最后活动时间: 2026-07-07

WiLoR

端到端的3D手部定位与重建模型,可在自然场景中实现高精度的手部姿态估计和3D重建。

  • Stars: ⭐️ 679
  • Tags: hand-pose 3d-reconstruction computer-vision deep-learning
  • 最后活动时间: 2026-04-07

comfyui-tooling-nodes

ComfyUI工具节点集合,支持将其作为后端服务使用,实现外部工具与ComfyUI直接图像传输。

  • Stars: ⭐️ 672
  • Tags: ComfyUI Stable Diffusion API
  • 最后活动时间: 2026-08-19

assets

Ultralytics官方资源库,包含YOLO系列模型权重和计算机视觉资源。

  • Stars: ⭐️ 672
  • Tags: computer-vision yolo object-detection ultralytics
  • 最后活动时间: 2026-09-14

Ming

基于Ling大模型构建的多模态理解与生成框架,支持高级多模态任务处理。

  • Stars: ⭐️ 671
  • Tags: multimodal llm vision-language
  • 最后活动时间: 2026-07-27

EmbodiedGen

面向具身智能的生成式3D世界引擎,能够高效生成高质量的3D场景与资产。为机器人和AI智能体提供逼真的虚拟训练与交互环境。

  • Stars: ⭐️ 670
  • Tags: 3d-generation embodied-ai world-model synthetic-data
  • 最后活动时间: 2026-08-24

OSEDiff

NeurIPS 2024 提出的单步有效扩散网络,专用于真实世界图像超分辨率。能高效提升低质量图像的清晰度与细节。

  • Stars: ⭐️ 666
  • Tags: diffusion super-resolution image-processing neurips
  • 最后活动时间: 2026-04-09

SAM3DBody-cpp

基于单摄像头的实时3D全身重建工具,支持多人BVH输出与70关节骨架。纯C++运行时结合ONNX与ggml,实现高性能动作捕捉。

  • Stars: ⭐️ 665
  • Tags: 3d-human-pose pose-estimation onnx cpp real-time
  • 最后活动时间: 2026-09-16

Prism

开源的跨平台壁纸应用,支持社区上传、精选合集以及AI壁纸生成功能,让用户轻松创建个性化壁纸。

  • Stars: ⭐️ 664
  • Tags: flutter wallpaper ai image-generation
  • 最后活动时间: 2026-09-16

UniControl

统一可控视觉生成模型,支持多种条件输入下的图像生成与编辑。适用于AIGC多模态视觉内容创作场景。

  • Stars: ⭐️ 662
  • Tags: aigc image-generation multi-modal controllable-generation
  • 最后活动时间: 2026-06-02

libreyolo

LibreYOLO 是一个采用 MIT 许可证的开源计算机视觉库。它提供了目标检测功能,适用于多种视觉应用场景。

  • Stars: ⭐️ 660
  • Tags: computer-vision yolo object-detection open-source
  • 最后活动时间: 2026-09-16

SeeSR

CVPR 2024论文,实现语义感知的真实世界图像超分辨率重建。

  • Stars: ⭐️ 657
  • Tags: super-resolution stable-diffusion image-enhancement
  • 最后活动时间: 2026-04-09

nnDetection

自配置3D医学目标检测框架,支持12个数据集,无需手动干预即可应用于新数据。

  • Stars: ⭐️ 657
  • Tags: medical-imaging 3d-object-detection deep-learning
  • 最后活动时间: 2026-08-09

PyMAF

ICCV 2021 Oral论文,基于金字塔网格对齐反馈循环的3D人体姿态和形状回归模型,用于人体网格重建。

  • Stars: ⭐️ 654
  • Tags: 3d-human-pose human-mesh-recovery smpl computer-vision
  • 最后活动时间: 2026-09-15

yolov7-object-tracking

基于YOLOv7的目标检测与跟踪项目,结合PyTorch、OpenCV和SORT算法实现实时多目标跟踪。

  • Stars: ⭐️ 653
  • Tags: yolo object-detection object-tracking pytorch opencv
  • 最后活动时间: 2026-09-11

rtmlib

一个轻量级的人体姿态估计库,无需依赖mmcv等复杂框架即可运行RTMPose、DWPose等系列模型。提供高效且易于部署的全身姿态识别解决方案。

  • Stars: ⭐️ 651
  • Tags: pose-estimation openpose rtmpose computer-vision
  • 最后活动时间: 2026-08-03

comfyui-lumi-batcher

ComfyUI 的批量处理扩展插件,通过批量调试参数显著提升工作流效率。解决了传统图像生成中需要逐一调整参数的痛点。

  • Stars: ⭐️ 650
  • Tags: comfyui batch-processing image-generation workflow
  • 最后活动时间: 2026-07-20

pHash

开源感知哈希库,用于图像相似度检测和内容识别。支持图片指纹生成与匹配,广泛应用于图像去重、版权检测等场景。

  • Stars: ⭐️ 648
  • Tags: perceptual-hashing image-similarity computer-vision
  • 最后活动时间: 2026-06-09

ReconViaGen

ICLR2026论文项目,通过生成式方法实现精确的多视角3D物体重建,支持图像到3D的转换和姿态估计。

  • Stars: ⭐️ 646
  • Tags: 3d-generation 3d-reconstruction image-to-3d pose-estimation generative-ai
  • 最后活动时间: 2026-04-04

Liquid

IJCV收录的多模态大语言模型,实现可扩展的统一文本到图像生成。

  • Stars: ⭐️ 640
  • Tags: Multimodal LLM Text-to-Image Generative AI
  • 最后活动时间: 2026-06-01

ComfyUI_Fill-Nodes

功能全面的 ComfyUI 大型自定义节点包,覆盖图像处理、文本工具与工作流辅助等多种能力。

  • Stars: ⭐️ 638
  • Tags: ComfyUI Custom-Nodes Image-Generation Node-Pack
  • 最后活动时间: 2026-09-14

FastSurfer

FastSurferCNN的PyTorch实现,用于脑部MRI图像快速分割。

  • Stars: ⭐️ 636
  • Tags: pytorch medical-imaging brain-segmentation mri cnn
  • 最后活动时间: 2026-09-15

MMIF-CDDFuse

CVPR 2023 论文官方实现,提出相关性驱动的双分支特征分解方法,用于多模态图像融合任务。

  • Stars: ⭐️ 634
  • Tags: image-fusion deep-learning cvpr2023 multi-modality
  • 最后活动时间: 2026-06-08

TRIDENT

大规模全切片图像处理工具包,支持病理学基础模型,用于组织病理学图像的深度学习分析和处理。

  • Stars: ⭐️ 632
  • Tags: deep-learning pathology whole-slide-image foundation-model
  • 最后活动时间: 2026-09-15

RT-DETRv4

RT-DETRv4官方实现,结合视觉基础模型无痛推进实时目标检测。该框架在保持高精度的同时实现了卓越的实时检测性能。

  • Stars: ⭐️ 632
  • Tags: object-detection real-time vision-transformer computer-vision
  • 最后活动时间: 2026-07-06

TorchUMM

一个基于PyTorch的统一多模态模型工具包,支持多种模态的数据处理与模型构建。为多模态研究与应用提供了便捷的框架支持。

  • Stars: ⭐️ 631
  • Tags: pytorch multimodal machine-learning deep-learning
  • 最后活动时间: 2026-09-01

3DGenStudio

基于 ComfyUI 与外部 API 的可视化 3D 生成工作台,串联文生图、图像编辑、网格生成、UV 展开与贴图全流程。一站式编排完整 3D 生成管线。

  • Stars: ⭐️ 629
  • Tags: 3d-generation text-to-image comfyui mesh-generation texturing
  • 最后活动时间: 2026-09-16

prov-gigapath

基于真实世界数据的数字病理学全切片基础模型。

  • Stars: ⭐️ 628
  • Tags: digital-pathology foundation-model medical-imaging
  • 最后活动时间: 2026-08-07

ComfyUI-DyPE

ComfyUI自定义节点,支持Qwen和Flux模型实现无伪影的4K+超高清图像生成。

  • Stars: ⭐️ 626
  • Tags: comfyui flux high-resolution text2image
  • 最后活动时间: 2026-09-11

comfyui-krea2edit

为ComfyUI打造的Krea 2指令式图像编辑节点与工作流,借助Identity Edit LoRA在保持人物身份一致性的同时完成精准修图。让AI图像编辑既高效又可控。

  • Stars: ⭐️ 625
  • Tags: ComfyUI Krea Image-Editing LoRA Diffusion
  • 最后活动时间: 2026-07-29

WildDet3D

Allen AI开源的可提示3D目标检测模型,支持在开放场景中进行可扩展的3D检测。

  • Stars: ⭐️ 623
  • Tags: 3d-detection computer-vision object-detection promptable
  • 最后活动时间: 2026-06-01

character_select_stand_alone_app

角色选择独立应用,支持AI提示词和ComfyUI/WebUI API,用于AI图像生成工作流。

  • Stars: ⭐️ 621
  • Tags: comfyui image-generation electron stable-diffusion
  • 最后活动时间: 2026-09-15

Awesome-Deep-Stereo-Matching

深度立体匹配资源精选合集,涵盖立体视觉、深度估计和相关深度学习算法。

  • Stars: ⭐️ 613
  • Tags: stereo-vision depth-estimation computer-vision deep-learning
  • 最后活动时间: 2026-09-02

Awesome-Face-Restoration

人脸修复方法综合资源列表,涵盖论文、代码库等计算机视觉前沿技术。

  • Stars: ⭐️ 608
  • Tags: face-restoration computer-vision image-enhancement deep-learning
  • 最后活动时间: 2026-03-20

ComfyUI_tinyterraNodes

ComfyUI自定义节点集合,为Stable Diffusion提供扩展功能和工作流增强。

  • Stars: ⭐️ 606
  • Tags: comfyui stable-diffusion nodes
  • 最后活动时间: 2026-05-17

z-tipo-extension

一个用于 Stable Diffusion WebUI 的扩展插件,利用 DanTagGen 模型对提示词进行扩写和增强,从而生成更丰富的图像细节。

  • Stars: ⭐️ 603
  • Tags: stable-diffusion webui-extension prompt-enhancement image-generation
  • 最后活动时间: 2026-08-04

3dgsconverter

3D Gaussian Splatting 模型转换工具,支持多种格式互转及 GPU 加速滤波处理。

  • Stars: ⭐️ 599
  • Tags: gaussian-splatting 3d-reconstruction neural-rendering converter
  • 最后活动时间: 2026-08-01

Visual-Tracking-Development

视觉目标跟踪相关的深度学习基准测试项目,涵盖多种跟踪算法和评估方法。

  • Stars: ⭐️ 597
  • Tags: visual-tracking deep-learning computer-vision benchmark
  • 最后活动时间: 2026-06-15

aot-benchmark

基于Transformer的视频目标分割高效模块化实现,支持多对象关联追踪。

  • Stars: ⭐️ 594
  • Tags: video-segmentation transformer object-tracking
  • 最后活动时间: 2026-04-07

ComfyUI-Flux2Klein-Enhancer

面向 Flux.2 Klein 9B 的增强节点套件,用于提升该模型在 ComfyUI 中的生成质量与可控性。

  • Stars: ⭐️ 592
  • Tags: ComfyUI Flux ImageGeneration CustomNodes
  • 最后活动时间: 2026-07-11

ml-starflow

STARFlow 是面向高分辨率图像合成的可扩展潜在归一化流模型,展示生成式视觉研究。

  • Stars: ⭐️ 591
  • Tags: image-generation normalizing-flows generative-ai
  • 最后活动时间: 2026-09-11

deepgen

轻量级统一多模态模型,专注于图像生成与编辑任务,提供高效的视觉创作能力。

  • Stars: ⭐️ 584
  • Tags: multimodal image-generation image-editing deep-learning
  • 最后活动时间: 2026-07-31

PixelHacker

一种具备结构一致性与语义一致性的图像修复(Inpainting)模型。能够有效处理图像缺失区域并生成逼真的填充内容。

  • Stars: ⭐️ 581
  • Tags: image-inpainting image-generation computer-vision
  • 最后活动时间: 2026-06-20

Awesome-Sketch-Synthesis

草图生成与合成领域的论文合集,涵盖矢量草图生成、笔画级处理等研究方向。

  • Stars: ⭐️ 579
  • Tags: sketch-generation sketch-synthesis vector-sketch generative-ai
  • 最后活动时间: 2026-09-09

anyup

ICLR '26 Oral 论文 "AnyUp: Universal Feature Upsampling" 的官方代码库,提出了一种通用的特征上采样方法。

  • Stars: ⭐️ 575
  • Tags: upsampling computer-vision iclr
  • 最后活动时间: 2026-04-17

ComfyUI-TRELLIS2

ComfyUI 的 TRELLIS 2 封装节点,支持从图像生成高质量 3D 资产与场景重建。

  • Stars: ⭐️ 573
  • Tags: ComfyUI TRELLIS 3D-Generation Multimodal
  • 最后活动时间: 2026-08-24

Coherent-Line-Drawing

从照片自动生成连贯线条画的计算机图形学项目,基于非真实感渲染技术。

  • Stars: ⭐️ 570
  • Tags: line-drawing npr opencv computer-graphics
  • 最后活动时间: 2026-07-11

PlateRecognition

高性能高精度的车牌识别开源项目,支持中国大陆、港澳台及韩国等12种车牌识别,准确率高达99%以上,可方便地移植到嵌入式和安卓端使用。

  • Stars: ⭐️ 568
  • Tags: license-plate-recognition ocr computer-vision deep-learning
  • 最后活动时间: 2026-09-02

supersplat-viewer

用户友好且高性能的3D高斯泼溅查看器,基于PlayCanvas和WebXR技术构建。提供流畅的Web端3D模型浏览体验。

  • Stars: ⭐️ 567
  • Tags: 3d-gaussian-splatting gaussian-splatting playcanvas webgl webxr viewer
  • 最后活动时间: 2026-09-09

photo-revival

一个 Codex 技能,利用提示词工程将日常照片转化为充满诗意的白纸手绘插图。它专注于图像生成与风格转换。

  • Stars: ⭐️ 565
  • Tags: prompt-engineering image-generation illustration
  • 最后活动时间: 2026-09-05

jimeng-free-api-all

即梦(Jimeng)反向代理 API 服务,兼容 OpenAI 接口格式,支持最新图像生成与视频生成模型。内置可视化管理控制台,自动同步官网最新模型,方便开发者快速集成 AI 绘画与视频能力。

  • Stars: ⭐️ 565
  • Tags: Image Generation Video Generation OpenAI API Reverse Proxy Free API
  • 最后活动时间: 2026-09-15

FaceRecognition_ReactNative

为 Android 和 iOS 提供端侧人脸验证、活体检测和人脸录入功能的 React Native 库。

  • Stars: ⭐️ 562
  • Tags: face-detection facerecognition faceverification liveness-detection react-native
  • 最后活动时间: 2026-08-14

FaceLift

ICCV 2025论文,从单张图像学习可泛化的3D人脸重建方法,基于合成头部数据训练。

  • Stars: ⭐️ 561
  • Tags: 3d-face-reconstruction computer-vision iccv2025
  • 最后活动时间: 2026-03-25

ComfyUI-OpenClaw

基于ComfyUI的个人AIGC工厂,支持多平台机器人集成,可生成任意图片和视频内容。

  • Stars: ⭐️ 558
  • Tags: comfyui image-generation agent bot aigc
  • 最后活动时间: 2026-09-11

2txt

快速将图片转换为文本的AI工具,基于OpenAI技术实现高效图像识别与文字提取。

  • Stars: ⭐️ 556
  • Tags: Image-to-Text OpenAI Next.js
  • 最后活动时间: 2026-07-30

facefusion-docker

业界领先的人脸处理平台,支持人脸替换、唇形同步等多种AI视频处理功能。

  • Stars: ⭐️ 555
  • Tags: ai face-swap lip-sync docker deepfake
  • 最后活动时间: 2026-09-01

segmenteverygrain

基于SAM的颗粒图像实例分割模型,适用于地质和材料科学领域。

  • Stars: ⭐️ 553
  • Tags: sam instance-segmentation grain-analysis geoscience
  • 最后活动时间: 2026-08-14

ptlflow

基于 PyTorch Lightning 的光流估计模型库,提供多种预训练模型和权重。

  • Stars: ⭐️ 552
  • Tags: optical-flow pytorch-lightning pretrained-models computer-vision
  • 最后活动时间: 2026-07-21

xianxia-visual-director

一个面向 Codex 的 AI 图像生成技能,专注打造电影级东方仙侠风格画面,涵盖仙界秘境与天空巨构等宏大视觉场景。

  • Stars: ⭐️ 551
  • Tags: image-generation codex-skill prompt-engineering creative-ai
  • 最后活动时间: 2026-08-08

XCube

CVPR 2024 Highlight论文,使用稀疏体素层次结构实现大规模3D生成建模。

  • Stars: ⭐️ 549
  • Tags: 3d-generation generative-ai voxel computer-vision
  • 最后活动时间: 2026-06-18

DrivAerNet

大规模多模态汽车数据集,包含计算流体动力学仿真和深度学习基准。支持图神经网络和生成式AI进行气动性能预测与设计优化。

  • Stars: ⭐️ 546
  • Tags: deep-learning generative-ai graph-neural-networks cfd surrogate-models
  • 最后活动时间: 2026-05-14

ComfyUIWorkflow

一套 ComfyUI 工作流合集,覆盖 AI 绘图与图像生成的常用节点流程。可直接导入 ComfyUI 复用,快速搭建 Stable Diffusion 出图管线。

  • Stars: ⭐️ 546
  • Tags: ComfyUI Stable Diffusion Image Generation Workflow
  • 最后活动时间: 2026-09-12

count-anything

基于视觉语言模型实现开放词汇目标计数的工具。能够对视频和图像中的任意物体进行计数。

  • Stars: ⭐️ 543
  • Tags: object-counting vision-language-model open-vocabulary
  • 最后活动时间: 2026-08-12

VistaDream

ICCV 2025论文,从单视图重建多视角一致的场景图像。

  • Stars: ⭐️ 542
  • Tags: diffusion-models novel-view-synthesis 3d-reconstruction
  • 最后活动时间: 2026-04-25

Pix2Vox

ICCV 2019 论文官方实现,基于上下文感知的深度学习方法,从单张或多视角图像重建3D体素模型。

  • Stars: ⭐️ 542
  • Tags: 3d-reconstruction deep-learning voxel computer-vision
  • 最后活动时间: 2026-06-15

Awesome-Object-Insertion

图像合成与物体插入领域的精选资源合集,涵盖论文、代码和工具,帮助生成逼真的合成图像。

  • Stars: ⭐️ 542
  • Tags: image-composition object-insertion image-generation computer-vision
  • 最后活动时间: 2026-08-20

DiffSplat

ICLR 2025论文官方实现,将图像扩散模型应用于可扩展的3D高斯溅射生成,实现高质量3D内容创建。

  • Stars: ⭐️ 542
  • Tags: diffusion-model 3d-generation gaussian-splatting image-to-3d
  • 最后活动时间: 2026-03-19

gemini-image-editing-nextjs-quickstart

基于Gemini 2.0和Next.js的图像生成与编辑快速入门项目,演示原生多模态能力。

  • Stars: ⭐️ 541
  • Tags: gemini gemini-api image-generation nextjs
  • 最后活动时间: 2026-06-24

MV-SAM3D

基于多视图图像的 Segment Anything Model (SAM) 3D 物体分割项目。利用多视角图像处理技术实现高效的3D对象识别与分割。

  • Stars: ⭐️ 541
  • Tags: 3d-segmentation sam multi-view computer-vision
  • 最后活动时间: 2026-05-30

XLens

使用异构摄像头进行实时度量深度估计的系统。能够高效处理多摄像头输入并生成精准的深度信息。

  • Stars: ⭐️ 541
  • Tags: depth-estimation computer-vision real-time cameras
  • 最后活动时间: 2026-07-29

FFHQ-UV

CVPR 2023 论文,提供归一化面部UV纹理数据集,用于高质量3D人脸重建。

  • Stars: ⭐️ 538
  • Tags: face-texture uv-mapping 3d-face cvpr2023
  • 最后活动时间: 2026-04-16

Concerto

NeurIPS'25 论文官方仓库,提出联合2D-3D自监督学习方法,能够自主学习空间表征,适用于计算机视觉和3D理解任务。

  • Stars: ⭐️ 537
  • Tags: self-supervised-learning 3d-vision spatial-representation neurips
  • 最后活动时间: 2026-08-18

Bonsai-Image-Demo

支持本地端侧部署的AI图像生成演示项目,主打1-bit与三值化小型模型。适合在设备上直接运行轻量级图像生成任务。

  • Stars: ⭐️ 537
  • Tags: image-generation on-device-ai small-models 1-bit ternary
  • 最后活动时间: 2026-09-08

MiVOLO

基于神经网络的年龄和性别预测模型,专注于人脸图像分析。

  • Stars: ⭐️ 536
  • Tags: neural-network age-prediction gender-prediction computer-vision
  • 最后活动时间: 2026-06-04

Awesome-Image-Harmonization

图像和谐化领域的论文与代码资源合集,专注于使合成图像前景与背景光照色彩协调一致。

  • Stars: ⭐️ 535
  • Tags: image-harmonization image-composition computer-vision generative-ai
  • 最后活动时间: 2026-08-20

opentryon

用于构建虚拟试穿和时尚AI应用的开源API、SDK和模型。支持生成模特、编辑服装并创建个性化时尚体验。

  • Stars: ⭐️ 535
  • Tags: fashion-ai virtual-try-on open-source toolkit
  • 最后活动时间: 2026-09-14

anime-face-detector

基于mmdet和mmpose的动漫人脸检测器,支持人脸关键点检测。

  • Stars: ⭐️ 534
  • Tags: anime-face-detection face-landmark pytorch
  • 最后活动时间: 2026-07-05

DeepMetricEye

利用UE MetaHuman生成数据进行VR近眼图像深度估计的研究代码。基于PyTorch和计算机视觉技术实现高精度度量。

  • Stars: ⭐️ 534
  • Tags: computer-vision depth-estimation metahuman pytorch vr
  • 最后活动时间: 2026-06-19

manhattan_sdf

CVPR 2022 Oral论文,基于曼哈顿世界假设的神经三维场景重建方法。

  • Stars: ⭐️ 533
  • Tags: 3d-reconstruction sdf cvpr2022 computer-vision
  • 最后活动时间: 2026-09-15

ian-xiaohei-scenes

小黑 2.0 Codex 技能,专为中文实物类文章配图与长图故事插画设计,通过提示词工程生成高质量图像。

  • Stars: ⭐️ 528
  • Tags: ai-agent image-generation illustration prompt-engineering codex-skill
  • 最后活动时间: 2026-06-04

proper-pixel-art

一款用于修复和优化AI生成的像素艺术图像、视频及精灵图资源的工具。它能有效解决AI生成像素画时的瑕疵问题,适用于游戏开发场景。

  • Stars: ⭐️ 526
  • Tags: computer-vision generative-ai image-processing pixel-art game-dev
  • 最后活动时间: 2026-09-04

visionary

基于WebGPU的高斯泼溅平台,支持3D/4D高斯泼溅、神经渲染和扩散模型的世界模型载体。

  • Stars: ⭐️ 525
  • Tags: gaussian-splatting webgpu neural-rendering diffusion-models computer-vision
  • 最后活动时间: 2026-06-26

SOTS

单目标跟踪与分割项目,结合目标检测与语义分割技术,适用于视频分析场景。

  • Stars: ⭐️ 517
  • Tags: object-tracking segmentation computer-vision
  • 最后活动时间: 2026-04-14

ml-mdm

以更少数据与算力训练高质量文生图扩散模型的工具库,适合高效图像生成研究与实践。

  • Stars: ⭐️ 516
  • Tags: diffusion-models text-to-image pytorch deep-learning
  • 最后活动时间: 2026-09-11

meshflow

CVPR 2026论文项目,通过MeshVAE和基于流的扩散Transformer实现高效的艺术化网格生成。

  • Stars: ⭐️ 514
  • Tags: Mesh-Generation Diffusion-Transformer 3D-Generation CVPR
  • 最后活动时间: 2026-09-02

zimage-ncnn-vulkan

基于 ncnn 和 Vulkan 实现的 Z-Image 图像生成器,支持跨平台运行。利用 GPU 加速推理,提供高效的图像生成能力。

  • Stars: ⭐️ 513
  • Tags: image-generation ncnn vulkan z-image
  • 最后活动时间: 2026-09-08

Reall3dViewer

基于Three.js构建的3DGS高斯泼溅查看器,支持标记、测量及预设LOD渲染等功能。提供丰富的Web端3D场景交互体验。

  • Stars: ⭐️ 512
  • Tags: 3dgs gaussian-splatting threejs webgl viewer typescript
  • 最后活动时间: 2026-09-11

XPretrain

多模态预训练框架,支持视觉与语言的联合表示学习。

  • Stars: ⭐️ 511
  • Tags: multimodal-learning pre-training deep-learning
  • 最后活动时间: 2026-08-28

ERNIE-Image

百度开源的文生图模型,基于单流 Diffusion Transformer 架构,仅 8B 参数即达到开源权重模型中的领先水平。

  • Stars: ⭐️ 509
  • Tags: text-to-image diffusion-transformer image-generation ernie
  • 最后活动时间: 2026-04-17

visionworkbench

NASA开发的通用图像处理与计算机视觉库,用于自主系统和机器人研究。

  • Stars: ⭐️ 505
  • Tags: computer-vision nasa image-processing robotics
  • 最后活动时间: 2026-09-02

photo2pixel

将照片转换为像素风格(8-bit)艺术的算法实现,支持在线工具 photo2pixel.co。

  • Stars: ⭐️ 503
  • Tags: image-processing pixel-art pytorch style-transfer
  • 最后活动时间: 2026-05-07

VLMCSHFG

用于夜间目标检测的视觉语言模型代码库,结合了一致性采样器和幻觉特征生成器。该研究发表于TIP 2025期刊。

  • Stars: ⭐️ 503
  • Tags: vision-language-model object-detection nighttime computer-vision
  • 最后活动时间: 2026-07-08

IMAGHarmony

可控图像编辑框架,在复杂多对象编辑中保持对象数量和布局一致性,实现高保真连贯的图像生成。

  • Stars: ⭐️ 316
  • Tags: Image Editing Diffusion Controllable
  • 最后活动时间: 2026-03-24

Open Source Models

MetaCLIP

Meta推出的CLIP模型实现,在视觉-语言理解任务上表现优异,入选NeurIPS、ICLR、CVPR等顶级会议。

  • Stars: ⭐️ 1.9k
  • Tags: clip vision-language multimodal contrastive-learning open-source
  • 最后活动时间: 2026-08-11

Video Generation

MoneyPrinterTurbo

利用AI大模型一键生成高清短视频的自动化工具,支持批量创作和多种视频风格。

  • Stars: ⭐️ 124.4k
  • Tags: AI视频生成 短视频 自动化
  • 最后活动时间: 2026-09-17

Deep-Live-Cam

实时AI换脸工具,仅需单张图片即可实现一键视频深度伪造和实时摄像头换脸。

  • Stars: ⭐️ 96.7k
  • Tags: deepfake face-swap real-time video-generation gan
  • 最后活动时间: 2026-09-15

OpenMontage

全球首个开源智能体视频生产系统,包含11条流水线、49个工具和400+智能体技能,将AI编程助手转变为完整的视频制作工作室。

  • Stars: ⭐️ 59.7k
  • Tags: agentic-ai video-generation ffmpeg open-source python
  • 最后活动时间: 2026-09-06

faceswap

开源深度学习换脸软件,支持多种模型和训练方式,适合学习和研究深度伪造技术。

  • Stars: ⭐️ 57.6k
  • Tags: 深度伪造 人脸替换 深度学习 视频处理
  • 最后活动时间: 2026-08-05

Open-Sora

开源视频生成模型,致力于让高效视频创作技术普及化,类似Sora的视频生成方案。

  • Stars: ⭐️ 29.8k
  • Tags: video-generation open-source ai sora
  • 最后活动时间: 2026-04-09

Pixelle-Video

AI全自动短视频生成引擎。结合图像生成、TTS等多种AI能力,实现从文本到视频的全流程自动化。

  • Stars: ⭐️ 28.2k
  • Tags: aigc comfyui video-generation tts
  • 最后活动时间: 2026-06-14

Pixelle-Video

AI全自动短视频生成引擎,支持从文本到视频的端到端创作。

  • Stars: ⭐️ 22.1k
  • Tags: video-generation aigc comfyui short-video
  • 最后活动时间: 2026-06-08

LivePortrait

高效的肖像动画生成框架,能快速将静态人像转化为生动的动态视频。支持精确的眼神控制与面部表情编辑。

  • Stars: ⭐️ 19.1k
  • Tags: face-animation image-animation video-editing video-generation
  • 最后活动时间: 2026-06-01

Toonflow-app

AI 短剧漫剧创作工具,自动将小说转化为剧本并生成图片和视频内容。

  • Stars: ⭐️ 15.7k
  • Tags: ai-video story-generation content-creation multimodal
  • 最后活动时间: 2026-08-26

Duix-Avatar

开源AI数字人工具包,支持离线视频生成与数字人克隆,适用于虚拟主播与内容创作场景。

  • Stars: ⭐️ 15.5k
  • Tags: ai-avatar digital-human video-generation open-source
  • 最后活动时间: 2026-04-21

huobao-drama

基于AI的一站式短剧生成平台,一句话即可生成完整短剧,实现从剧本到成片的全自动化流程。

  • Stars: ⭐️ 15.3k
  • Tags: video-generation ai-video drama-generator multimodal-ai
  • 最后活动时间: 2026-09-16

waoowaoo

工业级全流程AI影视生产平台,支持从短剧到真人实拍的好莱坞标准工作流,实现可控的视频内容生成。

  • Stars: ⭐️ 14.1k
  • Tags: ai-agent video-generation generative-ai film-production
  • 最后活动时间: 2026-09-05

MoneyPrinter

使用MoviePy自动化创建YouTube短视频,结合AI生成内容。

  • Stars: ⭐️ 14.0k
  • Tags: video-generation automation youtube moviepy ai-video
  • 最后活动时间: 2026-03-26

video-subtitle-remover

基于AI的视频/图片硬字幕和文本水印去除工具,本地运行无需第三方API,支持无损分辨率输出。

  • Stars: ⭐️ 12.9k
  • Tags: ai video-processing subtitle-removal deep-learning
  • 最后活动时间: 2026-06-30

HunyuanVideo

腾讯开源的系统性大型视频生成模型框架,支持高质量视频内容的生成与处理。

  • Stars: ⭐️ 12.5k
  • Tags: diffusion-models video-generation ai
  • 最后活动时间: 2026-06-29

ViMax

智能体驱动的视频生成平台,集成导演、编剧、制片和视频生成全流程。

  • Stars: ⭐️ 12.4k
  • Tags: video-generation agentic-aigc ai-video
  • 最后活动时间: 2026-07-29

waoowaoo

工业级全流程 AI 影视生产平台,支持从短视频到长片的可控视频生成与好莱坞标准工作流。

  • Stars: ⭐️ 12.0k
  • Tags: ai-agent video-generation generative-ai film-production
  • 最后活动时间: 2026-05-04

cosmos

NVIDIA Cosmos 是一个开源的世界模型平台,提供数据集和工具来构建物理 AI。它专为机器人、自动驾驶汽车和智能基础设施等领域的开发者设计。

  • Stars: ⭐️ 11.8k
  • Tags: world-models physical-ai robotics autonomous-vehicles nvidia
  • 最后活动时间: 2026-09-16

NarratoAI

AI驱动的视频解说与剪辑工具,一键生成视频解说并自动完成剪辑处理。

  • Stars: ⭐️ 11.1k
  • Tags: Video AI Agent LLM Python
  • 最后活动时间: 2026-09-07

LiveTalking

实时交互流媒体数字人系统,支持唇形同步与高逼真度虚拟人生成。基于NeRF等技术实现高质量的数字人实时驱动。

  • Stars: ⭐️ 9.5k
  • Tags: aigc digital-human nerf lip-sync realtime
  • 最后活动时间: 2026-09-13

LTX-2

LTX-2音频-视频生成模型的官方推理和LoRA训练工具包。

  • Stars: ⭐️ 9.4k
  • Tags: generative-ai video-generation audio-video
  • 最后活动时间: 2026-08-26

AI4Animation

Unity中基于AI的角色动画系统,利用计算机大脑让角色栩栩如生。

  • Stars: ⭐️ 8.9k
  • Tags: animation unity ai-animation game-development character-ai
  • 最后活动时间: 2026-04-17

video-shotcraft

专为Claude Code和Codex设计的AI视频生成技能,提供上百种镜头配方和动态预览,结合Remotion生成电影级产品视频。

  • Stars: ⭐️ 8.8k
  • Tags: ai-video claude-code remotion video-generation ai-agents
  • 最后活动时间: 2026-09-09

LongCat-Video

美团开源的视频生成基础模型,支持文生视频、图生视频及视频续写等多种生成任务,可产出高质量长视频。

  • Stars: ⭐️ 8.2k
  • Tags: Video-Generation Foundation-Model Text-to-Video Image-to-Video
  • 最后活动时间: 2026-05-27

hypit

用AI智能体一键克隆爆款视频的完整工作流,可批量替换人脸、文案与B-roll并生成上百个变体。面向创作者的视频自动化与生成工具。

  • Stars: ⭐️ 8.1k
  • Tags: ai-video video-generation ai-agents text-to-video video-automation
  • 最后活动时间: 2026-09-17

InfiniteTalk

支持图生视频和视频生视频的无限长度说话视频生成模型。能够生成高质量、连贯的数字人对话视频。

  • Stars: ⭐️ 7.9k
  • Tags: video-generation talking-head image-to-video deep-learning
  • 最后活动时间: 2026-05-22

autoclip

AI驱动的智能视频剪辑工具,自动识别并提取视频高光片段,助力二创内容快速生成。

  • Stars: ⭐️ 7.3k
  • Tags: AI视频 自动剪辑 高光提取
  • 最后活动时间: 2026-09-08

seedance-2.0

基于Seedance 2.0的四模态AI电影制作综合生产管线。为创作者提供从脚本到视频的端到端自动化工作流。

  • Stars: ⭐️ 7.3k
  • Tags: ai-filmmaking multimodal video-generation pipeline
  • 最后活动时间: 2026-09-08

ComfyUI-WanVideoWrapper

在 ComfyUI 中运行 Wan 系列开源视频生成模型的封装节点,支持文生视频与图生视频等 AI 视频创作流程。是 AI 视频生成工作流爱好者的实用扩展。

  • Stars: ⭐️ 6.7k
  • Tags: ComfyUI Video-Generation WanVideo Diffusion Text-to-Video
  • 最后活动时间: 2026-05-24

Jellyfish

一站式AI短剧生产工具,从剧本输入到AI视频生成、后期剪辑、一键导出成片全流程覆盖。

  • Stars: ⭐️ 6.4k
  • Tags: ai-video short-drama video-generation ai-production
  • 最后活动时间: 2026-07-30

Awesome-Video-Diffusion

视频扩散模型的精选资源列表,涵盖视频生成、编辑及运动定制等前沿应用。

  • Stars: ⭐️ 5.8k
  • Tags: video-diffusion video-generation diffusion-models generative-ai
  • 最后活动时间: 2026-08-31

aigcpanel

一站式 AI 数字人系统,支持视频合成、声音克隆、本地模型管理。

  • Stars: ⭐️ 5.6k
  • Tags: aigc digital-human video-synthesis voice-cloning
  • 最后活动时间: 2026-09-16

YouDub-webui

开源AI视频本地化工具,支持自动下载、字幕翻译、语音克隆配音及音轨混合。

  • Stars: ⭐️ 5.5k
  • Tags: ai-dubbing voice-cloning video-translation speech-to-text text-to-speech
  • 最后活动时间: 2026-09-08

short-video-factory

AI驱动的短视频批量生成工具,支持一键生成产品营销视频,跨平台桌面应用。

  • Stars: ⭐️ 5.4k
  • Tags: AI视频 短视频 自动剪辑
  • 最后活动时间: 2026-09-16

mmaction2

OpenMMLab新一代视频理解工具箱,支持动作识别、时序动作检测、视频分类等任务。

  • Stars: ⭐️ 5.2k
  • Tags: action-recognition video-understanding deep-learning pytorch openmmlab
  • 最后活动时间: 2026-03-18

ArcReel

AI Agent 驱动的开源视频生成工作台,支持从小说到视频的全流程自动化,实现跨镜头角色与场景一致性。

  • Stars: ⭐️ 4.7k
  • Tags: ai-video-generator ai-agent storyboard video-generation veo
  • 最后活动时间: 2026-09-17

vjepa2

Meta发布的视频自监督学习模型VJEPA2的PyTorch官方实现。

  • Stars: ⭐️ 4.6k
  • Tags: video self-supervised pytorch meta
  • 最后活动时间: 2026-03-23

html-video

面向编程代理的程序化视频生成工具,可将HTML、CSS和数据转换为真实的MP4视频。内置21个模板和可插拔渲染引擎,支持AI生成原声带。

  • Stars: ⭐️ 4.6k
  • Tags: video-generation html-to-video ai-agent ffmpeg
  • 最后活动时间: 2026-06-21

HunyuanVideo-1.5

腾讯开源的领先轻量级视频生成模型,支持文本到视频和图像到视频的高质量生成。

  • Stars: ⭐️ 4.6k
  • Tags: text-to-video video-generation image-to-video generative-ai
  • 最后活动时间: 2026-04-10

moyin-creator

AI影视生产级工具,支持Seedance 2.0,实现从剧本到成片的全流程批量化生产。

  • Stars: ⭐️ 4.5k
  • Tags: 视频生成 影视制作 AI工具
  • 最后活动时间: 2026-08-27

lingbot-world

推进开源世界模型发展的项目,专注于视频生成与AIGC。

  • Stars: ⭐️ 4.5k
  • Tags: world-models video-generation aigc
  • 最后活动时间: 2026-07-09

ComfyUI-LTXVideo

为ComfyUI提供LTX-Video模型支持的自定义节点,实现高效的图像到视频及文本到视频生成。

  • Stars: ⭐️ 4.1k
  • Tags: ComfyUI LTX-Video Video-Generation Diffusion-Models Image-to-Video
  • 最后活动时间: 2026-09-15

printfilm

一个工业级的AI短剧和动态漫画生成平台,提供强大的视频工作台功能。

  • Stars: ⭐️ 4.0k
  • Tags: ai video-generation motion-comic short-film
  • 最后活动时间: 2026-08-11

MAGI-1

大规模自回归视频生成模型,结合扩散模型实现高质量视频生成。支持从文本或图像生成连贯的视频内容。

  • Stars: ⭐️ 3.8k
  • Tags: autoregressive diffusion-models video-generation
  • 最后活动时间: 2026-06-17

PersonaLive

CVPR 2026 论文项目,专注于直播场景下的高表现力人像图像动画生成。

  • Stars: ⭐️ 3.8k
  • Tags: talking-head video-generation portrait-animation cvpr
  • 最后活动时间: 2026-08-28

kimodo

NVIDIA官方运动扩散模型,专注于生成高质量的人形角色动作序列。

  • Stars: ⭐️ 3.6k
  • Tags: 运动生成 扩散模型 角色动画
  • 最后活动时间: 2026-07-13

pytorchvideo

Meta开源的视频理解深度学习库,提供视频分类、检测等预训练模型。

  • Stars: ⭐️ 3.6k
  • Tags: video-understanding pytorch deep-learning computer-vision
  • 最后活动时间: 2026-05-05

ComfyUI-AnimateDiff-Evolved

专为 ComfyUI 打造的增强版 AnimateDiff,支持更高质量的 AI 动画生成与高级采样策略。

  • Stars: ⭐️ 3.5k
  • Tags: ComfyUI AnimateDiff Video-Generation Animation
  • 最后活动时间: 2026-07-28

FireRed-OpenStoryline

AI视频编辑智能体,通过自然语言交互和LLM驱动的规划,实现意图驱动的导演式创作体验。

  • Stars: ⭐️ 3.4k
  • Tags: Video Editing LLM LangChain
  • 最后活动时间: 2026-07-31

Ask-Anything

CVPR2024 Highlight项目,实现ChatGPT视频理解能力,支持miniGPT4、StableLM、MOSS等多种大语言模型。

  • Stars: ⭐️ 3.4k
  • Tags: video-understanding multimodal video-qa
  • 最后活动时间: 2026-07-17

flownet2-pytorch

FlowNet 2.0 PyTorch实现,用于深度学习光流估计。

  • Stars: ⭐️ 3.3k
  • Tags: optical-flow computer-vision flownet
  • 最后活动时间: 2026-03-30

SysMocap

面向3D虚拟角色的实时动作捕捉系统,支持AR应用和VTuber动画制作。

  • Stars: ⭐️ 3.2k
  • Tags: motion-capture vtuber augmented-reality 3d-animation
  • 最后活动时间: 2026-06-10

GeminiWatermarkTool

VEO和Gemini Nano视频生成模型的水印维护工具,支持CLI和GUI界面操作。

  • Stars: ⭐️ 3.1k
  • Tags: gemini veo3 watermark video-generation
  • 最后活动时间: 2026-07-28

MultiTalk

NeurIPS 2025论文项目,实现音频驱动的多人对话视频生成。支持根据音频自动生成多角色的交互式对话视频。

  • Stars: ⭐️ 3.0k
  • Tags: video-generation audio-driven neurips-2025
  • 最后活动时间: 2026-05-22

HunyuanWorld-1.0

混元3D世界模型,从文本或像素生成沉浸式、可探索的交互3D世界。

  • Stars: ⭐️ 2.9k
  • Tags: world-model text-to-3d scene-generation hunyuan3d
  • 最后活动时间: 2026-04-15

LightX2V

轻量级图像到视频生成推理框架,支持自回归扩散模型和多种视频生成模型的高效推理部署。

  • Stars: ⭐️ 2.8k
  • Tags: Video Generation Diffusion Inference Framework
  • 最后活动时间: 2026-09-17

editor

将你的AI智能体变成专业视频编辑器,让Agent具备剪辑与制作视频的能力。

  • Stars: ⭐️ 2.8k
  • Tags: ai-agents video-editing video agent-tools multimodal
  • 最后活动时间: 2026-09-14

narrator-ai-cli-skill

AI 视频解说技能封装,支持 Claude/Codex 等工具调用,可自动生成短视频解说内容。

  • Stars: ⭐️ 2.7k
  • Tags: claude-code-skill ai-video narration agent-skills
  • 最后活动时间: 2026-07-05

HY-World-2.0

多模态世界模型,能够重建、生成和模拟3D世界,支持场景理解和物理仿真。

  • Stars: ⭐️ 2.6k
  • Tags: world-model 3d-generation multimodal simulation
  • 最后活动时间: 2026-08-12

LongLive

LongLive 2.0 是一个专注于长视频生成的基础设施项目。它支持实时视频生成与并行处理。

  • Stars: ⭐️ 2.6k
  • Tags: video-generation infra real-time nvfp4
  • 最后活动时间: 2026-09-07

Stable-Video-Infinity

ICLR 2026 Oral论文项目,通过错误回收机制实现无限长视频生成。支持音频驱动的人脸生成和长视频扩散变换。

  • Stars: ⭐️ 2.6k
  • Tags: long-video-generation video-diffusion-transformers iclr-2026
  • 最后活动时间: 2026-06-03

HY-Motion-1.0

用于3D人体动作和角色动画生成的AI模型,支持高质量运动合成。

  • Stars: ⭐️ 2.6k
  • Tags: 3d-motion character-animation human-motion deep-learning
  • 最后活动时间: 2026-07-18

LiveAvatar

一种实时音频驱动的虚拟人生成方案,支持无限长度的流式输出。能够实现超低延迟的音视频同步驱动与渲染。

  • Stars: ⭐️ 2.4k
  • Tags: real-time avatar audio-driven streaming video-generation
  • 最后活动时间: 2026-08-24

awesome-seedance

Seedance 2.0 AI视频生成资源的精选合集,包含高质量提示词、API指南和高级视频生成工作流程。

  • Stars: ⭐️ 2.4k
  • Tags: ai video-generation seedance prompt-engineering
  • 最后活动时间: 2026-09-17

Seedance2-Storyboard-Generator

基于Seedance 2.0的AI剧本生成工具,可将小说故事一键转化为多集视频剧本。帮助创作者快速制作短剧内容。

  • Stars: ⭐️ 2.4k
  • Tags: video-generation storyboard ai-script
  • 最后活动时间: 2026-09-14

InternVideo

视频基础模型与多模态理解研究项目,支持动作识别、视频检索、问答等任务。

  • Stars: ⭐️ 2.4k
  • Tags: video-understanding multimodal foundation-models video-retrieval
  • 最后活动时间: 2026-07-02

Matrix-Game

开源的实时流式交互世界模型,支持长视频生成和交互式视频应用。

  • Stars: ⭐️ 2.3k
  • Tags: World Model Video Generation Interactive
  • 最后活动时间: 2026-03-30

lyra

ICLR 2026论文,通过视频扩散模型自蒸馏实现3D场景重建。

  • Stars: ⭐️ 2.3k
  • Tags: 3d-reconstruction video-diffusion generative-model
  • 最后活动时间: 2026-07-20

REAL-Video-Enhancer

基于AI的视频增强工具,支持插帧、超分辨率、去噪和压缩修复,使用Real-ESRGAN和RIFE等模型。

  • Stars: ⭐️ 2.3k
  • Tags: video-enhancement upscaling interpolation real-esrgan rife
  • 最后活动时间: 2026-09-02

VideoX-Fun

灵活的视频生成框架,支持任意分辨率视频生成及图像到视频转换。

  • Stars: ⭐️ 2.2k
  • Tags: Video Generation Image-to-Video AI Framework
  • 最后活动时间: 2026-09-10

videoeditor

AI驱动的视频编辑创意助手,基于React和Remotion构建的开源视频编辑器。

  • Stars: ⭐️ 2.2k
  • Tags: video-editor video-editing ai react remotion typescript
  • 最后活动时间: 2026-09-10

claude-real-video

让 Claude 或任何大语言模型真正“看懂”视频的工具。支持场景感知、去重帧提取与转录,可处理本地或 URL 视频文件。

  • Stars: ⭐️ 2.2k
  • Tags: video llm multimodal claude local
  • 最后活动时间: 2026-09-11

Helios

北大团队开源的实时长视频生成模型,支持文本/图像/视频到视频生成,具备世界模拟能力。

  • Stars: ⭐️ 2.1k
  • Tags: 视频生成 扩散模型 世界模型
  • 最后活动时间: 2026-08-24

claude-code-video-toolkit

AI原生视频生产工具包,集成Claude Code、ElevenLabs、Qwen-TTS等,支持程序化视频编辑与生成。

  • Stars: ⭐️ 2.1k
  • Tags: ai-video-generator claude-code video-production text-to-speech remotion
  • 最后活动时间: 2026-09-14

ai4animationpy

基于神经网络的AI驱动角色动画框架,支持智能生成角色动作与运动序列。

  • Stars: ⭐️ 2.1k
  • Tags: animation neural-networks character-animation deep-learning
  • 最后活动时间: 2026-08-14

WhatDreamsCost-ComfyUI

包含LTX Director及多种ComfyUI自定义节点与工作流。专注于视频生成与创意AI工作流扩展。

  • Stars: ⭐️ 2.0k
  • Tags: comfyui custom-nodes video-generation
  • 最后活动时间: 2026-07-30

Anime4KCPP

基于CNN的高性能动漫视频超分辨率放大工具,支持GPU加速和多种视频处理框架插件。

  • Stars: ⭐️ 2.0k
  • Tags: Upscaling CNN Video Processing
  • 最后活动时间: 2026-07-04

Code2Video

通过代码自动生成视频的工具,结合多智能体技术实现视频内容的自动化创作。

  • Stars: ⭐️ 2.0k
  • Tags: Video Generation Multi-Agent Education
  • 最后活动时间: 2026-08-24

LTX-Desktop

开源桌面应用,用于使用LTX模型生成视频,支持非线性编辑功能。

  • Stars: ⭐️ 2.0k
  • Tags: video-generation generative-ai ltx desktop-app
  • 最后活动时间: 2026-08-26

awesome-seedance-2-prompts

Seedance 2.0视频生成提示词精选合集,包含500+电影、动漫、UGC、广告等风格提示词及API使用指南。

  • Stars: ⭐️ 2.0k
  • Tags: ai-video video-generation prompt-engineering seedance
  • 最后活动时间: 2026-09-17

JoyAI-Echo

JoyAI-Echo 是一个推动长音视频生成前沿的项目,专注于高质量的多模态内容创建。

  • Stars: ⭐️ 2.0k
  • Tags: audio-visual video-generation multimodal
  • 最后活动时间: 2026-09-03

tapnet

任意点追踪(TAP)深度学习模型,用于计算机视觉中的视频点跟踪任务。

  • Stars: ⭐️ 2.0k
  • Tags: point-tracking computer-vision deep-learning video
  • 最后活动时间: 2026-09-15

story-to-handdrawn-video

Agent Skill:将中文故事文案或有序图片转换为手绘日记漫画风格的动画视频(无声 MP4)。

  • Stars: ⭐️ 2.0k
  • Tags: agent-skills video-generation animation
  • 最后活动时间: 2026-08-08

Latte

TMLR 2025论文实现,潜在扩散Transformer用于视频生成任务。

  • Stars: ⭐️ 1.9k
  • Tags: video-generation diffusion transformer
  • 最后活动时间: 2026-08-10

OminiControl

ICCV2025 Highlight,为Diffusion Transformer提供极简通用的控制方案。

  • Stars: ⭐️ 1.9k
  • Tags: diffusion-transformer controllable-generation minimal-control
  • 最后活动时间: 2026-07-02

awesome-talking-head-generation

数字人说话头像生成技术资源合集,涵盖人脸重演、图像动画、运动迁移等前沿方向。

  • Stars: ⭐️ 1.9k
  • Tags: talking-head face-reenactment image-animation motion-transfer deep-learning
  • 最后活动时间: 2026-04-27

JoyAI-VL-Interaction

一个开源的实时视频-语言交互系统,能够处理动态视频输入并实现智能对话交互。

  • Stars: ⭐️ 1.9k
  • Tags: video-language real-time multimodal
  • 最后活动时间: 2026-09-15

GVHMR

基于重力-视图坐标系的世界级人体动作恢复算法,能从视频中精准还原人体运动。该项目发表于SIGGRAPH Asia 2024及TPAMI 2026,具有极高的学术与工程价值。

  • Stars: ⭐️ 1.9k
  • Tags: human-motion-recovery computer-vision motion-capture 3d-reconstruction
  • 最后活动时间: 2026-05-21

AIComicBuilder

AI驱动的动画漫画生成器,可将剧本转化为完全动画化的视频。支持AI角色设计、分镜和视频合成。

  • Stars: ⭐️ 1.9k
  • Tags: ai-animation text-to-video storytelling-ai video-generation
  • 最后活动时间: 2026-04-27

video-search-and-summarization

大规模视频检索与摘要蓝图,支持实时或存档视频的智能分析、摘要生成和交互式问答,结合LLM、RAG和VLM技术。

  • Stars: ⭐️ 1.9k
  • Tags: video-search video-summarization rag vlm llm
  • 最后活动时间: 2026-09-17

FlashVSR

基于扩散模型的高效流媒体视频超分辨率框架,实现实时视频修复与增强。

  • Stars: ⭐️ 1.9k
  • Tags: video-super-resolution diffusion-models real-time video-restoration
  • 最后活动时间: 2026-09-01

JoyAI-Video-Edit

基于自回归扩散模型的开源开放式实时视频编辑框架。能够根据用户指令实现对视频内容的实时、开放式编辑与生成。

  • Stars: ⭐️ 1.9k
  • Tags: video-generation video-editing diffusion-models autoregressive-models
  • 最后活动时间: 2026-09-03

ComfyUI-VideoHelperSuite

为ComfyUI提供视频工作流相关的自定义节点扩展。简化视频生成与处理流程。

  • Stars: ⭐️ 1.8k
  • Tags: comfyui video-workflow custom-nodes
  • 最后活动时间: 2026-09-02

HunyuanVideo-I2V

腾讯混元推出的可定制图像到视频生成模型,基于扩散模型实现高质量视频生成,支持将静态图像转换为动态视频。

  • Stars: ⭐️ 1.8k
  • Tags: Image-to-Video Diffusion Models Tencent
  • 最后活动时间: 2026-04-07

4K4D

CVPR 2024 提出的实时 4D 视角合成算法,支持 4K 分辨率的高质量渲染。

  • Stars: ⭐️ 1.8k
  • Tags: 4d-view-synthesis real-time-rendering computer-vision cvpr-2024
  • 最后活动时间: 2026-09-15

capcut-mate

开源剪映自动化工具包,支持生成和下载草稿文件,可作为Coze插件使用。

  • Stars: ⭐️ 1.8k
  • Tags: capcut video-automation coze jianying
  • 最后活动时间: 2026-09-14

VideoClaw

AI 全自动化视频生成智能体,通过对话即可生成完整视频作品。

  • Stars: ⭐️ 1.8k
  • Tags: video-generation aigc multi-agent tts image-generation
  • 最后活动时间: 2026-08-26

Auto-Synced-Translated-Dubs

自动翻译视频字幕并利用AI语音服务生成同步配音的工具,结合翻译、TTS与字幕时间轴同步技术实现一键视频配音。

  • Stars: ⭐️ 1.7k
  • Tags: 视频配音 TTS 字幕翻译
  • 最后活动时间: 2026-05-11

BigBanana-AI-Director

工业级 AI 短剧/漫剧导演平台,实现从剧本到成片的全自动化生产,精准控制角色一致性与镜头运动。

  • Stars: ⭐️ 1.7k
  • Tags: ai-video ai-short-drama ai-comic video-generation
  • 最后活动时间: 2026-07-31

ComfyUI_MiniMaxH3_Director

面向 MiniMax H3 的多片段导演节点,可在 ComfyUI 中编排分段式 AI 视频生成。

  • Stars: ⭐️ 1.7k
  • Tags: ComfyUI MiniMax Video-Generation Director
  • 最后活动时间: 2026-09-15

SystemAnimatorOnline

基于AI的全身动作捕捉和扩展现实(XR)解决方案,支持VTuber和WebXR应用。

  • Stars: ⭐️ 1.7k
  • Tags: motion-capture mediapipe tensorflowjs threejs vtuber webxr
  • 最后活动时间: 2026-04-13

video-podcast-maker

AI驱动的视频播客创作工具,支持Bilibili和YouTube平台,集成6种TTS引擎,支持中英双语及4K Remotion渲染。

  • Stars: ⭐️ 1.6k
  • Tags: ai-video tts video-podcast remotion claude-code-skill
  • 最后活动时间: 2026-09-14

Video-Materials-AutoGEN-Workstation

集成内容策划、AI文案生成、TTS配音、图片合成、ASR字幕提取于一体的短视频生成工作站。

  • Stars: ⭐️ 1.6k
  • Tags: video-generation tts ai-content asr
  • 最后活动时间: 2026-06-02

HY-WorldPlay

交互式世界建模系统框架,支持实时延迟和几何一致性的3D世界生成。

  • Stars: ⭐️ 1.6k
  • Tags: world-model 3d-generation hunyuan image-to-3d
  • 最后活动时间: 2026-06-10

HunyuanWorld-Voyager

交互式RGBD视频生成模型,支持相机输入条件下的实时3D重建。

  • Stars: ⭐️ 1.6k
  • Tags: world-model image-to-video 3d-generation hunyuan3d
  • 最后活动时间: 2026-04-15

ai_story

AI视频、动漫、短剧自动化生成工具,支持AI漫剧内容创作。

  • Stars: ⭐️ 1.6k
  • Tags: ai-video ai-animation video-generation ai-storytelling
  • 最后活动时间: 2026-09-14

EasyVolcap

SIGGRAPH Asia 2023发表的神经体积视频研究加速框架,支持高效神经体积视频处理与渲染。

  • Stars: ⭐️ 1.6k
  • Tags: neural-volumetric-video 3d-reconstruction neural-rendering computer-vision
  • 最后活动时间: 2026-09-15

anything2explainer

基于 Claude Code 的智能体技能,可将任意主题自动生成带 TTS 旁白、字幕与章节进度条的动态图形讲解视频。

  • Stars: ⭐️ 1.6k
  • Tags: Text-to-Video AI-Agents Claude-Code TTS Remotion
  • 最后活动时间: 2026-09-17

Awesome-Talking-Head-Synthesis

数字人说话头像生成领域的精选资源合集,涵盖音频驱动的人脸合成、论文及实现方法。

  • Stars: ⭐️ 1.5k
  • Tags: talking-head audio-driven face-synthesis video-generation
  • 最后活动时间: 2026-09-04

DepthFlow

基于深度估计的图像转3D视差视频工具,可将静态图片转换为沉浸式动态效果。

  • Stars: ⭐️ 1.5k
  • Tags: depth-estimation parallax image-to-video 3d-effect
  • 最后活动时间: 2026-08-25

ai-moive-studio

AI电影生成工作流Agent,输入剧本即可自动完成分镜生成、画面与音频素材生成、视频合成全流程,让个人创作者也能制作电影级作品。

  • Stars: ⭐️ 1.5k
  • Tags: AI视频 电影生成 工作流Agent
  • 最后活动时间: 2026-09-16

py-motmetrics

多目标跟踪(MOT)评估工具,提供CLEAR-MOT等标准指标的Python实现。

  • Stars: ⭐️ 1.5k
  • Tags: object-tracking mot benchmark computer-vision
  • 最后活动时间: 2026-07-17

Fast-FoundationStereo

一种快速的基础立体匹配模型,可实现实时零样本立体匹配。该论文提出了高效的深度估计方案。

  • Stars: ⭐️ 1.5k
  • Tags: stereo-matching depth-estimation computer-vision real-time
  • 最后活动时间: 2026-09-11

ai-fusion-video

基于Agent的全流程AI短剧/漫剧/视频创作平台,支持自动化视频内容生成。

  • Stars: ⭐️ 1.5k
  • Tags: video-generation agents automation creative
  • 最后活动时间: 2026-08-18

deep-printfilm

AI驱动的短剧与动态漫画生成平台,提供工业级视频创作工作台。

  • Stars: ⭐️ 1.5k
  • Tags: ai video-generation motion-comic
  • 最后活动时间: 2026-05-07

GEN3C

CVPR 2025 Highlight论文,实现3D感知的世界一致性视频生成,支持精确相机控制,是视频生成领域的前沿研究。

  • Stars: ⭐️ 1.4k
  • Tags: video-generation 3d-aware camera-control diffusion-model cvpr2025
  • 最后活动时间: 2026-06-15

cosmos-predict2.5

NVIDIA Cosmos 世界基础模型,专注于通过视频形式模拟和预测世界未来状态。

  • Stars: ⭐️ 1.4k
  • Tags: world-models video-generation foundational-models
  • 最后活动时间: 2026-06-08

MagicTime

基于扩散模型的延时视频生成模型,能够模拟物体随时间变化的形态演变。

  • Stars: ⭐️ 1.3k
  • Tags: text-to-video diffusion-models video-generation
  • 最后活动时间: 2026-04-14

4DAnyone

SIGGRAPH Asia 2026 论文项目,可从普通单目视频中生成任意人物的4D动态模型。基于4D高斯泼溅与生成式AI技术。

  • Stars: ⭐️ 1.3k
  • Tags: 4d-gaussian-splatting generative-ai video-generation monocular-video siggraph
  • 最后活动时间: 2026-09-16

Bernini

统一视频生成与编辑框架,结合多模态大语言模型语义规划器和扩散变换器渲染器。

  • Stars: ⭐️ 1.3k
  • Tags: video-generation video-editing mllm dit
  • 最后活动时间: 2026-08-13

ml-neuman

仅需单段视频即可重建人体神经辐射场,支持真实感人体新视角渲染。

  • Stars: ⭐️ 1.3k
  • Tags: NeRF Human-Reconstruction Neural-Rendering ECCV
  • 最后活动时间: 2026-09-11

gbro-collage-broll

利用Gemini大模型生成半调纸拼贴风格B-roll视频的智能体技能工具。支持三闸门审批机制和首尾帧动画组装。

  • Stars: ⭐️ 1.3k
  • Tags: agent-skill broll gemini video-generation paper-collage
  • 最后活动时间: 2026-07-15

Tora

CVPR2025论文,面向轨迹的视频生成Diffusion Transformer,实现精确运动控制。

  • Stars: ⭐️ 1.2k
  • Tags: video-generation diffusion-transformer trajectory-control
  • 最后活动时间: 2026-07-27

pireel

开源的无后端 AI 视频编辑器,专为数字人视频设计,支持故事板、动态字幕及浏览器内导出。可通过 MCP 协议被任意 AI Agent 驱动。

  • Stars: ⭐️ 1.2k
  • Tags: ai-video video-editor talking-head mcp webcodecs
  • 最后活动时间: 2026-09-16

EvTexture

ICML 2024 & TPAMI 2026 论文实现,利用事件相机驱动视频超分辨率纹理增强,显著提升视频质量。

  • Stars: ⭐️ 1.2k
  • Tags: video-super-resolution event-camera pytorch computational-photography
  • 最后活动时间: 2026-06-11

SoulX-LiveAct

实时人体动画生成推理代码,支持小时级别动画生成。

  • Stars: ⭐️ 1.2k
  • Tags: human-animation video-generation real-time
  • 最后活动时间: 2026-06-15

short-video-generator-AI

开源AI短视频生成工具,可将YouTube长视频自动转化为病毒式短视频。集成高光检测、字幕、翻译与配音等一站式能力。

  • Stars: ⭐️ 1.2k
  • Tags: AI-Video Video-Generation Short-Video Python
  • 最后活动时间: 2026-09-07

handcrafted-persona-engine

AI 驱动的交互式虚拟形象引擎,集成 Live2D、LLM、ASR、TTS 和 RVC,适合 VTuber 和虚拟助手应用。

  • Stars: ⭐️ 1.2k
  • Tags: ai-vtuber live2d avatar tts asr
  • 最后活动时间: 2026-04-23

torchcodec

PyTorch媒体编解码库,提供视频和音频的解码与编码功能。

  • Stars: ⭐️ 1.2k
  • Tags: pytorch video audio codec media-processing
  • 最后活动时间: 2026-09-17

SoraWatermarkCleaner

基于深度学习的高质量Sora2视频水印清理工具。能够快速且无损地去除视频生成水印。

  • Stars: ⭐️ 1.1k
  • Tags: deep-learning video-processing watermark-removal sora
  • 最后活动时间: 2026-04-14

OC_SORT

CVPR2023多目标跟踪算法,对遮挡和非线性运动具有强鲁棒性,简单高效的在线跟踪方案。

  • Stars: ⭐️ 1.1k
  • Tags: object-tracking computer-vision deep-learning tracking
  • 最后活动时间: 2026-04-21

ComfyUI_Sonic

Sonic是一种专注于肖像动画中全局音频感知的方法,可通过ComfyUI使用。

  • Stars: ⭐️ 1.1k
  • Tags: ComfyUI Portrait Animation Audio Perception
  • 最后活动时间: 2026-05-04

MOVA

面向可扩展的同步视频-音频生成模型,基于扩散模型实现高质量多模态内容生成。

  • Stars: ⭐️ 1.1k
  • Tags: Video Generation Audio Generation Multimodal
  • 最后活动时间: 2026-09-17

video-talkcraft

将 Claude Code / Codex 变成动效设计工作室的 Agent 技能,可生成配音驱动的讲解视频,支持词级配音同步、78 张动效配方卡片与 Remotion 渲染。

  • Stars: ⭐️ 1.1k
  • Tags: Claude-Code Agent-Skills Video-Generation Motion-Design Remotion
  • 最后活动时间: 2026-09-17

ComfyUI-Frame-Interpolation

为 ComfyUI 提供视频帧插值自定义节点集,借助 RIFE、FILM 等 AI 模型在现有帧之间生成流畅过渡帧。可显著提升 AI 生成视频的帧率与平滑度,是视频生成工作流的热门增强组件。

  • Stars: ⭐️ 1.1k
  • Tags: ComfyUI Frame-Interpolation Video-Generation RIFE FILM Stable-Video
  • 最后活动时间: 2026-03-29

SoulX-FlashHead

一个统一的13亿参数框架,专为高保真、无限长度和实时流媒体肖像视频生成而设计。支持高质量的实时流媒体人物视频生成。

  • Stars: ⭐️ 1.1k
  • Tags: Portrait-Generation Streaming-Video Real-time Generative-AI
  • 最后活动时间: 2026-05-28

JJYB_AI_VideoAutoCut

智能视频自动剪辑与AI解说工具,支持离线TTS、原创解说和AI配音。

  • Stars: ⭐️ 1.1k
  • Tags: video-editing tts ai-video auto-editing
  • 最后活动时间: 2026-08-09

echomimic_v3

AAAI 2026论文项目,仅需1.3B参数即可实现统一的多模态和多任务人体动画生成。支持音频驱动的肖像与身体动画。

  • Stars: ⭐️ 1.1k
  • Tags: audio-driven-body-animation human-animation aaai-2026
  • 最后活动时间: 2026-03-18

SCAIL

CVPR 2026论文,通过上下文学习实现工作室级别的角色动画生成。

  • Stars: ⭐️ 1.1k
  • Tags: character-animation video-generation in-context-learning pose-estimation
  • 最后活动时间: 2026-05-06

bmf

字节跳动开源的跨平台多媒体处理框架,支持GPU加速、AI推理、转码和直播视频流处理。

  • Stars: ⭐️ 1.0k
  • Tags: 视频处理 AI推理 跨平台
  • 最后活动时间: 2026-08-26

StoryToolkitAI

AI驱动的视频编辑工具,集成ChatGPT实现转录、内容理解和智能搜索功能。

  • Stars: ⭐️ 1.0k
  • Tags: ai chatgpt video-processing speech-recognition editing
  • 最后活动时间: 2026-07-28

lanshu-create-ai-presenter-video

一个供应商中立的 Codex Skill,可根据脚本和授权的演示者图像生成经过验证的 AI 数字人演讲视频。支持数字人视频制作流程。

  • Stars: ⭐️ 1.0k
  • Tags: ai-video digital-human video-generation codex-skill
  • 最后活动时间: 2026-08-20

ComfyUI_MiniMaxH3_Director

基于ComfyUI的MiniMax H3导演工作流,将AI视频生成能力封装为可视化节点流程。适合创作者快速搭建专业级AI视频生产管线。

  • Stars: ⭐️ 997
  • Tags: ComfyUI MiniMax Video-Generation AI-Video Workflow
  • 最后活动时间: 2026-08-04

segment-anything-video

MetaSeg是Segment Anything的封装版本,支持视频目标分割,集成YOLO系列检测器。

  • Stars: ⭐️ 983
  • Tags: segment-anything video-segmentation object-detection yolo
  • 最后活动时间: 2026-09-14

SparseDrive

基于稀疏场景表示的端到端自动驾驶框架,通过多模态感知与规划实现高效驾驶决策。

  • Stars: ⭐️ 983
  • Tags: autonomous-driving end-to-end multimodal computer-vision
  • 最后活动时间: 2026-04-01

StoryGen-Atelier

AI 驱动的分镜与视频生成工具,结合 Gemini 生成分镜文本和画面,使用 Veo 生成过渡视频片段。

  • Stars: ⭐️ 982
  • Tags: Video Generation Gemini Veo Storyboard
  • 最后活动时间: 2026-09-17

CutClaw

CutClaw 是一个基于智能体的视频编辑工具,通过音乐同步实现数小时长视频的自动化剪辑。

  • Stars: ⭐️ 975
  • Tags: video-editing agents music-synchronization
  • 最后活动时间: 2026-04-17

ComfyUI-H3-Motion-Context

为 MiniMax H3 提供 ComfyUI 视频片段链式拼接节点,实现跨片段的运动与音频连续性。

  • Stars: ⭐️ 975
  • Tags: comfyui video-generation minimax nodes
  • 最后活动时间: 2026-09-06

Causal-Forcing

自回归扩散蒸馏方案,实现高质量实时交互式视频生成。

  • Stars: ⭐️ 968
  • Tags: diffusion-models video-generation autoregressive
  • 最后活动时间: 2026-08-28

brainrot.js

文本转视频生成器,可将任意主题转化为流行风格的短视频内容。支持多种个性化风格,适合快速创作教育或娱乐内容。

  • Stars: ⭐️ 960
  • Tags: Text-to-Video ChatGPT Content Generation
  • 最后活动时间: 2026-04-25

lingbot-video

面向具身智能的混合专家视频预训练模型。支持图生视频与世界模型构建。

  • Stars: ⭐️ 957
  • Tags: mixture-of-experts video-generation world-models
  • 最后活动时间: 2026-08-05

EGVSR

高效通用的视频超分辨率框架,支持实时视频增强处理。

  • Stars: ⭐️ 955
  • Tags: video-super-resolution real-time video-enhancement
  • 最后活动时间: 2026-08-27

generative-manim

基于GPT的视频生成工具,利用Manim将文本提示转换为动画视频,支持Streamlit界面。

  • Stars: ⭐️ 918
  • Tags: gpt-4 manim video-generation animation streamlit
  • 最后活动时间: 2026-09-17

VisoMaster-Fusion

强大易用的视频人脸替换与编辑软件,支持AI驱动的面部交换和视频处理功能。

  • Stars: ⭐️ 911
  • Tags: face-swap computer-vision video-editing deepfake
  • 最后活动时间: 2026-09-06

dlss5-visual-enhancer

基于神经网络的视频与图像增强工具,支持超分辨率、画质提升与帧插值。

  • Stars: ⭐️ 884
  • Tags: ai-upscaling video-enhancement neural-rendering frame-interpolation
  • 最后活动时间: 2026-09-14

YumCut

免费AI视频生成器,可将文本提示转换为适合TikTok、Reels和YouTube Shorts的竖屏视频。支持自动脚本、场景、配音、字幕生成,本地优先且支持多语言输出。

  • Stars: ⭐️ 879
  • Tags: ai-video-generator shorts tiktok ffmpeg nextjs
  • 最后活动时间: 2026-09-03

JoyVASA

基于扩散模型的人物与动物动画生成工具,支持音频驱动的说话头像生成。

  • Stars: ⭐️ 878
  • Tags: audio-driven talking-head portrait-animation diffusion
  • 最后活动时间: 2026-04-16

lumenx

LumenX Studio 是一个 AI 短漫剧一站式生产平台,能够将小说文本转化为动态视频。它打通了从剧本分析、角色定制、分镜绘制到视频合成的完整创作链路。

  • Stars: ⭐️ 876
  • Tags: AI Video Generation Text-to-Video Comic Creative Apps
  • 最后活动时间: 2026-07-13

OpenWorldLib

用于高级世界模型生成的统一代码库,支持3D场景生成、高斯泼溅和视频编辑等功能。

  • Stars: ⭐️ 872
  • Tags: world-model diffusion-models gaussian-splatting video-editing vlm
  • 最后活动时间: 2026-08-23

MatAnyone2

CVPR 2026 Highlight论文,通过学习型质量评估器实现视频抠像(Video Matting)的规模化。面向高质量视频前景分割与合成的前沿研究项目。

  • Stars: ⭐️ 859
  • Tags: video-matting computer-vision cvpr deep-learning video-segmentation
  • 最后活动时间: 2026-07-28

ConsisID

CVPR 2025 Highlight项目,通过频率分解实现身份保持的文本到视频生成。

  • Stars: ⭐️ 857
  • Tags: Text-to-Video Identity Preserving Diffusion
  • 最后活动时间: 2026-04-14

clipforge

开源 AI 电商短视频生成工具,上传商品图即可自动提炼卖点、生成种草脚本并配音配字幕,一键产出带货短视频。支持本地自部署,无水印批量出片。

  • Stars: ⭐️ 832
  • Tags: ai-video-generator text-to-video ai-voiceover ecommerce self-hosted
  • 最后活动时间: 2026-09-16

DiT-Extrapolation

视频扩散Transformer的长度外推方法,支持长视频生成和位置嵌入优化。

  • Stars: ⭐️ 828
  • Tags: diffusion-transformer video-generation position-embedding
  • 最后活动时间: 2026-06-06

AlayaWorld

全栈开源的交互式长视野世界模型,能够模拟和生成长时间跨度的环境状态。适用于复杂环境感知与视频生成任务。

  • Stars: ⭐️ 828
  • Tags: world-model interactive video-generation open-source
  • 最后活动时间: 2026-07-31

DCVC

基于深度上下文模型的神经视频压缩研究项目,利用深度学习显著提升视频压缩效率。是该领域的代表性开源工作。

  • Stars: ⭐️ 828
  • Tags: video-compression deep-learning neural-codec computer-vision
  • 最后活动时间: 2026-08-25

kandinsky-5

Kandinsky 5.0 扩散模型,支持高质量的视频与图像生成。

  • Stars: ⭐️ 827
  • Tags: diffusion text-to-video image-generation
  • 最后活动时间: 2026-08-07

Text-To-Video-AI

利用AI技术实现文本到视频生成的工具集合。

  • Stars: ⭐️ 824
  • Tags: text-to-video ai-video-generator video-generation
  • 最后活动时间: 2026-08-24

SD-CN-Animation

利用StableDiffusion和ControlNet实现视频风格化自动处理的脚本工具。能够高效地将视频转换为AI生成的艺术风格动画。

  • Stars: ⭐️ 821
  • Tags: stable-diffusion controlnet video-generation animation ai-art
  • 最后活动时间: 2026-04-01

kimodo.cpp

将NVIDIA的Kimodo文本驱动骨骼动画模型移植到C++/GGML,通过自然语言即可生成自然的骨骼动画。纯C++本地推理实现,无需Python环境。

  • Stars: ⭐️ 821
  • Tags: Text-to-Motion GGML Animation C++ Generative-AI
  • 最后活动时间: 2026-09-01

autoshorts

本地优先的桌面应用,利用AI驱动的爆款排名技术将长音视频自动转换为竖屏短视频。

  • Stars: ⭐️ 814
  • Tags: ai-video shorts-generator desktop-app local-first
  • 最后活动时间: 2026-08-02

pose2sim

基于任意摄像头的无标记运动捕捉系统,从2D姿态估计到3D OpenSim运动学分析。

  • Stars: ⭐️ 812
  • Tags: pose-estimation motion-capture 3d-kinematics biomechanics
  • 最后活动时间: 2026-08-24

OmniWeaving

实现统一视频生成、自由形式组合与推理的官方项目。支持复杂组合条件下的视频生成。

  • Stars: ⭐️ 810
  • Tags: video-generation composition reasoning
  • 最后活动时间: 2026-04-11

rcm

用于双向/自回归视频扩散模型蒸馏的领先统一算法与基础设施,支持大规模实时流视频生成。

  • Stars: ⭐️ 807
  • Tags: video-generation diffusion distillation autoregressive world-models
  • 最后活动时间: 2026-06-25

mamma

无标记多人动作捕捉与3D人体重建的官方代码库。基于深度学习与PyTorch实现高精度人体姿态估计。

  • Stars: ⭐️ 801
  • Tags: computer-vision deep-learning human-pose-estimation pytorch motion-capture
  • 最后活动时间: 2026-07-10

Stand-In

一个轻量级的即插即用框架,专注于保持身份一致性的视频生成。该框架为视频生成任务提供了高效的身份特征保留方案。

  • Stars: ⭐️ 790
  • Tags: video-generation identity-preserving cvpr2026
  • 最后活动时间: 2026-08-10

InfinityStar

NeurIPS 2025 Oral论文项目,提出统一时空自回归建模框架,用于高质量的视觉与视频生成。

  • Stars: ⭐️ 786
  • Tags: autoregressive-models generative-model video-generation visual-generation
  • 最后活动时间: 2026-04-16

MoCha

端到端视频角色替换系统,无需结构引导即可实现高质量视频人物替换。

  • Stars: ⭐️ 781
  • Tags: Video Character Replacement End-to-End
  • 最后活动时间: 2026-04-30

StoryMem

用于多镜头长视频叙事生成的记忆模型官方代码。通过记忆机制增强长视频连贯性与叙事能力。

  • Stars: ⭐️ 768
  • Tags: video-generation storytelling memory-network multimodal
  • 最后活动时间: 2026-07-22

director

多模式工作流的 AI 视频导演技能,覆盖脚本、镜头设计、媒体生成到成片交付的完整视频制作流程。

  • Stars: ⭐️ 765
  • Tags: agent-skill video-generation ai-workflow storytelling
  • 最后活动时间: 2026-08-10

All-In-One-Deflicker

CVPR2023论文项目,基于神经滤波和缺陷图谱的盲视频去闪烁方法,有效消除视频中的闪烁伪影。

  • Stars: ⭐️ 761
  • Tags: video-deflickering neural-filtering computer-vision video-processing
  • 最后活动时间: 2026-07-14

EgoX

从单个外视角视频生成内视角视频的项目。实现了视角转换的视频生成能力。

  • Stars: ⭐️ 755
  • Tags: video-generation egocentric view-transform
  • 最后活动时间: 2026-07-10

cosmos-transfer2.5

基于Cosmos-Predict2.5构建的世界模拟模型,能够根据多种空间控制输入生成高质量的世界模拟视频。适用于复杂的视频生成与空间控制场景。

  • Stars: ⭐️ 742
  • Tags: world-models video-generation spatial-controls world-simulation
  • 最后活动时间: 2026-06-30

short-video-generator-AI

开源AI短视频生成工具,可将YouTube长视频自动转化为病毒式短视频,集成高光检测、字幕、翻译与配音。

  • Stars: ⭐️ 741
  • Tags: AI-Video Short-Video Highlight-Detection TTS Subtitles
  • 最后活动时间: 2026-09-08

SparkVSR

基于稀疏关键帧传播的交互式视频超分辨率工具,利用AI实现高质量视频增强和修复。

  • Stars: ⭐️ 732
  • Tags: video-super-resolution generative-ai video-processing vlm
  • 最后活动时间: 2026-08-03

comfy_mtb

面向动画制作的ComfyUI节点扩展包,支持人脸替换和插值功能。

  • Stars: ⭐️ 726
  • Tags: comfyui animation faceswap stable-diffusion
  • 最后活动时间: 2026-07-04

reelbench-skills

面向 AI 视频的学习笔记与工具技能集,覆盖镜头解析、视频分析与 FFmpeg 工作流。

  • Stars: ⭐️ 721
  • Tags: AI-Video Claude-Skills FFmpeg Video-Analysis
  • 最后活动时间: 2026-09-14

comfyui-vrgamedevgirl

ComfyUI的自定义节点集,提供电影级颗粒、色彩匹配和视频增强功能。

  • Stars: ⭐️ 719
  • Tags: comfyui video-enhancement color-matching workflow
  • 最后活动时间: 2026-09-13

ardy

结合自回归与扩散模型的混合表示框架,用于交互式人类动作生成。该项目为SIGGRAPH 2026的官方实现,能生成高质量且连贯的3D人体运动。

  • Stars: ⭐️ 711
  • Tags: autoregressive-diffusion motion-generation human-motion computer-graphics
  • 最后活动时间: 2026-07-10

Sparse-VideoGen

通过稀疏注意力机制加速视频扩散Transformer的创新方法,显著提升视频生成效率。ICML 2025和NeurIPS 2025 Spotlight论文。

  • Stars: ⭐️ 708
  • Tags: Video Generation Diffusion Model Sparse Attention Efficient ML
  • 最后活动时间: 2026-07-04

CityDreamer

CVPR 2024 官方实现,可组合生成无限 3D 城市场景的生成模型。

  • Stars: ⭐️ 700
  • Tags: 3d-generation city-generation cvpr2024 generative-model
  • 最后活动时间: 2026-09-07

AlayaRenderer

一款面向游戏和虚拟世界的AI原生生成式渲染器。结合扩散模型与神经渲染技术,实现高质量的虚拟世界视频生成。

  • Stars: ⭐️ 684
  • Tags: diffusion-model neural-rendering game-rendering video-generation
  • 最后活动时间: 2026-05-05

SEA-RAFT

荣获ECCV2024口头报告及最佳论文候选的简单高效光流估计模型。在精度与速度上取得了极佳的平衡,优于传统RAFT架构。

  • Stars: ⭐️ 682
  • Tags: Optical-Flow Computer-Vision RAFT ECCV2024
  • 最后活动时间: 2026-03-26

DreamID-V

基于扩散Transformer的高保真视频换脸方法,实现图像到视频的跨模态生成。

  • Stars: ⭐️ 681
  • Tags: face-swapping diffusion-transformer video-generation
  • 最后活动时间: 2026-05-22

NeoVerse

CVPR 2026 Highlight论文,利用野外单目视频增强4D世界模型。视频生成与世界模型方向的前沿研究。

  • Stars: ⭐️ 677
  • Tags: world-model video-generation 4d-reconstruction cvpr deep-learning
  • 最后活动时间: 2026-05-12

flowkit

AI智能体驱动的视频内容创作工具,旨在自动化并优化手动视频制作流程。

  • Stars: ⭐️ 674
  • Tags: ai-agents video-generation content-creation
  • 最后活动时间: 2026-09-17

SolarWM

面向长时程视频世界模型的开源数据与可扩展训练框架,支持扩散变换器与实时交互式视频生成。

  • Stars: ⭐️ 673
  • Tags: World-Models Video-Generation Diffusion AIGC
  • 最后活动时间: 2026-09-17

make-prompt-seedance2

整合字节跳动 Seedance 2.0 视频生成模型的结构化提示词方法与通用 Skill,提供 16+ 模板和 8+ 示例,覆盖带货广告、TVC 等场景,助力快速产出高质量 AI 视频。

  • Stars: ⭐️ 672
  • Tags: prompt-engineering video-generation seedance ai-video
  • 最后活动时间: 2026-08-16

OPSD-V

一种用于后训练少步自回归视频生成器的策略自蒸馏方法,旨在提升视频生成的效率与质量。

  • Stars: ⭐️ 668
  • Tags: video-generation autoregressive-model self-distillation generative-ai
  • 最后活动时间: 2026-08-31

video-production-skills

可复用的AI视频制作技能库,涵盖视频创作、重现、动态设计及质量保证等功能。

  • Stars: ⭐️ 660
  • Tags: ai video-production motion-design skills
  • 最后活动时间: 2026-07-14

vidi

Vidi 大型多模态模型官方仓库,专注于视频理解与编辑任务。

  • Stars: ⭐️ 656
  • Tags: video-understanding video-editing multimodal-llm
  • 最后活动时间: 2026-08-03

mpv-upscale-2x_animejanai

基于 Real-ESRGAN 模型的实时动漫视频超分辨率工具,可在 mpv 播放器中将动漫视频实时放大至 4K。

  • Stars: ⭐️ 652
  • Tags: real-esrgan super-resolution anime-upscaling tensorrt video
  • 最后活动时间: 2026-04-18

MiKaPo

基于MediaPipe的实时网页端MMD动作捕捉系统。利用姿态估计技术实现流畅的3D模型驱动。

  • Stars: ⭐️ 651
  • Tags: mediapipe mmd motion-capture pose-estimation nextjs
  • 最后活动时间: 2026-08-25

ai-shortVideo-pipeline

端到端AI短视频制作管线,集成多模型故障转移、断路器机制与AI质量门控。

  • Stars: ⭐️ 645
  • Tags: ai-pipeline video-generation multi-model fastapi
  • 最后活动时间: 2026-09-02

Diffuman4D

ICCV 2025论文实现,利用时空扩散模型从稀疏视角视频生成4D一致性人体视图合成。

  • Stars: ⭐️ 635
  • Tags: 4d-synthesis diffusion human-avatar novel-view-synthesis
  • 最后活动时间: 2026-09-15

ComfyUI-PainterI2V

一个增强版的Wan2.2图生视频节点,专门用于修复4步LoRA中的慢动作问题。显著提升视频生成效率与质量。

  • Stars: ⭐️ 635
  • Tags: ComfyUI Wan2.2 Image-to-Video LoRA Video Generation
  • 最后活动时间: 2026-08-01

Ditto

基于高质量合成数据集的指令驱动视频编辑方法,利用扩散模型实现精准视频编辑。

  • Stars: ⭐️ 629
  • Tags: Video Editing Diffusion Models Synthetic Data
  • 最后活动时间: 2026-06-01

LoGeR

基于混合记忆的长上下文几何重建模型复现代码。利用长上下文信息提升三维几何重建的精度与连贯性。

  • Stars: ⭐️ 622
  • Tags: 3d-reconstruction geometric-reconstruction long-context multimodal
  • 最后活动时间: 2026-04-27

MAGI-2-preview

高效扩展的视频生成模型预览版。专注于提升视频生成的效率与规模。

  • Stars: ⭐️ 621
  • Tags: video-generation scaling efficiency
  • 最后活动时间: 2026-08-06

cs-board

本地运行的 AI 工具,可将参考声音与中文文案自动合成为白板动画视频,融合 TTS 语音克隆与动画生成技术。

  • Stars: ⭐️ 621
  • Tags: TTS AI-Video Whiteboard-Animation FastAPI Chinese
  • 最后活动时间: 2026-09-05

Comfyui_Minimax_h3_latent_Upscaler

面向 Minimax H3 的神经潜空间超分节点,可直接放大低分辨率 latent,绕过昂贵 VAE 编解码,加速高分辨率视频生成。

  • Stars: ⭐️ 618
  • Tags: ComfyUI LatentUpscale VideoGeneration Minimax
  • 最后活动时间: 2026-09-17

sleap

多动物姿态追踪深度学习框架,支持行为分析和姿态估计,广泛应用于神经科学和动物行为研究。

  • Stars: ⭐️ 613
  • Tags: pose-estimation deep-learning animal-tracking computer-vision
  • 最后活动时间: 2026-09-16

HelixWorld

HelixWorld 是一个实时交互式音视频世界模型,能够生成带有空间音频的沉浸式动态场景。它将生成式AI与实时交互相结合,代表了世界模型方向的前沿探索。

  • Stars: ⭐️ 605
  • Tags: World Model Generative AI Audio-Visual Real-time Spatial Audio
  • 最后活动时间: 2026-09-03

UniScene-Unified-Occupancy-centric-Driving-Scene-Generation

UniScene 是一个统一的以占用为中心的驾驶场景生成框架,发表于 CVPR 2025 和 TPAMI。该项目在自动驾驶场景生成领域具有重要的研究价值。

  • Stars: ⭐️ 603
  • Tags: autonomous-driving scene-generation occupancy-prediction computer-vision
  • 最后活动时间: 2026-05-24

GPT-Image-2-Seedance-2.5-Workflow

GPT Image 2 到 Seedance 2.5 的早期访问工作流指南。涵盖图像到视频生成的自动化流程与提示词工程,助力创意视频制作。

  • Stars: ⭐️ 596
  • Tags: ai-video gpt-image-2 seedance text-to-video workflow-automation
  • 最后活动时间: 2026-06-24

Magic-TryOn

基于大规模视频扩散Transformer的视频虚拟试穿框架,支持高质量服装替换与视频编辑。

  • Stars: ⭐️ 592
  • Tags: virtual-tryon video-diffusion transformer video-editing
  • 最后活动时间: 2026-04-30

awesome-ltx2

汇集了所有可用的 LTX-2 模型、编码器、工作流和 LoRA,专为 ComfyUI 打造。提供高效的文本到视频生成解决方案。

  • Stars: ⭐️ 592
  • Tags: ai comfyui ltx-2 lora video-ai
  • 最后活动时间: 2026-09-14

Vista4D

CVPR 2026 Highlight论文项目,利用4D点云实现视频重拍。结合3D视觉与视频生成技术。

  • Stars: ⭐️ 591
  • Tags: 3d-vision novel-view-synthesis cvpr-2026
  • 最后活动时间: 2026-06-02

DigiHuman

使用姿态估计和地标生成技术实现3D角色自动动画化。

  • Stars: ⭐️ 586
  • Tags: 3d-animation pose-estimation digital-human unity
  • 最后活动时间: 2026-05-05

Open-Magiviz

开源的 AI 视频创作引擎,将完整的影视级制作流程交给每一位开发者与创作者。通过 AI 驱动端到端的视频内容生产,降低创作门槛。

  • Stars: ⭐️ 584
  • Tags: AI-Video Video-Generation Creative-AI Open-Source
  • 最后活动时间: 2026-09-04

prompt-lens

AI视频反向提示词与智能剪辑工具,可从视频中提取台词、分析镜头,并用一句话自动剪出目标片段。

  • Stars: ⭐️ 577
  • Tags: video-to-prompt video-analysis prompt-engineering shot-detection ai-video
  • 最后活动时间: 2026-09-02

SAM2Long

ICCV 2025论文,通过免训练记忆树增强SAM2的长视频分割能力。

  • Stars: ⭐️ 569
  • Tags: sam2 video-segmentation memory-tree iccv2025
  • 最后活动时间: 2026-08-14

openclip

AI驱动的长视频精彩时刻自动提取工具,大幅提升视频剪辑效率。利用大语言模型智能识别并提取视频高光片段。

  • Stars: ⭐️ 560
  • Tags: ai video-processing llm auto-highlight
  • 最后活动时间: 2026-08-24

Maestro

一款100%本地运行的AI一体化创作工作室,集视频、图像和音乐生成于一体。其导演模式可从单个提示词规划完整的音乐视频和短片,基于WanGP流水线构建,可通过Pinokio一键安装。

  • Stars: ⭐️ 559
  • Tags: AI Local-AI Video-Generation Image-Generation Music-Generation Text-to-Video
  • 最后活动时间: 2026-09-17

UniVideo

ICLR 2026论文项目,实现视频的统一理解、生成与编辑。提供一体化的视频处理方案。

  • Stars: ⭐️ 557
  • Tags: video-generation video-editing iclr-2026
  • 最后活动时间: 2026-07-03

genblaze

用于编排生成式AI媒体管道的开源Python SDK,支持跨视频、音频和图像提供商并内置输出溯源功能。

  • Stars: ⭐️ 554
  • Tags: generative-ai ai-pipeline python video-generation audio-generation
  • 最后活动时间: 2026-09-17

ComfyUI-WanAnimatePreprocess

为WanAnimate模型提供输入预处理的ComfyUI自定义节点,优化动画与视频生成工作流。

  • Stars: ⭐️ 545
  • Tags: ComfyUI CustomNodes Preprocessing Animation VideoGeneration
  • 最后活动时间: 2026-05-27

forge-film

基于DAG驱动的多模型并行AI电影生成引擎,利用关键路径法(CPM)实现场景并行调度,大幅提升生成效率。

  • Stars: ⭐️ 537
  • Tags: ai-video-generation text-to-video dag-scheduling multi-modal
  • 最后活动时间: 2026-03-26

ffmpeg-sidecar

FFmpeg Rust封装库,提供直观的迭代器接口,简化视频音频处理流程,适用于多模态AI系统的媒体预处理与后处理。

  • Stars: ⭐️ 535
  • Tags: ffmpeg video-processing audio-processing rust
  • 最后活动时间: 2026-08-15

taehv

面向混元视频及其他视频生成模型的轻量自动编码器,用于高效潜在空间压缩与解码。

  • Stars: ⭐️ 535
  • Tags: AutoEncoder Hunyuan-Video VAE Video-Models
  • 最后活动时间: 2026-08-31

free-ai-video-upscaler

一款免费且开源的AI视频画质提升工具,利用WebGPU和WebCodecs技术实现高效的视频增强处理。

  • Stars: ⭐️ 534
  • Tags: upscaling video-enhancement webcodecs webgl webgpu
  • 最后活动时间: 2026-05-20

twick

基于 React 构建的 AI 视频编辑器 SDK,支持画布时间轴、拖拽编辑、AI 字幕生成和无服务器 MP4 导出。

  • Stars: ⭐️ 533
  • Tags: ai-video-editor react sdk ai-captions video-editing
  • 最后活动时间: 2026-06-04

VideoChat-Flash

ICLR 2026,通过分层压缩实现长上下文视频建模的视频对话模型。

  • Stars: ⭐️ 530
  • Tags: video-understanding long-context video-llm multimodal
  • 最后活动时间: 2026-07-19

Orkas-VideoStudio

将编码智能体转化为视频工作室的开源工具。通过自然语言描述视频,由 AI 智能体自动编写时间线并生成最终视频文件。

  • Stars: ⭐️ 525
  • Tags: ai-agents ai-video generative-ai mcp-server text-to-video
  • 最后活动时间: 2026-08-28

animatable_nerf

基于可动画隐式神经表示,从视频中重建逼真三维数字人,实现姿态可控的神经渲染。

  • Stars: ⭐️ 524
  • Tags: NeRF NeuralRendering Avatar ComputerVision 3D
  • 最后活动时间: 2026-09-15

StereoCrafter

一个强大的框架,能够将任何普通的2D视频转换为沉浸式的立体3D视频。

  • Stars: ⭐️ 522
  • Tags: 3d-video stereoscopic video-generation depth-estimation
  • 最后活动时间: 2026-05-27

DVR-Scan

一款基于OpenCV的视频动态场景提取工具,能够智能识别并提取监控录像中的移动画面。适用于安防监控和DVR录像的自动化分析。

  • Stars: ⭐️ 521
  • Tags: opencv video-processing motion-detection python
  • 最后活动时间: 2026-07-22

video-generator-client

异步 Python 封装库,统一调用 Seedance、Kling、MiniMax 和 Wan 等视频生成 API。提供 CLI 命令行与本地 Web UI,方便开发者快速集成多种 AI 视频生成服务。

  • Stars: ⭐️ 520
  • Tags: video-generation python kling seedance minimax cli web-ui
  • 最后活动时间: 2026-09-14

Google-Colab_Notebooks

收集了大量用于各类AI项目的Google Colab笔记本,涵盖图像生成、视频生成及模型工作流等。为开发者提供了便捷的云端运行环境,快速体验最新的多模态AI模型。

  • Stars: ⭐️ 515
  • Tags: colab-notebooks text-to-video image-to-image comfyui-workflow multimodal
  • 最后活动时间: 2026-08-23

VideoMaMa

CVPR 2026 论文官方实现,基于生成先验与掩码引导进行视频抠图,实现高质量 Video Matting。

  • Stars: ⭐️ 515
  • Tags: VideoMatting GenerativeAI CVPR ComputerVision
  • 最后活动时间: 2026-04-01

Nomi

开源 AI 视频工作台,可接入任意模型或本地 ComfyUI,通过 MCP 由 AI 助手驱动分镜、生成与时间线剪辑,本地优先且无遥测。

  • Stars: ⭐️ 514
  • Tags: ai-video comfyui mcp video-generation local-first
  • 最后活动时间: 2026-09-17

AlayaRenderer

面向游戏与虚拟世界的AI原生渲染引擎,基于扩散模型实现神经渲染和视频生成。

  • Stars: ⭐️ 507
  • Tags: neural-rendering diffusion-model video-generation game-rendering ai-renderer
  • 最后活动时间: 2026-05-05

未分类 (Others)

mediapipe

Google开源的跨平台机器学习框架,提供人脸检测、手势识别、姿态估计等实时ML解决方案,支持多平台部署。

  • Stars: ⭐️ 37.0k
  • Tags: 计算机视觉 机器学习 跨平台
  • 最后活动时间: 2026-09-17

sharp

高性能Node.js图像处理库,适用于多模态AI图像预处理

  • Stars: ⭐️ 32.7k
  • Tags: image-processing nodejs performance
  • 最后活动时间: 2026-09-13

moondream

轻量级视觉语言模型,专为边缘设备优化部署设计。

  • Stars: ⭐️ 9.6k
  • Tags: VLM Tiny Model Edge AI
  • 最后活动时间: 2026-04-20

ml-ferret

Ferret 是可在任意粒度引用与定位图像内容的多模态大模型,擅长视觉接地与指代理解。

  • Stars: ⭐️ 8.7k
  • Tags: multimodal vision-language grounding
  • 最后活动时间: 2026-09-11

minimind-v

1小时从零训练26M参数视觉多模态VLM的轻量级框架,适合快速入门和学习VLM架构原理。

  • Stars: ⭐️ 8.6k
  • Tags: VLM 多模态 训练框架
  • 最后活动时间: 2026-08-06

GLM-OCR

基于GLM的高精度OCR模型,支持快速全面的文字识别能力。

  • Stars: ⭐️ 7.4k
  • Tags: ocr glm image-to-text deep-learning
  • 最后活动时间: 2026-04-21

ml-fastvlm

为视觉语言模型打造的高效视觉编码器,在保持精度的同时大幅加速多模态推理。

  • Stars: ⭐️ 7.4k
  • Tags: VLM Vision-Language Efficient-AI CVPR
  • 最后活动时间: 2026-09-11

pytesseract

Google Tesseract OCR的Python封装库,提供强大的光学字符识别能力,支持多种语言和图片格式。

  • Stars: ⭐️ 6.4k
  • Tags: ocr tesseract computer-vision python
  • 最后活动时间: 2026-07-13

Bagel

开源统一多模态模型,支持多种模态的理解与生成任务。

  • Stars: ⭐️ 6.2k
  • Tags: Multimodal Model Open Source Unified Model
  • 最后活动时间: 2026-05-04

ml-depth-pro

不到一秒即可预测锐利的单目度量深度图,实现高质量实时深度估计。

  • Stars: ⭐️ 5.7k
  • Tags: Depth-Estimation Monocular-Depth Computer-Vision
  • 最后活动时间: 2026-09-11

PySceneDetect

基于OpenCV的视频场景检测工具,自动识别视频中的转场与切割点。

  • Stars: ⭐️ 5.2k
  • Tags: video-processing scene-detection opencv
  • 最后活动时间: 2026-09-15

SpatialLM

NeurIPS 2025论文,专注于训练大语言模型进行室内场景结构化建模,融合点云与空间智能技术。

  • Stars: ⭐️ 4.7k
  • Tags: mllm point-clouds scene-understanding spatial-intelligence
  • 最后活动时间: 2026-06-26

OpenSfM

开源的三维重建流水线库,用于从图像序列中恢复相机位姿和三维结构。

  • Stars: ⭐️ 3.8k
  • Tags: sfm 3d-reconstruction photogrammetry
  • 最后活动时间: 2026-09-09

Pix2Text

开源Python工具,支持布局分析、表格、数学公式(LaTeX)和文字识别,输出Markdown格式。

  • Stars: ⭐️ 3.2k
  • Tags: ocr math-formula table-recognition markdown
  • 最后活动时间: 2026-08-23

Segment-and-Track-Anything

开源视频目标分割与跟踪工具,结合SAM和AOT实现交互式视频对象分割。

  • Stars: ⭐️ 3.1k
  • Tags: segment-anything video-segmentation object-tracking sam
  • 最后活动时间: 2026-07-03

GLM-V

智谱GLM系列多模态推理模型,通过可扩展强化学习实现通用多模态推理能力。

  • Stars: ⭐️ 2.4k
  • Tags: vlm multimodal reasoning video-understanding
  • 最后活动时间: 2026-09-02

perception_models

最先进的图像与视频CLIP模型及多模态大语言模型集合。

  • Stars: ⭐️ 2.4k
  • Tags: multimodal clip vision-language llm
  • 最后活动时间: 2026-04-13

ml-fastvit

FastViT官方实现,一种采用结构重参数化的高效混合视觉Transformer,在保持精度的同时大幅提升推理速度,ICCV 2023论文。

  • Stars: ⭐️ 2.0k
  • Tags: vision-transformer fastvit computer-vision efficient-models
  • 最后活动时间: 2026-09-11

ml-4m

大规模多模态掩码建模框架,统一训练图像、文本、几何等多种模态。

  • Stars: ⭐️ 1.8k
  • Tags: Multimodal Masked-Modeling Foundation-Model
  • 最后活动时间: 2026-09-11

HealthGPT

ICML 2025 Spotlight医学视觉语言模型,统一理解与生成能力。

  • Stars: ⭐️ 1.7k
  • Tags: Medical AI VLM Healthcare
  • 最后活动时间: 2026-07-31

ml-mobileclip

面向移动设备的高效视觉语言模型,在端侧实现强大的图文理解能力。

  • Stars: ⭐️ 1.7k
  • Tags: CLIP Vision-Language Mobile-AI CVPR
  • 最后活动时间: 2026-09-11

Retinexformer

ICCV 2023论文,基于Retinex理论的单阶段Transformer低光照图像增强方法。

  • Stars: ⭐️ 1.5k
  • Tags: low-light-enhancement transformer image-restoration
  • 最后活动时间: 2026-05-23

AKStream

全平台、全架构的流媒体管理控制接口平台,集成 GB28181、RTSP、RTMP 等协议的推拉流控制。支持 PTZ 控制、音视频录制与裁剪合并等完整功能。

  • Stars: ⭐️ 1.5k
  • Tags: streaming gb28181 rtsp rtmp mediaserver
  • 最后活动时间: 2026-08-13

Video-ChatGPT

ACL 2024视频对话模型,能够就视频内容进行有意义的对话,含量化评估基准。

  • Stars: ⭐️ 1.5k
  • Tags: video-understanding vision-language video-conversation
  • 最后活动时间: 2026-09-05

transfusion-pytorch

MetaAI Transfusion模型PyTorch实现,单模型实现下一token预测与图像扩散。

  • Stars: ⭐️ 1.4k
  • Tags: multimodal transformers diffusion flow-matching
  • 最后活动时间: 2026-09-04

superpoint_transformer

ICCV'23和3DV'24 Oral论文官方实现,用于高效3D语义分割和全景分割的超点Transformer。

  • Stars: ⭐️ 1.1k
  • Tags: 3d point-cloud semantic-segmentation transformer
  • 最后活动时间: 2026-04-21

PointLLM

ECCV 2024最佳论文候选,赋能大语言模型理解3D点云数据的多模态模型。

  • Stars: ⭐️ 1.1k
  • Tags: Point Cloud Multimodal LLM 3D
  • 最后活动时间: 2026-05-15

Hulu-Med

面向整体医学视觉语言理解的透明通用模型。

  • Stars: ⭐️ 1.0k
  • Tags: medical-ai vision-language-model multimodal
  • 最后活动时间: 2026-08-30

MocapNET

实时3D人体姿态估计系统,从单目RGB图像直接生成BVH格式的动作捕捉数据,支持显著遮挡情况下的姿态恢复。

  • Stars: ⭐️ 950
  • Tags: Pose Estimation Computer Vision 3D Animation TensorFlow
  • 最后活动时间: 2026-08-13

MultimodalOCR

研究大型多模态模型中OCR能力的隐藏奥秘,提供OCRBench基准测试。

  • Stars: ⭐️ 893
  • Tags: OCR Multimodal Benchmark
  • 最后活动时间: 2026-08-16

videoseal

Meta开源的图像与视频水印工具,基于深度学习为AI生成内容提供高效、不可见的水印与内容溯源能力。适用于AI内容安全与版权保护场景。

  • Stars: ⭐️ 775
  • Tags: watermarking deep-learning video image ai-safety
  • 最后活动时间: 2026-07-02

VLX-Seek

VLX-Seek是一款设备原生的视觉语言模型,使机器能够高精度地看见、理解并推理视觉世界。

  • Stars: ⭐️ 747
  • Tags: Vision-Language-Model VLM Edge-AI Multimodal
  • 最后活动时间: 2026-09-02

molmo2

Molmo2是由Allen AI研究所开发的开源视觉-语言模型,支持图像理解、视觉问答等多模态任务,性能优异。

  • Stars: ⭐️ 724
  • Tags: vision-language-model multimodal open-source vlm
  • 最后活动时间: 2026-03-18

Vision-DeepResearch

首个长周期多模态深度研究MLLM,支持数十轮推理和数百次搜索引擎交互。

  • Stars: ⭐️ 684
  • Tags: multimodal deep-research reasoning benchmark
  • 最后活动时间: 2026-08-08

VLM2Vec

ICLR 2025论文,训练视觉语言模型用于大规模多模态嵌入任务。

  • Stars: ⭐️ 683
  • Tags: embedding vision-language-model multimodal
  • 最后活动时间: 2026-08-23

OmniVinci

全模态大语言模型,支持视觉、音频和语言的联合理解。

  • Stars: ⭐️ 679
  • Tags: multimodal vision-language-model audio-language-model
  • 最后活动时间: 2026-08-31

Q-Align

ICML2024论文,视觉评分一体化基础模型,支持图像质量评估(IQA)、美学评估(IAA)和视频质量评估(VQA),可高效微调至下游数据集。

  • Stars: ⭐️ 623
  • Tags: IQA VQA Aesthetic ICML2024
  • 最后活动时间: 2026-06-24

Multimodal-Toolkit

基于HuggingFace Transformers的多模态工具包,支持文本和表格数据的联合建模。

  • Stars: ⭐️ 619
  • Tags: multimodal-learning transformers tabular-data huggingface
  • 最后活动时间: 2026-05-04

Emotion-LLaMA

基于指令微调的多模态情感识别与推理模型,能够理解和分析图像中的情感表达。

  • Stars: ⭐️ 616
  • Tags: Emotion Recognition Multimodal LLM Instruction Tuning
  • 最后活动时间: 2026-08-28

mvdust3r

Meta Reality Labs开源的MV-DUSt3R实现,可在2秒内从稀疏视图完成单阶段场景重建,支持3D视觉与深度学习应用。

  • Stars: ⭐️ 602
  • Tags: 3d-reconstruction computer-vision deep-learning scene-understanding
  • 最后活动时间: 2026-08-03

ml-matrix3d

CVPR 2025 Highlight 一体化大规模摄影测量模型,从图像一站式完成三维重建。

  • Stars: ⭐️ 600
  • Tags: 3D-Reconstruction Photogrammetry Computer-Vision CVPR
  • 最后活动时间: 2026-09-11

locate-anything.cpp

NVIDIA LocateAnything-3B 视觉定位模型在 ggml 上的移植版本,支持在本地设备上高效运行视觉语言定位推理。适合边缘设备和本地部署场景。

  • Stars: ⭐️ 584
  • Tags: ggml visual-grounding vision-language-model multimodal local-inference cpp
  • 最后活动时间: 2026-07-22

cambrian-s

面向视频空间超感知的视觉语言模型,实现视频场景的深度空间理解。

  • Stars: ⭐️ 569
  • Tags: 视频理解 空间感知 多模态
  • 最后活动时间: 2026-04-03

Senna

连接大型视觉语言模型与端到端自动驾驶的桥梁项目。

  • Stars: ⭐️ 558
  • Tags: autonomous-driving vision-language-model end-to-end
  • 最后活动时间: 2026-08-12

Live-Video-Magnification

基于欧拉视频放大算法的实时应用,可放大视频中的微小运动与颜色变化。

  • Stars: ⭐️ 545
  • Tags: video-magnification eulerian opencv
  • 最后活动时间: 2026-08-01

XLens

X-Lens 是一个实时度量深度估计项目,支持异构相机输入,可在多种摄像头配置下实现高精度的真实尺度深度感知。适用于机器人、AR 等需要实时空间理解的视觉场景。

  • Stars: ⭐️ 538
  • Tags: depth-estimation computer-vision real-time metric-depth camera
  • 最后活动时间: 2026-07-29

opennsfw2

Yahoo Open-NSFW 模型的 Keras 实现,用于检测图像中的不雅内容,支持 TensorFlow2 和 JAX 后端。

  • Stars: ⭐️ 530
  • Tags: image-classification nsfw-detection keras tensorflow content-moderation
  • 最后活动时间: 2026-09-13

DAAAM

DAAAM 提出了一种实时、大规模的时空记忆新方法,能够随时随地描述任意事物。该项目为多模态场景理解与持续视觉记忆提供了前沿的解决方案。

  • Stars: ⭐️ 512
  • Tags: AI Multimodal Spatio-Temporal Memory Real-Time Scene-Understanding
  • 最后活动时间: 2026-04-14

DFormer

面向 RGB-D 多模态语义分割的 Transformer 模型,相关成果见于 CVPR、ICLR、NeurIPS 等顶会。

  • Stars: ⭐️ 508
  • Tags: semantic-segmentation multimodal RGB-D transformer computer-vision
  • 最后活动时间: 2026-09-10