AI 오픈 소스 프로젝트

총 1020개 문서
MiniMind:2小时从零训练26M参数GPT的开源工具

미니마인드: 처음부터 2시간 동안 2600만 개의 매개변수를 교육하는 GPT 오픈 소스 도구

일반 소개 미니마인드는 개발자 징야오공이 만든 오픈 소스 프로젝트입니다. 미니마인드의 핵심 목표는 일반인들도 자신의 AI 모델을 빠르게 훈련할 수 있도록 하는 것입니다. 미니마인드의 주요 기능은 단일 NVIDIA에서 2시간을 사용하는 것입니다.
1 년 전
0111.5K
PPTAgent:自动生成和评估PPT演示文稿,文档转PPT

PPTAgent: PPT 프레젠테이션, 문서를 PPT로 자동 생성 및 평가

일반 소개 PPTAgent는 문서에서 프레젠테이션을 자동으로 생성하도록 설계된 혁신적인 시스템입니다. 이 시스템은 콘텐츠 품질과 시각적 효과를 보장하기 위해 2단계 프로세스를 사용하여 프레젠테이션을 제작하는 인간의 접근 방식을 따릅니다. 또한 PPTAgent는 포괄적인 PPTEval을 소개합니다.
2 년 전
0111.4K
Fish Speech:快速且高精度使用少样本克隆中英文语音

물고기 음성: 몇 개의 샘플을 사용하여 영어와 중국어 음성을 빠르고 정확하게 복제합니다.

일반 소개 피쉬 스피치는 피쉬 오디오에서 개발한 오픈 소스 텍스트 음성 변환(TTS) 합성 도구입니다. 이 도구는 VQ-GAN, Llama 및 VITS와 같은 최첨단 AI 기술을 기반으로 하며 텍스트를 사실적인 음성으로 변환할 수 있습니다.Fish S...
1 년 전
0111.3K
Browser Use Web UI:运行AI智能体浏览网页,让AI能够自动操作网页的开源框架

브라우저 사용 웹 UI: 웹 탐색을 위해 AI 인텔리전스를 실행하기 위한 오픈 소스 프레임워크로, AI가 웹 페이지를 자동으로 조작할 수 있습니다.

일반 소개 브라우저 사용 웹 UI는 AI 에이전트에 그래픽 인터페이스 도구로서 브라우저 상호 작용 기능을 제공하는 데 중점을 둔 혁신적인 오픈 소스 프로젝트입니다. 이 프로젝트는 브라우저 사용 핵심 프레임워크 위에 구축된 Gradio를 기반으로 합니다.
1 년 전
0111.3K
PaddleOCR:基于飞桨的多语言OCR工具库,支持80多种语言识别

PaddleOCR: 80개 이상의 언어 인식을 지원하는 플라잉 패들 기반의 다국어 OCR 툴 라이브러리입니다.

종합 소개 PaddleOCR은 실용적이고 초경량 OCR 시스템을 제공하도록 설계된 PaddlePaddle 기반의 다국어 OCR 툴킷입니다. 80개 이상의 언어 인식을 지원하며 데이터 주석 및 합성 도구를 제공하여 현업에서 사용할 수 있도록 지원합니다.
2 년 전
0111.2K
ComfyUI disty Flow:为 ComfyUI 提供友好的用户界面,简化工作流程

컴피유 디스티 플로우: 워크플로우를 간소화하는 컴피유 사용자 친화적 인터페이스

일반 소개 ComfyUI-disty-Flow는 ComfyUI에 사용자 친화적인 인터페이스를 제공하는 사용자 정의 노드입니다. 이 노드는 워크플로우 생성을 위한 대체 사용자 인터페이스를 제공하여 워크플로우 실행을 단순화하기 위한 것입니다.ComfyUI-disty...
2 년 전
0111.1K
FlowiseAI:构建自定义LLM应用的节点拖放界面

FlowiseAI: 커스텀 LLM 애플리케이션을 위한 노드 드래그 앤 드롭 인터페이스 구축

일반 소개 FlowiseAI는 개발자가 맞춤형 LLM(대규모 언어 모델) 애플리케이션과 AI 에이전트를 구축할 수 있도록 설계된 오픈 소스 로우코드 툴입니다. 간단한 드래그 앤 드롭 인터페이스를 통해 사용자는 LLM 애플리케이션을 빠르게 생성하고 반복할 수 있어 테스트부터 생산에 이르는 프로세스를 더욱 효율적으로 진행할 수 있습니다.
2 년 전
0111.1K
Aider:开源编程助手工具,使用AI助手进行代码编写和文件编辑

Aider: 오픈 소스 프로그래밍 보조 도구, 코드 작성 및 파일 편집에 AI 어시스턴트 사용

일반 소개 Aider는 개발자가 자연어 대화를 통해 코드를 작성, 편집 및 리팩터링할 수 있도록 도와주는 강력한 오픈 소스 AI 프로그래밍 보조 도구입니다. 대화형 AI 쌍 프로그래밍 도구인 Aider는 여러 주요 프로그래밍 언어를 지원하며 Git에 원활하게 통합할 수 있습니다.
1 년 전
0110.5K
阿布量化交易系统:基于Python的开源量化交易平台

아부 퀀트 트레이딩 시스템: 파이썬 기반 오픈 소스 퀀트 트레이딩 플랫폼

일반 소개 아부 퀀트 트레이딩 시스템은 파이썬 기반의 오픈 소스 플랫폼입니다. 투자자가 코드를 통해 퀀트 트레이딩 전략을 구현할 수 있도록 사용자 "bbfamily"가 만들었습니다. 이 시스템은 주식, 옵션, 선물, 비트코인 등 다양한 금융상품의 백테스팅과 거래를 지원합니다. It...
1 년 전
0110.4K
Page Assist:本地AI模型对话与检索文档的网页助手插件

Page Assist: 네이티브 AI 모델 대화 및 문서 검색을 위한 웹 어시스턴트 플러그인

일반 소개 페이지 어시스트는 사용자가 로컬 AI 모델과 쉽게 상호작용할 수 있도록 설계된 오픈 소스 브라우저 확장 프로그램입니다. 이 확장 프로그램을 사용하면 모든 웹 페이지에서 사이드바를 열어 로컬에서 실행 중인 AI 모델과 상호 작용할 수 있습니다.Page Assi...
1 년 전
0110.3K
AgenticSeek:完全本地运行的任务自动化AI助手

에이전틱시크릿: 완전히 로컬에서 실행되는 작업 자동화를 위한 AI 어시스턴트

일반 소개 에이전틱시크는 완전히 로컬에서 실행되는 오픈 소스 AI 어시스턴트로, 딥시크 R1 모델을 기반으로 합니다. 클라우드 API가 필요하지 않으며 수백 달러의 월 사용료가 발생하지 않습니다. 영화 속 '자비스'와 유사한 지능형 비서를 목표로 합니다...
1 년 전
0110.1K
VoltAgent:快速构建AI智能体的TypeScript开源框架

VoltAgent: AI 인텔리전스를 빠르게 구축하기 위한 TypeScript 오픈 소스 프레임워크

일반 소개 VoltAgent는 개발자가 AI 인텔리전스를 빠르게 구축하고 조율할 수 있도록 설계된 오픈 소스 TypeScript 프레임워크입니다. 모듈식 도구와 표준화된 개발 모델을 제공하여 대규모 언어 모델(LLM)과의 상호 작용을 간소화하고, 상태...
1 년 전
0110K
ChatGPT-on-WeChat:基于大模型构建的智能对话机器人,支持微信等多对话平台接入

ChatGPT-on-WeChat: 대형 모델에 구축된 지능형 대화 로봇으로, WeChat 및 기타 다중 대화 플랫폼 액세스를 지원합니다.

종합 소개 ChatGPT-on-WeChat 프로젝트는 대형 모델 기반의 지능형 대화 로봇으로, 개인 WeChat, WeChat 공개 번호, 기업 WeChat 애플리케이션, 플라이북, 네일 등에 대한 다중 플랫폼 액세스를 지원합니다. 사용자는 GPT3.5, GPT-4, Claude, Man ...
2 년 전
0109.9K
tldraw:开源无限画布白板SDK,AI生成简约线框图和UML图

tldraw: 오픈 소스 무제한 캔버스 화이트보드 SDK, 미니멀한 와이어프레임과 UML 다이어그램을 생성하는 AI

일반 설명 tldraw는 사용자가 그래픽을 빠르게 그리고, 텍스트를 작성하고, 즉시 협업할 수 있는 무제한 캔버스를 제공하는 무료 즉각적인 협업 그리기 도구입니다. 직관적인 인터페이스와 뛰어난 성능을 갖추고 있어 팀 협업과 원격 작업에 적합합니다. 오픈 소스 커뮤니티를 통해 지원되는 tldr...
2 년 전
0109.9K
IC-Light(V2):图像照明控制神器,控制图像光影和背景

IC-Light (V2): 이미지 조명 제어 마법, 이미지 빛과 그림자 및 배경 제어

종합 소개 IC-Light는 고급 AI 모델을 통해 이미지의 조명 효과를 조작하는 것을 목표로 하는 이미지 조명 제어 프로젝트입니다. Lvmin Zhang 등이 개발한 이 프로젝트는 텍스트 조건부 재조명 모델과 배경 조건부 모델이라는 두 가지 주요 모델을 제공합니다. 사용자는 통과할 수 있습니다...
2 년 전
0109.6K
Gemini Balance:Gemini模型API兼容OpenAI格式,解锁区域限制并支持多API Key轮询

제미니 밸런스: 제미니 모델 API는 OpenAI 형식과 호환되며, 지역 제한을 해제하고 다중 API 키 폴링을 지원합니다.

종합 소개 Gemini Balance는 효율적인 멀티 API 키 관리 및 최적화 기능을 제공하는 것을 목표로 FastAPI 프레임워크를 기반으로 개발된 OpenAI API 프록시 서비스입니다. 이 프로젝트는 Gemini 모델 호출을 지원하며, 주요 기능으로는 멀티 API...
1 년 전
0109.1K
GitIngest:快速将Github代码仓库转为适合LLM理解的文本

GitIngest: 깃허브 코드 리포지토리를 LLM 이해에 적합한 텍스트로 빠르게 변환하기

일반 소개 GitIngest는 GitHub 코드 리포지토리를 대규모 언어 모델(LLM) 힌트에 적합한 텍스트로 변환하도록 설계된 오픈 소스 도구입니다. 사용자는 간단한 조작으로 모든 GitHub 리포지토리의 콘텐츠를 추출하고 LLM에 맞게 형식을 지정할 수 있습니다.
2 년 전
0108.8K
文多多 AiPPT:AI生成PPT,演讲稿生成

웬두오두오 AiPPT: AI 생성 PPT, 프레젠테이션 생성

개요 AiPPT는 인공지능 기술을 기반으로 한 PPT 생성 도구로, 사용자가 전문적인 프레젠테이션을 빠르게 만들 수 있도록 설계되었습니다. 테마 입력, 파일 업로드 또는 URL 제공 등을 통해 콘텐츠가 풍부하고 아름답게 디자인된 슬라이드를 자동으로 생성합니다. 기본 차트, 애니메이션 및 3D 특수 효과를 지원합니다.
1 년 전
0108.5K
GPT SoVITS:革命性的语音生成与语音克隆工具

GPT SoVITS: 혁신적인 음성 생성 및 음성 복제 도구

종합적인 소개 GPT-SoVITS는 오픈 소스 음성 변환 및 합성 도구로, GPT 모델과 SoVITS 보이스 체인저 기술을 결합한 것입니다. 이 도구는 샘플이 전혀 없거나 적은 상태에서 즉석에서 텍스트를 음성으로 변환하고 5초의 오디오 샘플만으로 음성 스타일 마이그레이션을 지원합니다. 그 기능에는 교차 언어가 포함됩니다 ...
2 년 전
0108.5K
cognee:基于知识图谱构建的RAG开源框架,核心prompts学习

cognee: 지식 그래프 기반 RAG 구성, 핵심 프롬프트 학습을 위한 오픈 소스 프레임워크

일반 소개 Cognee는 AI 애플리케이션과 AI 에이전트를 위해 설계된 신뢰할 수 있는 데이터 레이어 솔루션입니다. LLM(대규모 언어 모델) 컨텍스트를 로드하고 구축하여 지식 그래프와 벡터 스토어를 통해 정확하고 해석 가능한 AI 솔루션을 생성하도록 설계되었습니다. 이 프레임워크는 비용 절감, 해석 가능한 ...
2 년 전
0107.5K
AutoGen Studio:多代理系统AutoGen的简易用户界面版

오토젠 스튜디오: 사용하기 쉬운 멀티 에이전트 시스템 오토젠의 인터페이스 버전

일반 설명 AutoGen Studio 2.0은 다중 에이전트 솔루션의 생성 및 관리 프로세스를 간소화하도록 설계된 AutoGen 기반의 사용자 인터페이스입니다. 이 플랫폼을 통해 사용자는 직관적인 인터페이스를 통해 에이전트와 워크플로를 선언적으로 정의하고 수정할 수 있습니다.
2 년 전
0107.3K
A2A:谷歌发布AI智能间通信的开放协议

A2A: Google, AI 인텔리전스 간 통신을 위한 개방형 프로토콜 출시

일반 소개 A2A(에이전트2에이전트)는 서로 다른 프레임워크 또는 공급업체에서 개발한 인공지능이 서로 통신하고 협업할 수 있도록 Google에서 개발한 오픈 소스 프로토콜입니다. 이 프로토콜은 지능이 서로의 기능을 발견하고 작업을 공유하며 작업을 완료할 수 있는 표준화된 방법 세트를 제공합니다.
1 년 전
0107.1K
ElizaOS:构建自主执行的多智能体,功能完备的开源AI智能体开发框架

ElizaOS: 자율적으로 실행되는 다중 지능 구축, 완전한 기능을 갖춘 오픈 소스 AI 지능체 개발 프레임워크

포괄적 인 소개 Eliza는 고급 다중 지능형 바디 (다중 에이전트) 개발 프레임 워크이며 자율 지능형 바디 (자율 에이전트) 프로세스의 구성 및 배포를 단순화하기 위해 최선을 다하고 있습니다. 역할 설정이 다른 여러 지능형 바디의 배포를 지원하고 지능적인 ...
2 년 전
0107.1K
Steel Browser:自动化网页浏览器API,构建控制浏览器操作的智能体与应用

스틸 브라우저: 브라우저 운영을 제어하는 인텔리전스 및 애플리케이션을 구축하기 위한 자동화된 웹 브라우저 API

일반 소개 스틸 브라우저는 AI 에이전트 및 애플리케이션을 위해 설계된 오픈 소스 브라우저 API입니다. 사용자가 인프라에 대한 걱정 없이 웹 작업을 자동화할 수 있는 전체 브라우저 인스턴스를 제공하며, 스틸 브라우저는 다음을 지원합니다.
2 년 전
0107K
MetaGPT:多智能体协作框架,构建 AI 软件开发团队实现自然语言编程

MetaGPT: 자연어 프로그래밍을 위한 AI 소프트웨어 개발 팀을 구축하기 위한 다중 지능체 협업 프레임워크

종합 소개 MetaGPT는 완전한 AI 소프트웨어 회사의 운영을 시뮬레이션하도록 설계된 혁신적인 다중 지능 바디 프레임워크입니다. 이 프로젝트의 목표는 서로 다른 역할을 하는 GPT 모델을 협업 엔티티로 결합하는 것입니다....
1 년 전
0107K
Klee:桌面本地运行AI大模型并管理私人知识库

Klee: 데스크톱에서 로컬로 AI 매크로 모델을 실행하고 비공개 지식창고를 관리하기

일반 소개 Klee는 사용자가 안전한 비공개 지식 베이스 관리와 마크다운 노트 필기 기능을 통해 로컬에서 오픈 소스 LLM(대규모 언어 모델)을 실행할 수 있도록 설계된 오픈 소스 데스크톱 애플리케이션입니다. Ollama와 LlamaIndex 기술을 기반으로 합니다...
1 년 전
0106.8K
InstantID:上传一张图片,迁移人像特征来生成不同风格图片

InstantID: 이미지를 업로드하고 초상화 기능을 마이그레이션하여 다양한 스타일의 이미지를 생성합니다.

개요 InstantID는 단일 참조 ID 사진을 사용하여 높은 수준의 충실도를 보장하면서 개인화된 스타일이나 포즈를 가진 이미지를 몇 초 만에 생성하는 데 중점을 둔 고급 기술입니다. 이 기술은 얼굴 이미지, 랜드마크 지도를 통합하여 확산 모델 기반 솔루션을 사용합니다....
2 년 전
0106.5K
Step1X-Edit:自然语言指令编辑图像的开源工具

Step1X-Edit: 자연어 명령어로 이미지를 편집할 수 있는 오픈 소스 도구

일반 소개 Step1X-Edit는 스텝펀 AI 팀이 개발하고 깃허브에서 호스팅하는 오픈 소스 이미지 편집 프레임워크로, 멀티모달 대용량 언어 모델(Qwen-VL)과 확산 변환기(DiT)를 결합하여 사용자가 간단하고 자연스러운 방식으로 이미지를 만들 수 있도록 합니다.
1 년 전
0106.2K
CrewAI:多角色扮演协作智能框架,简化复杂任务

CrewAI: 복잡한 작업을 간소화하는 멀티 롤플레이 협업 인텔리전스 프레임워크

종합 소개 CrewAI는 롤플레잉과 자율 AI 에이전트 간의 협업을 조율하도록 설계된 고급 프레임워크입니다. CrewAI는 협업 인텔리전스를 촉진함으로써 에이전트들이 원활하게 협력하여 복잡한 작업을 해결할 수 있도록 지원합니다. 지능형 어시스턴트 플랫폼을 구축하든, 고객 서비스 팀을 자동화하든, 멀티 에이전트를 구축하든 관계없이...
2 년 전
0105.8K
MoneyPrinterTurbo:输入视频主题一键生成视频文案和高清短视频

머니프린터터터보: 동영상 테마를 입력하여 한 번의 클릭으로 동영상 사본과 짧은 HD 동영상을 생성합니다.

종합 소개 머니프린터터터보는 고급 AI 빅 모델 기술을 사용하여 한 번의 클릭으로 짧은 HD 동영상을 생성하는 기능을 달성하는 오픈 소스 프로젝트입니다. 사용자는 비디오 테마 또는 키워드만 제공하면 시스템이 자동으로 비디오 카피, 비디오 클립, 비디오 자막 등을 생성합니다.
1 년 전
0105.6K
Moffee:将Markdown转为PPT幻灯片

Moffee: 마크다운을 PPT 슬라이드쇼로 변환하기

일반 소개 Moffee는 마크다운 파일을 빠르고 간단하고 효율적으로 전문 슬라이드쇼로 변환하는 오픈 소스 도구입니다. 사용자는 마크다운 콘텐츠를 작성하기만 하면 Moffee가 레이아웃, 페이지 매김 및 스타일을 자동으로 처리하므로 수동으로 조판할 필요가 없습니다.
1 년 전
0105.1K
Refly:基于自由画布上流程编排的AI写作平台,自动化生成文章

Refly: 자동화된 기사 생성을 위한 무료 캔버스에서 프로세스 오케스트레이션을 기반으로 하는 AI 글쓰기 플랫폼

종합 소개 Refly는 멀티 스레드 대화, 지식 베이스 통합, 문맥 메모리 및 지능형 검색 기술을 통해 사용자가 아이디어를 고품질 콘텐츠로 전환할 수 있도록 설계된 무료 캔버스 기반 AI 네이티브 저작 엔진입니다. 이 플랫폼은 학습을 포함한 20개 이상의 전문 시나리오 템플릿을 지원합니다.
1 년 전
0104.9K
Unstructured:开源预处理非结构化文档,无结构数据处理的利器

비정형: 비정형 문서 전처리 오픈 소스, 비정형 데이터 처리 도구

포괄적인 소개 Unstructured-IO는 PDF, HTML, Word 문서 등과 같은 이미지 및 텍스트 문서를 처리하고 전처리하기 위한 오픈 소스 구성 요소 세트를 제공합니다. 주요 목표는 데이터 처리 워크플로우를 단순화하고 최적화하는 것으로, 특히 대규모 언어 모델(LL...
2 년 전
0104.5K
Kokoro:高效语音合成模型,生成自然流畅的语音

Kokoro: 자연스럽고 부드러운 음성을 생성하는 효율적인 음성 합성 모델

일반 소개 Kokoro 82M은 더 적은 매개변수와 데이터로 고품질의 음성을 생성하도록 설계된 Hugging Face에서 제공하는 효율적인 음성 합성 모델입니다. 이 모델에는 8,200만 개의 파라미터가 있으며 Apache 2.0에 따라 라이센스가 부여되어 있습니다.
2 년 전
0104K
PocketFlow:100行代码实现AI应用开发的极简框架

PocketFlow: 100줄의 코드로 AI 애플리케이션 개발을 위한 미니멀리즘 프레임워크

포괄적인 소개 PocketFlow는 100줄의 코드만으로 구성된 경량 AI 애플리케이션 개발 프레임워크로, The-Pocket 팀에서 개발하여 GitHub에서 오픈 소스화했습니다. 100줄의 핵심 코드 제어, 외부 종속성 없는 미니멀리즘 디자인을 추구합니다.
1 년 전
0103.7K
MediaCrawler:多社交媒体平台内容、视频评论爬虫工具

MediaCrawler: 멀티 소셜 미디어 플랫폼 콘텐츠, 동영상 댓글 크롤러 도구

일반 소개 미디어크롤러는 개발자를 위해 설계된 소셜 미디어 콘텐츠 크롤러 도구입니다. 강력한 크롤러 기능을 제공하여 샤오홍슈, 셰이크, 셔터, B, 웨이보 등과 같은 소셜 플랫폼에서 동영상, 이미지, 댓글, 좋아요, 리트윗 및 기타 데이터를 빠르게 수집할 수 있습니다.
2 년 전
0103.5K
Browser-Use:构建智能网页自动化工具,让AI智能体轻松操作浏览器

브라우저 사용: AI 인텔리전트가 브라우저를 쉽게 운영할 수 있는 지능형 웹 자동화 도구 구축

종합 소개 브라우저 사용은 언어 모델(LLM)이 웹사이트와 자연스럽게 상호 작용할 수 있도록 특별히 설계된 혁신적인 오픈 소스 웹 자동화 도구입니다. 이 도구는 강력하고 유연한 프레임워크를 제공하여 GPT-4, Claud... 등 다양한 주류 언어 모델을 지원합니다.
2 년 전
0103.4K
AIGCPanel:开源克隆数字人整合系统,一键部署免费数字人客户端

AIGCPanel: 디지털 맨 통합 시스템의 오픈 소스 클론, 무료 디지털 맨 클라이언트를 원클릭으로 배포할 수 있습니다.

종합 소개 AigcPanel은 모든 사용자를 위한 원스톱 AI 디지털 휴먼 제작 시스템으로, 전자+뷰3+타입스크립트 기술 스택으로 개발되어 Windows에서 원클릭 배포를 지원합니다. 이 시스템은 핵심인 사용자 친화적으로 설계되었습니다.
2 년 전
0103.4K
AsrTools:语音转字幕工具,内置剪映、快手、必剪接口的轻量客户端

AsrTools: 음성-자막 변환 도구, 컷씬, 레이서 및 머스트 컷에 대한 인터페이스가 내장된 경량 클라이언트

포괄적인 소개 AsrTools는 Cutscene, QuickScope, MustCut 등과 같은 대형 업체의 인터페이스가 내장된 지능형 음성 텍스트 변환 도구입니다. GPU나 번거로운 구성이 필요하지 않으며 효율적인 멀티스레드 일괄 처리를 지원합니다. 파이큐트5 개발, 아름답고 사용자 친화적인 인터페이스를 기반으로 하며, SRT 및 TXT 형식의 단어를 출력할 수 있습니다....
2 년 전
0103.3K
Unsloth:高效微调和训练大语言模型的开源工具

Unsloth: 대규모 언어 모델의 효율적인 미세 조정 및 학습을 위한 오픈 소스 도구

종합 소개 Unsloth는 대규모 언어 모델(LLM)을 미세 조정하고 학습하기 위한 효율적인 도구를 제공하기 위해 설계된 오픈 소스 프로젝트입니다. 이 프로젝트는 라마, 미스트랄, 파이, 젬마 등 잘 알려진 다양한 모델을 지원합니다.Unsloth의...
1 년 전
0103.1K
Dia:生成超现实多人对话的文本转语音模型

Dia: 초현실적인 멀티플레이어 대화 생성을 위한 텍스트 음성 변환 모델

일반 소개 Dia는 초현실적인 대화 오디오를 생성하는 데 중점을 두고 나리 랩스에서 개발한 오픈 소스 텍스트 음성 변환(TTS) 모델입니다. 텍스트 스크립트를 한 번의 프로세스로 사실적인 다중 문자 대화로 변환하고 감정과 억양 제어를 지원하며 비언어적 표현까지 생성합니다....
1 년 전
0102.6K
Fabric:集成众多提示词的AI开源工作流框架,高效处理各种事务

Fabric: 다양한 트랜잭션을 효율적으로 처리하기 위해 많은 단서 단어를 통합하는 AI 오픈 소스 워크플로우 프레임워크입니다.

일반 소개 Fabric은 일상적인 컴퓨터 작업을 단순화 및 자동화하고 인공 지능을 더 쉽게 사용할 수 있도록 Daniel Miessler가 개발한 오픈 소스 AI 프레임워크입니다. 모듈식 설계와 사전 정의된 프롬프트 단어(패턴)를 통해 사용자가 효율적으로 사용할 수 있도록 도와줍니다...
2 년 전
0102.4K
RD-Agent:自动化数据驱动研发工具,通过AI技术推动以数据为导向的研发过程

RD-Agent: AI 기술을 통해 데이터 기반 R&D 프로세스를 촉진하는 자동화된 데이터 기반 R&D 도구

일반 소개 RD-Agent는 연구 개발(R&D) 프로세스를 자동화하고 최적화하도록 설계된 Microsoft의 오픈 소스 도구입니다. 이 도구는 인공 지능 기술을 통해 모델 및 데이터 개발의 효율성을 개선하기 위해 데이터 기반 시나리오에 초점을 맞추고 있으며, RD-Agent는 연구...
1 년 전
0102K
Sonic:音频驱动肖像图片生成面部表情生动的数字人口播视频

소닉: 오디오 기반 인물 이미지로 생생한 얼굴 표정이 담긴 디지털 데모 동영상 생성

일반 소개 Sonic은 글로벌 오디오 인식에 초점을 맞춘 혁신적인 플랫폼으로, 오디오를 기반으로 생생한 인물 애니메이션을 생성하는 것을 목표로 합니다. 텐센트와 저장대학교의 연구팀이 개발한 이 플랫폼은 오디오 정보를 사용하여 얼굴 표정과 머리 움직임을 제어하여 자연스럽고 부드러운 애니메이션 동영상을 생성합니다....
1 년 전
0102K
Llasa 1~8B:高品质语音生成和克隆的开源文本转语音模型

Llasa 1~8B: 고품질 음성 생성 및 복제를 위한 오픈 소스 텍스트 음성 변환 모델

일반 소개 Llasa-3B는 홍콩과학기술대학교 오디오 랩(HKUST Audio)에서 개발한 오픈 소스 텍스트 음성 변환(TTS) 모델입니다. 이 모델은 여러 언어를 지원할 뿐만 아니라 고품질 음성 생성을 제공하도록 세심하게 튜닝된 Llama 3.2B 아키텍처를 기반으로 합니다.
1 년 전
0101.9K
DUIX:实时互动的智能数字人,支持多平台一键部署

DUIX: 실시간 상호 작용을 위한 지능형 디지털 인력, 멀티 플랫폼 원클릭 배포 지원

일반 소개 DUIX(대화 사용자 인터페이스 시스템)는 실리콘 인텔리전스에서 만든 AI 기반 디지털 인간 상호작용 플랫폼입니다. 오픈 소스 디지털 인간 상호 작용 기능을 통해 개발자는 대규모 모델, 자동 음성 인식(ASR)을 쉽게 통합할 수 있습니다.
2 년 전
0101.9K
CFG-Zero-star:提升图像和视频生成质量的开源工具

CFG-Zero-star: 이미지 및 동영상 생성 품질을 개선하는 오픈 소스 도구

종합 소개 CFG-Zero-star는 웨이첸 팬과 난양공과대학교의 S-Lab 팀이 개발한 오픈 소스 프로젝트입니다. 이 프로젝트는 안내 전략과 제로 이니셜을 최적화하여 스트림 매칭 모델에서 분류기 무료 안내(CFG) 기술을 개선하는 데 중점을 둡니다.
1 년 전
0101.9K
Qwen-Agent:基于Qwen的智能代理应用框架,包括工具调用、代码解释器、RAG和Chrome扩展。

Qwen-Agent: 도구 호출, 코드 인터프리터, RAG 및 Chrome 확장 프로그램을 포함한 지능형 에이전트 애플리케이션을 위한 Qwen 기반 프레임워크입니다.

종합 소개 Qwen-Agent는 명령 팔로잉, 도구 사용, 계획 및 메모리 등의 기능을 갖춘 Qwen 2.0 이상을 기반으로 개발된 지능형 에이전트 애플리케이션 프레임워크입니다. 이 프레임워크는 브라우저 어시스턴트, 코드 인터프리터 및 사용자 지정 어시스턴트와 같은 다양한 샘플 애플리케이션을 제공합니다....
2 년 전
0101.8K
MangaNinjia:自动化线稿上色工具,为动漫黑白线稿快速填色

만화 닌자: 애니메이션 흑백 선화를 빠르게 색칠할 수 있는 자동 선 채색 도구입니다.

종합 소개 만화닌자는 알리바바 통이 시각지능연구소(Ali-Vilab)에서 개발한 오픈소스 프로젝트로, 선화 채색 자동 처리에 중점을 두고 있습니다. 이 도구는 딥러닝 기술을 통해 참조 이미지의 정확한 색상 일치를 달성하여 크게 개선된 ...
2 년 전
0101.6K
Gemini Teacher:英语口语发音纠正助手

쌍둥이자리 선생님: 영어 말하기 발음 교정 도우미

일반 소개 제미니 선생님은 구글 제미니 AI를 기반으로 한 영어 말하기 연습 도우미입니다. 사용자의 영어 발음을 실시간으로 인식하고 즉각적인 피드백과 교정 제안을 제공합니다. 이 도구는 사용자가 다음을 통해 영어 말하기 능력을 향상시킬 수 있도록 설계되었습니다.
1 년 전
0101.5K