AI 모델
SAM 3는 사용자가 텍스트 및 시각적 프롬프트를 활용하여 이미지나 비디오에서 객체를 정확하게 식별, 분할 및 추적할 수 있도록 합니다. 곧 메타 AI 앱의 Instagram Edits 및 Vibes에서 사용할 수 있게 되어 사용자들의 비디오 제작을 향상시킬 것입니다.
AI 모델에서 최고의 모델을 발견하세요 — DistilGPT2와 Claude Opus 같은 언어 변환기부터 GPT-5.6: Frontier intelligence, Google DeepMind의 Gemini 3.1 Pro 같은 고급 시스템까지, 개발자와 연구자가 프로젝트를 향상시키는 도구를 탐색하는 곳입니다: 인간과 유사한 텍스트를 생성하고, 대화형 에이전트를 구축하며, 복잡한 알고리즘을 개발하고, AI 역량의 한계를 확장합니다. AI 모델 및 LLM, 머신러닝 플랫폼, 과학적 발견 및 실험실 도구, 3D 모델 생성기 및 자연어 처리 도구 등을 아우르는 17개의 AI 모델을(를) 살펴보세요.
17 tools
AI 모델
SAM 3는 사용자가 텍스트 및 시각적 프롬프트를 활용하여 이미지나 비디오에서 객체를 정확하게 식별, 분할 및 추적할 수 있도록 합니다. 곧 메타 AI 앱의 Instagram Edits 및 Vibes에서 사용할 수 있게 되어 사용자들의 비디오 제작을 향상시킬 것입니다.
DETR은 Transformer를 핵심 구성 요소로 통합한 종단 간(end-to-end) 객체 탐지 및 파놉틱 분할 프레임워크입니다. 아키텍처를 단순화하고 객체 집합을 직접 예측하며, COCO와 같은 까다로운 데이터셋에서 최첨단 성능을 달성하여 컴퓨터 비전 작업에 더 유연하고 간소화된 접근 방식을 제공합니다.
AI 모델
Densenet은 PyTorch를 통해 제공되는 심층 합성곱 신경망 아키텍처입니다. 각 레이어를 이전의 모든 레이어에 연결하여 특징 전파 및 재사용을 향상시킵니다. 이 모델은 ImageNet으로 사전 학습되었으며 이미지 분류 작업을 위한 densenet121, densenet169, densenet201,…
MobileNets는 TensorFlow용 모바일 우선 컴퓨터 비전 모델 제품군으로, 효율적인 온디바이스 또는 임베디드 애플리케이션을 위해 설계되었습니다. 연산량, 전력 소비량, 저장 공간을 최소화하면서 정확도를 극대화하여 인터넷 연결 없이도 실시간 시각 인식에 이상적입니다.
AI 모델
FaceNet은 FaceNet 논문을 기반으로 한 얼굴 인식 및 클러스터링을 위한 TensorFlow 구현체입니다. 딥러닝 모델을 활용하여 얼굴에 대한 통합 임베딩을 생성함으로써 정확한 식별 및 그룹화를 가능하게 합니다. 이 프로젝트는 사전 학습된 모델과 사용자 정의 분류기 학습을 위한 코드를 제공합니다.
AI 모델
MMAction2는 액션 인식 및 비디오 이해 작업을 위한 기반 라이브러리입니다. PyTorch를 기반으로 하며 OpenMMLab 생태계와 통합되어 최첨단 비디오 분석 모델을 개발하고 배포하기 위한 포괄적인 툴킷을 제공합니다. 이 문서는 튜토리얼, API 참조 및 프로젝트 정보를 다룹니다.
AI 모델
Fast R-CNN은 객체 탐지를 위한 딥러닝 프레임워크입니다. R-CNN 및 SPPnet과 같은 이전 방법들에 비해 학습 및 테스트 속도를 크게 향상시키며, 벤치마크 데이터셋에서 더 높은 정확도를 달성합니다. Python과 C++/Caffe로 작성되어 컴퓨터 비전 분야의 연구원 및 개발자에게 적합합니다.
AI 모델
py-faster-rcnn은 Faster R-CNN 객체 탐지 모델의 Python 구현체입니다. 공식 MATLAB 버전에 대한 대안을 제공하며, CPU 기반 Python 레이어로 인한 테스트 시간 속도의 약간의 차이에도 불구하고 유사한 정확도를 제공합니다. 이 프로젝트는 Detectron을 위해 폐기되었습니다.
AI 모델
객체 탐지를 위한 SSD 구현이 포함된 Caffe 프레임워크입니다. 이 리포지토리는 빠르고 개방적인 딥러닝 프레임워크를 제공하며, 특히 Single Shot MultiBox Detector에 맞춰져 있습니다. 단일 모델로 객체 탐지 네트워크의 학습 및 평가를 가능하게 하여 효율적인 성능을 제공합니다.
Feature Pyramid Networks (FPN)는 딥 컨볼루션 네트워크에서 최소한의 계산 오버헤드로 다중 스케일 특징 맵을 생성하여 객체 탐지를 향상시킵니다. 이 아키텍처는 다양한 객체 크기에 걸쳐 정확도를 개선하여 실시간 탐지 작업에 실용적이고 효율적인 솔루션을 제공합니다.
DeepLab은 의미론적 이미지 분할을 위한 최첨단 딥러닝 모델입니다. 이 TensorFlow 구현은 PASCAL VOC 및 Cityscapes와 같은 데이터셋에서 분할 결과의 학습, 평가 및 시각화를 위한 코드를 제공합니다. 픽셀 수준 레이블링을 위한 다양한 네트워크 백본과 고급 기능을 지원합니다.
AI 모델
ViT-Adapter는 객체 탐지 및 분할과 같은 밀집 예측 작업에서 Vision Transformer(ViT)의 성능을 향상시키는 AI 모델입니다. 사전 학습 없이 이미지별 귀납적 편향을 도입하여 일반 ViT가 특수 트랜스포머와 유사한 결과를 달성할 수 있도록 하여 다양한 다운스트림 애플리케이션에 적합하게 만듭니다.
AI 모델
TimeSformer는 비디오 이해를 위한 혁신적인 AI 아키텍처로, 셀프 어텐션 트랜스포머만을 활용합니다. 액션 인식 벤치마크에서 최첨단 결과를 달성하며, 기존 3D CNN에 비해 훈련 속도가 훨씬 빠르고 추론 컴퓨팅 비용이 낮습니다. 이를 통해 더 복잡한 비디오 분석 및 실시간 애플리케이션이 가능해집니다.
GIT (Generative Image-to-text Transformer)는 Microsoft에서 개발한 비전 및 언어 작업을 위한 AI 모델입니다. 이미지에서 텍스트 설명을 생성하며 시각적 질의응답을 수행할 수 있습니다. 이 모델은 다양한 애플리케이션을 위해 여러 사전 학습 및 미세 조정 버전을 제공합니다.
AI 모델
R-FCN은 완전 컨볼루션 네트워크를 활용하여 정확하고 효율적인 이미지 분석을 수행하는 영역 기반 객체 탐지 프레임워크입니다. 전체 이미지에 걸쳐 연산을 공유하여 ResNet과 같은 강력한 분류기 백본을 채택할 수 있도록 하여 객체 탐지 성능을 향상시킵니다.
Squeeze-and-Excitation Networks (SENet)는 채널별 특징 응답을 적응적으로 재보정하는 딥러닝 모델 아키텍처입니다. 채널 간의 상호 의존성을 명시적으로 모델링하여 성능을 향상시키고 이미지 분류 작업의 정확도를 개선합니다. Caffe로 구현되었습니다.
Panoptic FPN은 인스턴스 및 의미론적 분할을 단일 네트워크 아키텍처로 통합합니다. 공유 Feature Pyramid Network 백본을 사용하는 의미론적 분할 분기를 추가하여 Mask R-CNN을 향상시키며, 두 작업 모두에 대해 경량화되고 효과적인 솔루션을 제공합니다. 이 연구는 Panoptic 분할을 위한…
ToolPotion은 사람들이 최고의 AI 모델를 찾기 위해 탐색하는 AI 도구 디렉토리입니다. 등록은 무료이며 모든 제출물은 편집자가 검토합니다 — 검색이 시작되는 곳에 귀하의 도구를 배치하세요.