Thẻ: vision
Tất cả bản tin và bài dịch có thẻ "vision".
118 mục đã xuất bản 118 bài dịch 0 bản tin Bài dịch trong thẻ này trải trên 5 loại nguồn (118 bài). Loại nguồn: công ty/blog 46 Loại nguồn: web 45 Loại nguồn: GitHub 21 Loại nguồn: tài liệu 4 Loại nguồn: cộng đồng 2 Chỉ gồm bài dịch Mới nhất của chủ đề là bài dịch: OpenArch: đọc kiến trúc LLM qua các implementation PyTorch tối giản Bài dịch mới nhất: OpenArch: đọc kiến trúc LLM qua các implementation PyTorch tối giản Nguồn gốc: github.com · Loại nguồn: GitHub
- Mới nhất trong chủ đề này Bài dịch
GPT-5.6 Sol: vision của OpenAI tốt hơn rõ rệt, nhưng batch vẫn phải tính giá
tinAI dịch bài này sang tiếng Việt từ : GPT 5.6 Sol is the best "vision" model OpenAI ever released (blog.roboflow.com) · Loại nguồn: web · Tác giả gốc: Roboflow
Ngày gốc: · Đọc khoảng 2 phút · Dịch ngày:
Trong bản tin: tinAI #169: Copilot Autofix gỡ pattern an toàn, mở cửa vào Jira nội bộ của Snowflake
Roboflow đo GPT-5.6 Sol tăng mạnh ở object detection và counting so với GPT-5.5, nhưng OCR gần như đi ngang và extraction còn thấp hơn. Sol đáng thử cho UI agent và document…
- Bài dịch
Shieldstral: model moderation multimodal 3B với policy viết bằng ngôn ngữ tự nhiên
tinAI dịch bài này sang tiếng Việt từ : Introducing Shieldstral. (mistral.ai) · Loại nguồn: công ty/blog · Tác giả gốc: Mistral AI
Ngày gốc: · Đọc khoảng 2 phút · Dịch ngày:
Trong bản tin: tinAI #159: Shai-Hulud quay lại qua keyv: đây là kiểu sự cố npm phải xử lý ngay
Mistral giới thiệu Shieldstral, model moderation 3B open-weights theo Apache 2.0. Thay vì taxonomy cố định, model nhận policy dạng câu hỏi yes/no ở runtime và trả safety score cho…
- Bài dịch
FeyNoBg: model tách nền tốt hơn mà không quên kỹ năng cũ
tinAI dịch bài này sang tiếng Việt từ : FeyNoBg: A SOTA Model For Background Removal — Feyn (usefeyn.com) · Loại nguồn: công ty/blog · Tác giả gốc: Feyn
Ngày gốc: · Đọc khoảng 4 phút · Dịch ngày:
Trong bản tin: tinAI #150: FeyNoBg: model tách nền open source có thư viện train đi kèm
Feyn phát hành FeyNoBg, model tách nền dựa trên BiRefNet, cùng thư viện NoBg để chạy và train lại model. Release này hữu dụng vì đi kèm benchmark, giải thích data mix và code path…
- Bài dịch
Siêu năng lực mới của AI là tập trung và làm đến cùng
tinAI dịch bài này sang tiếng Việt từ : The New AI Superpowers: Focus and Followthrough (rickmanelius.com) · Loại nguồn: web · Tác giả gốc: Rick Manelius
Ngày gốc: · Đọc khoảng 2 phút · Dịch ngày:
Trong bản tin: tinAI #148: Claude Opus 5: model agentic coding mới của Anthropic
AI có thể tăng tốc từng tác vụ, nhưng cũng dễ khiến backlog cá nhân nổ tung. Bài viết khuyên dùng AI để đi sâu vào ít việc quan trọng hơn, thay vì mở thêm hàng chục…
- Bài dịch
FLUX 3: model multimodal cho image, video, audio và action
tinAI dịch bài này sang tiếng Việt từ : FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence. (bfl.ai) · Loại nguồn: công ty/blog · Tác giả gốc: Black Forest Labs
Ngày gốc: · Đọc khoảng 3 phút · Dịch ngày:
Trong bản tin: tinAI #145: Software factory tắt đèn dễ đốt cháy codebase
FLUX 3 là foundation model multimodal của Black Forest Labs, train chung image, video và audio để tạo video có âm thanh, chỉnh sửa ảnh/video và làm backbone cho action prediction…
- Bài dịch
Nativ: chạy open model local trên Mac cho coding agent
tinAI dịch bài này sang tiếng Việt từ : Nativ — Local AI for your Mac (blaizzy.github.io) · Loại nguồn: web · Tác giả gốc: Nativ
Ngày gốc: · Đọc khoảng 4 phút · Dịch ngày:
Trong bản tin: tinAI #144: Agent swarm không thắng nhờ đông, mà nhờ chia context đúng chỗ
Nativ là app open source cho Apple Silicon, chạy open models local và expose endpoint cho các coding agent như Codex, Claude Code, Hermes hoặc OpenCode. Điểm đáng thử là telemetry…
- Bài dịch
Qwen-Image 3.0: ảnh nhiều chữ, layout dày và world knowledge
tinAI dịch bài này sang tiếng Việt từ : Qwen-Image-3.0: Rich Content, Authentic Details, Deep Knowledge (qwen.ai) · Loại nguồn: công ty/blog · Tác giả gốc: Qwen
Ngày gốc: · Đọc khoảng 5 phút · Dịch ngày:
Trong bản tin: tinAI #144: Agent swarm không thắng nhờ đông, mà nhờ chia context đúng chỗ
Qwen-Image 3.0 tập trung vào ảnh có cấu trúc: prompt tới 4,5k token, text nhỏ 10px, 12 ngôn ngữ và layout phức tạp. Đây là bước đáng theo dõi cho workflow tạo slide, infographic…
- Bài dịch
Google Vids thêm Gemini Omni và avatar cá nhân
tinAI dịch bài này sang tiếng Việt từ : Create, edit and star in videos with two Google Vids updates (blog.google) · Loại nguồn: web · Tác giả gốc: Justin Luk
Ngày gốc: · Đọc khoảng 2 phút · Dịch ngày:
Trong bản tin: tinAI #142: Cars24 đưa voice/chat agents vào toàn bộ phễu bán xe
Google Vids bổ sung Gemini Omni để sinh/chỉnh video bằng prompt và personal avatars để người dùng tạo avatar từ selfie cùng voice recording. Với dev, điểm đáng học là UX của…
- Bài dịch
claude-real-video: cho LLM đọc video bằng frame và transcript
tinAI dịch bài này sang tiếng Việt từ : Let Claude (or any LLM) actually watch a video (github.com) · Loại nguồn: GitHub · Tác giả gốc: HUANGCHIHHUNGLeo
Ngày gốc: · Đọc khoảng 2 phút · Dịch ngày:
Trong bản tin: tinAI #130: Phương pháp “short leash” khi code bằng AI agent
`claude-real-video` chạy local để trích frame theo scene change, loại frame lặp và tạo transcript bằng Whisper. Output là một folder có frame, transcript và manifest để đưa vào…
- Bài dịch
Kimi K2.7 Code đã có trong GitHub Copilot
tinAI dịch bài này sang tiếng Việt từ : Kimi K2.7 Code is generally available in GitHub Copilot (github.blog) · Loại nguồn: công ty/blog · Tác giả gốc: GitHub
Ngày gốc: · Đọc khoảng 2 phút · Dịch ngày:
Trong bản tin: tinAI #129: Claude Code đang nhúng dấu hiệu ẩn vào request khi dùng custom API gateway
GitHub Copilot bắt đầu rollout Kimi K2.7 Code, open-weight model đầu tiên trong Copilot model picker. Model được host trên Azure, tính phí theo usage-based billing, và…