Thẻ: audio
Tất cả bản tin và bài dịch có thẻ "audio".
34 mục đã xuất bản 34 bài dịch 0 bản tin Bài dịch trong thẻ này trải trên 5 loại nguồn (34 bài). Loại nguồn: công ty/blog 12 Loại nguồn: web 11 Loại nguồn: GitHub 9 Loại nguồn: cộng đồng 1 Loại nguồn: tài liệu 1 Chỉ gồm bài dịch Mới nhất của chủ đề là bài dịch: litelm: phần routing của LiteLLM trong khoảng 2.900 dòng Bài dịch mới nhất: litelm: phần routing của LiteLLM trong khoảng 2.900 dòng Nguồn gốc: github.com · Loại nguồn: GitHub
- Mới nhất trong chủ đề này Bài dịch
litelm: phần routing của LiteLLM trong khoảng 2.900 dòng
tinAI dịch bài này sang tiếng Việt từ : GitHub - kennethwolters/litelm: litellm without the bloat (github.com) · Loại nguồn: GitHub · Tác giả gốc: Kenneth Wolters
Ngày gốc: · Đọc khoảng 3 phút · Dịch ngày:
Trong bản tin: tinAI #186: RTK báo cắt 89% token, nhưng hóa đơn agent không nghe theo
litelm giữ routing, chuyển đổi message, streaming, tool use và embedding nhưng bỏ proxy, cache, budget cùng nhiều lớp khác của LiteLLM. Dự án mới ở alpha; dev nên kiểm tra đúng…
- Bài dịch
18 model on-device của Desert Ant Labs: từ benchmark đến tích hợp
tinAI dịch bài này sang tiếng Việt từ : On-device intelligence for every product (desertant.com) · Loại nguồn: công ty/blog · Tác giả gốc: Desert Ant Labs
Ngày gốc: · Đọc khoảng 4 phút · Dịch ngày:
Trong bản tin: tinAI #185: 18 model nhỏ của Desert Ant: giá trị nằm ở đường đưa vào app, không phải nhãn “frontier”
Desert Ant Labs phát hành 18 model chuyên biệt cho audio, vision và text qua SDK Swift, Kotlin và JavaScript, miễn phí tới 100.000 thiết bị hoạt động mỗi tháng. Giá trị chính là…
- Bài dịch
Pianoify: biến 10 giây audio thành MIDI và bản nhạc piano
tinAI dịch bài này sang tiếng Việt từ : pianoify — turn any recording into piano (pianoify.net) · Loại nguồn: web · Tác giả gốc: pianoify
Ngày gốc: · Đọc khoảng 2 phút · Dịch ngày:
Trong bản tin: tinAI #172: MCP chuyển từ gọi tool sang hạ tầng cho agent chạy dài
Pianoify nhận file audio hoặc link YouTube, crop còn 10 giây và stream các note lên piano roll trong lúc transcriber xử lý. Ứng dụng hỗ trợ phát lại piano, chord và export…
- Bài dịch
FLUX 3: model multimodal cho image, video, audio và action
tinAI dịch bài này sang tiếng Việt từ : FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence. (bfl.ai) · Loại nguồn: công ty/blog · Tác giả gốc: Black Forest Labs
Ngày gốc: · Đọc khoảng 3 phút · Dịch ngày:
Trong bản tin: tinAI #145: Software factory tắt đèn dễ đốt cháy codebase
FLUX 3 là foundation model multimodal của Black Forest Labs, train chung image, video và audio để tạo video có âm thanh, chỉnh sửa ảnh/video và làm backbone cho action prediction…
- Bài dịch
Nativ: chạy open model local trên Mac cho coding agent
tinAI dịch bài này sang tiếng Việt từ : Nativ — Local AI for your Mac (blaizzy.github.io) · Loại nguồn: web · Tác giả gốc: Nativ
Ngày gốc: · Đọc khoảng 4 phút · Dịch ngày:
Trong bản tin: tinAI #144: Agent swarm không thắng nhờ đông, mà nhờ chia context đúng chỗ
Nativ là app open source cho Apple Silicon, chạy open models local và expose endpoint cho các coding agent như Codex, Claude Code, Hermes hoặc OpenCode. Điểm đáng thử là telemetry…
- Bài dịch
Apple SpeechAnalyzer vượt Whisper trong benchmark on-device đầu tiên
tinAI dịch bài này sang tiếng Việt từ : Apple's New Speech API vs Whisper: The First Real Benchmark (get-inscribe.com) · Loại nguồn: công ty/blog · Tác giả gốc: Inscribe
Ngày gốc: · Đọc khoảng 3 phút · Dịch ngày:
Trong bản tin: tinAI #138: Apple SpeechAnalyzer vượt Whisper trong benchmark on-device
Apple SpeechAnalyzer trên iOS/macOS 26 đạt WER 2.12% trên LibriSpeech clean và 4.56% trên noisy, tốt hơn Whisper Small trong bài đo của Inscribe. Với app speech-to-text trên Apple…
- Bài dịch
GPT-Live trong ChatGPT Voice: full-duplex và agent chạy nền
tinAI dịch bài này sang tiếng Việt từ : Introducing GPT-Live (openai.com) · Loại nguồn: công ty/blog · Tác giả gốc: OpenAI
Ngày gốc: · Đọc khoảng 3 phút · Dịch ngày:
Trong bản tin: tinAI #137: GPT-5.6 ra mắt với Sol, Terra, Luna và multi-agent trong API
GPT-Live dùng kiến trúc full-duplex để nghe và nói đồng thời, giúp ChatGPT Voice bớt cứng theo lượt. API chưa mở ngay, nhưng thiết kế delegate tác vụ sâu sang model phía sau là…
- Bài dịch
GPT-Live: voice model full-duplex cho hội thoại tự nhiên hơn
tinAI dịch bài này sang tiếng Việt từ : Introducing GPT-Live (openai.com) · Loại nguồn: công ty/blog · Tác giả gốc: OpenAI
Ngày gốc: · Đọc khoảng 5 phút · Dịch ngày:
Trong bản tin: tinAI #136: ChatGPT Work thành agent làm việc dài hơi trên app và file
GPT-Live là thế hệ voice model mới của OpenAI, dùng kiến trúc full-duplex để vừa nghe vừa nói, giảm cảm giác hội thoại theo lượt cứng nhắc. Model có thể giữ flow khi delegate tác…
- Bài dịch
GPT‑Live: hội thoại thoại hai chiều cho AI thời gian thực
tinAI dịch bài này sang tiếng Việt từ : Introducing GPT‑Live (openai.com) · Loại nguồn: công ty/blog · Tác giả gốc: OpenAI
Ngày gốc: · Đọc khoảng 2 phút · Dịch ngày:
Trong bản tin: tinAI #134: GPT‑Live ra mắt: thoại AI mới, ngắt quãng ít hơn và vẫn xử lý tác vụ nặng trong nền
GPT‑Live là bản phát hành mới của OpenAI với kiến trúc nghe-giao tiếp liên tục thay cho giao thức turn-based truyền thống. Nó giữ cuộc trò chuyện mượt hơn và chuyển bài toán khó…
- Bài dịch
Tòa Đức xử Google chịu trách nhiệm trực tiếp với AI Overviews — "tự nói" thì tự chịu
tinAI dịch bài này sang tiếng Việt từ : Landmark German ruling declares Google's AI Overviews are Google's own words and makes it liable for false answers (the-decoder.com) · Loại nguồn: web · Tác giả gốc: the-decoder
Ngày gốc: · Đọc khoảng 5 phút · Dịch ngày:
Trong bản tin: tinAI #126: Tòa Đức xử Google phải chịu trách nhiệm vì AI Overviews "tự nói"
Tòa Munich phán quyết Google là 'direct infringer' khi AI Overviews phát tán thông tin sai về hai nhà xuất bản — vì AI tổng hợp ra câu trả lời mới (không nằm trong source nào)…